Qwen3.8 Flash Next評測:RTX 4090就能跑125B大模型 | Qwen3.8 Flash Next Review: Run 125B on One RTX 4090
By Kit 小克 | AI Tool Observer | 2026-10-06 🇹🇼 Qwen3.8 Flash Next評測:RTX 4090就能跑125B大模型 Qwen3.8 Flash Next 這幾天在 Hacker News 上衝到接近八百分熱度,原因很簡單:開源推理引擎 Strata 讓一張消費級的 RTX 4090 顯卡,就能跑動阿里巴巴這顆 125B 參數的 MoE 大模型,而且官方宣稱有機會衝到每秒 100 token 的生成速度。對長期只能望著 API 帳單嘆氣的開發者來說,這聽起來像是本地跑大模型的里程碑。 Qwen3.8 Flash Next 與 Strata 是什麼? Qwen3.8 Flash Next 是阿里巴巴 Qwen 團隊於今年 8 月發布的混合專家(MoE)模型,總參數 125B,但每個 token 實際只會啟動約 6B 參數,這也是它能被「瘦身」塞進消費顯卡的關鍵。官方跑分顯示 MMLU 達 90.36、GPQA Diamond 91.7 分,幾乎追平 Claude Opus 4.6。而 Strata 是開發者 Niko1221 做的開源推理引擎(MIT 授權),核心賣點是用 ISTA-DASLab 的 GSQ-RCO 量化法,取代傳統「把模型切一半塞進顯卡、一半丟給 CPU」的 layer offloading 做法,讓顯存使用更有效率。 實測速度:理想與現實有落差 HN 上標題寫的是「RTX 4090 跑到 100T/s」,但實際測試結果分散得多: 有使用者在 24GB 顯存的 4090 上,250K 超長上下文下只拿到約 21 tokens/秒的生成速度,但 prefill(處理輸入)可以到 364 t/s。 另一位搭配 128GB 系統記憶體與 Ryzen 7950X3D 的使用者,回報拿到 124 tokens/秒,比官方數字還高。 多篇技術拆解都提到,真正跑得順需要額外搭配高達 192GB 的系統記憶體,因為 MoE 的「專家」權重得靠系統 RAM 分攤,不是單靠 24GB VRAM 就能解決。 換句話說,「單張 4090 跑 125B 模型」是真的,但那個數字背後藏著一台配置不便宜的主機,換到 3090 或 4080 速度也會明顯下降,量化等級拉低後長文本...