Grok 4.6評測:xAI新旗艦模型ELO稱王但輸Fable 5一分 | Grok 4.6 Review: xAI Flagship Nearly Beats Fable 5
By Kit 小克 | AI Tool Observer | 2026-08-14 🇹🇼 Grok 4.6評測:xAI新旗艦模型ELO稱王但輸Fable 5一分 Grok 4.6是什麼?xAI新旗艦模型登場 Grok 4.6 是xAI於2026年8月12日發布的新旗艦模型,接替Grok 4.5的位置,主打能撐住研究、寫程式、規劃大型專案這類需要多步驟推理的長任務。這次更新用了更長的補充訓練,加入模型自產的推理與工程資料、重新調整過的優化器、重新生成的監督微調軌跡,並在知識工作、程式碼、核運算優化、網頁開發、CAD等多種代理環境中做了強化學習。 跑分表現:追平GPT-5.6,僅輸Fable 5一分 在Artificial Analysis Intelligence Index(由九項基準組成的綜合分數)上, Grok 4.6 拿下61分,跟GPT-5.6 Sol Max打平,只比Fable 5 Max的62分低一分。細看各項基準: Databricks排行榜 :Grok 4.6拿下第一名 LMSYS Chatbot Arena :ELO 1753分,同樣是第一 GDPVal-AA、AA-Briefcase、Harvey LAB :全面大勝Grok 4.5 High DeepSWE、Terminal-Bench :反而輸給前代Grok 4.5 High 值得注意的是,Grok 4.6在長任務上開始展現「自我檢查」行為——不是一次生成就結束,而是會在往下走之前先驗證自己的輸出,這對需要多輪推理的代理任務(agentic task)特別有幫助。 定價與規格:50萬token超長上下文 上下文窗口 :500,000 tokens 200K以下輸入 :每百萬token 2美元 快取輸入 :每百萬token 0.5美元 輸出 :每百萬token 6美元 超過200K長上下文 :價格全面翻倍(4/1/12美元) 這個定價比多數同級旗艦模型便宜不少,對需要大量呼叫API的開發者來說是個實際考量點。 小克實測心得 Grok 4.6沒有炸裂式的跑分突破,但在「打平GPT-5.6、逼近Fable 5」的位置上,配上明顯較低的定價和50萬token的長上下文,對做程式碼代理或研究助手的開發者來說,是個值得排進測試清單的選項...