發表文章

目前顯示的是有「Grok 4.7」標籤的文章

Grok 4.7評測:編碼分數衝高,代幣成本現形 | Grok 4.7 Review: Coding Gains, Token Costs Exposed

By Kit 小克 | AI Tool Observer | 2026-09-22 🇹🇼 Grok 4.7評測:編碼分數衝高,代幣成本現形 Grok 4.7 是 xAI 在 2026 年 9 月 21 日推出的最新旗艦模型,主打程式編碼與長時間推理任務,維持了 Grok 4.6 每百萬 token 2 美元/6 美元的定價,但把 CursorBench 4.0 編碼分數從 40.4% 拉高到 46.3%。聽起來很划算,但深入看代幣消耗量與智力分數表現,故事沒那麼單純。 Grok 4.7 是什麼? Grok 4.7 是一個 2.1 兆參數的推理模型,針對複雜編碼、專業知識工作與多小時推理任務優化,並訓練成原生理解 Grok Bot 介面框架,讓對話與一般知識工作的表現更自然。它已經免候補直接上線 Cursor、Grok Build、多家模型路由平台與 xAI API,GitHub 也同步將 Grok 4.7 分階段推送到所有 Copilot 方案。 Grok 4.7 編碼能力有多強? 官方數據確實好看: CursorBench 4.0 :從 40.4% 提升到 46.3% DeepSWE v1.1 :達到 71.0% AA-Briefcase 企業代理測試 :1657 Elo,比 Grok 4.6 高出 111 分 GDPval :1695 Elo 但值得注意,開發者社群測試顯示同期模型中 Fable 5.1 在絕對編碼分數上仍略勝 Grok 4.7,代表這不是全面領先,而是「同價位下的進步」。 Grok 4.7 定價真的划算嗎?代幣成本現形 Grok 4.7 維持每百萬 token 2 美元(輸入)/6 美元(輸出)的定價,比 GPT-5.6 Sol 便宜超過三分之一,帳面上很吸引人。但 VentureBeat 的實測指出,Grok 4.7 為了衝高分數,會消耗明顯更多的代幣量,真實任務的總成本可能跟便宜的單價互相抵銷,ROI 不如宣傳的漂亮。換句話說,便宜的是「牌價」,不一定是「帳單」。 Grok 4.7 智力分數輸給誰? 在更廣泛的推理與知識測驗(Artificial Analysis 綜合指數)上,Grok 4.7 大約只拿到 26% 的分數,遠遠落後 OpenAI GPT-6 Astra 的 ...