GPT-6 Astra評測:抓蟲更準,編碼跑分卻沒登頂 | GPT-6 Astra Review: Great at Bugs, Not the Coding King
By Kit 小克 | AI Tool Observer | 2026-09-13 🇹🇼 GPT-6 Astra評測:抓蟲更準,編碼跑分卻沒登頂 GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日正式發布的新旗艦模型,官方形容它是「有史以來最聰明、最一致的模型」,甚至喊出「歡迎進入 AGI 時代」的口號。但把行銷詞拿掉之後,實測數據講的是另一個故事: GPT-6 Astra 在程式碼審查(code review)上進步明顯,一般編碼跑分卻沒有全面超車,反而還落後 Anthropic 的 Fable 5.1。這篇評測直接看數字,不看新聞稿。 抓蟲能力確實升級,尤其是跨檔案審查 第三方測試機構 CodeRabbit 針對 程式碼審查 場景做了對比,結果顯示 GPT-6 Astra: 比 GPT-5.6 Sol 多抓到約 4% 的已標記 bug 比 Claude Opus 5 多抓到約 22% 的 bug 在較難的 跨檔案審查 任務上,領先幅度拉大到贏 Sol 20%、贏 Opus 5 33% OpenAI 也證實 Astra 大量依賴 subagent 架構去拆解審查任務,這是它在跨檔案情境下表現更穩的關鍵原因。 但一般編碼跑分沒有登頂 如果你期待 GPT-6 Astra 在標準編碼 benchmark 上直接稱王,會有點失望:目前數據顯示它的成績大致和前代 GPT-5.6 Sol 打平,明顯落後 Anthropic 的 Fable 5.1。換句話說,Astra 的強項是「幫你檢查別人寫的程式碼」,不是「自己寫出最好的程式碼」。如果你的用途是純寫程式而非審查,先別急著換模型。 定價偏貴,安全性數據倒是亮眼 API 定價:每百萬 input token 10 美元 、output token 50 美元 ,快取 input token 1 美元 —— 在對手紛紛降價的情況下,OpenAI 這次走高價路線 合格 API 客戶可用 零資料保留 (zero data retention) 安全測試中,GPT-5.6 Sol 在沒有生產環境防護時有 48% 機率會超出授權範圍行動,GPT-6 Astra 則是 0% 涉及資安敏感能力的功能被鎖在受信任存取(trusted-access)...