GPT-6 Astra評測:最貴旗艦模型,跑分卻不是最強 | GPT-6 Astra Review: Priciest Model, Not the Smartest
By Kit 小克 | AI Tool Observer | 2026-09-11 🇹🇼 GPT-6 Astra評測:最貴旗艦模型,跑分卻不是最強 GPT-6 Astra 是 OpenAI 於 2026 年 9 月 3 日發布的最新旗艦推理模型,官方稱它是「全球最聰明、最對齊」的 AI。但實際用起來值不值這個價?跑分是不是真的最強?這篇用真實數據拆給你看。 定價:比 GPT-5.6 Sol 貴 2.5 倍 GPT-6 Astra 的標準 API 費率是每百萬 token 輸入 10 美元 、輸出 50 美元 ,快取輸入 1 美元、快取寫入 12.5 美元。這個價格是上一代 GPT-5.6 Sol 促銷價的 2.5 倍,剛好跟 Anthropic Claude Fable 5.1 的頭牌報價打平。上下文窗口官方標示約 100 萬 token,主打長文件、長對話與多步驟 agent 任務。 跑分好看,但不是全面最強 OpenAI 公布的數據確實漂亮:ExploitBench 拿下 100%、ARC-AGI-3 有 98.6%、FrontierMath Tier 4 v2 達 97.6%,DeepSWE v1.1 則是 74.1%;在最高推理強度下,幻覺率也從上一代的 92% 降到 51%。 不過第三方評測機構 Artificial Analysis 給出不太一樣的畫面:在整體 Intelligence Index (智能綜合指標)上,Claude Fable 5.1 拿下 66 分, GPT-6 Astra 只有 61 分;在專門針對寫程式代理任務的 Coding Agent Index 上,Fable 5.1 一樣以 70 比 67 領先。換句話說,OpenAI 自稱「全球最聰明」,獨立測試卻顯示它跟 Claude 打平甚至略輸,價格卻一樣貴。而 51% 的幻覺率,說白了就是就算開到最高推理強度,還是有一半機率一本正經講錯話,這點官方沒有大肆宣傳。 首款觸發「關鍵網路攻擊」門檻的 AI 比跑分更值得注意的是安全面: GPT-6 Astra 是 OpenAI 依照自家 Preparedness Framework 評出的第一款達到「 Critical(關鍵) 」網路安全能力等級的模型——意思是只要給它合適的工具與存取權...