發表文章

目前顯示的是有「LLM Benchmark」標籤的文章

GPT-6 Astra評測:最貴旗艦模型,跑分卻不是最強 | GPT-6 Astra Review: Priciest Model, Not the Smartest

By Kit 小克 | AI Tool Observer | 2026-09-11 🇹🇼 GPT-6 Astra評測:最貴旗艦模型,跑分卻不是最強 GPT-6 Astra 是 OpenAI 於 2026 年 9 月 3 日發布的最新旗艦推理模型,官方稱它是「全球最聰明、最對齊」的 AI。但實際用起來值不值這個價?跑分是不是真的最強?這篇用真實數據拆給你看。 定價:比 GPT-5.6 Sol 貴 2.5 倍 GPT-6 Astra 的標準 API 費率是每百萬 token 輸入 10 美元 、輸出 50 美元 ,快取輸入 1 美元、快取寫入 12.5 美元。這個價格是上一代 GPT-5.6 Sol 促銷價的 2.5 倍,剛好跟 Anthropic Claude Fable 5.1 的頭牌報價打平。上下文窗口官方標示約 100 萬 token,主打長文件、長對話與多步驟 agent 任務。 跑分好看,但不是全面最強 OpenAI 公布的數據確實漂亮:ExploitBench 拿下 100%、ARC-AGI-3 有 98.6%、FrontierMath Tier 4 v2 達 97.6%,DeepSWE v1.1 則是 74.1%;在最高推理強度下,幻覺率也從上一代的 92% 降到 51%。 不過第三方評測機構 Artificial Analysis 給出不太一樣的畫面:在整體 Intelligence Index (智能綜合指標)上,Claude Fable 5.1 拿下 66 分, GPT-6 Astra 只有 61 分;在專門針對寫程式代理任務的 Coding Agent Index 上,Fable 5.1 一樣以 70 比 67 領先。換句話說,OpenAI 自稱「全球最聰明」,獨立測試卻顯示它跟 Claude 打平甚至略輸,價格卻一樣貴。而 51% 的幻覺率,說白了就是就算開到最高推理強度,還是有一半機率一本正經講錯話,這點官方沒有大肆宣傳。 首款觸發「關鍵網路攻擊」門檻的 AI 比跑分更值得注意的是安全面: GPT-6 Astra 是 OpenAI 依照自家 Preparedness Framework 評出的第一款達到「 Critical(關鍵) 」網路安全能力等級的模型——意思是只要給它合適的工具與存取權...

DeepSeek V4.1 Flash評測:48小時限時Beta,編程強知識弱 | DeepSeek V4.1 Flash Review: 48-Hour Beta, Cheap Coding

By Kit 小克 | AI Tool Observer | 2026-09-10 🇹🇼 DeepSeek V4.1 Flash評測:48小時限時Beta,編程強知識弱 DeepSeek V4.1 Flash 是DeepSeek在9月9日悄悄放出的限時測試模型,主打原生多模態架構,但這場實測只開放48小時,9月10日就要下線——也就是說,你現在讀到這篇文章的當下,它很可能已經關掉了。這正是這次話題的核心:一家中國AI公司用「快閃beta」的方式,讓全世界幫它跑分,隨時可以喊停走人。 DeepSeek V4.1 Flash是什麼:架構大改版 與8月21日發布、只是在文字模型外掛視覺套件的V4-Flash-Vision-Exp不同,DeepSeek V4.1 Flash把文字、圖片、語音輸入直接整合進模型架構本身,是V4系列自今年4月發布以來最大的一次架構更新。技術規格上它是552B參數的MoE模型,採不對稱設計:輸入端只啟動8B參數,輸出端啟動16B參數,這也是它能維持低成本的關鍵。 跑分實測:編程、資安贏過旗艦模型,知識類明顯落後 在多項第三方跑分中,DeepSeek V4.1 Flash表現出乎意料。資安測試CyberGym拿下88.1分,超過GPT 5.6 Sol與GLM 5.3的84.5分;軟體工程測試DeepSWE v1.1拿下74.2分,微幅超過Claude Opus 5的74.0分;自動化任務Automation-Bench更以54.8分領先Opus 5的50.3分。 但這不代表全面超越 ——知識類測試HLE上,Opus 5拿56.3分,V4.1 Flash只有36.8分;終端操作測試Terminal-Bench 3.0上,Opus 5更以43.3分大幅甩開它的30.0分。簡單說:這是一個被刻意調校去打「agentic與編程」戰場的模型,知識廣度不是它的主場。 便宜到誇張,但別急著All In 價格才是真正吸睛的地方。離峰時段輸出價格每百萬token只要0.6美元,是Claude Opus 5每百萬token 25美元的四十分之一以上;尖峰時段也還維持在約二十分之一的水準。在OpenDesign Arena的設計任務測試中,V4.1 Flash只花5.3分鐘、0.023美元完成,同等任務GPT-6 Astra要價...

GLM-5.3-Flash評測:神秘模型現形,價格僅Opus的1/30 | GLM-5.3-Flash Review: Mystery Model, 1/30 the Price

By Kit 小克 | AI Tool Observer | 2026-09-04 🇹🇼 GLM-5.3-Flash評測:神秘模型現形,價格僅Opus的1/30 GLM-5.3-Flash 這幾天在開發圈炸出一則有趣的偵探故事:8 月 20 日到 26 日,OpenRouter 上悄悄出現一個代號「Ox Alpha」的匿名模型,免費開放測試。短短六天,它就衝上 OpenRouter 使用量冠軍,還吃下超過 10% 的 OpenCode 流量。開發者靠著比對 tokenizer 輸出、影片 token 消耗模式,以及一些「很 GLM」的錯誤訊息,拼湊出它的真實身分。8 月 26 日,中國 AI 實驗室 Z.ai 正式承認:Ox Alpha 就是他們的新旗艦 GLM-5.3-Flash ,權重同步上架 Hugging Face。 GLM-5.3-Flash 規格:320B 參數,MIT 授權開源 GLM-5.3-Flash 是 GLM-5 系列第一個原生多模態模型,支援文字、圖片、影片輸入,採 320B 總參數、18B 啟用參數的 MoE 架構,context window 拉到 100 萬 token。架構上使用混合稀疏與線性注意力機制,搭配 Z.ai 自稱的「Manifold-Constrained Hyper-Connections」,官方數據顯示長文本情境下注意力運算量少了約 3 倍、KV cache 縮小超過 4 倍。最重要的是,這次是 完全開源的 MIT 授權 ,想自架部署沒有任何限制。 跑分逼近 Claude Opus 4.8,價格卻只要三十分之一 在 Z.ai 自家的 Code Bench(max effort)上,GLM-5.3-Flash 拿下 29.0 分,只小輸 Claude Opus 4.8 的 29.5 分;在 DeepSWE v1.1 上,分數從上一代 GLM-5.2 的 46.2 直接跳到 63.4。更狠的是效率:在 High effort 設定下,GLM-5.3-Flash 只用約 5 萬個輸出 token 就拿到 31.4% 的成績,Opus 4.8 卻要燒掉約 12 萬個 token 才有 29.5%。定價方面,輸入 $0.15/M、輸出 $0.50/M、快取輸入 $0.03/M,相較 Opus...

Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 | Qwen3.8-Max Review: Alibaba's 2.4T Model Rivals Fable 5

By Kit 小克 | AI Tool Observer | 2026-08-07 🇹🇼 Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 Qwen3.8-Max 是阿里巴巴8月3日發布的最新旗艦模型,總參數量來到2.4兆、每次推理啟用950億參數的MoE架構,官方公布的評測數字直接對標Claude Fable 5與GPT-5.6。這是阿里近期少數願意開源的Max等級模型,也讓「中國模型追平美系旗艦」的話題再度成為焦點。 Qwen3.8-Max規格與定價多少? Qwen3.8-Max是2.4兆參數的混合專家(MoE)模型,實際啟用參數約950億,支援文字、圖片、影片輸入,單次可處理高達100萬token的上下文。API目前已上線阿里雲Model Studio,價格為每百萬輸入token 2美元、輸出token 6美元,快取token則是每百萬0.25美元,同時提供OpenAI相容與Anthropic相容介面,理論上把Claude Code或Codex的設定改個幾行就能接上。 Qwen3.8-Max真的贏過Fable 5和GPT-5.6嗎? 阿里公布的內部評測顯示,Qwen3.8-Max在OSWorld-Verified、Terminal-Bench 2.1等代理型任務上分數領先GPT-5.6與Claude Fable 5,在Arena.AI的文字類排行榜上也一舉衝上中國模型第一名。但要注意這些數字目前全部來自官方自報,第三方尚未有機會用開源權重獨立覆現,加上不同媒體整理出來的分數版本差異不小,建議先當參考、別直接當成定論。 開源時程與對開發者的實際意義 阿里表示Qwen3.8-Max的開源權重會「下週」釋出,這將是Qwen系列第一個Max等級的開源模型,也代表阿里從先前把旗艦模型收緊為閉源,重新轉向開源策略。對開發者來說重點有三: 先API後開源 :現在只能透過付費API測試,真正能自架、微調要等權重釋出,屆時才有機會驗證官方數字是否誇大。 定價具競爭力 :每百萬token 2/6美元的組合,比多數美系旗艦模型便宜,適合先拿來做大量呼叫的原型測試。 相容層省事 :OpenAI與Anthropic雙相容介面,讓既有的agent workflow遷移成本降低,但複雜推理、安全性仍建議實測再上生產環境...