發表文章

目前顯示的是有「Fable 5」標籤的文章

Grok 4.6評測:xAI新旗艦模型ELO稱王但輸Fable 5一分 | Grok 4.6 Review: xAI Flagship Nearly Beats Fable 5

By Kit 小克 | AI Tool Observer | 2026-08-14 🇹🇼 Grok 4.6評測:xAI新旗艦模型ELO稱王但輸Fable 5一分 Grok 4.6是什麼?xAI新旗艦模型登場 Grok 4.6 是xAI於2026年8月12日發布的新旗艦模型,接替Grok 4.5的位置,主打能撐住研究、寫程式、規劃大型專案這類需要多步驟推理的長任務。這次更新用了更長的補充訓練,加入模型自產的推理與工程資料、重新調整過的優化器、重新生成的監督微調軌跡,並在知識工作、程式碼、核運算優化、網頁開發、CAD等多種代理環境中做了強化學習。 跑分表現:追平GPT-5.6,僅輸Fable 5一分 在Artificial Analysis Intelligence Index(由九項基準組成的綜合分數)上, Grok 4.6 拿下61分,跟GPT-5.6 Sol Max打平,只比Fable 5 Max的62分低一分。細看各項基準: Databricks排行榜 :Grok 4.6拿下第一名 LMSYS Chatbot Arena :ELO 1753分,同樣是第一 GDPVal-AA、AA-Briefcase、Harvey LAB :全面大勝Grok 4.5 High DeepSWE、Terminal-Bench :反而輸給前代Grok 4.5 High 值得注意的是,Grok 4.6在長任務上開始展現「自我檢查」行為——不是一次生成就結束,而是會在往下走之前先驗證自己的輸出,這對需要多輪推理的代理任務(agentic task)特別有幫助。 定價與規格:50萬token超長上下文 上下文窗口 :500,000 tokens 200K以下輸入 :每百萬token 2美元 快取輸入 :每百萬token 0.5美元 輸出 :每百萬token 6美元 超過200K長上下文 :價格全面翻倍(4/1/12美元) 這個定價比多數同級旗艦模型便宜不少,對需要大量呼叫API的開發者來說是個實際考量點。 小克實測心得 Grok 4.6沒有炸裂式的跑分突破,但在「打平GPT-5.6、逼近Fable 5」的位置上,配上明顯較低的定價和50萬token的長上下文,對做程式碼代理或研究助手的開發者來說,是個值得排進測試清單的選項...

Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 | Qwen3.8-Max Review: Alibaba's 2.4T Model Rivals Fable 5

By Kit 小克 | AI Tool Observer | 2026-08-07 🇹🇼 Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 Qwen3.8-Max 是阿里巴巴8月3日發布的最新旗艦模型,總參數量來到2.4兆、每次推理啟用950億參數的MoE架構,官方公布的評測數字直接對標Claude Fable 5與GPT-5.6。這是阿里近期少數願意開源的Max等級模型,也讓「中國模型追平美系旗艦」的話題再度成為焦點。 Qwen3.8-Max規格與定價多少? Qwen3.8-Max是2.4兆參數的混合專家(MoE)模型,實際啟用參數約950億,支援文字、圖片、影片輸入,單次可處理高達100萬token的上下文。API目前已上線阿里雲Model Studio,價格為每百萬輸入token 2美元、輸出token 6美元,快取token則是每百萬0.25美元,同時提供OpenAI相容與Anthropic相容介面,理論上把Claude Code或Codex的設定改個幾行就能接上。 Qwen3.8-Max真的贏過Fable 5和GPT-5.6嗎? 阿里公布的內部評測顯示,Qwen3.8-Max在OSWorld-Verified、Terminal-Bench 2.1等代理型任務上分數領先GPT-5.6與Claude Fable 5,在Arena.AI的文字類排行榜上也一舉衝上中國模型第一名。但要注意這些數字目前全部來自官方自報,第三方尚未有機會用開源權重獨立覆現,加上不同媒體整理出來的分數版本差異不小,建議先當參考、別直接當成定論。 開源時程與對開發者的實際意義 阿里表示Qwen3.8-Max的開源權重會「下週」釋出,這將是Qwen系列第一個Max等級的開源模型,也代表阿里從先前把旗艦模型收緊為閉源,重新轉向開源策略。對開發者來說重點有三: 先API後開源 :現在只能透過付費API測試,真正能自架、微調要等權重釋出,屆時才有機會驗證官方數字是否誇大。 定價具競爭力 :每百萬token 2/6美元的組合,比多數美系旗艦模型便宜,適合先拿來做大量呼叫的原型測試。 相容層省事 :OpenAI與Anthropic雙相容介面,讓既有的agent workflow遷移成本降低,但複雜推理、安全性仍建議實測再上生產環境...