發表文章

目前顯示的是有「程式碼生成」標籤的文章

GPT-5.6評測:Sol、Terra、Luna三檔怎麼選不踩雷 | GPT-5.6 Review: Sol vs Terra vs Luna, Pick Right

By Kit 小克 | AI Tool Observer | 2026-09-15 🇹🇼 GPT-5.6評測:Sol、Terra、Luna三檔怎麼選不踩雷 OpenAI 最新發布的 GPT-5.6 大改了命名邏輯:不再是單一模型,而是切成 Sol、Terra、Luna 三個檔位,讓開發者依任務難度和預算自行搭配。三檔到底怎麼選、划不划算,直接影響 API 帳單,這篇用實測數字說清楚,不談行銷術語。 GPT-5.6 三檔是什麼 在 GPT-5.6 的新命名法裡,版本號代表世代,Sol/Terra/Luna 則是可各自獨立升級的能力層級: Sol :旗艦款,唯一支援最高推理強度與 Ultra 模式,每百萬 token 輸入 5 美元、輸出 30 美元。 Terra :主力款,多數跑分只落後 Sol 2~3 分,價格砍半以上(輸入 2 美元/輸出 12 美元)。 Luna :極速款,價格只要 Sol 的二十五分之一(輸入 0.2 美元/輸出 1.2 美元),適合高流量、低深度的工作。 別只看單價,要算「解出一個任務的成本」 程式碼審查工具商 CodeRabbit 實測 100 多個長流程編碼任務發現: Sol 平均只用 20,968 個 output token 就拿下 63.7% 通過率; Terra 雖然單價便宜,卻要燒到 55,594 個 token 才拿到 40.7% 通過率。換算下來,複雜任務丟給 Terra 省的是帳面單價,賠的是總 token 量與失敗重跑的時間—— 便宜不等於划算 。 三檔怎麼分工比較實際 Terra 當預設 :一般任務、程式碼初審、中等複雜度的助理功能。 Sol 留給硬仗 :長流程 Agent、瀏覽器與終端機操作(BrowseComp 拿下 92.2%、Terminal-Bench 2.1 拿下 88.8%)、資安研究這類需要一路盯到底的工作。 Luna 專攻走量 :分類、摘要這種淺任務,但長文本記憶只有 41.3%(Sol 是 91.5%),別拿它做需要記住整份文件的工作。 誠實地說:GPT-5.6 不是全面最強 在純程式碼跑分 SWE-Bench Pro 上,Claude Fable 5 拿下 80%,Sol 只有 64.6%。GPT-5.6 的優勢在「長時間不...

DeepSeek V4 Flash評測:官方版跑分贏過Pro預覽版 | DeepSeek V4 Flash Review: GA Build Beats Pro-Preview

By Kit 小克 | AI Tool Observer | 2026-08-08 🇹🇼 DeepSeek V4 Flash評測:官方版跑分贏過Pro預覽版 DeepSeek 在 7 月 31 日把 DeepSeek V4 Flash 從預覽版轉正,正式推出 0731 版本,這次更新主打「代理任務」與寫程式能力大幅提升,官方公布的跑分甚至超越自家更貴的 V4-Pro-Preview。對天天要跑 agent workflow 又在意成本的開發者來說,這是這週最值得關注的模型更新。 DeepSeek V4 Flash 跑分:官方版真的贏了 Pro 預覽版 V4-Flash-0731 是一個 284B 參數的 MoE 模型,實際運算只啟動 13B 參數,支援 100 萬 token 的超長上下文。模型架構跟 Preview 版完全一樣,這次只重做了 post-training(後訓練),但成績差很多: Terminal Bench 2.1 :82.7 分,V4-Pro-Preview 只有 72.1,前一版 Flash Preview 更只有 61.8 Cybergym :76.7 分 Toolathlon verified :70.3 分 NL2Repo :54.2 分、 DeepSWE :54.4 分 Agent Last Exam :25.2 分,明顯是幾項跑分裡最弱的一項 價格砍到不能再砍 比跑分更狠的是價格:輸入 token 每百萬只要 0.14 美元(命中快取只要 0.0028 美元,等於打不到 2 折),輸出每百萬 0.28 美元。對於需要大量呼叫 API 跑 agent 迴圈的團隊,這個價格幾乎把雲端 API 成本壓到跟本地跑模型差不多的水準。 老實說:DeepSeek V4 Flash 跑分要保留一點懷疑 DeepSeek 官方是用自家的 Harness(測試工具鏈)在 minimal mode、max tier 條件下測出這些分數,agent 類跑分對測試環境非常敏感,同一個模型換一套 harness 分數可能差一大截。在社群獨立重現這些數字之前,這些成績只能當「廠商自報」參考,不建議直接拿來做選型的唯一依據。另外要提醒,V4-Pro 正式版目前還沒上線,官方說「很快就來」,代表現階段 Flas...