發表文章

目前顯示的是有「阿里巴巴」標籤的文章

AI蒸餾風波評測:六家中國AI廠遭美方點名抄襲模型 | AI Distillation Review: US Names 6 Chinese AI Labs

By Kit 小克 | AI Tool Observer | 2026-09-10 🇹🇼 AI蒸餾風波評測:六家中國AI廠遭美方點名抄襲模型 AI蒸餾是什麼?NSA、CISA、FBI 為何聯手出手 美國國家安全局(NSA)、網路安全暨基礎設施安全署(CISA)與聯邦調查局(FBI)9 月 9 日發布聯合公告,直指六家中國AI公司—— DeepSeek、Moonshot AI、阿里巴巴(Alibaba)、MiniMax、StepFun、Z.AI ——自 2024 年底起,對美國前沿AI模型進行「工業規模」的 AI蒸餾 ,並認定這種行為已違反美國廠商的使用條款,威脅美國的技術領先地位。 六家廠商各自的「取材」對象 公告內容相當具體,點名了每家公司蒸餾的目標模型: DeepSeek :2024 年底到 2025 年中,被指蒸餾 Claude 3.7、Claude Sonnet 4/4.5、Claude Opus 4.1、Gemini 2.5 Pro/Flash Preview、GPT-4、GPT-4o、GPT-4 Mini、GPT-4 Nano、GPT-5、Grok 4,用來訓練 R1 與 V3 模型。 Moonshot AI :至少從 2025 年中起,大量擷取 Claude Fable 5 的輸出訓練 Kimi-K3,並用 GPT-4o 的輸出訓練 Kimi-K2。 阿里巴巴 :2025 年底蒸餾 Claude 與 GPT-5,用來強化 Qwen 系列模型。 公告用詞很重:蒸餾不是這些公司的「輔助手段」,而是「核心」的模型建構方式。 蒸餾到底是不是「抄襲」? 技術上,AI蒸餾指的是大量呼叫別家模型的 API、收集輸出結果,再拿這些資料訓練自己的(通常更小、更便宜的)模型——這在學術界是行之有年的正常技巧,OpenAI、Google 自己也用類似方法壓縮模型。爭議點在於「規模」與「條款」:Claude、GPT、Gemini 的使用條款都明文禁止用輸出訓練競品模型,這次公告等於用國安層級的措辭,把違反 TOS 的行為定調成國安威脅。但要注意,這是一份「公告」(advisory),不是起訴書,目前沒有任何法律行動,執行力其實有限。 對開發者與用戶的實際影響 如果你在用 Claude、GPT-5 或 Gemini 的 A...

Qwen3.8 Max 0902評測:跑分反超Opus 5,實測仍輸在關鍵任務 | Qwen3.8 Max 0902 Review: Wins on Paper, Not in Practice

By Kit 小克 | AI Tool Observer | 2026-09-09 🇹🇼 Qwen3.8 Max 0902評測:跑分反超Opus 5,實測仍輸在關鍵任務 Qwen3.8 Max 0902 是阿里巴巴 9 月 2 日推出的後訓練更新版本,架構沒變(2.4 兆參數 MoE、100 萬 token 上下文),但在 Code Arena WebDev 跑分上以 1691 分反超 Claude Opus 5 Max 的 1687 分,登上榜首。聽起來很猛,但拆開細看跑分,故事沒那麼簡單——它在關鍵的終端機代理任務上還是明顯落後。 Code Arena WebDev 贏了,但只贏 3 分 Qwen3.8 Max 0902 全部 8 項 coding 跑分都有進步,其中 TerminalBench 3.0 從 11.3 分暴增到 29.0 分, ProgramBench Almost Solved (黑箱程式碼還原)從 10.5 分翻到 28.0 分,看起來像是巨大進步。但 Code Arena WebDev 的領先幅度只有 3 分(1691 vs 1687),基本上是誤差範圍內的打平,稱不上「大勝」。 它真正贏的地方 SWE-Atlas QnA (跨檔案程式碼理解):贏 Opus 5 約 3 分 WorkArena (辦公任務)Elo 提升 120 分,來到 1468 多模態評測:小幅領先 Agentic SaaS 工作流:50.8 vs 50.3,基本是銅板機率 終端機代理任務,差距還是很大 真正決定「AI 能不能自己動手改 code」的 TerminalBench ,Qwen3.8 Max 0902 拿 29.0 分,Opus 5 拿 42.7 分——差了 13.7 分。NL2Repo(自然語言生成整個 repo)Qwen 是 64.9 分,Opus 5 是 72.3 分。CoWorkBench 辦公任務也是 76.1 分打 79.6 分。換句話說, Qwen3.8 Max 在「單題跑分」上進步很快,但碰到需要多步驟自主操作的真實任務,還是輸給 Opus 5。另外要注意,WorkArena、CoWorkBench、QwenSWEBench V2 這三項是 Qwen 自家設計的跑分,拿來當「贏」的證據時...

Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 | Qwen3.8-Max Review: Alibaba's 2.4T Model Rivals Fable 5

By Kit 小克 | AI Tool Observer | 2026-08-07 🇹🇼 Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 Qwen3.8-Max 是阿里巴巴8月3日發布的最新旗艦模型,總參數量來到2.4兆、每次推理啟用950億參數的MoE架構,官方公布的評測數字直接對標Claude Fable 5與GPT-5.6。這是阿里近期少數願意開源的Max等級模型,也讓「中國模型追平美系旗艦」的話題再度成為焦點。 Qwen3.8-Max規格與定價多少? Qwen3.8-Max是2.4兆參數的混合專家(MoE)模型,實際啟用參數約950億,支援文字、圖片、影片輸入,單次可處理高達100萬token的上下文。API目前已上線阿里雲Model Studio,價格為每百萬輸入token 2美元、輸出token 6美元,快取token則是每百萬0.25美元,同時提供OpenAI相容與Anthropic相容介面,理論上把Claude Code或Codex的設定改個幾行就能接上。 Qwen3.8-Max真的贏過Fable 5和GPT-5.6嗎? 阿里公布的內部評測顯示,Qwen3.8-Max在OSWorld-Verified、Terminal-Bench 2.1等代理型任務上分數領先GPT-5.6與Claude Fable 5,在Arena.AI的文字類排行榜上也一舉衝上中國模型第一名。但要注意這些數字目前全部來自官方自報,第三方尚未有機會用開源權重獨立覆現,加上不同媒體整理出來的分數版本差異不小,建議先當參考、別直接當成定論。 開源時程與對開發者的實際意義 阿里表示Qwen3.8-Max的開源權重會「下週」釋出,這將是Qwen系列第一個Max等級的開源模型,也代表阿里從先前把旗艦模型收緊為閉源,重新轉向開源策略。對開發者來說重點有三: 先API後開源 :現在只能透過付費API測試,真正能自架、微調要等權重釋出,屆時才有機會驗證官方數字是否誇大。 定價具競爭力 :每百萬token 2/6美元的組合,比多數美系旗艦模型便宜,適合先拿來做大量呼叫的原型測試。 相容層省事 :OpenAI與Anthropic雙相容介面,讓既有的agent workflow遷移成本降低,但複雜推理、安全性仍建議實測再上生產環境...

Qwen3.8-Max評測:阿里2.4兆參數模型下週開源 | Qwen3.8-Max Review: Alibaba 2.4T Model Goes Open Source

By Kit 小克 | AI Tool Observer | 2026-08-05 🇹🇼 Qwen3.8-Max評測:阿里2.4兆參數模型下週開源 Qwen3.8-Max 是阿里巴巴8月4日發布的最新旗艦模型,總參數量達2.4兆、採用MoE(混合專家)架構、每次請求僅啟動約950億參數,支援高達100萬token的上下文視窗。這次發布最受矚目的不是效能數字,而是阿里承諾 下週釋出開源權重 ——這是Qwen-Max等級模型首次不再只鎖在API後面。 Qwen3.8-Max效能到底如何? 基準測試結果是「各有勝負」,不是一面倒的碾壓。在程式碼相關測試上: Terminal-Bench 2.1 :86.6分,略輸GPT-5.6 Sol的88.8分,但贏過Claude Opus 4.8與Fable 5的84.6分 SWE-bench Pro :67.7分,明顯落後Claude Fable 5的80.0分,這是Qwen3.8-Max最弱的一塊 PaperBench :93.0分,反而超越GPT-5.6 Sol的90.5分與Fable 5的88.8分 在代理(Agent)任務與長流程作業上,Qwen3.8-Max表現最亮眼:CoWorkBench拿下74.8分(贏過Sol的71.5分),WideSearch更是拿到81.9分。官方展示案例包括讓模型獨立完成125小時的研究複現任務、10天份的完整程式專案,以及一場電商模擬賺進人民幣416,252元——顯示這顆模型的長時間自主作業能力是重點賣點,而非單純的解題分數。 為什麼開源這件事比跑分更重要 過去阿里的Qwen-Max系列都是「參數最大、效能最強」但只能透過API使用的頂規模型,開源的是縮小版。這次Qwen3.8-Max打算把旗艦權重也公開,加上小老弟Qwen3.8-27B同步開源,等於讓企業和開發者可以自架、微調、甚至商用部署一顆真正接近前沿水準的模型,不必被單一API供應商綁住。這對正在評估 私有化部署 或資料合規要求高的團隊,是很實際的誘因。 價格與取得方式 API目前已經上線,走OpenAI相容端點,價格為每百萬輸入token 2美元、每百萬輸出token 6美元,快取輸入token只要0.25美元,比多數西方競品便宜不少。內建五種工具(程式碼直譯器、網頁搜尋、網頁...