發表文章

目前顯示的是有「Open Source LLM」標籤的文章

GLM-5.3-Flash評測:神秘模型現形,價格僅Opus的1/30 | GLM-5.3-Flash Review: Mystery Model, 1/30 the Price

By Kit 小克 | AI Tool Observer | 2026-09-04 🇹🇼 GLM-5.3-Flash評測:神秘模型現形,價格僅Opus的1/30 GLM-5.3-Flash 這幾天在開發圈炸出一則有趣的偵探故事:8 月 20 日到 26 日,OpenRouter 上悄悄出現一個代號「Ox Alpha」的匿名模型,免費開放測試。短短六天,它就衝上 OpenRouter 使用量冠軍,還吃下超過 10% 的 OpenCode 流量。開發者靠著比對 tokenizer 輸出、影片 token 消耗模式,以及一些「很 GLM」的錯誤訊息,拼湊出它的真實身分。8 月 26 日,中國 AI 實驗室 Z.ai 正式承認:Ox Alpha 就是他們的新旗艦 GLM-5.3-Flash ,權重同步上架 Hugging Face。 GLM-5.3-Flash 規格:320B 參數,MIT 授權開源 GLM-5.3-Flash 是 GLM-5 系列第一個原生多模態模型,支援文字、圖片、影片輸入,採 320B 總參數、18B 啟用參數的 MoE 架構,context window 拉到 100 萬 token。架構上使用混合稀疏與線性注意力機制,搭配 Z.ai 自稱的「Manifold-Constrained Hyper-Connections」,官方數據顯示長文本情境下注意力運算量少了約 3 倍、KV cache 縮小超過 4 倍。最重要的是,這次是 完全開源的 MIT 授權 ,想自架部署沒有任何限制。 跑分逼近 Claude Opus 4.8,價格卻只要三十分之一 在 Z.ai 自家的 Code Bench(max effort)上,GLM-5.3-Flash 拿下 29.0 分,只小輸 Claude Opus 4.8 的 29.5 分;在 DeepSWE v1.1 上,分數從上一代 GLM-5.2 的 46.2 直接跳到 63.4。更狠的是效率:在 High effort 設定下,GLM-5.3-Flash 只用約 5 萬個輸出 token 就拿到 31.4% 的成績,Opus 4.8 卻要燒掉約 12 萬個 token 才有 29.5%。定價方面,輸入 $0.15/M、輸出 $0.50/M、快取輸入 $0.03/M,相較 Opus...

DeepSeek融資評測:估值兩個月翻倍衝上750億美元 | DeepSeek Funding Review: Valuation Doubles to $74B in Two Months

By Kit 小克 | AI Tool Observer | 2026-08-31 🇹🇼 DeepSeek融資評測:估值兩個月翻倍衝上750億美元 DeepSeek 傳出正在進行新一輪融資,金額約 74 億美元 (人民幣 500 億元),投前估值來到 740 億美元 ,投後估值約 810 億美元,預計 2026 年 8 月底完成交割。這距離 6 月那輪外部募資、估值僅約 500 億美元,才過了兩個月,估值幾乎翻倍——這是這家開源模型黑馬第一次真正意義上的「創投化」,也是這波 AI 新聞裡最值得拆解的一則。 從避險基金自籌到外部創投 DeepSeek 過去主要靠創辦人梁文鋒的避險基金 High-Flyer Quant 自掏腰包養算力,但基礎設施成本一路飆升,光是這輪就打算加碼約 1GW 運算容量,用來訓練更大模型、搶人才。這次名單上出現 Monolith、世芯資本(Shixiang Capital)、寧德時代(CATL)等既有股東,加上 CPE、聯想之星(Legend Capital)、合肥的地方國資基金等新面孔,等於把「DeepSeek 融資」從創辦人個人操盤,正式轉為一場多方參與的資本局。 估值背後的誠實提問:營收撐得起 740 億嗎? 目前流傳的數字是 DeepSeek 年化營收(ARR)約 5 億美元 ,對應 740 億估值,大約是 150 倍營收 的天價倍數。要注意的是,這輪條款尚未經 DeepSeek 或 High-Flyer 官方證實,外媒說法都來自「知情人士」。換句話說,這是一則值得關注、但還不能全信的融資傳聞——AI 圈的估值故事,這幾年已經看過太多先喊價、後打折的案例。 對用戶與開發者實際上代表什麼 老實說:這輪融資不會讓你手上的 DeepSeek R1 或 V3 模型變得更聰明,開源權重也不會因為估值翻倍而改版。真正該注意的是 DeepSeek 先前已經調漲過 API 價格——算力便宜了,但晶片、電費、留才成本沒有變便宜,這才是融資背後真正的商業邏輯。如果你在生產環境用 DeepSeek API,該看的是計費頁面,不是估值新聞。 DeepSeek 計畫最快 2026 年底遞交 IPO 申請,2027 年在上海科創板掛牌。這條路線清楚說明中國把 DeepSeek 當成 AI 國家隊在扶植,但估值是否...

Qwen3.8-Max評測:2.4兆參數開源模型直逼Claude | Qwen3.8-Max Review: 2.4T-Param Open Model Rivals Claude

By Kit 小克 | AI Tool Observer | 2026-08-23 🇹🇼 Qwen3.8-Max評測:2.4兆參數開源模型直逼Claude Qwen3.8-Max 是阿里巴巴 8 月 3 日正式推出的新一代開源模型,號稱是「史上最大開源模型」——2.4 兆參數的 MoE 架構,官方甚至聲稱效能只落後 Anthropic 的 Claude。這篇評測整理規格、開源程度和實際能不能用的落差,給想評估的開發者參考。 Qwen3.8-Max 規格拆解:2.4兆參數、100萬token上下文 Qwen3.8-Max 採用 Mixture-of-Experts(MoE)架構,總參數 2.4 兆,但每次推論只啟用約 950 億參數,這是大型 MoE 模型控制算力成本的標準做法。原生上下文窗口 26.2 萬 token,透過 YaRN 技術可擴展到 100 萬 token ,並支援多模態輸入。 參數規模 :2.4T 總參數 / 95B 啟用參數(MoE) 上下文長度 :262K,YaRN 擴展至 1M token 模態 :多模態(文字+圖像) API 定價 :QwenCloud 上約 $2 / $6 每百萬 token(輸入/輸出) 開源到什麼程度?27B 全開放 vs 2.4T 客製授權 這裡是最容易誤會的地方。真正「開源」的是 Qwen3.8-27B ,8 月 13-14 日以 Apache 2.0 授權上架 Hugging Face,可以自由商用、自由微調。但外界最關注的 2.4 兆參數旗艦版(Qwen3.8-2.4T-A95B)雖然也開放了權重,用的卻是 客製授權條款 ,不是完全無限制的 Apache 2.0。換句話說,「史上最大開源模型」這個標題要打折扣看——權重公開了,但條款仍有限制。 真的能自己跑嗎?硬體門檻才是關鍵 2.4 兆參數就算是 MoE 架構,權重檔案動輒數百 GB 起跳,一般開發者的單機、甚至單張消費級 GPU 完全跑不動,需要多卡叢集才有辦法本地部署。所以對大多數團隊來說,Qwen3.8-Max 的實際使用方式還是透過 QwenCloud API,而不是自己架設。真正能「拿回家跑」的其實是 27B 版本,這也是它比 2.4T 版本更值得關注的原因——一般開發機或雲端單卡就能跑。 Q...

Muse Glimmer評測:Meta 30B開源模型單張GPU可跑 | Muse Glimmer Review: 30B Open Model Runs on One GPU

By Kit 小克 | AI Tool Observer | 2026-08-16 🇹🇼 Muse Glimmer評測:Meta 30B開源模型單張GPU可跑 Muse Glimmer 是 Meta 於 2026 年 8 月 10 日釋出的 300 億參數開源模型,主打不靠雲端、單張消費級顯卡就能跑本地代理任務。這款模型採用 Apache 2.0 授權,重點不是刷榜分數,而是把原本要 55GB RAM 的 30B 模型硬是壓到 20GB 以下,讓一般玩家的 RTX 卡也能跑起來。 Muse Glimmer 的核心技術:怎麼把 30B 塞進消費級顯卡 Meta 用了兩招把 Muse Glimmer 的硬體門檻壓低: 4-bit 量化 :把模型權重壓縮成 4 位元,記憶體用量大幅下降,代價是精度略有損失。 Drafter 驗證機制(DFlash) :先用一個較小的「草稿模型」快速生成初步答案,再由主模型驗證、修正、輸出最終結果,藉此加快推論速度。 官方在 Hugging Face 上同時釋出 BF16 完整權重、GGUF 量化版、ExecuTorch 版本,以及那個 Drafter 模型,開發者可以依自己的硬體條件選擇。 誰該關注這款開源模型 如果你是想在本機跑 agent(代理任務、工具呼叫、長時間背景執行)又不想燒雲端 API 費用的開發者, Muse Glimmer 值得列入候選名單。官方強調它是為「always-on 本地代理」設計,也就是那種需要長時間掛著、不斷呼叫工具的場景,而不是單次問答。 實測前要注意的限制 量化後精度是否夠用,要看你的任務類型,複雜推理場景建議自己先測再上線。 雖然號稱「一張消費級 GPU」,20GB VRAM 對大多數家用顯卡(如 12GB/16GB 卡)仍偏緊,建議先確認自己的顯卡等級。 Drafter 驗證機制在某些任務上能加速,但不是所有場景都有感,實際延遲要自己量。 這波開源模型競賽(包含先前的 Qwen3.8-27B)顯示一個趨勢:廠商越來越在意「能不能在本地跑」而不只是雲端跑分。對想擺脫 API 依賴的團隊來說,這類模型是值得追蹤的方向,但別急著全面替換正式環境。 好不好用,試了才知道。 資料來源: VentureBeat: Meta retu...

Muse Glimmer評測:Meta 30B開源模型單卡跑本地AI代理 | Muse Glimmer Review: Meta's 30B Local AI Agent Model

By Kit 小克 | AI Tool Observer | 2026-08-11 🇹🇼 Muse Glimmer評測:Meta 30B開源模型單卡跑本地AI代理 Muse Glimmer 是Meta Superintelligence Labs在2026年8月10日開源釋出的300億參數AI代理模型,重點是「單張消費級GPU就能在本地跑」——不用雲端API、不用訂閱費,經過4-bit量化後記憶體需求從55GB壓到18-20GB,24GB或32GB VRAM的顯卡(例如RTX 4090或Mac)就能塞下模型、KV cache、感知編碼器跟推測解碼器一起跑。這篇評測拆解Muse Glimmer到底能不能取代雲端AI代理。 什麼是Muse Glimmer? Muse Glimmer是從Meta更大型的Muse Spark系列蒸餾出來的開源代理模型,採用Apache 2.0授權,可自由商用。它不是單純的聊天模型,而是針對「常駐型本地代理」設計的:寫程式、呼叫函式(function calling)、排程管理、整理檔案、多步驟推理與失敗重試都在它的目標場景內。 Muse Glimmer能在什麼硬體上跑? 這是 Muse Glimmer 最大的賣點。透過4-bit量化,模型本體加上推論所需的KV cache、感知編碼器、投機解碼draft model,全部塞進24GB到32GB VRAM,一張桌機等級的顯卡或近期的Mac就能整套跑起來,不必碰資料中心等級的硬體。對比動輒要租A100、H100的雲端代理方案,這個門檻低了不少。 跟其他開源代理模型比有什麼優勢? 市面上開源模型不少,但多數要嘛參數量太大跑不動消費卡,要嘛閹割到能力打折。Muse Glimmer的定位很明確:犧牲一點頂尖跑分,換取「真的能在自己電腦上常駐執行」的可用性。Meta把這定位成開源陣營對抗OpenAI、Anthropic封閉模型策略的一步棋——本地跑代表資料不用上傳雲端,對重視隱私或想省API費用的開發者是實質誘因。但要注意,本地代理長時間背景執行,同時也代表少了雲端平台常見的安全稽核與日誌機制,這點在導入前要自己補上防護。 怎麼下載使用Muse Glimmer? 模型權重已上架Hugging Face,Apache 2.0授權下可直接下載、微調或整合進現...

Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 | Qwen3.8-Max Review: Alibaba's 2.4T Model Rivals Fable 5

By Kit 小克 | AI Tool Observer | 2026-08-07 🇹🇼 Qwen3.8-Max評測:阿里2.4兆參數模型開源迎戰Fable 5 Qwen3.8-Max 是阿里巴巴8月3日發布的最新旗艦模型,總參數量來到2.4兆、每次推理啟用950億參數的MoE架構,官方公布的評測數字直接對標Claude Fable 5與GPT-5.6。這是阿里近期少數願意開源的Max等級模型,也讓「中國模型追平美系旗艦」的話題再度成為焦點。 Qwen3.8-Max規格與定價多少? Qwen3.8-Max是2.4兆參數的混合專家(MoE)模型,實際啟用參數約950億,支援文字、圖片、影片輸入,單次可處理高達100萬token的上下文。API目前已上線阿里雲Model Studio,價格為每百萬輸入token 2美元、輸出token 6美元,快取token則是每百萬0.25美元,同時提供OpenAI相容與Anthropic相容介面,理論上把Claude Code或Codex的設定改個幾行就能接上。 Qwen3.8-Max真的贏過Fable 5和GPT-5.6嗎? 阿里公布的內部評測顯示,Qwen3.8-Max在OSWorld-Verified、Terminal-Bench 2.1等代理型任務上分數領先GPT-5.6與Claude Fable 5,在Arena.AI的文字類排行榜上也一舉衝上中國模型第一名。但要注意這些數字目前全部來自官方自報,第三方尚未有機會用開源權重獨立覆現,加上不同媒體整理出來的分數版本差異不小,建議先當參考、別直接當成定論。 開源時程與對開發者的實際意義 阿里表示Qwen3.8-Max的開源權重會「下週」釋出,這將是Qwen系列第一個Max等級的開源模型,也代表阿里從先前把旗艦模型收緊為閉源,重新轉向開源策略。對開發者來說重點有三: 先API後開源 :現在只能透過付費API測試,真正能自架、微調要等權重釋出,屆時才有機會驗證官方數字是否誇大。 定價具競爭力 :每百萬token 2/6美元的組合,比多數美系旗艦模型便宜,適合先拿來做大量呼叫的原型測試。 相容層省事 :OpenAI與Anthropic雙相容介面,讓既有的agent workflow遷移成本降低,但複雜推理、安全性仍建議實測再上生產環境...