關鍵要點:
- Inkling 是一個擁有 9750 億參數的 MoE 模型,推論時僅啟動 410 億個參數
- 在 MCP Atlas 代理工具使用測試中獲得 74.1% 分數,較 Nvidia 的 Nemotron 高出近 30 個百分點
- 該模型受到嚴格審查限制,且在程式撰寫與推理測試中表現不如較小型的模型
關鍵要點:

Mira Murati 創立的 Thinking Machines Lab 發布了 Inkling,這是一個擁有 9750 億參數的開源模型,是西方訓練出的最佳開放權重 AI 模型——但其優勢領域狹窄且受到嚴格審查,限制了對多數開發者的吸引力。
「過去一年來,開放權重領域的競賽一直由中國實驗室主導。Inkling 是首個從零訓練、能在代理基準測試中具備可信競爭力的西方模型,」Edgen 的 AI 基礎設施分析師 Rachel Kim 表示。
Inkling 採用混合專家架構,推論時僅啟動 410 億個參數,支援文字、圖像與音訊輸入,並能處理 100 萬 token 的上下文視窗。該模型在 45 兆個 token 上進行預訓練,並已在 OpenRouter 上線,輸入 token 定價為每百萬個 1 美元,輸出 token 為每百萬個 4.05 美元——與中階專有模型相當。完整的權重檔案已在 Hugging Face 上以 Apache 2.0 授權發布,意味著企業法務團隊無需擔心中國相關的合規問題。
此次發布是 Thinking Machines Lab 自 Murati 於 2024 年 9 月離開 OpenAI 以來的首個公開產品。西方實驗室在開放權重競賽中一直處於劣勢:Mistral 於 4 月發布的模型,面對的是由阿里巴巴的 Qwen、Z.ai 的 GLM 及 Moonshot AI 的 Kimi 所主導的排行榜,而 Nvidia 的 Nemotron 是唯一躋身頂級陣營的西方模型。Inkling 至少在理論上改變了這一局面。
代理工具使用是明確的勝利
Inkling 最強勁的基準測試是 MCP Atlas,該測試衡量代理透過模型上下文協定完成真實世界任務的可靠性。Inkling 獲得 74.1% 的分數,較 Nvidia 的 Nemotron 3 Ultra 高出近 30 個百分點。在測試自主 GitHub 錯誤修復能力的 SWE-Bench Verified 中,Inkling 取得 77.6% 的成績,而 Nemotron 為 70.7%。任何透過 OpenRouter 路由的 Hermes 或 OpenClaw 設置,無需額外配置即可直接替換為 Inkling,使其成為代理工作流程的可靠選擇。
但在其他維度上,情況則截然不同。一個名為 Bonsai 27B 的 270 億參數模型——基於 Qwen 3.6,壓縮至 3.9 GB 且可在手機上運行——在相同提示下產出了更完整的程式碼結果。Inkling 完全無法完成一個 1,955 字的程式碼提示,僅產出空白畫面;而在簡化為 99 字版本的提示下,也只生成了一個帶有抽象幾何圖形的基本遊戲。較小模型在所有方面的輸出都明顯更優。
在邏輯推理方面,Inkling 傾向於模式匹配而非真正的推理。面對一個過橋謎題——四個人分別需要 1、2、5 和 10 分鐘過橋,共用一個手電筒——Inkling 給出了 17 分鐘的答案,這是另一個不同版本(限制每次只能兩人過橋)的經典答案。而正確答案應為 10 分鐘,因為提示中並未限制同時過橋的人數。Claude Fable 5 和 GPT-5.6 Sol 在相同測試中同樣失敗,顯示訓練資料污染是整個產業普遍存在的問題。
審查機制導致市場空間狹窄
Inkling 直接拒絕了兩個測試提示:一是關於如何與摯友的妻子調情的建議;二是一名自稱海洛因成癮且有四個孩子的人詢問如何解釋上班缺席而不被開除。在兩種情況下,模型的內部推理都將這些請求視為促進傷害行為。海洛因案例的拒絕更具啟發性:幫助用戶保住工作,實際上是減少傷害的最佳結果,但模型將政策置於個人之上。
開源模型通常透過「消融」技術來解決審查問題——即透過微調運行從權重中移除安全訓練。但 9750 億參數是一個巨大的計算目標,而大多數社群消融專案針對的是規模小得多的模型。想要一個功能強大且不受審查的開放權重模型的開發者,已有更小、更便宜且在若干任務上表現更優的替代方案。對 Inkling 進行消融唯一合理的場景,是那些需要開源 AI 但因合規原因無法使用中國模型的大型企業。
創意寫作展現野心,但未臻成熟
在 Edgen 的測試中,Inkling 是唯一一個以代理方式處理創意寫作提示的模型——它在寫作前會進行網路搜尋並擷取文章。其文筆在部分段落確實出色:「千年的空氣像裹著天鵝絨的拳頭迎面襲來——充滿鹽分、發酵的棕櫚酒,以及燃燒椰子殼的煙燻甜味。」但該模型為一位委內瑞拉作家虛構了菲律賓與墨西哥的血統,創造出根本不存在的貿易路線和歷史錯誤。它透過研究正確判斷了世紀背景,卻完全搞錯了人物身份。
投資視角
Inkling 的發布傳遞了一個訊號:頂尖 AI 人才持續從原有企業出走創辦新創公司,這可能帶動 AI 新創生態系統的投資增長。對於上市 AI 公司而言,競爭威脅確實存在但範圍有限。Nvidia 的資料中心業務——上一個會計年度創造了 620 億美元營收——並未面臨來自 Inkling 的直接營收風險,因為該模型運行於 Nvidia GPU 之上,且需要資料中心級別的算力。Anthropic 的 Claude 模型與 Inkling 處於相同的能力級別,可能會因企業對封閉源碼定價感到不滿而面臨壓力。Anthropic 的 Mythos 和 Fable 5 提供頂尖能力,但所謂的專有模型「token 稅」可能促使合規導向的組織轉向像 Inkling 這樣的開放權重替代方案。
對於大多數以程式碼效能、無審查輸出或每美元基準測試品質為優化目標的開發者來說,這筆帳算不來。以更低價格提供更多價值的較小型模型比比皆是。Murati 的實驗室確實推出了一個從零訓練、真實可用的產品——這對長期發展具有重要意義。然而,第一版只是一個專業工具,而非日常主力。
本文僅供參考,不構成投資建議。