AI主導權之爭不再關乎誰能打造最聰明的模型——而是誰能可靠地交付結果。
AI主導權之爭不再關乎誰能打造最聰明的模型——而是誰能可靠地交付結果。

AI主導權之爭不再關乎誰能打造最聰明的模型——而是誰能可靠地交付結果。
根據中信證券本週發布的一份報告,阿里巴巴、騰訊、OpenAI與xAI正競相整合Harness層——即介於AI模型與終端用戶之間的中介軟體——因為競爭焦點正從原始模型能力轉向任務交付。這一轉變將潛在市場規模從約2000億美元擴大至1.5兆美元。
「模型決定了智慧的上限,但Harness決定了這份智慧能否穩定、可控且具成本效益地轉化為實際成果,」中信證券分析師寫道,並認為該層的價值在於降低使用門檻並捕捉高品質的長時間任務資料。
這股迫切性源於單步驟能力與端到端交付之間的根本落差。根據METR的數據,Claude Mythos Preview在持續約17小時的任務中成功率降至50%,而Anthropic估計,多智能體系統的token消耗量約為標準對話模式的15倍。相比之下,微軟的CodeAct Harness透過優化工具編排,將執行時間縮短52.4%,token消耗減少63.9%,證明執行層——而非模型本身——往往決定複雜任務能否完成。
Harness層連接上游模型供應與下游客戶需求,在多個模型之間路由請求,管理上下文、記憶、工具調用、權限與狀態,最終交付輸出。中信報告估計,透過以自然語言辦公界面取代專業整合開發環境,該層將潛在市場從AI編碼領域約2000億美元,擴大到一般白領知識工作的1.5兆美元。
讓模型真正交付的四階段流程
阿里巴巴將QoderWork、Wukong與MuleRun整合為單一產品Qwen Work。騰訊推動WorkBuddy與QClaw團隊融合。OpenAI深化ChatGPT與Codex之間的整合。xAI加強與Cursor的連結。每一步都指向同一個結構性瓶頸:模型能推理,但無法可靠執行。
根據Visa發布的Project Glasswing白皮書,Harness層在進入修復與漏洞驗證階段之前,須經歷四個階段——代碼植入、威脅建模、深度驗證與利用鏈綜合分析。Visa在利用Anthropic的Claude Mythos自行挖掘支付網路漏洞後發布該報告。該公司已在GitHub上開源其Vulnerability Agentic Harness,截至7月20日已獲得595顆星與97個分支。Visa還引入了一項新指標——平均適應時間——衡量團隊確認漏洞、修復並證明攻擊路徑已關閉的速度,取代Visa認為可能掩蓋風險擴大的傳統平均檢測時間指標。
數據回流打造自我強化的護城河
Harness的戰略價值不僅在於執行可靠性。每完成一項任務都會產生一條軌跡——工具調用、錯誤修正與決策點的序列——成為下一輪模型迭代的訓練資料。這形成中信所謂的「飛輪效應」:TAM擴張、數據回流與產品強化相互疊加,使後來者更難複製。
中國桌面辦公代理市場的加速發展說明了這一點。根據Analysys的數據,月訪問量從2026年3月的超過2000萬次增長至6月的超過6000萬次,瓶頸已從「能否使用」轉變為「能否穩定大規模交付」。WorkBuddy等類似產品現已提供多模型路由,削弱了單一模型提供商與終端用戶之間的連結,同時在Harness層中掌握用戶關係、任務歷史與反饋資料。
對投資人而言,這意味著AI領域的護城河正從模型權重轉向執行層。隨著開源模型縮小能力差距——Cisco Antares-1B在漏洞定位方面達到0.209的File F1分數,超越擁有7530億參數的GLM-5.2——將任務路由至正確模型、管理長時間運行的代理狀態並捕捉所產生資料的能力,將成為持久的競爭優勢。中信認為,擁有成熟Harness產品、雲端基礎設施與高頻辦公入口的企業——如阿里巴巴、騰訊及具備類似資產的平台提供商——最具備掌握1.5兆美元潛在市場的優勢。該報告建議優先關注已展現從統一入口到任務執行再到結果交付完整閉環的公司。
本文僅供資訊參考,不構成投資建議。