決定Jefferies八家美中AI代理基準測試勝負的,是Harness工程,而非模型智慧。
決定Jefferies八家美中AI代理基準測試勝負的,是Harness工程,而非模型智慧。

決定Jefferies八家美中AI代理基準測試勝負的,是Harness工程,而非模型智慧。
阿里巴巴的千問辦公(Qianwen Office)以95分位居榜首,擊敗Anthropic的Claude Cowork(94分)和OpenAI的Codex(92分),儘管其底層模型的智慧得分低於競爭對手。
Jefferies分析師在報告中寫道:「Harness優勢足以彌補模型智慧差距。」該測試涵蓋五項企業任務,包括多檔案檢索、自主網路研究、瀏覽器控制、簡報製作和行銷海報生成。
測試揭示了令人矚目的現象:同一個Claude Opus 4.6模型在Terminal-Bench 2.0上的得分介於58.0%至76.4%之間,取決於其外包裝的Harness——差距高達18.4個百分點。Gemini 3 Pro在不同Harness下的得分差異達13.4個百分點。Jefferies將代理能力拆解為60%模型權重和40% Harness權重,並逆向推算出各產品的隱含Harness得分。千問辦公的Harness排名最高,超越Claude Cowork和Codex。
這項發現重塑了企業評估AI供應商的方式。模型智慧得分——Qwen 3.8 Max為56分、Claude Opus 5為61分、GPT-5.6 Sol為59分——不再能預測哪款代理產品能真正完成工作。千問辦公的API成本約為每百萬token 1.1美元,而Opus 5為3.9美元、GPT-5.6 Sol為4.4美元,這使得Harness優勢在成本調整後更具說服力。
Jefferies將Harness工程拆解為六個層面:指令、上下文、工具、邊界、回饋和治理。每個層面處理模型自身無法管理的事項——定義任務及其限制、提供背景資訊、提供執行工具、設定行動範圍、透過回饋迴圈實現自我修正,以及讓組織能夠管理代理集群。
這個框架直接對應企業管理員工的方式:交代任務、提供資訊、配發工具、設定權限、給予回饋並進行監督。一個强大的模型被置入管理不善的環境中表現不佳,正如優秀人才若缺乏適當管理也會失敗。
騰訊的Workbuddy呈現出最引人注目的反常現象。其每月2,100萬次的造訪量使其成為中國使用最廣泛的AI代理,但其隱含Harness得分卻在Jefferies測試的中國產品中墊底。解釋在於分發管道的差異:Workbuddy深度嵌入騰訊的產品生態——包括微信文件、IMA和企業微信——並採取模型無關的架構,讓用戶在Kimi K3、DeepSeek V4和GLM 5.2之間自由切換。龐大的行銷支出進一步放大了其觸達範圍。
Jefferies的評估:短期內,Workbuddy依靠分發管道取勝;長期而言,其2,100萬用戶將產生真實世界的追蹤數據,這些數據有助於改進其Harness,並有可能用於訓練專有模型。
報告還發現了任務層面的優勢與劣勢。美國代理在行銷海報生成上表現失準——Claude Cowork和Gemini Spark均未通過該任務——而中國代理則在瀏覽器控制上表現不佳,Workbuddy和MiniMax Code在此折戟。速度也各不相同:Gemini Spark是美國代理中最快的,Workbuddy則是中國代理中最快的。
報告指出了中國Harness開發商具備的四項結構性優勢:超級應用整合(代理直接嵌入企業微信、飛書和釘釘)、模型無關的Harness架構、token價格平均比美國同類產品低70-80%,以及由更大用戶群體和更多失敗案例驅動的更快速迭代週期。
四項劣勢則抵消了這些優勢:模型差距依然存在(較弱的模型更依賴Harness品質)、中國的企業軟體變現仍具挑戰、國際擴張面臨專為本地平台建構的軟體生態,以及算力限制制約了代理工作流程所需的高負載推理任務。
對投資者而言,該基準測試顯示AI代理市場的價值流向那些掌握部署基礎設施的公司,而不僅是模型權重。阿里巴巴的千問辦公證明,搭載優越Harness的中階模型可以在真實企業任務中以遠低於競爭對手的成本超越前沿模型。騰訊的Workbuddy則顯示分發管道可以暫時掩蓋Harness的弱勢,但來自2,100萬用戶的數據飛輪為其提供了追趕的路徑。處於最佳位置的企業是那些將強勁的Harness工程與能產生改進數據的用戶基礎相結合的公司——在中國,這一動態有利於阿里巴巴和騰訊;在美國,則有利於Anthropic和OpenAI。
本文僅供參考,不構成投資建議。