評測編碼智能體,過去總在幾塊割裂的場子裏打轉——修 bug 的看 SWE-bench,做前端的看 Design2Code,生產環境的基準又多半關着門不讓外人審計。騰訊這次把四塊拼到一處,端出一個叫 WorkBuddy Bench 的多領域評測套件,論文已掛在 arXiv 上。它最較勁的地方不在於題多,而在於這些題從根上就防着"背答案"。

整套基準橫跨四個工作領域:代碼(倉庫級軟件工程)、網頁(前端製品)、辦公(多文件業務流程)和安全(紅藍隊)。規模分別是80、70、50、60個任務,合計260道。關鍵點在於,每個任務都不是從某份公開題庫裏改來的,而是從真實的代碼提交、拉取請求或業務場景裏"逆向工程"出來,再改寫成簡短、口語化、帶角色扮演味道的請求。這麼做的好處是,任務的提示詞沒法靠上網搜到對應的 PR 或提交線索——你搜不到,自然就背不了。由於數據集是公開發布的(任務目錄、環境鏡像、評估工具、測試用例、參考方案全給),它的抗污染靠的是這種構造方式加版本管理,而不是把題捂着。

image.png

四個子集共享同一套任務目錄格式,但各自有獨立的驗證方式,分數因此不能在子集之間直接比,所以騰訊乾脆不報套件平均分。代碼類按隱藏測試通過率打分;網頁類用規則檢查加 LLM/VLM 評判再加智能體評判,且必須交付一條聲明路徑上的製品、不連實時互聯網;辦公類走確定性規則檢查加基於證據的 LLM 評判,權重0.70到0.95之間偏向規則;安全類則乾脆用確定性的 scoring.py 跑三次取平均,不用大模型當裁判。安全子集還布了五層反作弊——禁字面量掃描、重命名輸入、覆蓋篡改測試、編碼依賴、低權重誘餌,紅隊38題、藍隊22題,白盒審計錨定 binutils、curl、nginx 等真實 CVE。

任務構建走的是統一流水線:來源收集、改寫成真實請求、組裝工作空間、回合後隔離評估資產、獨立目錄打包,全程不碰用戶數據。代碼任務給五種角色(開發者、算法工程師、產品經理、QA、運維),安全任務賦專業角色,而且刻意把信息寫得不充分——不告訴你目標文件、模式或邊界,智能體得自己把上下文找回來。評分資產在智能體跑完之後才引入,它全程看不見。

評測在隔離容器裏跑,模型和沙箱分離,框架用 CodeBuddy Code(默認)和 Claude Code 兩種,推理努力調高、上下文給到200k,並禁用 WebSearch 與 AskUserQuestion。這點很重要:關掉聯網搜索,本就爲了驗證抗污染是不是真管用。

排行榜把多家模型族擺上了檯面(分數0–100,思考模式,三次平均)。Claude Opus4.8在代碼、網頁、辦公、安全多數榜首通吃,拿下五個第一;GLM-5.2在 security 兩榜登頂,GPT-5.5則摘下 office cc 第一。框架的敏感性也不小——安全子集重排最狠,平均絕對變動達8.6個點;Claude Opus4.8在 cc 框架下拒答了13次,GPT-5.5在 cbc 下只拒2次。效率上,GPT-5.5輸出 token 最少卻分數不低,而 DeepSeek-V4-Pro 在代碼上跑了44輪、出入 token 都高,顯得更"費勁"。

這篇論文由騰訊多家實驗室合力完成,署名的包括優圖實驗室(Youtu Lab)、科恩安全實驗室(Keen Security Lab)、Workbuddy 團隊與雲鼎安全實驗室(Yunding Security Lab)。團隊也坦承侷限:代碼子集以 Python 爲主、跨語言偏少;開源發佈本身帶來被爬取污染的風險,得靠版本管理緩解;評判器偏差尚未量化;辦公類偏文本,暫無 OCR 與 GUI。近期計劃是校準網頁評分、擴充公開榜單。對一個想把"真實工作分佈"搬進考場的評測來說,WorkBuddy Bench 已經把門敞得很開了。