評価エンジンの知能体は、過去にはいくつかの断片的な場面で動き続けてきた。バグ修正ではSWE-benchを参考にし、フロントエンドではDesign2Codeを参照するが、実際の運用環境のベンチマークは大抵公開されていない。今回は Tencent が4つの領域を統合し、WorkBuddy Bench という多分野の評価キットを発表した。論文はarXivに掲載されている。このベンチマークの特徴は問題数ではなく、これらの問題が「答えを覚える」ことを根本的に防ぐように設計されている点である。

この一連のベンチマークは4つの仕事の分野をカバーしている: コード(リポジトリレベルのソフトウェアエンジニアリング)、ウェブ(フロントエンド製品)、オフィス(複数ファイルの業務プロセス)、およびセキュリティ(赤チーム・青チーム)。それぞれのタスク数は80、70、50、60であり、合計260のタスクとなる。重要な点は、各タスクが公開された問題集から改変されたものではなく、実際にコードのコミットやプルリクエスト、またはビジネスシナリオから「逆工程」して作成され、簡潔で口語的で役割プレイ風の要請に改訂されたものだ。このような工夫により、タスクのヒントはインターネットで検索しても対応するPRやコミットの痕跡を見つけることはできない。データセットは公開されている(タスクディレクトリ、環境イメージ、評価ツール、テストケース、参考ソリューションがすべて提供されるため)、そのため汚染耐性は構造化方法とバージョン管理によって得られるのであって、問題を秘匿することで得られるわけではない。

image.png

4つのサブセットは同じタスクディレクトリ形式を使用しているが、それぞれ独立した検証方法を持ち、したがってサブセット間でのスコア比較は直接行われない。したがって Tencent は全体の平均スコアを公表しない。コード系は隠しテスト通過率でスコア付けされる。ウェブ系はルールチェックとLLM/VLMによる評価に加え、エージェント自身の評価も行われるが、リアルタイムインターネットに接続しないことが必須条件である。オフィス系は決定論的なルールチェックと証拠に基づくLLM評価を行い、重みは0.70から0.95の範囲でルールに偏っている。セキュリティ系は決定論的なscoring.pyを使って3回実行し、その平均値を採用する。また、大規模モデルは審判者として使われない。セキュリティサブセットには5段階の不正防止措置が設けられており、文字列スキャン禁止、入力のリネーム、テストの改竄防止、コーディング依存、低重みの誘導要素がある。赤チームは38問、青チームは22問あり、白ボックス監査ではbinutils、curl、nginxなどの実際のCVEが基準となる。

タスクの構築は統一されたワークフローに従う:元データの収集、現実的な要求に書き直し、ワークスペースを組み立て、ラウンド後の評価資産を隔離し、個別のディレクトリにパッケージ化する。このプロセス中ではユーザーのデータには触れない。コードタスクには5つの役割(開発者、アルゴリズムエンジニア、プロダクトマネージャー、QA、運用)が割り当てられ、セキュリティタスクには専門的な役割が与えられる。さらに情報が意図的に不十分に記述されている—目標ファイル、パターン、境界が明示されず、エージェント自身が上下文を再構築する必要がある。スコア付けの資産はエージェントが動作した後に導入され、それまでは見ることはできない。

評価は隔離されたコンテナ内で行われ、モデルとサンドボックスは分離されている。フレームワークとしてCodeBuddy Code(デフォルト)とClaude Codeの2種類が使用され、推論の努力度を高め、200kのコンテキストを提供し、WebSearchとAskUserQuestionは無効化される。これは非常に重要である:ネットワーク接続をオフにすることで、汚染耐性が本当に機能しているかどうかを検証するためである。

ランキングには多くのモデル族が登場している(スコア0〜100、思考モード、3回の平均)。Claude Opus4.8はコード、ウェブ、オフィス、セキュリティの多くでトップに立って、5つの第1位を獲得した。GLM-5.2はセキュリティの2つのリストで上位に立ち、GPT-5.5はオフィスccの第1位を獲得した。フレームワークの感度も大きい—セキュリティサブセットでは順位が最も大きく変動し、平均絶対変動は8.6ポイントに達する。Claude Opus4.8はccフレームワークで13回拒否したが、GPT-5.5はcbcでたった2回だけ拒否した。効率面では、GPT-5.5は出力トークンが最少なのにスコアが低いわけではない。一方、DeepSeek-V4-Proはコードで44ラウンドを実行し、入出力のトークンともに高いことから、「効率が悪い」と見える。