それほど長くない政策文書が、今日北京で実施されたが、数か月前までは論文や技術コミュニティの専門用語として活発に使われていた語が一気に公式文書に掲載された。この「北京市スマートエージェントをリードするためのいくつかの措置」は10条から構成されており、Agentic AI、Harness Engineering、AI OS、FDE、OPC、トークン経済、TaaS、AaaS、RaaS、トークン工場、AIPなどが列挙されている。特に、「駆け込み層エンジニアリング」と訳された「Harness Engineering」が第2条に記載され、スマートエージェント経済の広大なビジョンが初めて政策レベルで明確な輪郭を描いた。

第1条は基礎モデルに焦点を当て、重要な言葉は「大規模モデルの実際的なタスク遂行能力を継続的に向上させる」である。過去数年間、大規模モデルはBenchmarkスコアで比較されてきたが、エージェントが実際に作業するときには、通常は曖昧な目標しか得られず、情報を補完し、計画を分割し、ツールを調整し、フィードバックを読み取り、ルートを修正して結果を得るまでかかる。ここには現実的な計算がある:エージェントが連続して100ステップを実行し、各ステップの正確率が99%であれば、すべて正しい確率は約36.6%になる。さらに単一ステップを99.9%に上げても、完全に実行できる確率は約90.5%になる。したがって、エージェントの実用価値は乗算のように考えられる——モデルの能力と長期的な信頼性、環境の操作性、結果の検証性を掛け合わせたものであり、いずれかがゼロに近づけば全体の価値もゼロに近づく。前線の評価もこの方向に移行しており、METRが提案したTask Completion Time Horizonは、エージェントが50%または80%の成功確率で人間の専門家がどれだけかかるべきかを直接測定する。これはなぜコードがエージェントの最初の爆発的成長分野になったのかを説明する。それは高度にデジタル化され、ロールバック可能で検証可能だからである。
第2条では「Harness Engineering」を「駆け込み層エンジニアリング」と翻訳し、コンテキスト工学の最適化、タスクの永続化、マルチエージェント協力、システムの拡張性を強化する共通基盤の整備を要求している。モデルは潜在的な能力を提供するが、その能力が安定して実行されるかどうかは、モデル周辺のシステムにかかっている——コンテキストの選択方法、ツールの調節方法、タスクの分割方法、権限の制御方法、状態の保存方法、失敗時の再試行方法、結果の検証者など。これらが統合されたものが「Harness」である。今年4月の論文「Agentic Harness Engineering」は、基本モデルを変えずに、モデル外のツール、ミドルウェア、長期記憶、観測システムのみを反復改善することで、Terminal-Bench2のPass@1が69.7%から77.0%に上昇することを確認した。他のモデルファミリーでも5.1〜10.1ポイントの改善が見られ、増益の多くはツール、ミドルウェア、長期記憶によって得られた。政策ではスキルマーケット、ソフトウェアストア、AIPなどの相互接続標準にも言及している——今後多くのソフトウェアの直接的なユーザーがエージェントになるため、App Storeのランキングだけでなく、エージェントがどのように発見され、デフォルトで呼び出されるスキルとなるかが競争の鍵になる。
第3条は、エージェントに基づいて下位の構造を再構築することを奨励し、中心的な考え方は「需要の知能化」である。ソフトウェアの知能は3段階に分けられる:機能知能は特定のノードに生成ボタンを追加するに過ぎない;プロセス知能は固定されたワークフローの一部をつなぐことができる;需要知能は、ユーザーが最終的な結果を述べるだけで、システムが手順を判断し、モデルとスキルを調節し、ソフトウェアを結びつけ、承認を探すことができる。それに応じて「スーパーソフトウェア」が登場する——その強さは機能の多さではなく、既存のソフトウェアの境界を超えて、一貫した要件を理解し、分散された能力を再構築することにある。この条項ではFDE(先端配置エンジニア)を特別に記述している:顧客の現場に赴き、業務とシステムを分解し、データを整理し、毎日の新しい問題を製品に戻す。指標の基準には5つの条件がある——タスクの頻度、人件費、デジタル化の程度、結果の検証可能性、エラーの取り消し可能性、これらの条件を満たすほど、実際のROIが生まれやすくなる。これにより、なぜ科学、医療、教育、行政、製造、文化が選ばれたのかが説明される。
第4条はソフトウェアから端末へと進み、エージェントをスマートフォン、メガネ、イヤホン、ウェアラブル、ロボット、自動車に深く埋め込むことを求め、そして「チップ・モデル・クラウド・端末・使用の五つ一体」を推進する。エージェント端末は環境を継続的に感知し、ユーザーの状態を理解し、長期的なコンテキストを記憶し、適切なタイミングで意思決定し、デバイスを通じて実行しなければならない。センサーにより世界を感知し、デバイスのIDおよび個人データにより「自分とは誰か」を理解し、オペレーティングシステムとアクチュエーターにより世界を変える。エッジ側は低遅延の感知、身分認証、プライバシーデータ、高頻度の簡単なタスクを担当し、クラウドは複雑な計画と推論を担当し、デバイス間でタスク状態を共有し、一つのタスクがイヤホンで始まり、スマートフォンで続けられ、自動車やコンピュータで完了するようにする。ファイルでは、条件に合致する新製品を家電の旧品交換およびデジタルスマート製品の購入対象に含め、直接的に需要側を補助する。
第5条は一般の人にとって最も直接的な条項である:OPC(一人会社)を代表とするイノベーションと起業の新しいモデルを支援する。その背景には企業の境界が緩和されている。1937年にコーズが企業が存在する理由を説明したのは、市場で臨時に人を捜し、交渉し、契約し、監督するよりも内部の調整が安価だったためである。しかしエージェントは同時に実行コストと調整コストを圧縮し、コードの書き換え、デザインの作成、顧客の管理、問い合わせへの対応、報告書の作成などの知識作業が、複数のエージェントを通じて一人で行えるようになり、企業の最小可能な規模が低下する。政策はただ一声を叫ぶだけではなく、柔軟な計算力、専門的な育成、起業指導、科技金融、知的財産権、政策相談、OPCコミュニティ、全周期サービスステーション、供給と需要の対接、利便性のある登記などを継続して記述している。これは過去の企業内のバックオフィス能力を社会的な公共サービス層に移したようなものである。機会をつかみたい個人にとって必要な資産は3種類ある:業界の判断、顧客と信頼、再利用可能なエージェントシステムである。
第6条はトークン経済について述べている。エージェントが実行するのは動的なタスクであり、長さ、コンテキスト、推論の回数、ツール数、再試行回数が不確定である。20億のトークンを消費しても何も得られないことが一般的であり、これによりトークンはコストの測定単位としては使えるが、価値の通貨としては難しい。政策は一方でトークンの品質評価と料金規範を提示し、もう一方で、知能の質、使用量、変換効率に基づく評価体系の構築を奨励している。また、この条項の中で最も重い一文を記述している——「創新主体がトークンの消費量による課金から価値課金に転向することを奨励する」。3つのビジネスモデルは3つの価値レベルに対応する:TaaSは基本的なトークンと推論供給を販売し、価格、速度、安定性、モデルの質を比較する;AaaSはモデル、ツール、Harnessをまとめた動作可能なエージェントを販売し、1つの能力を販売する;RaaSは直接的な結果を販売し、顧客は契約が審査されたか、コードが修正されたか、リードが変換されたかを気にする。上のレベルに行くほどトークンから離れ、顧客価値に近づくが、RaaSの難易度も急激に増す。サプライヤーはタスクの失敗、繰り返し実行、コストの変動、品質の検証、賠償責任を負う必要がある。以降、エージェント企業が計算すべき新しい勘定は「成功タスクあたりのコスト(Cost per Successful Task)」であり、さらに上は「成功タスクあたりの価値(Value per Successful Task)」である。ファイルでは、条件に合致するトークン新製品を中小企業サービス券に含め、トークン券とスマートエージェントサービス券の探索を行い、トークン工場を介して供給を解決し、サービス券で需要を促進し、価値課金で閉環を維持する。
第7条は安全について述べている。チャットボットはコンテンツを生成するが、エージェントは行動権を得ており、コードの編集、支払いの調整、デバイスの制御、ユーザーの代理での連絡を行うことができる。リスクは「一言間違える」から「一件間違える」に広がった。エージェントの安全は少なくとも5つの問題に直面しなければならない:目標の誤解、権限の越境、プロンプト注入の操作、長期記憶の汚染、複数エージェント間の誤りの迅速な拡散。第3-partyツールやスキルの接続により、あらゆるプラグインやインターフェースの故障がタスクチェーンを通じてコアに侵入する可能性がある。このファイルの安全対策はコンテンツ監視から実行時治理に移行している。今年5月に国家ネット情報弁公室などの3部門が発表した「スマートエージェントの規範的な応用とイノベーション発展意見」では、本人のみの意思決定、許可が必要な意思決定、自主的な意思決定の境界を示している。分級分類の規制は業界の加速を可能にするかもしれない——低リスクタスクは自己検証を速やかに行い、高リスクタスクは厳密な検査と人工確認を追加する。安全性は制約であり、同時に市場准入証でもある。
第8条では「銀河算廊」プロジェクトを実施し、スマートエージェントの高い同時アクセスと低遅延のニーズに応じた新たな計算力インフラストラクチャーを建設し、計算力ネットワークと5G-A、6G、F5Gの統合を推進し、既存の計算力を掘り起こし、小規模な計算力を「ゼロ貯金」する。大規模モデルのトレーニングは集中型の大規模プロジェクトだが、エージェントの推論は長期的に稼働する生産ネットワークのようなものであり、膨大なタスクに常に応え、リアルなビジネスにより強い負荷変動を持つ。将来の調整はGPUだけでなく、雲・エッジ・端の異なるチップ、異なるモデル、異なる地域のデータ権限とネットワーク条件も含む。銀河算廊の価値はスマート生産のための計算力物流システムを建設することに近似する。計算力ルーティング、異種調達、エッジ推論がここに機会を生み出す。ファイルでは銀行や保険機関がスマートエージェントの実装を支援する金融製品を開発することを支持し、エージェント企業の初期に最も価値がある資産はコード、データ、契約であるが、新しい時代に最も核心的な新資産は「タスクトラック」である——目標、計画、アクション、観察、修正、結果のこの一連の流れは、モデルのトレーニングやHarnessの最適化に使用でき、セキュリティの欠陥や業務プロセスの分析にも役立つ。
第9条はオープンソースと開放を推進し、中国と上海協力機構加盟国の人工知能応用協力センターの高水準建設を提案し、各国ごとの大規模モデルとスマートエージェントの海外展開ルートを研究し、世界的に影響力のあるオープンソースコミュニティの建設を提唱する。スマートエージェントの時代は特にオープンソースとプロトコルが必要であり、それは天生に結合される必要があり、エコシステムのネットワーク効果が非常に強いためである。新しいスキルが接続されると、すべての互換プロトコルを持つエージェントがその能力を獲得する可能性がある。エージェントが多くなるほど、開発者がスキルを供給しようとする意欲が高まり、スキルが多くなるほどエージェントがより有用になる。どのプロトコルが広く採用されるかによって、開発入口とエコシステムの主導権を握ることになる。ファイルではオープンソースへの貢献度の評価を特に記述し、オープンソースが本当は高価なのは長期的な保守とコミュニティ運営であるからである。海外展開部分ではスマートエージェントが普通のコンテンツ製品よりも深く地元の経済に組み込まれており、より複雑なプライバシーや責任、准入問題に直面するため、「各国ごとの戦略」が提案されている。
