最近、騰訊の混元マルチモーダルチームは深い人事再編と戦略調整を経験しました。元xAIのマルチモーダル理解責任者であるリン・クードン氏が正式に騰訊混元に加入し、マルチモーダルコンテンツ生成アルゴリズムの責任者となりました。この変化は、元マルチモーダル理解責任者のフー・ハン氏が起業し、元OpenAI研究員のティアン・ヨンロン氏が加入するなど、一連の密集した調整とともに起こり、さらに騰訊がマルチモーダル大規模モデル開発の路線で深刻な再構築を進んでいることを示しています。

騰訊混元の過去のマルチモーダル開発史を振り返ると、その技術版図は主にいくつかの主要な製品を中心に展開してきました。そのうち、文章から動画を生成するモデルHunyuanVideoは2024年末にリリースされ、世界最大のオープンソース動画生成モデルとなりました。その後2025年には画像から動画生成、カスタマイズ生成、およびデジタル人間駆動などの機能を急速に拡張しました。画像生成においては、初期のHunyuanImageから、2K解像度をサポートする2.1バージョンおよび800億パラメータの3.0バージョンに至るまで、工業レベルへと進化し続けています。また、単体3Dモデルに特化したHy3Dも、ECでのモデリングや製品設計で広く利用されています。空間知能分野では、世界初のオープンソースでシミュレーションをサポートする没入型3D世界生成モデルHy World1.0とその後続バージョンを公開し、空間知能の研究方向に深く適合しています。

しかし、大言語モデル部とマルチモーダルモデル部が統合されて「基礎モデル部」が設立され、姚順雨氏によって全面的に管理されるようになると、騰訊のマルチモーダル開発の考え方は深刻な変化を迎えています。現在の技術路線においては、マルチモーダルと知能メインストリームの関係について業界内で異なる見解があります。李飛飛のWorld Labsなどは、世界モデルが空間知能の一部としてAGIの重要なメインストリームであると考えていますが、DeepSeekなどは視覚モダルを言語モデルのツールとして位置づけ、独立した3Dや世界モデルの路線を弱めることを主張しています。

姚順雨氏の最近の戦略的配置とエース製品Hy3の実装を見ると、彼は後者の技術路線に傾いているように見えます。姚順雨氏は公開の場で何度も強調しており、AIの後半戦の競争の壁は単なるモデルパラメータ数ではなく、文脈と推論能力にあると述べています。マルチモーダル理解能力を基礎モデルの主流に深く組み込み、ツール呼び出しの安定性と長文脈の保持を最適化することで、騰訊はモデルの理解と実行効率を向上させています。リン・クードン氏の参加は、マルチモーダル理解能力を向上させ、生成モデルにおける前後の不一致や空間的な不安定さなどの課題を解決することを目的としています。この再編は、騰訊内部の技術路線の入れ替わりを反映しているだけでなく、AGIの後半戦での競争において本流に近づき、生産性の実現に焦点を当てた戦略的決意を示しています。