2026年の夏、黄浦江の畔で世界人工知能会議が開催され、智象未来(HiDream.ai)はその舞台で、世界初の無限時間のコンテンツ創作に対応するマルチモーダルAIエージェント「vivago R1」を発表しました。このほかにも、中国科学技術大学類腦研究所などの機関と連携して「一帯一路Token出海連盟」を設立し、飛捷科思などと協力して「物理知能革新共同提案」を発起しました。同社は、技術革新と生態系の協調の両輪によって、AIを単なるツールではなく、共に働く知能パートナーへと進化させようとしています。

会議期間中に中国情報通信研究院が主催したフォーラムで、智象未来の創業者兼CEOである梅涛氏は『世界モデルへの道:ネイティブな全モーダルがスマートエージェントの能力向上を促す』というテーマで基調講演を行い、大規模モデルとスマートエージェントが双方向的に進化し、世界モデルへと向かう流れを体系的に述べました。彼の見解は明確です。最高レベルのモデルはすでに人間の天才レベルに達していますが、基礎的な大規模モデルと現実的なシナリオとの間に、実装困難、適応性が弱く、コントロールが難しい産業的なギャップがあります。スマートエージェントは、自律的な記憶、論理的な計画、ツールの配分、多端末での協働といった特徴を持ち、基礎モデルの生成・推論の優位性を、標準化され、検証可能で、納品可能な産業的な能力に変換できます。基礎モデルにスマートエージェントを組み合わせることで、AIは千行百業への支援の中心的な形態となるのです。

image.png

梅涛氏はさらに現実的な課題を指摘しました。複雑なタスクにおいて、単独のスマートエージェントには明らかに限界があります。複数のエージェントが専門的なチームのように分担して協力しない限り、本格的な産業的なハードボーンは克服できません。そして、これらのスマートエージェント群を安定的かつ効率的で、秩序ある形で運用するためには、AgentOSというスマートエージェントオペレーティングシステムは欠かせない土台となります。そのため、智象は自社開発したHD-AgentOSを用いて、リソース層、システム層、能力層の3層構造により、全体的な産業展開体制を支えています。リソース層では、エージェントが呼び出すための基本的なリソースと原子的な能力を提供し、作業の基盤になります。システム層では、フロー全体の運用管理、リスク管理、監視、セキュリティ治理を担当します。能力層では、モデル、ツール、知識、プロセスを領域固有のスキルにカプセル化します。このオペレーティングシステムがあることで、複数のスマートエージェントによる協力は、単打独斗の制約を乗り越え、感知できる、推論ができる、実行できる、進化できる専門的なチームを構築することが可能になります。

vivago R1はこのようにした核心技術に基づいた製品であり、世界初の無限時間の動画生成と編集をサポートするマルチモーダルクリエーションAIエージェントです。その登場は、AIがクリエイティブ生産分野における范式の転換を示しています。即ち、単なる素材の補助生成から、自主的な計画、調整、長く続くクリエーションを行う知能的なパートナーへの進化です。智象はその中心的な強みを「長」「長」「穩」とまとめ、業界で長年存在していた時長制限、論理の混乱、効果の不安定という3つの課題に直接対応しています。

第一の「長」は、無限時間、すべてのシナリオで制限なしに適合することです。現在の主流のAI動画製品は、15秒〜30秒の短いシーンに制限されています。しかし、vivago R1はその時間を超えて、任意の時間の動画を連続的かつ一貫して生成でき、ドラマ、ドキュメンタリー、ブランドビデオ、映画の完成版など、すべての長時間のクリエーションシナリオを受け入れるため、業界における長時間動画制作の空白を埋めました。第二の「長」は、長時間の思考を保証し、クリエーションの論理の一貫性を確保することです。長時間の動画は単なる短いシーンの積み重ねではありません。完全な物語の論理、一貫した画風、安定したキャラクター設定や背景、そして統一された表現が必要です。vivago R1は長時間の思考機能を持ち、詳細な論理構成、カメラワークの配置、スタイルの調整を自動的に行い、画面の不連続、キャラクターの崩れ、物語の断絶、スタイルの分離といった古い問題をすべて解決します。第三の「穩」は、高安定な生成によって商業的な規模の拡大を可能にするということです。従来の大規模モデルは確率的な出力バイアスを持っており、完成品の利用可能性が低く、企業の調整コストが高くつきます。AgentOSのフルラインのスケジューリングとガバナンスに依存して、vivago R1はクリエーションの全工程を制御可能かつ校正可能にし、内容の有効利用率を85%まで引き上げ、業界平均を大幅に上回ります。繰り返しの修正と調整の時間が大きく削減され、生成されたコンテンツは直接商業制作、ブランド伝播、市場販売に使えるようになります。

このような能力は、SNSコンテンツ作成やビジネスマーケティングのような継続的な長時間のシナリオで特に威力を発揮します。単純なスクリプト生成のように見えるタスクでも、脚本に基づき画像を描き、カメラ言語やストーリーのテンポ、感情表現を理解し、さらにはショートビデオのVlog、ショートドラマ、商品素材ビデオにおけるスクリプトの違いを区別しなければなりません。このような深い業界理解は、単に大規模モデルAPIを呼び出すだけで済ませられるものではありません。vivago R1は、多エージェント協調メカニズムによって、タスクの理解、ストーリーの構成、スクリプトの作成、主要な素材の生成、超長時間の動画生成という完結したサプライチェーンを原子化し、専門的なスケジューリングを行います。これにより、ストーリー、カメラワーク、キャラクター、スタイル、音声、審美の要素が有機的に統合され、単点ツールから全プロセスのクリエーションシステムへの変化を実現しました。

製品以外にも、智象未来はWAIC期間中に二つの重要なエコシステムの動きを展開しました。飛捷科思などのイノベーション企業やトップ研究機関と共同で「物理知能革新共同提案」を発起し、学術研究と産業界の力を集めて、ネイティブな全モーダル世界モデルの産業的な協調的新構図を築こうとしています。同時に、智象は中国科学技術大学類腦研究所などと提携し、「一帯一路Token出海連盟」を設立しました。これは、トークンを通じた国境を超えたAIの連携を核理念として、中国のネイティブな全モーダルAIの能力を山々を越えて世界中のインフラとつなぎ、一带一路の国々と地域のスマート化とデジタルエコシステムの接続を支援し、その発展を助けます。

業界の競争の次元はすでに全面的にアップグレードされました。かつての単一のモデルパラメータの競争は徐々に理性を取り戻し、それに代わって、基礎モデルとスマートエージェントシステムの全方位的なエコシステムの競争が起こっています。智象が構築した1+1+3のビジネスモデルは、この新たな課題への対応です。ベースモデルでは世界的な競争力を維持し、ユーザーが最も求めている垂直分野で最も深く掘り下げます。vivago R1の発表と二つの連盟の構築を通じて、智象はWAICという空前の規模のイベントで最新成果を集中して展示し、AIがツールから知能パートナーへと進化する道を模索しました。今後も、智象はマルチモーダル技術をネイティブな全モーダル、そして世界モデルにさらに深く進化させ、ハードウェアの革新とグローバルな協調によって、人工知能産業を規格化され、商業化される新しい時代に進める予定です。