8月27日、小鵬グループは「TIME 時間」をテーマにした物理AIの共有と第2世代VLAの新バージョン体験イベントを開催しました。小鵬の第2世代VLA大規模モデルは、リリース以来初めての重要なアップグレードを遂げ、新しいXOS6.3.0バージョンが小鵬G9Lで世界初公開されます。今回のモデルアップグレードの核心は、AIが本格的に時間を理解し、物理AI基盤モデルが静的な3D空間理解から動的な4D時空理解への下位能力の飛躍を実現することです。

自律走行分野でScaling Lawを継続的に検証している小鵬は、今回のアップグレードでエッジ側モデルのパラメータ数を3.5倍に拡大し、業界内で一般的な小さなモデルとの差を数量級レベルに広げました。超長時系列の文脈記憶能力により、AIドライバーは真正に「見分けられ、考え、反応する」ことができます。また、新バージョンでは車両全体の脳であるMaster Agentを導入し、VLAとVLMの運転室融合を実現し、一部のロボタクシーのL4レベルの体験を量産車に下放しました。

image.png

物理AIが直面する現実世界は一枚の静止画ではなく、連続的に進化するプロセスです。モデルが人間のように世界を理解するにはまず「時間」を理解する必要があります。従来のモデルは車や歩行者を認識できますが、車は過去、現在、そして未来に何が起こるかを知る必要があります。そのため、第2世代VLAはInfini-VLAという長期時系列構造を新たに導入し、前の30秒間の世界を記憶できるようになり、道の状況判断においてより長い文脈を持てるようになります。連続して発生する道路イベントが個別の画像に分割されることがなくなります。

現実の道路状況が常に変化していることを考慮し、第2世代VLAはモデルの推論効率を同時に向上させ、Streaming Inference(ストリーミング自己回帰推論)を採用し、離散的な推論から連続的な推論へと移行しました。エンドツーエンドの応答速度は300%向上しています。モデルは「見る、考える、行動する」を並列処理でき、前方の車が突然停止したり、歩行者が折り返したり、隣の車が急に割り込んできたなどの突発的な状況に対しても、ベテランドライバーのように熟練かつ素早く反応します。

さらに、小鵬のX-Foresight予測世界モデルが初めて搭載され、6秒以内に発生する出来事を予測し、周囲の交通参加者の将来の可能性を推論できます。新バージョンではMoTミックス構造も導入され、異なるタスクごとにモデルの能力を動的に割り当てることで、都市部、パーク、駐車などの異なるシナリオ間のタスク干渉を減らします。より大きなパラメータ数、前倒しの軌跡予測、超長有効時系列、そして速い意思決定応答を通じて、多面的な総合的な安全性が20倍向上しています。

車載コンソール方面では、小鵬は初めてMaster Agentを導入し、ロボットのように車載脳を再構築し、VLAとVLMの運転室融合を実現しました。これは自然言語や曖昧な意味を理解し、ユーザーの意図を自動的にタスクに分解し、智駆、サスペンション、コンソール、車体制御などの垂直Agentを協調して実行することができるようにします。新バージョンでは、「音声で横線停車」や「音声で近くの駐車」機能も追加され、「音声指令」から「自主的実行」までの完全なループを実現しました。ロボタクシーのL4レベルの同源技術は、量産車へと加速的に下放されています。

小鵬は世界に向けて展開する身体知能企業であり、統一された技術基盤を通じて自動車とロボットを結びつけ、物理AIをスケーラブルな複製段階に推進しようとしています。第2世代VLAを搭載したロボタクシーは最近、広州市のスマートネットワーク車の遠隔テスト資格を取得し、関連道路で主ドライバー無しでのテストを行うことができます。ロボット本体に関しては、3つのチューリングAIチップを搭載した小鵬汎用人形ロボットIRONは、2250TOPSの演算能力を持ち、エッジ側に配備されて複雑な作業を自主的に行うことができます。小鵬ロボット事業は最近、9億ドルを超える最初の株式投資を完了し、投資後の評価額は63億ドルを超えています。

技術の普及を実現するために、小鵬は学習型Token圧縮と蒸留トレーニングを通じて、第2世代VLAベースモデルの能力を計算力が低いプラットフォームに配備しました。蒸留後のチューリングVLA2.0Liteは9月に小鵬G9L Maxバージョンに初めて搭載されます。同時に、小鵬は第2世代VLAのグローバル展開を全力で進めています。最近ドイツでローカル化検証テストを完了し、来年上半期にヨーロッパで規制許可を取得し、海外ユーザーに提供することを目指しています。