視覚大規模モデルは長期間、見えない壁に阻まれてきた。トップクラスの効果を得るためには、膨大なデータと計算能力を蓄積する必要があり、これにより高度な視覚機能は一部の上位チームの専有物となっていた。7月21日、小鵬グループは「TuringViT」高效視覚エンコーダーを発表し、アーキテクチャ、データパターン、トレーニングプロセスをシステム的に再構築し、業界に再現可能で低コストなSOTA級の視覚Transformerトレーニング経路を提供した。これにより、高精度の視覚大規模モデルが上位チームに特化していたものを、業界全体に広めることを実現した。
TuringViTの位置付けは明確である:VLMおよびVLAの時代に向けて、スマートドライブ、スマートシーリング、IRON人形ロボットの三大ビジネスシーンを全面的にサポートする。アーキテクチャ、データ、トレーニングの3つの観点から同時に突破を遂げ、線形注目を主導する、高品質なデータ管理、ネイティブな動的解像度の三位一体の技術体系を構築し、効果、効率、実装性の3重向上を図っている。

アーキテクチャにおいて、TuringViTは2つの仕様バージョンを推出した。TuringViT-18Lは3つのTuring Blockを含み、合計15層のTLAと3層のMHAを持つ。これは動的解像度下での効率的な展開を主に推進する。TuringViT-24Lは4つのTuring Blockを含み、合計20層のTLAと4層のMHAを持つ。これは線形計算を主導しながらも、表現力をさらに高める。実測データによると、入力解像度が上がると、TuringViTの遅延増加曲線は標準的なsoftmax ViTよりもはるかに緩やかであり、高解像度下での効率的な優位性が顕著になる。1536×1536解像度では、TuringViT-18Lの推論スループットはSeed1.5-ViTの3.04倍であり、SigLIP2-ViT-Lに対しては2.16倍となり、高解像度の感知、複数カメラ入力、長時間のビデオ処理におけるエッジ側の展開を解決する重要な障害を除去した。
業界がデータ量を増やす粗放な方法を採用しているのとは異なり、TuringViTが真正に鋭いのはデータ管理である。それはVISTA-Curationというマルチモーダルデータ管理フローを構築し、データ量を増やす代わりに、単一サンプルの監督価値を上げることによってデータ効率を段階的に飛躍させた。画像・文章データに関しては、このフローは3段階の細かい選別を行う。まず、低解像度、ぼけ、低模様の劣質画像をフィルタリングする。次に、多モデルと多提示文によって多様な候補キャプションを生成し、視覚的一貫性を交差検証する。最後に、相対的な画像・文章の一致度、文章情報量、曖昧さを総合してスコアリングを行い、視覚的貼り合わせ度が高い、意味密度の高い優れたラベルを選出する。ぼけ、一般化、弱一致のサンプルは除外する。ビデオデータについては、まず長いビデオを連続した短いセグメントに分割し、均等に代表フレームを抽出する。その後、語義的一貫性と運動的一貫性の両方でフィルタリングし、有効なセグメントを保持する。最後に、局所的なフレームレベルの詳細キャプションと、全体的な時系列語義キャプションを統合し、変化を感知できるビデオラベルを生成し、モデルが連続した画面上でより頑健な視覚表現を学習できるようにする。

データ効率の向上は結果に直接反映されている。TuringViTはわずか0.85Bの画像・文章ペアを使用しており、これはSigLIP2-Lのトレーニングデータ規模の約10分の1である。しかし、ImageNet-1Kなどの6つのゼロショット分類基準において、平均正確率は83.6%に達し、10Bのデータでトレーニングされた主流のオープンソースベースラインを上回った。COCOおよびFlickr30Kの画像・文章検索タスクにおいても同様の優位性があり、本当に10分の1のデータでより良い結果を得るという突破を実現した。

トレーニングプロセスにおいて、TuringViTは4段階の段階的なネイティブな動的解像度トレーニングパラダイムを採用しており、トレーニング開始から最初の日に、サブトレーニングVLMおよびVLAの入力特性に適合し、固定解像度のトレーニング後、後処理による適応という従来のモードを完全に打ち切りている。
このエンコーダーは、小鵬の技術体系の中で明確な落としどころを持っている。スマートドライブ分野では、これは第2世代VLAモデルの核心的な視覚エンコーダーであり、複数の周辺カメラからの高解像度、多フレーム動的道路場面入力を処理し、予測型世界モデルに視覚トークンを提供する。スマートシーリングとドライブ・パーキング一体化に向かって、TuringViTのVLMネイティブな特性により、視覚特徴と言語モデルがより効率的に一致し、異なる画角と比率の視覚入力をサポートでき、より豊かなシーリングインタラクション機能を支える。小鵬IRON人形ロボットシステムでは、これは視覚網膜の中心的な役割を果たし、物体の細粒度認識、空間関係理解、操作可能な領域検出、動的な環境追跡などの基本的な知覚能力を提供する。プロジェクトページはすでに公開されており、https://turingvit.github.io/ です。
