この大規模モデル時代における従来の手法である「単語単位での予測」は、上海人工知能研究室と上海交通大学人工知能学部LUMIA Labチームによって新たな予訓練タスク「次の概念予測(NCP)」を提案し、世界初の8.9B規模の離散的な隠れ空間ベースモデル「NCP-ArchPreview」を公開することで、一歩ずつ破られました。これにより、トレーニング効率に関する計算が再評価されました。

これらの数字は非常に注目されます。5.73TのDolma-3データセットに基づいてトレーニングされたモデルですが、51.3%のToken予算でOLMo-3-7Bの最終的なトレーニングロスに追いつき、等価収束速度は1.95倍向上し、計算パレート効率は1.74倍システム的に向上しました。下流タスクにおいては総合的な性能が2.45ポイント上回り、特にGSM8K数学推論では約6ポイントも向上しています。つまり、他のモデルが一箱の計算リソースを使い切って到達する位置に、このモデルは半分のリソースで到達したのです。

NCP-ArchPreviewの構造は、三段階の隠れ空間概念処理フローから成っています。まず、乗法量子化によって巨大な離散的概念表現空間を構築し、その後、微分可能な次の概念予測、因果的漏れ防止フィードバックメカニズムおよび階層的残差ルーティングを通じて、未来の概念を明示的にモデル化します。これは、単純に次の単語を当てようとするのではなく、次の概念がどのようなものかを事前に考えることを意味します。このように、隠れ空間の概念予測への転換により、従来の単語単位予測の枠組みは根本的に打ち破られました。

予訓練だけではなく、驚きは他にもあります。わずかな17Mの隠れ空間パラメータのみを微調整することでLoRAを上回る結果が得られ、記憶喪失の問題もありません。トレーニングのスループットは向上し、GPUメモリ使用量は減少しました。この概念表現をドラフトモデルに導入したことで、推定デコードの平均受容長が4.17%向上し、特にコードタスクでは7.59%も向上しました。これにより、推論の高速化のための新たな道を開きました。技術報告書では、チームはハマったエラーとその解決策を公開し、千億規模の代理指標選択メカニズムを構築し、全ステージのチェックポイントや評価フレームワークを含むすべての資産をオープンソース化しました。モデルの微調整や推論高速化の新しい突破口を探している研究者にとって、この隠れ空間のアプローチはまさに新鮮なロードマップです。