最近、Liquid AI と Hugging Face は、LFM2.5シリーズの3つの主要モデルのDSparkドラフトモデルチェックポイントを正式にリリースしました。これは、LFM2.5-1.2B-Instruct、LFM2.5-2.6B、およびLFM2.5-8B-A1Bです。新たなサロゲートデコードパスを導入することで、モデル出力の品質を一切変えることなく、推論のスループットを大幅に向上させました。

コアパフォーマンスの向上と応用性能

実際のテストでは、DSparkドラフトモデルが目覚ましい加速効果を示しました。GPU端末では、全体のスループットが最大で3.18倍まで向上します。エッジデバイスでは、最大で2.87倍の向上が達成されます。

特にエッジデバイスでのスマートエージェント(Agent)推論シナリオにおいて、LFM2.5-2.6Bの関数呼び出し遅延は平均で57%低下しました。M4Max MacBook Proをエッジテストプラットフォームとして使用した場合、出力速度は最大で秒間139トークンに達し、これによりローカルでエージェントアプリケーションを動作させるハードルが大幅に低下し、ユーザー体験が一部専有クラウドモデルを上回るようになりました。

image.png

DSparkの仕組みとアーキテクチャ設計

従来の大規模言語モデルの推論フェーズはメモリバンド幅に制限されており、大部分の遅延はモデルウェイトをDRAMからSRAMにストリーミングするプロセスに起因しています。サロゲートデコードはこの課題を解決するために登場しました。軽量なドラフトモデルを使用して候補となるトークンを迅速に生成し、そのトークンをターゲットモデルが一度の前方伝播で統一的に検証することで、ウェイトのロードコストを効率的に分散させます。

DSparkは既存の方法に基づいて深く統合されており、主に3つのコアコンポーネントから構成されています:

  • 並列メインネットワーク: DFlashに類似したスタイルを採用しており、ターゲットモデルの文脈特徴を条件として、一度の前方伝播の中ですべてのドラフトトークンに対して一様な隠れ状態を生成します。
  • 順序ヘッド(Markovヘッド): 隣接するトークン間のマルコフ連鎖をシミュレートすることで依存関係を増加させ、後続位置の受け入れ率を効果的に向上させます。
  • 信頼度スケジューリング検証器: 各トークンの生存確率を予測し、検証コストが節約コストを上回る場合、自動的に低信頼度の末尾を削除します。

モデルトレーニングに関しては、SFT、チャット、コード、関数呼び出しを含む大規模で多様なデータミックスが使用されました。厳密なアブレーション実験の結果、最終的に選ばれた初期バージョンは、アテンションのみのアーキテクチャで、5層と9つのブロックからなり、全体のパラメータ数は約3億程度に制御されています。

image.png

品質の整合性と推論エコシステムのサポート

サロゲートデコードメカニズムの特性により、グリーディー解釈では、ドラフトトークンがターゲットモデルの分布と完全に一致している場合にのみ受け入れられ、拒否された場合はターゲットモデル自身のトークンによって置き換えられます。そのため、生成される出力シーケンスはベースラインのグリーディー解釈と構造的に完全に一致しており、あらゆるベンチマークテストの正確性には変化がありません。

エコシステムのサポートについては、DSparkはリリース当日に主流の推論フレームワークとの互換性を実現しました:

  • SGLang: 特定の統合と起動設定を通じて、アクセラレーター上で動作をサポートしています。
  • llama.cpp: 公式ビルドサポートを実装し、コマンドラインからGGUFウェイトとドラフトモデルファイルを読み込むことが可能です。