NVIDIAの研究チームは、異なるモデル間でKVキャッシュを移行できる方法を見つけるという画期的な進展を遂げました。ターゲットモデルは、予備入力ステップを直接スキップでき、コンテキストを再処理するよりも2.7倍から25倍速く変換できます。

この進歩の意味を理解するには、まずKVキャッシュの役割について知る必要があります。ChatGPTやClaudeを使用する際、最初の単語の生成が明らかに遅く、その後の内容はほぼ瞬時に表示されます。その背景には、モデルが最初の単語を生成する前に、すべての入力コンテキストを処理し、中間結果をKVキャッシュとして保存するように意図的に設計されたメカニズムがあります。以降の単語はこれらのキャッシュを再利用できるため、処理が非常に早くなります。

問題は、KVキャッシュが「1回ずつモデル」に限定されていたことです。別のモデルに切り替えたり、モデルバージョンをアップグレードしたりすると、以前に計算されたキャッシュはすべて無駄になり、新しいモデルはコンテキスト全体を再び処理しなければなりません。長文のシナリオでは、これにより多くの繰り返し計算と時間が浪費されることになります。

NVIDIAの提案によって、KVキャッシュが移行可能になりました。1つのモデルで計算されたキャッシュは変換後、他のモデルが直接使用できます。ターゲットモデルは予備入力ステップを完全にスキップします。変換プロセス自体もコンテキストを再処理するよりもはるかに高速です—スピード向上はモデルやコンテキストの複雑さによって異なり、2.7倍から25倍の範囲です。

この研究はAI業界に深く影響を与えるでしょう。現在のLLM APIの利用コストの相当部分は、特に長時間の会話や長いドキュメントのシナリオにおいて、コンテキスト処理に起因しています。もしKVキャッシュがモデル間で移行可能であれば、ユーザーがモデルを切り替える際に重複計算のコストを負う必要がなくなり、モデルのアップグレード時にも既存の会話コンテキストを破棄する必要がなくなるのです。この研究は、AI推論インフラストラクチャの設計方法を変える可能性があり、モデル間の切り替えをよりスムーズで経済的に行えるようになるでしょう。