大規模言語モデル(LLM)技術の深化に伴い、検索エンジンは第三次的なパラダイムの転換を経験しており、従来のキーワードテキストマッチングから、複雑な意図理解と認知意思決定を核とする3.0時代へと加速して進化しています。最近、メイドゥー技術チームは深い技術解析を発表し、メイドゥー検索3.0がサービス小売順序付けの場面において経験した3回の進化を全面的に明らかにし、大規模言語モデルの意味的表現(Semantic Representation)がローカルライフの複雑な環境においてどのように実装され、その重要な価値を示すかを明らかにしました。

image.png

一、 サービス小売の突破: 従来の語彙マッチングから大規模言語モデルによる意味的再構築

サービス小売と商品小売は業務形態において本質的な違いがあります。商品小売は比較的標準化されている一方で、メイドゥーが関与するサービス小売とローカルライフのシーンは品目が多く、検索要求のタイプが多様(取引型、情報型、リード型が共存)、供給が非標準化であるなど特徴があります。

日常的な検索では、従来の精排モデルはテキストの語彙マッチングに強く依存しています。しかし、膨大な長尾品目や複雑なユーザーの意図に直面すると、従来の特徴工学の汎化能力は明らかに限界があります。例えば、「ペット スパ+シャンプー」を検索するユーザーの場合、該当する店舗または商品名は「萌寵クリーンケアパッケージ」かもしれません。「春節の大掃除」を検索する場合、対応するのは「深部清掃サービスパッケージ」です。このような典型的なケースでは、Queryと供給は語彙上ほとんど重なることがなく、背後にある意味は非常に相関しています。

この従来の意味的ギャップを乗り越えるために、メイドゥーのサービス小売検索順序付けチームは過去1年以上にわたり、LLMを精排モデルに導入するための体系的な探求を進めました。検索語(Query)、店舗(POI)、商品(Deal)に対して高品質な意味的ベクトル表現を生成し、コサイン類似度を通じて順序付けモデルに意味的マッチング信号を注入することで、単点の特徴検証から体系的な再構築、さらには跨シナリオへの移行・利用の飛躍的な発展を実現しました。

二、 三期の技術進化: 可行性の検証から全領域のシステム構築

1. 一期: 大規模言語モデルの意味的表現の導入(可行性の検証)

一期段階では、チームの主な目標は明確でした: LLM表現が精排モデルに実質的な助けになるかどうかを検証することです。

  • 技術設計: 小規模パラメータのオープンソースベースモデルを選定し、すべてのパラメータを微調整し、語彙に特別なトークンを導入して集約のアンカーポイントとして使用し、注意マスクを丁寧に設計してQueryと店舗情報を隔離しました。
  • 特徴の注入: モデルの推論によりそれぞれの埋め込みを生成した後、コサイン類似度を計算し、離散的なバケット方式によって精排モデルの特徴に学習可能な埋め込みとして組み込みました。
  • オンライン成果: 離線での検証ではクリックNDCGが顕著に向上し、リリース後に全体の検索支払い注文とサービス小売注文が顕著に増加しました。特に伝統的な語彙マッチングが弱い長尾シナリオにおいて、BadCaseが顕著に減少しました。これは直接的にLLMの意味的表現が精排シナリオにおける大きな潜在力を持っていることを証明しています。

2. 二期: 店舗の精排表現の体系的なアップグレード

一期で露出した商品側の意味的欠如、全パラメータの微調整コストの高さ、最適化目標の不完全さなどの課題に対処するために、二期では表現生産の全プロセスを体系的に再構築しました。

  • 五つの要素と対話学習: Query、商品の正サンプル、店舗の正サンプルおよび困難な負サンプルを含む五つの要素のトレーニングデータを構築し、従来の二分類ターゲットを完全に放棄し、InfoNCE LossとTriplet Lossを全面的に導入し、順序付けモデルが本当に関心を持つ「複数の候補の相対順位」問題を完璧に解決しました。
  • 軽量化と効率的な抽出: 全パラメータの微調整からLoRAアプローチに切り替え、独立したシーケンスと学習可能なベクトルを古い方法に代わり、次元削減方式をMRL-E(Matryoshka Representation Learning)にアップグレードし、トレーニングと推論効率を向上させながら、多尺度の柔軟な応用をサポートしました。
  • オンライン成果: 店舗の精排におけるクリックGAUCと変換効率が全体的に強化されました。オンラインデータによると、全体の有効クリックと結果ページの変換率(QV_CTR)が顕著に上昇し、大規模言語モデルの意味的表現がより多くの露出機会をもたらすだけでなく、正確な推薦によって全体的な変換品質を最適化できることを十分に証明しています。

3. 三期: 下位の精排に表現と全域特徴の交差を導入

店舗の精排を体系的に再構築した後、チームは成熟した手法をさらに下位の精排(つまり、店舗に下がる具体的な商品の順序付け)に移し、同時に全域交叉統計特徴の整備と補充を進めました。

  • カバー範囲の難題の解決: 店舗の精排と下位の精排のQuery分布には本質的な違いがあるため、移行初期にはQueryカバー率不足の課題がありました。チームは両方のシナリオを詳細に整列し、データ治理を行い、大規模言語モデルの意味的表現能力を商品下位層にスムーズに拡張しました。
  • 二つのラインの並行: 「大規模言語モデルの表現移行」と「個別化×商品」、「Queryの意図×商品」の交差次元モデリングを組み合わせ、検索結果の細分化された次元での再度の飛躍を実現しました。

三、 総括と展望

メイドゥー検索3.0の進化過程は、大規模言語モデルがローカルライフ分野に実装されるのが一朝一夕でないことを示しています。それは、単一の特徴検証、体系的な表現再構築、そして跨シナリオの一般化・利用の堅実な道のりを経て実現されます。LLMの強力な意味的理解能力を高密度の連続表現と離散バケット特徴に変換することで、メイドゥーはサービス小売のシナリオにおいて複雑な意図と非標準化された供給との壁を突破し、ユーザーにさらに正確でスマートなローカルライフ検索体験を提供できました。