モデルがローカルにデプロイ可能であるからといって、それが実際のビジネスシナリオでスムーズに機能するとは限らない。具体的な業務フローにおいて、AIは基本的な会話能力だけでなく、複雑なルールを正確に理解し、セキュリティの境界を守り、適切に外部ツールを呼び出して規格に合った結果を出力する必要がある。この課題を解決するために、アリババ・アーシステムチームはオープンソースコミュニティと連携し、ローカル化された大規模モデルの後訓練用ツールキット「AReno」を開発した。最近では、百霊大モデルと共同で、軽量な後訓練の実践経路を提供し、単一マシン環境でAgentic RL(強化学習)のクローズドループを実現した。

この技術方案の高い再現性を確保するため、今回の協力ではルールが明確でフィードバックが直接的なタッチゲームを最小検証タスクとして選んだ。実験はDGX Sparkハードウェア環境で行われ、総パラメータ数が79億だがアクティブパラメータが13億のLing-3.0-tinyモデルに対して後訓練が行われた。トレーニングの初期段階では、モデルは基本的なルールを理解していたが、インタラクション中に不正なアクションが発生していた。そして、タスクルールを正確なリワードフィードバックメカニズムに変換し、GSPOアルゴリズムを使用して400ステップトレーニングを行った後、モデルのリワード平均値が顕著に向上し、出力長も収束した。再テスト結果は、モデルがツール呼び出しとアクション選択における安定性と合理性が質的に向上したことを十分に示している。

image.png

この探求の核心的な価値は、透明性があり再現可能なタスク適応方法論を検証した点にある。誤りを正確に発見し、検証可能なフィードバックを定義し、ローカルトレーニングを完了し、同じ環境に戻って再テストを行うというプロセスである。このモデルはチェスなどの実験にとどまらず、ツール呼び出しの修正や構造化フィールドの抽出、分野固有の指示の遵守、およびビジネスプロセスのインテリジェントエージェントなど多様な実際の製品シナリオにスムーズに移行できる。

現在、Ling-3.0-tinyはBF16、FP8、INT4などの多数のオープンソースバージョンを提供しており、開発者はHugging Faceまたは魔搭コミュニティを通じて取得して使用できる。また、ARenoのオープンソースリポジトリにアクセスして以降のコードの共同開発や技術的な議論にも参加できる。