大規模モデルのオープンソース分野におけるイノベーションのペースが再び記録を更新しました。アリババ・トンイー・チンチームは最近、新しいマルチモーダルMoEモデル「Qwen3.8-Flash-Next」を正式にオープンソース化しました。これはQwen4のアーキテクチャの初期プレビュー版であり、極めて低い計算コストで非常に高いパフォーマンスを発揮しています。
コアアーキテクチャとパラメータの規模において、Qwen3.8-Flash-Nextは高さに疎な混合エキスパート(MoE)設計を採用しています。このモデル全体のパラメータ数は1250億で、さらに510億のN-gram埋め込みテーブルと40億の多トークン予測モジュールが追加されていますが、各トークンごとに実際にアクティブになるパラメータ数は60億です。全体のネットワーク構造は48層で、MoE層には512個のエキスパートが統合されており、top-10によりルーティングが行われています。
技術革新の面では、このモデルは複数の先端的なアップグレードを統合しています。GDNとQSAの混合注目機構を導入し、長文処理タスクの実行効率と情報検索精度の両方を考慮して、元々の256KのコンテキストウィンドウをYaRN技術によって1Mまで拡張しました。また、510億のN-gram埋め込みを導入することで、追加の計算コストをほとんど増やさずに容量を大幅に拡大し、非同期プリフェッチを通じてシステムの遅いDRAMメモリに格納することが可能です。さらに、ゲート付き残差接続(GR)およびマイクロブロック粒度の選択的コンテキストの疎注目設計も採用しています。
実際のパフォーマンスとコスト表現において、このモデルは目覚ましい結果を示しました。極限まで疎に設計されているため、訓練コストは前世代のQwen3.7-Plusの約1/9に抑えられ、コード作成やオフィス業務などの核心的なタスクでの性能は顕著に向上しました。多くの評価と最新報によると、わずか6Bのアクティブパラメータを使用して、このモデルはClaude Opus 4.6 Maxなどのトップエンドモデルを打ち負かすことができました。
エコシステムの展開とオープンソースのペースにおいて、SGLangはモデル発表の初日にDay-0レベルの直接的なサポートを提供しました。開発者はオープンソース経由でモデルの重みを取得し、ローカルまたはクラスタ環境で効率的に展開することができます。このような一連の基本的なアーキテクチャのイノベーションと突破は、世界中のオープンソースコミュニティに前線の技術探索のサンプルを提供し、高性能AIの大規模モデルが低コストかつ高効率なスケーラブルな展開へと進化することをさらに推進しました。
VIP会員