DeepSeek-V4.1-Flashはこのほど千問AIプラットフォームにリリースされ、APIサービスとToken Planも同時に公開されました。開発者は標準APIを通じて業務システムに接続することができ、またQoderや千問APP、Codexなどのツール内で直接Token Planを呼び出して、コード、ドキュメント、ビジュアル理解およびエージェントのタスクに使用できます。

プラットフォーム公告によると、このモデルはDeepSeekの新世代の軽量フラッグシップであり、総パラメータ数は552BのMoE構造で、Causal-Encoder-Decoder非対称構造を採用しています。入力アクティベーションは約8B、出力アクティベーションは約16Bです。ネイティブにテキストと画像の理解をサポートし、最大の文脈長は100万token、プラットフォームの最大出力は約393Kです。公式はこのモデルが複数のエージェントおよびコードベンチマークにおいて同シリーズの前世代よりも向上しており、より低いアクティベーションパラメータで高いスループットと低遅延を実現できることを述べています。
コスト面は今回のリリースの重点です。新世代のキャッシュ圧縮により、KV Cacheに対するHBMの要件は前世代の1/4に低下し、SSDストレージの要件は1/8にまで低下しました。長い文脈と複数のホルダーアプリケーションの呼び出しはさらにリソースを節約します。千問ページでは時間帯ごとの価格を示しています:空き時間の入力は1元/百万token、出力は4元/百万token、忙しい時間の入力は2元、出力は8元です。レートリミットはRPM15K、TPM1Mで、機能はプレフィックス補完、関数呼び出し、キャッシュ、構造化出力、バッチタスク、ネットワーク検索をカバーしています。
展開については、アリババクラウドの百煉とvLLMオープンソースコミュニティが適応を完了し、中国サイトと国際サイトどちらからでも呼び出しが可能です。北京、シンガポール、Globalアメリカ、ドイツ、日本、香港など多くの地域をカバーしています。百煉ドキュメントによると、このモデルは複数回の会話、関数呼び出し、ネットワーク検索、文脈キャッシュ、構造化出力をサポートしており、max_tokensの上限は約393216で、企業が長文ドキュメントの解析、カスタマーサポート知識ベース、コードリポジトリの質問、マルチモーダル審査作業などを同じインターフェースに移行するのに適しています。
業界の見解では、V4.1-Flashは「大規模パラメータ、小規模アクティベーション、強力なキャッシュ」の組み合わせを千問エコシステムに導入し、長文脈エージェントの試行錯誤のコストを下げることになります。中小チームにとって、空き時間の安価な価格とToken Planのサブスクリプションは、バッチ推論とプロトタイプ検証をより柔軟に行うために役立ちます。
VIP会員