CLUEチームが最新に公開したSuperCLUE-Terminal中国語スマートエージェント端末プログラミング評価ランキングによると、DeepSeek-V4-Pro-0813は51.52点を獲得し、すべての参加モデルの中で第2位となり、トップのKimi K3にわずかに劣った。より注目すべきは、この成績を収めたことと同時に非常に低い呼び出しコストを維持していることで、高得点モデルの中でも特に突出したコストパフォーマンスを示している。このランキングは国内開発者向けに設計されており、すべての課題が中国本土の現実的なプログラミングタスクを採用しており、Cluade Codeを統一された実行フレームワークとして使用し、各モデルが中国語の要件を理解し、タスクを計画し、ツールを呼び出し、エラーを修正・コードを変更する能力を公平に比較する。

image.png

評価のリアルさはその課題設定から来ている:各問題に対してモデルは50〜110ラウンドのインタラクションを完了する必要があり、1問の完全な実行には30分〜1時間半かかる。これは日常的な開発における複雑なワークフローを高度に再現したものである。今回のランキングでは、Kimi K3が60.61点で第1位を獲得し、DeepSeek-V4-Pro-0813がこれに続いて、GLM-5.2の48.48点や旧版のDeepSeek-V4-Flashの46.46点を上回り、第一陣に安定して位置づけられている。

1.42元の単問コスト、トップレベルの計算力と対抗

最も目を引くのは、DeepSeek-V4-Pro-0813のコスト管理である:単問の呼び出しコストは約1.42元であり、これはKimi K3の1/14、GLM-5.2の1/16に過ぎない。ヘッドモデル同士のスコアの差がたった数点である現在において、このような桁違いのコスト差は、中小企業が「ほぼトップクラス」のコード能力を手頃な価格で利用できることを意味し、それぞれのインタラクションに高い計算リソース費用を支払う必要がなくなる。