ステップは今日、新世代のエリートベースモデルであるStep5Previewをフルオープンしました。明確な位置付けは——実世界におけるエージェントタスク専用の主力モデルです。このモデルが解決しようとするのはAIモデルにおいて古典的な「パレート問題」です:能力、効率、コストの3つの目標が互いに引き合う中で、歴史的に一つの次元で前進しようとすると、他の次元を犠牲にしなければなりません。パレートフロントを推進するとは、選択肢をなくすのではなく、新しい設計によって全体の境界を外へ押し広めるということです。

今回の推進方法はスパースMoE構造です。Step5Previewの総パラメータ数は600Bですが、一度にアクティブ化されるのは27Bであり、ネイティブに100万トークンのコンテキスト窓をサポートし、テキストと視覚の両方の入力を直接処理できます。Artificial AnalysisのIntelligence Indexでは44点を獲得し、世界のオープンソースモデル上位3位にランクインしています。さらに驚くべきことに、単一タスクのコストはClaude Opus5の約1/8です——同じ予算でより強力な知能を得たり、同等の能力をより低価格で実現したりする二つの道をすべて開いています。

image.png

硬実力はいくつかの高難度のベンチマークで明らかになりました。Agents' Last ExamのCLIサブセットALE-CLI、金融投資研究評価FrontierFinance、そして横断的深層研究評価DRACOにおいて、Step5PreviewはGPT-6AstraやClaude Opus5に次いで、他の参加したオープンソースモデルを後ろに置き去りにしています。GDPval-AA v2では9月19日までの最新結果が採用されており、DeepSWE v1.1はSWE-agent harness下でtemperature=1.0、top_p=0.95で評価されています。

プログラミングに関しては、ステップ自身がStepCodeBenchを構築し、553の独立コードリポジトリ、9種類のタスク、20の応用分野、33種類のプログラミング言語をカバーしています。Step5Previewは全体の成功率と多様なシナリオでの安定性において十分な実績を持っています。バグ修正、機能開発、リファクタリング、環境設定といった現実的な作業をこなせます。あるデモでは、ESP32デバイスの大量開発ドキュメントを読み、ESP32-S3開発ボードをBluetoothボタンおよび音声入力に対応したVibe Codingキーボードに改造しました。その過程でCOMシリアルポートを開き、カメラを調整し、デバイス画像をキャプチャし、マウスをシミュレートして、リアルなエラーに基づいてコードを連続的に修正・実行し、3時間以上にわたって作業を行いました。

image.png

長期間のタスクにおいては本質が見られます。第一の実験では24時間とH100を提供し、MLA GPUカーネルのゼロから最適化(頭部次元512、batch1、64個のアテンションヘッド、8192トークン)をさせました。Step5Previewはコードを自主的に修正し、カーネルを実行し、スループットを測定します。動作可能だが性能が低下する案は放棄し、最良バージョンから再び登り始め、約22時間後にピーク性能を508TFLOPSまで引き上げ、Claude Opus5の493TFLOPSを上回りました。第二の実験も24時間で、Qwen3-30B-A3BベースモデルのAIME24におけるパフォーマンス向上を自動後訓練を通じて行わせました。モデル自身がどのように注釈APIを使用し、データを調整するかを決定し、最終的には正確率を53.3%から60%まで引き上げ、Opus5と同等の結果を達成し、注釈トークンを節約しました。

フロントエンドとビジュアルにおいては、このモデルはウェブページを書くだけでなく、Blenderを使って3D資産を作成し、繰り返し修正し、Three.jsでインタラクティブアプリケーションやゲームに接続できます。また、1922年の『広九鉄路旅行案内』から情報を抽出し、旅程検索、費用計算、ルート再生を行うなど、当時の線路に沿って小さな電車を走らせることで、史料をインタラクティブな製品に変換することも可能です。

金融は総合的な能力の試金石として扱われています。ステップは企業研究という高度なプロセスを中心に、3つの内部評価を構築しました:FinStepBench-LiveSearchは需要に応じた金融情報の検索と検証を試験し、CorporateValuationはデータと仮定を再現可能な評価に変換することを試験し、DeepResearchは証拠収集から完全な研究レポートに至るまでの全行程を試験します。外部ベンチマークであるFrontierFinanceでは、220問の専門家問題と11,543項目の評価基準により6つの投資シナリオをカバーします。この4つのベンチマークでStep5Previewはすべて強い結果を示しました。