本日早朝、SpaceXAIは最強モデルのGrok4.7をリリースしました。発表ページの冒頭には「攻撃的な」定位が記載されており、「プログラミングと知識作業に特化した最強モデル」とし、速度は対応モデルの2倍で、価格は半額です。今回のアップグレードはスコア表にとどまらず、より大きな基礎モデルを使用し、長期的なタスク、自己チェック、長文の文脈管理を強化し、ドキュメント、プレゼンテーション、法務、医療、エンジニアリングなどの専門的な業務を重点的にテストしています。その目標は、数時間にわたるタスクで間違った道を歩まず、直接使用可能な結果を出せるようにすることです。
マスク氏はツイートで、Grok4.7は知能レベル、実行速度、コストにおいて「非常に競争力のあるバランス」を達成したと述べました。

長期的なタスクが主戦場
Grok4.7はGrok4.6よりも大きな基礎モデルを使用しており、訓練段階では強化学習の期間を延長し、タスクの組み合わせをさらに難しくしています。この中には数時間かかるサンプルも含まれます。公式によると、新しいモデルは自身の作業をチェックしたり、長文の文脈を管理したりする能力が向上しています。これはプログラミングエージェントにとって最も難しい問題である、複雑なソフトウェアタスク(リポジトリの読み込み、要件の分解、複数のファイルの修正、テストの実行、繰り返しのエラー修正)におけるモデルの性能に直結しています。つまり、一度に美しいコードを書くことよりも、長い実行プロセスの中で目標を保持し、エラーを発見できるかどうかが重要です。

長時間のコーディングを評価するCursorBench4.0では、Grok4.7は46.3%というスコアを記録し、前世代の40.4%を上回っています。DeepSWE v1.1の高推論強度でのスコアは71.0%、Terminal-Bench4.0は前世代の20.3%から38.0%に上昇しました。モデルはGrok Botの実行フレームワークをネイティブに理解するよう訓練されており、公式ではこれにより会話や一般的な知識作業のパフォーマンスが改善されたと説明しています。これは、アップグレードの焦点が単一の回答から、モデルとツール、実行環境との継続的な協力へと広がっていることを示しています。
コードの執筆から完全な知識作業へ
プログラミングはGrok4.7の最も目立つ特徴ですが、評価範囲は明らかに広がっています。AA Briefcase v1.1では1657点(前世代は1546点)を獲得し、GDPval Eloは1605から1695に上昇し、Fable5.1の1735に近づき、GPT-6Astraの1542を上回りました。専門分野でも向上があります。EEBenchは53.0%から64.0%に、Harvey Legal Agent Benchmarkは15.8%から19.6%に、HealthBench Professionalは48.5%から56.7%に上昇しました。これは明確なトレンドを示しています。先端モデルの競争は「仕事全体を完了する」段階に入っているのです。タスクの理解、ツールの呼び出し、ファイルの生成、そして自動的に検証を行う必要があります。
セキュリティ面では、Grok4.7は新たな保護システムを導入しており、公式ではこれが拒否回答と脱獄への抵抗性で最も優れているとされています。生物安全のLatchBio基準では62.4%でトップとなり、HackerBench v0.3では高リスクの二重用途提示のうち3.3%のみが許可され、通常のセキュリティ研究はほとんど誤ってブロックされることはありません。SpaceXAIは少数のサイバーセキュリティパートナーに対して招待制の赤チーム機能を公開しています。
VIP会員