今天一早,SpaceXAI 推出最強模型 Grok4.7。發佈頁開頭只有一句極具“攻擊性”的定位:面向編程與知識工作的最強模型,速度達可比模型兩倍,價格僅一半。這次升級沒有停留在跑分表上——Grok4.7換用更大的基礎模型,強化長時間任務、自我檢查和長上下文管理,並把文檔、演示、法律、醫療和工程等專業工作納入重點測試,目標是讓模型在持續數小時的任務裏少走彎路、交出可直接使用的結果。
馬斯克發推稱,Grok4.7在智能水平、運行速度和成本之間取得了“很有競爭力的平衡”。

長任務成爲主戰場
Grok4.7採用比 Grok4.6更大的基礎模型,訓練階段延長了強化學習週期,任務組合進一步加難,其中更多樣本需要數小時完成。官方稱新模型在檢查自身工作、管理長上下文方面均有提升,直接對應編程智能體最棘手的問題:複雜軟件任務包含讀倉庫、拆需求、改多處文件、跑測試和反覆糾錯,模型能否在漫長執行鏈中保持目標、發現錯誤,往往比一次寫出漂亮代碼更重要。

在考察長時間編碼的 CursorBench4.0上,Grok4.7得分46.3%,高於上一代的40.4%;DeepSWE v1.1高推理強度成績71.0%;Terminal-Bench4.0從上一代20.3% 升至38.0%。模型也被訓練爲原生理解 Grok Bot 運行框架,官方稱這改善了對話與通用知識工作表現,意味着升級重點已從單輪迴答延伸到模型與工具、執行環境的持續協作。
從寫代碼走向完整知識工作
編程仍是 Grok4.7最醒目的標籤,但評測範圍明顯更寬。AA Briefcase v1.1上它獲1657分(上代1546),GDPval Elo 由1605升至1695,接近 Fable5.1的1735,高於 GPT-6Astra 的1542。專業領域同樣提升:EEBench 由53.0% 升至64.0%,Harvey Legal Agent Benchmark 由15.8% 升至19.6%,HealthBench Professional 由48.5% 升至56.7%。這透露出清晰趨勢——前沿模型競爭正進入“完成整項工作”階段,需理解任務、調用工具、產出文件並自行復核。
安全方面,Grok4.7啓用全新防護體系,官方稱是拒答與抵抗越獄表現最強的一款;生物安全 LatchBio 基準以62.4% 登頂,HackerBench v0.3僅放行3.3% 高風險雙重用途提示,並很少誤攔正常安全研究。SpaceXAI 還向少數網絡安全夥伴開放邀請制紅隊能力。
價格上,標準版起價每百萬輸入 Token2美元、輸出6美元,與 Grok4.6一致;快速版速度翻倍。Grok4.7已上線 Cursor 和 Grok Build,並通過 API、第三方框架及雲平臺提供。開發者無需爲換代多付標準版 Token 成本,卻能獲得更強的長任務與專業工作表現。不過網友似乎並不買賬,有人直言“這種模型居然也敢發佈”。客觀來看,Grok4.7的賣點並非全面碾壓競品,而是用遠低於部分旗艦的 API 成本,換來了相當接近、並在個別專業任務上領先的性能。
VIP會員