8月14日,智譜正式發佈大模型 GLM-5.3。基座參數量仍然是7400多億,跟 GLM-5.2同一套底子,此前傳聞的萬億參數升級並沒有出現——那枚牌大概被留給了 GLM-5.5。但智譜靠着後訓練這招,硬是讓 GLM-5.3的性能比上一代提升了50%,在多項主流基準測試中拿下了當前開源模型最高排名,編程與智能體能力接近 Claude Fable5,編程體感超過其他國產模型。
幾項關鍵基準的成績躍升很有說服力。在衡量模型於真實終端環境中完成複雜任務的 Terminal-Bench3.0上,得分從4.6一口氣躥到28.3;聚焦長程軟件工程與持續代碼修改能力的 DeepSWE v1.1,從46.2漲到66.9;覆蓋多類真實專業場景、強調跨工具協作與長程任務的 Agents' Last Exam,從23.8提升到28.5。在覆蓋44種職業、考察真實高價值知識工作的 GDPval-AA v2中,GLM-5.3拿到1769分,展現出基於編程能力涌現出的專業任務執行力。整體來看,它在複雜軟件工程、終端操作和更廣泛的真實世界 Agent 任務上都有顯著進步。

最能說明問題的是智譜自研的 Z.ai Code Bench——這套評估把模型塞進真實的本地開發環境,在不同思考檔位下執行端到端任務,儘可能還原開發者實際用 Coding Agent 時的體感。測試結果顯示,GLM-5.3在效果和 Token 利用率之間找到了更好的平衡:High 檔位下準確率達到31.4%,超過 Claude Opus4.8最高檔位的29.5%,而每項任務平均只輸出約5萬 tokens,Opus4.8則需要約12萬 tokens——意味着 GLM-5.3能用更短的執行路徑走完同樣的事。

產品落地方面,GLM-5.3即日起上線智譜官方編程工具 ZCode 和效率工具 AutoClaw,同步開放給 GLM Coding Plan 全量用戶及訂閱用戶。TraeWork、TraeCode、釦子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等第三方編碼平臺也開放了搶先體驗。API 很快上線,完整模型權重將在兩週內完成必要的安全加固後開源——智譜的策略是儘可能限制模型的潛在攻擊能力,同時保留其防禦價值。今天13:00,GLM Coding Plan 全員額度已經重置,所有用戶後臺的用量統計均可看到額度回滿。
