本週 DeepSeek 發佈了 V4.1 Flash,這個大模型架構變化之大,完全可以稱得上是 V5,但 DeepSeek 很低調地沒有更換大版本號。Pro 系列的新品已確定爲 V4.1 Pro,具體升級尚未公佈;如果是 V4 到 V4.1 這樣的提升幅度,V4.1 Pro 的性能上限也會很高,但考慮到此前 V4 Pro-0813 正式版不及預期,外界期待值不宜拉得太高。
DeepSeek Code 2.0 被指即將發佈,主打電腦控制
據爆料,後續還有一波大模型,名爲 DeepSeek Code 2.0,即將在 9 月份發佈,預計性能會擊敗 Mythos 5.1 和 GPT-6 Astra——這是當前最強大的兩個前沿級大模型。
其他方面,DeepSeek Code 2.0 預計將繼續保持開源開放,設計重點是 Computer Use,也就是電腦控制:讓 AI 替代用戶操作電腦完成大量工作,Astra 目前許多令人驚訝的表現正來自這一能力。
3 萬億參數,國內最強規模
爆料稱該模型擁有高達 3 萬億以上的參數量,顯然這也是它提升性能的關鍵。作爲對比,國內目前最強的是 K3 大模型的 2.8 萬億參數,千問 Qwen 3.8 Max 爲 2.4 萬億參數,DeepSeek V4 Pro 爲 1.6 萬億參數。
從 V4.1 Flash 換用新結構使參數量翻倍來看,Code 2.0 從當前 1.6 萬億提升到 3 萬億參數的可信度是有的——想與 Mythos 5.1 及 Astra 這樣的大模型競爭,就需要這個級別的參數量,否則性能上限很難提升。
不過這一爆料的可信度尚難判斷。DeepSeek 在 2023 至 2024 年曾推出過三款名字帶 Code 的大模型,當時表現平平;這次若重推偏向代碼 / 邏輯的 Code 大模型、作爲旗艦級產品,也不失爲一個方向,讓 V4.1 Pro 及 Flash 面向通用 Agent 任務即可。
VIP會員