Google近期延續了罕見的密集更新節奏,在六週內連續推出了三款Flash系列模型。最新發佈的Gemini3.8Flash作爲這一週期的重頭戲,被官方寄予了厚望,其核心任務直指長週期軟件工程、自主Agent以及複雜的企業級工作流,大有代替遲遲未現身的Pro系列支撐門面的意味。

從官方公佈的各項基準測試成績來看,Gemini3.8Flash的數據堪稱華麗。在測試長週期軟件工程能力的DeepSWE v1.1中,該模型拿到了71.0%的高分,距離頂尖的Claude Opus5僅有一步之遙;在跨越多個學科的HLE-Verified測試中,54.9%的得分甚至略高於Opus5。此外,在圖表理解、長視頻處理以及金融和法律等專業Agent任務中,它同樣展現出了超越前代和部分昂貴前沿模型的潛力。

image.png

在價格策略上,該模型延續了限時優惠政策,輸入和輸出費用分別保持在每百萬Token0.75美元和3.75美元。Google解釋稱,3.8Flash之所以能處理更困難的任務,本質上在於它“更加努力”——通過執行更多的推理步驟、反覆調用工具並在過程中自我檢查來完成複雜問題。然而這也帶來潛在代價,即可能比3.7Flash消耗更多的Token,如果用戶更重視計算效率,官方建議降低推理檔位或繼續使用舊版本。同時,伴隨3.8Flash一同亮相的還有面向網絡安全機構的專屬版本3.8Flash Cyber,專門用於漏洞的發現與修復。

儘管官方演示中通過3D魔法城堡和DOS界面的Google Maps等案例展示了其強大的多任務交互潛力,但社區的首批實際測試和開發者反饋卻顯現出了明顯的反差。在實際的三維直升機模型和3D水流模擬等編程任務中,雖然模型依然保持了極高的響應和生成速度,能夠快速交付結構完整、代碼可運行的成果,但在機身細節、部件邏輯等精細化要求上卻顯得相對粗糙,與官方案例存在肉眼可見的差距。

這種官方跑分與實際體驗的分裂,折射出當前使用方式的差異。官方演示通常依託於專門設計的Agent框架、特定的工具環境和明確的多輪測試標準,展現的是模型在整套技術棧託舉下的上限;而普通用戶往往基於一次性自然語言指令,接觸到的是模型單獨工作時的下限。它在應對複雜長任務時,依然容易出現草率理解需求、迅速堆砌結果的現象,判斷力和穩定性與頂級旗艦模型相比仍有明顯差距。

從宏觀戰略來看,Google在旗艦模型競爭受挫後,正將更多資源轉向成本更低、迭代更快的Flash路線。通過“周更”式的持續更新,讓Flash模型迅速滲透進搜索、移動端和十億級用戶的日常中,在真實使用中暴露並修復問題。對於擁有龐大基礎體量的Google而言,追求絕對的跑分第一已不再是唯一目標,高性價比與高併發運行能力構成了更具實用價值的商業邏輯。但在Gemini4真正登場前,由Flash強行頂上技術代言人的定位,也讓它揹負了速度與複雜任務處理能力雙重考驗的獨特壓力。