如果你從去年就開始用Gemini,最近最流行的一句調侃是:那種感覺就像看着自家兄弟慢慢得了阿爾茨海默症。按理說,一家公司發新模型,本該是用來打臉這種調侃的。可就在剛剛,Google一口氣甩出三款新模型之後,網友非但沒收回這句話,反而笑得更大聲了,頗有一種他們都不看好你、偏偏你最不爭氣的即視感。這三款模型分別是3.6Flash、3.5Flash-Lite,以及專攻網絡安全的3.5Flash Cyber,官方博客的措辭依舊眼熟,更高效、更聰明、爲大規模AI agent而生,一句不落,但實際體感卻冰火兩重天。

先說當家頭牌3.6Flash。它是今年5月I/O大會上3.5Flash的小版本迭代,官方給它的定位是真正扛活的幹活模型。這一代最大的賣點是省token:按Artificial Analysis Index的數據,3.6Flash比3.5Flash少用了17%的輸出token,在DeepSWE這類場景上甚至能省到65%,跑多步任務時推理步數和工具調用都更少。價格也確實降了,輸入1.5美元每百萬token、輸出7.5美元每百萬token,而上一代3.5Flash的輸出價是9美元,這波直接砍到7.5,又快又省,單個agent任務的成本被壓了下來。

image.png

基準測試上,代碼能力是重點,DeepSWE從37%提升到49%,官方稱多餘代碼改動更少、執行循環更短、生成代碼更貼近生產環境要求;機器學習研究方向的MLE Bench提升更明顯,從49.7%拉到63.9%;計算機操作OSWorld-Verified從78.4%升到83%,而且計算機操作本身成了Gemini API和企業版的內置工具,主打開箱即用;知識工作GDPval-AA v2從1349漲到1421,Hebbia、Harvey等客戶反饋它在文檔解析、圖表數據分析、報告起草這類多模態任務上尤其突出,Figma、JetBrains也出面背書。一個不起眼但實在的更新是,知識截止日期終於從2025年1月推進到了2026年3月,老黃曆總算翻篇。安全方面,官方說3.6Flash上了升級版Frontier Safety防護,重點盯着化學、生物、放射性、核與網絡攻擊這兩類濫用,抗越獄能力更強,同時儘量不誤傷正常需求、少亂拒絕。

image.png

比它低一檔的是3.5Flash-Lite,主打快和便宜,專治高吞吐、低延遲的任務,比如agent搜索和文檔處理。它是3.5系列裏最快的,按Artificial Analysis測量每秒能吐350個token,價格更是白菜價,輸入0.3美元、輸出2.5美元每百萬token,質量比3月發的3.1Flash-Lite好一大截。它支持調推理檔位,低配活兒開最低檔圖快和省,碰到要多步拆解的子任務就把思考檔位往上撥,電腦操作這次也做成了內置工具。

提升相當明顯:代碼和agent任務的Terminal-Bench2.1從31%幹到54%,長上下文的GDM-MRCR v2從60.1%提到72.2%,真實任務執行的GDPval-AA v2更是從642飆到1140。最有意思的是,這個低檔小弟在不少agent和代碼任務上居然反超了輩分更高的3Flash,比如SWE-Bench Pro是54.2%對49.6%、OSWorld-Verified是74.0%對65.1%,等於跑3Flash的活兒現在有了個更快更強的平替。官方舉了幾個用法,從海量電商數據裏抽產品特徵、給3.6Flash當副手一口氣生成25個網頁設計方案、批量翻譯總結收據、邊玩邊迭代做小遊戲,Ashler、Palo Alto Networks、Ramp這幾家客戶也來誇它速度、智能、成本三合一。

最後一個3.5Flash Cyber畫風突變,專門用來找和修代碼裏的安全漏洞。Google的邏輯挺妙:現在AI找漏洞的速度已經比現有系統修漏洞快了,漏洞越堆越多,不如用便宜高效的Flash來批量補鍋。這個模型在3.5Flash基礎上微調出來,搭配自家的CodeMender工具,裏面跑好幾個Flash Cyber agent協同工作、最後彙總成一份報告,在業內知名的CyberGym基準上摸到了第一梯隊水平,還比更大的模型更省token。不過這模型暫時用不上,考慮到找漏洞是把雙刃劍,Google也學Anthropic玩起了安全敘事,把它鎖得死死的,只對可信合作伙伴限量開放、走內測,目的是給一線防守方爭取時間,趕在漏洞被利用前先修掉,同時防着有人拿它去幹壞事。

看到這兒你可能會問,發了一堆Flash,真正的旗艦3.5Pro去哪了。官方口徑是正在和合作夥伴測試、準備好就上,但這套說辭背後的故事可能沒那麼體面。據彭博社等媒體報道,3.5Pro的代碼生成能力一直沒達到內部預期,Google6月下旬還專門更新了一版訓練數據來補代碼這塊短板,結果成績依舊沒起色,更有傳聞說Google乾脆推翻了原來的訓練方案、從零開始重訓。而Google AI宣傳委員Logan Kilpatrick更是索性在輿論上跳過3.5Pro,把預告重點放在Gemini4上,聲稱已經啓動了史上最雄心勃勃的Gemini4預訓練、進展讓人興奮。放在旗艦跳票的背景下看,這多少有點轉移視線、畫餅續命的味道。

光看今天發佈的Flash模型本身,網友也並不全然買賬。第三方評測機構Artificial Analysis表示,兩個新模型確實把單任務耗時砍半、token效率也提升了,Flash-Lite的智能指數漲了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步。價格沒便宜到足以忽略能力差距,能力也沒高到能解釋它的成本。X平臺上有網友吐槽,3.6Flash在Artificial Analysis上跟3.5Flash拿了一模一樣的分,還不如Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5、5.6Terra這一票對手,直呼簡直爛透了。

網友Angel則從性價比入手,指出3.6Flash的使用成本比GPT-5.6Sol medium還高、智能程度反而更低,又貴又笨的組合屬實尷尬,畢竟Flash系列立身的根本就是性價比,結果被人當場指出性價比不如對手,等於自砸招牌。作爲對比,OpenAI的Tibo剛剛也發話,由於周活躍用戶達到1000萬,Codex和ChatGPT Work的付費用戶迎來新一輪額度重置。這對比、這落差,還有人記得大明湖畔的Google Gemini3嗎。

實測派也來補刀。網友Balder直接開團,稱這三個模型性能全比之前的3.5Flash差,問題包括但不限於基礎解碼就有毛病、中文選詞經常很離譜,生成的圖片視頻質量極差、跟指令對不上還限額嚴重,經常記憶混亂、調用完全錯誤的工具。他還拋出一個陰謀論,認爲Google之所以這麼搞,是爲了把算力騰出來賣給Anthropic,陰陽了一句這就是皮查伊想要的Cloud First。X網友Conor Dart用Google自家的Antigravity跑了個AI生成遊戲測試,結果木頭紋理更差了、大理石看着差不多但還是不能用,他直言又是一次翻車,表示自己還是等Gemini3.5或者3.6Pro吧。

一邊是官方更高效、更便宜、更省token的漂亮賬本,一邊是大多數網友的當場差評,以及模型背後旗艦跳票、大牛出走、市值縮水等一連串糟心事。這很難不讓人好奇,Google這次是不是真點歪了科技樹,光顧着省成本忘了提智商,只能先靠幾個Flash穩住場子。反正Gemini4的預訓練都已經開跑了,這一把要是再翻車,那句阿爾茨海默的玩笑,可就真要成讖語了。