AI 評測機構 Artificial Analysis 於 8 月 24 日發佈博文,攜手 Liquid AI 推出面向手機端的本地 AI 性能基準,重點關注模型在蘋果 iPhone 17 Pro 上的真實表現。雙方分工明確:Artificial Analysis 負責智能水平測試,Liquid AI 負責推理性能測試,共選用函數調用、指令遵循、知識認知、高難問答與數學五類基準。
小模型也能跑出高智能
測試對象爲 4 bit 量化後體積不超過 8GB、可在端側跑起來的模型,示例包括 Gemma 4 E2B 與 LFM2-2.6B-Exp。在上下文限制 16K tokens 時,平均得分最高的是南北閣實驗室的 Nanbeige4.2-3B 與 Liquid AI 的 LFM2.5-2.6B;若把響應時間卡在 1 分鐘內,LFM2.5-8B-A1B 則登頂,其後依次爲 LFM2-2.6B-Exp、Gemma 4 E4B 與 Granite 4.1 8B。
Nanbeige4.2-3B 由 BOSS 直聘旗下實驗室推出,僅 30 億非嵌入參數卻借 Looped Transformer 架構循環複用層,在不增參數的前提下擡高有效計算深度,得分比肩對手。這套基準把"端側小模型"的智能上限擺上檯面,也說明手機本地 AI 的競賽,正從單純能跑轉向跑得快、答得準。
VIP會員