一家叫 Acrab 的初創公司,今天正式把它的第一款邊緣 AI 終端 SoC 端上了檯面——GΞLIX 1。這塊基於 5nm 製程的芯片,主打一個硬指標:能讓 1000 億參數規模的大模型,直接在本地跑起來,不必把數據送去雲端。

硬件上,GΞLIX 1 走的是異構計算架構,把 20 核 Arm CPU、3TFLOPS 的 GPU、獨立 NPU 以及音視頻處理引擎全收進一顆芯片,AI 總算力拉到 650TOPS。橫向擺一下就更清楚了:高通驍龍 X Elite 的 NPU 算力約 45TOPS,英特爾酷睿 Ultra 系列的 NPU 在 40TOPS 上下——GΞLIX 1 的 AI 算力差不多是它們的十幾倍。

爲餵飽大模型推理那張貪婪的胃口,緩存與內存子系統也專門按高吞吐需求設計。芯片配了 8MB L1 緩存,共享 L2 緩存帶寬衝到 768GB/s,外掛 256-bit 位寬的 LPDDR5X 內存,傳輸速率 8533MT/s。大模型推理時,權重讀取和 KV Cache 存取對內存帶寬格外敏感,這套配置正是 100B 模型能落到端側的地基。

這一回,Acrab 重點秀的是預填充階段的性能。預填充,就是大模型接到用戶輸入後、開始一個字一個字往外蹦之前,先把整段輸入做全量編碼的過程,它的快慢直接決定長文本輸入下的首 Token 延遲。Acrab 用矢量硬件單元給 Transformer 注意力機制計算加速,又對預填充路徑做了針對性優化。官方放出的測試裏,在 40k KV 緩存、10k Token 輸入的 Gemma 26B A4B 配置下,這塊芯片跑出了 1416.8 Token/s,是蘋果 M4 Pro Mac Mini 的 7.5 倍。

軟件側,Acrab 同步端出了完整軟件棧加智能體參考設計,從底層驅動一路覆蓋到上層應用框架。第一方終端設備 Agent Box 也一併亮相,作爲 GΞLIX 1 的參考實現,供開發者評估和做原型驗證。