在追求大模型“高智商”的同時,AI 的持續執行能力正成爲衡量其進化水平的新維度。根據人工智能研究機構

測試結果顯示,
AIbase 注意到,雖然測試數據中出現了模型理論上可連續工作超過20小時的數值,但
然而,也有專家對該測試的侷限性提出了質疑。目前 METR 僅涵蓋了14個樣本,且有觀點認爲這種基準測試可能被模型針對性地“刷分”。但不可否認的是,

在追求大模型“高智商”的同時,AI 的持續執行能力正成爲衡量其進化水平的新維度。根據人工智能研究機構

測試結果顯示,
AIbase 注意到,雖然測試數據中出現了模型理論上可連續工作超過20小時的數值,但
然而,也有專家對該測試的侷限性提出了質疑。目前 METR 僅涵蓋了14個樣本,且有觀點認爲這種基準測試可能被模型針對性地“刷分”。但不可否認的是,
Artificial Analysis聯合Liquid AI發佈手機端本地AI性能基準,聚焦iPhone 17 Pro真實表現。前者測智能水平,後者測推理性能,涵蓋函數調用、指令遵循、知識認知、高難問答與數學五類。測試對象爲4bit量化、體積不超8GB的端側模型,旨在驗證小模型也能實現高智能。
DeepSeek正推進第二輪融資。2026年前7個月營收約4.75億元,是2025全年十倍,淨虧損由9.35億收窄至7.15億。開源模型帶來高毛利,業務增速顯著,爲潛在IPO鋪路。6月完成首輪500億元融資後,隨即啓動第二輪,計劃募資500億元。
Stability AI完成7600萬美元B輪融資,將用於創意產品開發、應用研究及專業服務。投資方包括EA、索尼音樂、環球音樂、華納音樂和AMD風投。CEO稱此舉印證生成式AI賦能製片人、音樂人與講述者的願景。
機器人初創公司Generalist完成由8VC領投的近2億美元新增融資,估值升至30億美元。本輪是今年6月Radical Ventures領投、估值20億美元的4億美元B輪延續,使B輪總額達6億美元。公司由前DeepMind研究員Pete Florence、Andy Zeng及前波士頓動力工程師Andrew Barry於2024年創立。
中科天塔自研航天大模型“華山”健康管理模塊隨“辰光一號”衛星入軌後,完成星上AI全流程在軌實戰驗證。該模塊專注商業航天智能化管理,賦予衛星遙測數據解析、異常檢測、趨勢預測與自主決策能力,標誌衛星在軌運維模式迎來技術變革。