中國信通院人工智能研究所近日公佈的檢驗報告顯示,上海原點星輝科學技術有限公司(StartLux)研發的本地大模型 StartLux-V1.0-27B-Preview 在可信AI大模型基準測試(MCP專項測試)中表現亮眼。該模型以27B 的參數量取得了綜合性能排名第二的成績,超越了第三名的 DeepSeek-V4-Flash,其能力範圍正式跨入 DeepSeek-V4-Pro 所代表的萬億參數模型能力區間。
此次 MCP專項測試共涵蓋位置導航、網頁搜索、瀏覽器自動化、金融分析、代碼倉庫管理、3D設計等6類專項任務及綜合評估,重點考察大模型在多工具協同、複雜任務執行及真實環境交互等維度的綜合表現。測試結果顯示,StartLux-V1.0-27B-Preview 綜合得分爲39.25,不僅超越了284B 的 DeepSeek-V4-Flash-0731和198B 的 Step-3.7-Flash,在同等參數規模下也比 Qwen-3.6-27B 高出5.34個百分點。在單項任務中,該模型在位置導航上斬獲第一,在瀏覽器自動化與金融分析等任務中則與1.6T 參數的 DeepSeek-V4-Pro 並列第一或獨佔鰲頭。

這一突破源於技術路徑的創新。StartLux 以 Qwen3.6-27B 爲基座進行後訓練定向增強,團隊自主設計了全新、多維度、可驗證、可規模化的模型優化升級技術。在訓練過程中,團隊採用 AI 訓練 AI(Auto Research)方法自主開展訓練實驗,並通過反饋持續持續優化策略,使其成爲國內首個採用該方法進行後訓練的本地 Agent 模型。

這一進展折射出行業的深刻轉向:當基礎模型能力跨過實用門檻,過去兩年以參數規模爲核心的軍備競賽已進入同質化階段。相比跑分,企業和用戶更關注實際問題解決能力、數據安全與可控成本,而這些需求正加速推動本地大模型走向前臺。當前,Google、Meta、英偉達等全球科技巨頭均在加速佈局30B 級別的本地模型,行業普遍預測本地大模型將在未來幾年內佔據重要市場份額。
目前,StartLux-V1.0-27B-Preview 已經能夠在消費級個人電腦上運行。據悉,該公司計劃於年內推出第一代本地智能解決方案,同時團隊也在穩步推進後續訓練,並對擴散式語言模型等新架構展開深入研究與優化。
VIP會員