隨着ChatGPT熱潮,國內外大模型評測榜單陸續推出,但參數規模相近的大模型在不同榜單中的排名差異巨大。產業界和學界分析認爲,這主要與評測集的不同有關,還與主觀題比例上升導致評測公正性受質疑相關。因此,第三方評測機構如OpenCompass和FlagEval開始受關注。但業內認爲,要做出真正全面有效的大模型評測,還需要考量模型魯棒性、安全性等其他維度,目前仍在探索中。
相關推薦
字節要衝 5 萬億參數:豆包的智商有望拉滿,代價是百萬顯卡級別算力
國產大模型參數規模持續攀升,Qwen3.8Max、Kimi K3已分別達2.4萬億和2.8萬億。字節跳動計劃訓練超5萬億參數模型,有望成爲國內最大,但項目尚處早期,未必發佈。5萬億參數被視爲GPT-5.6或Opus5級別,標誌着能力進一步躍升。
Aug 7, 2026
393.4k
模型變小,能力不減:新浪VibeThinker-3B 開源,AI 推理迎來“輕量化”新思路
新浪開源VibeThinker-3B模型僅30億參數,在數學、編程等基準測試中性能媲美百倍規模大模型,部分競賽級任務超越頂尖產品。其成功源於基於阿里Qwen2的獨特訓練策略,挑戰了參數量“越大越好”的觀念。
Jun 29, 2026
251.1k
爆火的DeepSeek-V4 背後:北大開源框架One-Eval如何終結AI測評“噩夢”?
DeepSeek-V4發佈僅10小時,北京大學DCAI團隊便通過最新開源的One-Eval評測框架,快速生成全量自動化評測報告。傳統大模型評測流程繁瑣,需耗費大量精力在搭建測試管道上,而One-Eval顯著提升了效率,標誌着行業進入新階段。
Apr 28, 2026
209.8k
只需2%參數就能“幹翻”GPT-4o?阿里通義千問Qwen 3. 5 小模型殺瘋了!
阿里通義千問Qwen 3.5系列小模型打破“參數量決定智商”的常規認知。其中僅40億參數的Qwen 3.5-4B在第三方測試中,與參數量過千億的GPT-4o同臺競技,表現不落下風甚至略勝一籌。這標誌着國產大模型在本地部署和效率優化上取得重要突破,開啓“以小博大”的新時代。
Mar 9, 2026
253.0k
“百模大戰”家家第一,大模型“跑分”作弊何時休?
["📊 <b>大模型的評測體系</b>:當前的大模型評測體系存在開源數據集可刷題、封閉評測數據集引發公平性問題以及評測指標不夠科學全面等問題。","💡 <b>大模型的應用趨勢</b>:文章提到大模型已經從模型端發展到應用端創新。","🔎 <b>大模型的商業化問題</b>:對大模型團隊來說,是否能實現商業化遠比排名和參數更重要。"]
Nov 29, 2023
189.1k
