Colossal-AI 團隊通過低成本構建了中文版的 LLaMA-2 大模型,在多個評測榜單中取得了優異的成績。他們開源了完整的訓練流程、代碼及權重,並提供了評估體系框架 ColossalEval。這一方案可用於構建任意垂類領域的大模型,爲 AI 應用帶來了更多的可能性。
相關推薦
騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間
騰訊混元新研究聚焦在線大模型強化學習的批大小設置:當模型自生成訓練數據、rollout生成與訓練縮放節奏不一致時,經典臨界批大小理論需在新場景重推。研究覆蓋GRPO與PPO等主流算法並給出務實結論,爲大規模GPU集羣下提升訓練效率提供參考。
Sep 24, 2026
224.8k
阿里試水QwenBook AI設備,團隊規模約150人
阿里雲無影團隊正研發AI設備QwenBook,定位原生智能體電腦,形態接近“千問平板”,尚處早期試水,主打辦公場景,接入Qwen3.8-Max和Flash模型。產品定義與硬件自研,融合無影雲電腦系統及端雲能力,團隊約150人。
Sep 22, 2026
219.2k
上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手
上海AI實驗室與上海交大LUMIA Lab提出新預訓練任務“下一個概念預測”(NCP),推出全球首個8.9B離散隱空間基座模型NCP-ArchPreview。該模型僅用51.3%的Token預算,就在5.73T語料上追平OLMo-3-7B最終預訓練Loss,顯著提升訓練效率。
Sep 22, 2026
181.6k
雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.1 Pro 領銜
中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。
Sep 20, 2026
251.1k
MiniMax 開源 Code CLI:命令行編程工具亮出 76.7% 通過率,把企業級 harness 攤在陽光下
MiniMax 正式開源命令行 AI 編程工具 MiniMax Code CLI v0.4.12,源碼已上架 GitHub,作爲客戶端核心組件,底層實現向開發者開放。該工具在 FrontierHarness Eval 評測中任務通過率達76.7%,成功任務耗時中位數4分33秒,兩項均優於公開基線,兼具準確性與效率。
Sep 20, 2026
245.3k
VIP會員