黃學東在 GAIR 2023 大會上指出,大模型時代需要注重模型的集成與融通能力,以應對百花齊放的局面。他強調人們常常高估技術的短期效力,低估其長期影響。未來的發展趨勢是以大模型爲中心,實現多模態的聯合發展。
相關推薦
騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間
騰訊混元新研究聚焦在線大模型強化學習的批大小設置:當模型自生成訓練數據、rollout生成與訓練縮放節奏不一致時,經典臨界批大小理論需在新場景重推。研究覆蓋GRPO與PPO等主流算法並給出務實結論,爲大規模GPU集羣下提升訓練效率提供參考。
Sep 24, 2026
242.5k
阿里試水QwenBook AI設備,團隊規模約150人
阿里雲無影團隊正研發AI設備QwenBook,定位原生智能體電腦,形態接近“千問平板”,尚處早期試水,主打辦公場景,接入Qwen3.8-Max和Flash模型。產品定義與硬件自研,融合無影雲電腦系統及端雲能力,團隊約150人。
Sep 22, 2026
219.2k
上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手
上海AI實驗室與上海交大LUMIA Lab提出新預訓練任務“下一個概念預測”(NCP),推出全球首個8.9B離散隱空間基座模型NCP-ArchPreview。該模型僅用51.3%的Token預算,就在5.73T語料上追平OLMo-3-7B最終預訓練Loss,顯著提升訓練效率。
Sep 22, 2026
166.7k
雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.1 Pro 領銜
中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。
Sep 20, 2026
266.9k
智譜發佈 GLM-5.3-FlashX:速度飆至200tokens/s,國產算力再提速
智譜AI推出GLM-5.3-FlashX,API同步上線,最高輸出200tokens/s,主打智能、價格、速度,面向企業開發者提供高吞吐低延遲推理。前身GLM-5.3-Flash曾以Ox Alpha匿名在海外亮相,憑同尺寸最強智能與高性價比積累口碑,調用量持續攀升,智譜正支撐增長需求。
Sep 18, 2026
373.9k
VIP會員