相关推荐
腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO生成吞吐最高拉到2.29倍、GRPO省下29%训练时间
腾讯混元新研究聚焦在线大模型强化学习的批大小设置:当模型自生成训练数据、rollout生成与训练缩放节奏不一致时,经典临界批大小理论需在新场景重推。研究覆盖GRPO与PPO等主流算法并给出务实结论,为大规模GPU集群下提升训练效率提供参考。
2026年9月24号 13:57
226.6k
阿里试水QwenBook AI设备,团队规模约150人
阿里云无影团队正研发AI设备QwenBook,定位原生智能体电脑,形态接近“千问平板”,尚处早期试水,主打办公场景,接入Qwen3.8-Max和Flash模型。产品定义与硬件自研,融合无影云电脑系统及端云能力,团队约150人。
2026年9月22号 16:01
216.4k
上海AI Lab与上交大抛出NCP预训练新范式,8.9B隐空间模型用一半Token追平对手
上海AI实验室与上海交大LUMIA Lab提出新预训练任务“下一个概念预测”(NCP),推出全球首个8.9B离散隐空间基座模型NCP-ArchPreview。该模型仅用51.3%的Token预算,就在5.73T语料上追平OLMo-3-7B最终预训练Loss,显著提升训练效率。
2026年9月22号 10:39
179.8k
双节前后 10 多款大模型蓄势待发:GPT-6 全系、Opus 5.2、V4.1 Pro 领衔
中秋国庆双节前后,国内外至少十余款大模型将密集发布。国外方面,OpenAI月底开发者大会前,重磅产品延期至下周,将补齐GPT-6全系:Sol、Terra、Luna,与已发布的Astra形成完整矩阵;Anthropic则被指跳过5.1版本。美国厂商虽无节前发布习惯,但此次节点巧合,或掀新一轮AI竞赛。
2026年9月20号 16:07
263.2k
智谱发布 GLM-5.3-FlashX:速度飙至200tokens/s,国产算力再提速
智谱AI推出GLM-5.3-FlashX,API同步上线,最高输出200tokens/s,主打智能、价格、速度,面向企业开发者提供高吞吐低延迟推理。前身GLM-5.3-Flash曾以Ox Alpha匿名在海外亮相,凭同尺寸最强智能与高性价比积累口碑,调用量持续攀升,智谱正支撑增长需求。
2026年9月18号 14:00
388.8k
VIP会员