淘天集团联合爱橙科技开源了大模型训练框架 Megatron-LLaMA,旨在提升大语言模型的训练性能,降低训练成本,并与 LLaMA 社区保持兼容性。框架在 32 卡训练上能够取得 176% 的加速,对网络不稳定也表现出高容忍度。Megatron-LLaMA 将关注自适应最优配置选择、模型结构改动的支持以及在不同硬件环境下的极致性能训练解决方案。
相关推荐
DeepSeek 长文本为何突然“抽风”?字节 Seed 团队揭开 AI 性能波动谜团
字节跳动Seed团队在最新论文中揭示,大语言模型处理超长文本时性能波动,主要源于分块KV缓存压缩技术的“相位敏感性”。为降低长上下文推理内存消耗,该技术通过固定步幅将连续标记窗口压缩为更少条目,却引入Token相对于压缩窗口的新位置坐标,造成检索偏差,进而引发性能波动。
2026年10月9号 9:08
206.0k
哈佛心理学家平克:别渲染 AI 末日,真正该做的是安全工程
哈佛大学心理学家史蒂文·平克公开表示,“AI会毁灭人类”的生存性风险被夸大。他在 Quillette 致精神科医生兼科技博主斯科特·亚历山大的公开信中阐述理由。亚历山大此前邀其公开辩论AI生存风险,平克婉拒,称这类辩论只是“供人围观的竞技活动”。他尤其不认同“回形针最大化器”等极端推演。
2026年9月29号 9:33
306.3k
Glassdoor报告:美国员工AI好评率跌至43%,生成式AI引发职场不满情绪
Glassdoor数据显示,美国员工对企业引入AI的满意度大幅下滑。2019年至2026年中,涉及AI、大语言模型等关键词的评论占比增长超240%,但积极评价从81%骤降至43%,负面评价升至53%,反映职场对AI落地态度已转向消极。
2026年8月31号 9:23
242.5k
量子技术与AI迎来深度融合!国内首个“玄幂”量子增强大模型正式发布
国光量超人工智能团队将前沿量子技术引入大语言模型决策与推理核心,推出面向科研学术领域的“玄幂”大模型家族。该模型在科研科普、任务路由、智能体决策等垂直任务中展现独特竞争优势,助力大语言模型突破纯经典计算物理边界。
2026年8月28号 10:16
300.8k
苹果王炸芯片登场!M6首秀2纳米,M5 Ultra四Die架构狂飙AI极限
苹果发布新款Mac Studio与Mac mini,搭载M6和M5 Ultra芯片,桌面端本地AI算力大幅提升。M6为首款2纳米自研芯片,配备12核CPU、12核GPU,并首次采用双16核神经引擎,强化大语言模型等本地人工智能处理能力。
2026年8月26号 11:48
245.4k
VIP会员