AI大模型真的引领了国内的“资本盛宴”吗?是,也不是

来源:

来源:
AMD 发布重要人事调整,公司总裁 Victor Peng 宣布将于下个月退休,留任顾问职位以协助过渡。Peng 自 2022 年加入 AMD,领导 AI 战略,尤其对强化嵌入式业务和推进跨公司 AI 方案贡献显著,使 AMD 成为领先的 FPGA 和自适应计算解决方案供应商。AMD ERP Vamsi Boppana 接管 Instinct 数据中心加速器芯片业务。同时,AMD 加速推进其 Instinct 处理器产品线,以响应与 Nvidia 在数据中心 AI 芯片市场的竞争,计划推出 MI300 和 MI325 处理器,增强市场竞争力。
本文探讨近期《自然·机器智能》杂志上发表的一篇论文,介绍了一种令人瞩目的新方法——视觉预测编码(visual predictive coding)。此技术向我们展示了如何让人工智能构建认知地图,模仿人类大脑中的神经结构来处理视觉信息及理解周围环境。研究的核心思想则通过对未来的感官输入进行预测,帮助机器从过往经验中学习并构建环境地图。通过构建神经网络模型模拟人类大脑中的预测过程,论文展现出机器能够自动从单张图片中构建出高精度的认知地图。团队进一步在模拟环境中对这一方法进行了验证,结果显示机器人不仅能够精确构建环境地图且支持有效导航。 此项研究标志着人工智能领域的一次重大进展,预示未来AI可能具备更高度的智能理解与感知力,适应更多人类生活和工作的场景,为自动驾驶、家庭助手、医疗诊断、教育辅导等领域带来革命性变化。借助视觉预测编码技术,人工智能正逐渐接近人类的认知水平,为这一领域带来无限可能性与潜力。
近期,有着4050亿参数的开源大型语言模型LLama3.1因在Reddit上泄露,引发了广泛关注,被视为目前最接近GPT-4o的开源产品,甚至在某些性能上超越了GPT-4o。模型由Meta(原Facebook)推出,包括基础与70B版本的基准测试结果,在多项性能测试上均超出GPT-4o。LLama3.1在多语言支持能力与广泛训练数据集(逾15T tokens、直至2023年底)的基础上提供出色的多语言对话性能。研究团队注重模型安全,通过多方位数据收集策略,结合人工与合成数据,引入边界和对抗性提示以优化数据质量。此开源模型的泄露,不仅展示了强大性能,也成为表明开源社区对大型AI模型发展的积极贡献。
Luma AI, 一家位于旧金山的人工智能公司, 正式推出了其名为 “Loops” 的 Dream Machine 平台新功能。这一功能使用户能够通过文本描述、图片或关键帧一键制作无缝、连续的视频循环, 简化了视频创作过程,极大地提高了效率。特别是对于内容创作者和数字营销人员而言,此功能使得无限循环视频成为可能,大幅减少了制作时间和成本。Luma AI 在其官方推特上展示了该功能的众多创意应用案例,如宇宙飞船穿越超空间的画面、水豚在公园骑自行车的场景,展示了创作出完美循环视频的潜力。 值得注意的是,“Loops” 功能解决了 AI 生成视频时常见的不连贯性问题,以平滑流畅的效果吸引观众,降低制作门槛。Luma AI 对 AI 开发秉持负责任态度,已计划引入水印和归属系统,保证内容透明度。未来,Luma AI 计划推出 API 和插件,旨在与流行创意软件集成,进一步拓展影响力。总之,作为新功能,Luma AI 的“Loops”正以高度创新和实用性改变视频创作领域,同时关注技术与伦理的平衡。
Stability AI近推出开源音频生成模型Stable Audio Open,能生成最长47秒,采样率44.1kHz,采用开放权重设计,允许用户查阅、修改和扩展,推动科研及开发者创新。使用Creative Commons许可音频训练确保数据合法和道德性。模型技术架构先进,支持高质量立体声生成,多样性和高保真度得到验证,与顶尖模型表现相当。这一工具对研究者、艺术家和开发者极具价值,标志着音频生成领域的重要进展。