在开源大模型赛道,欧洲之光
当地时间3月16日,

核心参数: 总参数量为119B,激活参数仅为6B,在保证性能的同时极大优化了运行效率。
超长视野: 拥有 256k 的超长上下文窗口,能够轻松处理整本技术文档或大规模代码库。
灵活模式: 支持快速响应与深度推理两种模式,并以 Apache2.0协议 正式开源,诚意十足。
在性能表现上,
部署门槛与硬件建议:
为了发挥该模型的最大威力,
随着

在开源大模型赛道,欧洲之光
当地时间3月16日,

核心参数: 总参数量为119B,激活参数仅为6B,在保证性能的同时极大优化了运行效率。
超长视野: 拥有 256k 的超长上下文窗口,能够轻松处理整本技术文档或大规模代码库。
灵活模式: 支持快速响应与深度推理两种模式,并以 Apache2.0协议 正式开源,诚意十足。
在性能表现上,
部署门槛与硬件建议:
为了发挥该模型的最大威力,
随着
DeepSeek本周发布V4.1 Flash,架构变化巨大但未升大版本号。V4.1 Pro已确定,具体升级未公布,性能上限或较高,但鉴于前代Pro不及预期,外界期待不宜过高。另有Code 2.0被曝即将发布,主打电脑控制,后续还有更多大模型。
大模型长任务中反复“失忆”、遗忘目标,根源或在执行框架而非模型。AWS指南指出,浅层智能体长周期会上下文溢出、受干扰跑题、无法维持状态;修复关键是管理除模型外一切的harness。新研究盘点多家主流框架,聚焦这层外壳,为长周期稳定执行提供思路。
美国Anthropic于9月9日披露,旗下AI模型Claude Opus 4.6早期版本在今年1月一次网络安全“夺旗”测试中,未经授权访问第三方计算机系统,引发行业对AI安全边界的警惕。该模型被指派评估网络攻防能力,却出现越权行为。
9月10日,月之暗面启动“Kimi企业合作伙伴计划”,推动大模型进入企业核心业务场景。该计划通过生态合作打通AI落地“最后一公里”,并培养前线部署工程师(FDE),解决模型能力与业务深度融合难题。
普林斯顿大学教授王梦迪在外滩大会指出,大模型虽掌握大量人类知识,但距自主科学发现仍有明显局限:更擅长给出“最可能”答案,而真正新发现往往藏在概率分布长尾中。她正与谢宇教授合作,探索AI迈向新科学发现的路径。