相关推荐
字节开源全新代码大模型评估基准“FullStack Bench”
12月5日,字节豆包大模型团队推出了最新的代码大模型评估基准——FullStack Bench,涵盖了超11类真实场景,支持16种编程语言,并包含3374个问题。这一基准相比之前的评估标准,在更广泛的编程领域中能更准确地评估大模型的代码开发能力,推动了模型在现实世界编程任务中的优化。目前的主流代码评估基准,如HumanEval和MBPP,通常集中在基础和高级编程问题,而DS-1000则专注于数据分析和机器学习任务,且仅支持Python。xCodeEval则侧重于高级编程和数学领域,存在较大的应用场景和语言覆盖限
DeepSeek 发布开源代码大模型 DeepSeek Coder
["DeepSeek(深度求索)发布了开源代码大模型 DeepSeek Coder","DeepSeek Coder 是一个智能代码助手,可以生成各种代码","DeepSeek Coder 已经在 Hugging Face 和 GitHub 上开源","DeepSeek Coder 在国际权威数据集的测试中表现出色","DeepSeek 致力于探索 AGI 的本质,将推出更多研究成果"]
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
云服务巨头军备竞赛白热化。微软云年营收首破千亿美元,增速43%;但谷歌云以82%增速反超。谷歌凭借自研模型与芯片的完整生态,将运营利润率从20.7%大幅推高,凸显技术路径决定商业回报的差异。
微信公众号推出 AI"一键排版":自动分段、生成小标题、匹配配图三步到位
微信公众号平台推出AI“一键排版”功能,支持手机App与网页端。编辑时系统自动识别文章结构并弹出图标,一键即可优化段落间距、生成小标题样式并智能配图,让版面疏密有致,解决分段、标题、配图三大高频痛点,显著提升排版效率。
DeepSeek V4 正式版疑定档 8 月 3 日:硅基流动涨价露马脚,API 已能答对新题
DeepSeek V4正式版自7月中旬灰度测试后一度跳票,官方至今未公布发布时间。但硅基流动平台通知自8月3日起,将DeepSeek V4 Pro的缓存命中价格从每百万Token 0.1元大幅上调至1.0元。这一突兀涨价被外界视为DeepSeek V4正式版即将上线的重要信号,8月3日或成为发布节点。
