相关推荐
Claude Sonnet5.5发布:编程能力反超旗舰,API价格腰斩
9月29日,Anthropic发布中端定位新模型Claude Sonnet5.5,却在多项基准测试中逼近甚至超越旗舰Opus5.5,引发关注。其最大亮点是编程能力显著提升,在代码生成与理解测试中反超更昂贵的Opus5.5,成为Anthropic当前代码能力最强的模型。同时,该模型在知识问答、跨领域推理等方面也有相关表现。
2026年9月29号 9:33
223.0k
Gemini 3.8 Flash发布 六周三连更但干活不灵光
谷歌六周内密集推出三款Flash模型,最新Gemini 3.8 Flash被寄予厚望,主攻长周期软件工程、自主Agent和复杂企业工作流,填补Pro系列空缺。官方基准测试表现亮眼,尤其在DeepSWE v1.1等长周期软件工程测试中成绩突出。
2026年9月3号 9:04
266.1k
腾讯混元大模型王炸升级:770B旗舰新版Hy4preview震撼开源,直奔开源第一梯队
腾讯混元发布旗舰模型预览版Hy4preview,总参数770B、激活参数49B,上下文长度支持1M。该模型在代码、办公、科学等真实生产力任务中表现卓越,居开源模型第一梯队,内部盲测综合表现优于同类竞品,并已在腾讯内部多领域应用。
2026年8月28号 15:19
327.8k
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash
蚂蚁百灵发布新模型Ling-3.0-Flash,总参数量124B、激活仅5.1B,在基础推理、指令遵循及长文本处理上对标甚至超越2-3倍参数的领先模型,实现更高智效比与性价比。已上线OpenRouter,免费一周后正式开源。
2026年7月27号 15:23
296.0k
华盛顿州立大学研究:ChatGPT 在复杂科学判断中表现出严重的“自相矛盾”
华盛顿州立大学研究发现,ChatGPT在处理复杂科学论断时准确率有限,表现接近随机猜测,且常给出前后矛盾的回答。研究团队测试了719条研究假设,模型表面正确率约80%,但实际可靠性不足。
2026年3月19号 14:52
222.0k
VIP会员