相關推薦
Claude Sonnet5.5發佈:編程能力反超旗艦,API價格腰斬
9月29日,Anthropic發佈中端定位新模型Claude Sonnet5.5,卻在多項基準測試中逼近甚至超越旗艦Opus5.5,引發關注。其最大亮點是編程能力顯著提升,在代碼生成與理解測試中反超更昂貴的Opus5.5,成爲Anthropic當前代碼能力最強的模型。同時,該模型在知識問答、跨領域推理等方面也有相關表現。
Sep 29, 2026
216.5k
Gemini 3.8 Flash發佈 六週三連更但幹活不靈光
谷歌六週內密集推出三款Flash模型,最新Gemini 3.8 Flash被寄予厚望,主攻長週期軟件工程、自主Agent和複雜企業工作流,填補Pro系列空缺。官方基準測試表現亮眼,尤其在DeepSWE v1.1等長週期軟件工程測試中成績突出。
Sep 3, 2026
266.1k
騰訊混元大模型王炸升級:770B旗艦新版Hy4preview震撼開源,直奔開源第一梯隊
騰訊混元發佈旗艦模型預覽版Hy4preview,總參數770B、激活參數49B,上下文長度支持1M。該模型在代碼、辦公、科學等真實生產力任務中表現卓越,居開源模型第一梯隊,內部盲測綜合表現優於同類競品,並已在騰訊內部多領域應用。
Aug 28, 2026
327.8k
螞蟻百靈發佈新一代原生混合推理模型Ling-3.0-Flash
螞蟻百靈發佈新模型Ling-3.0-Flash,總參數量124B、激活僅5.1B,在基礎推理、指令遵循及長文本處理上對標甚至超越2-3倍參數的領先模型,實現更高智效比與性價比。已上線OpenRouter,免費一週後正式開源。
Jul 27, 2026
296.0k
華盛頓州立大學研究:ChatGPT 在複雜科學判斷中表現出嚴重的“自相矛盾”
華盛頓州立大學研究發現,ChatGPT在處理複雜科學論斷時準確率有限,表現接近隨機猜測,且常給出前後矛盾的回答。研究團隊測試了719條研究假設,模型表面正確率約80%,但實際可靠性不足。
Mar 19, 2026
221.1k
VIP會員