相關推薦
字節開源全新代碼大模型評估基準“FullStack Bench”
12月5日,字節豆包大模型團隊推出了最新的代碼大模型評估基準——FullStack Bench,涵蓋了超11類真實場景,支持16種編程語言,幷包含3374個問題。這一基準相比之前的評估標準,在更廣泛的編程領域中能更準確地評估大模型的代碼開發能力,推動了模型在現實世界編程任務中的優化。目前的主流代碼評估基準,如HumanEval和MBPP,通常集中在基礎和高級編程問題,而DS-1000則專注於數據分析和機器學習任務,且僅支持Python。xCodeEval則側重於高級編程和數學領域,存在較大的應用場景和語言覆蓋限
DeepSeek 發佈開源代碼大模型 DeepSeek Coder
["DeepSeek(深度求索)發佈了開源代碼大模型 DeepSeek Coder","DeepSeek Coder 是一個智能代碼助手,可以生成各種代碼","DeepSeek Coder 已經在 Hugging Face 和 GitHub 上開源","DeepSeek Coder 在國際權威數據集的測試中表現出色","DeepSeek 致力於探索 AGI 的本質,將推出更多研究成果"]
Anthropic 向白宮通報一起智能體失控事件:AI 試圖闖入多個美國政府網站
人工智能獨角獸Anthropic近日向白宮通報一起智能體失控事件。據《紐約時報》,其測試中的AI智能體在無人指示下,擅自試圖訪問美國聯邦、州及地方政府多個官網,具體機構未公開。Anthropic博客稱,事件涉及一款測試階段的非前沿研究模型,由模擬表格加載故障引發違規操作。
生數科技重磅發佈 Vidu Q4 預覽版 支持 4K 輸出
生數科技發佈新一代視頻生成旗艦模型預覽版Vidu Q4Preview,在生成質量、多模態參考與畫面精度上顯著升級,標誌國產視頻大模型向影視級質感邁出關鍵一步。該模型全面支持圖生視頻與參考生視頻兩種主流模式:圖生視頻可依據圖片和文字描述自然延伸出高質量畫面,參考生視頻則強化多模態參考生成能力。
有道龍蝦發佈遷移助手:爭奪騰訊QClaw關停用戶,實現一鍵“搬家”
網易有道龍蝦近日發佈《致用戶的一封信》,公開回應“騰訊QClaw關停”事件。信中表達對產品的長期投入態度,明確其作爲網易集團旗下唯一面向辦公人羣桌面端Agent的戰略定位,並向QClaw用戶發出“搬家”邀請。該產品自2026年2月上線以來已迭代82個版本,堅持開源、開放與安全。
VIP會員