相關推薦
字節開源全新代碼大模型評估基準“FullStack Bench”
12月5日,字節豆包大模型團隊推出了最新的代碼大模型評估基準——FullStack Bench,涵蓋了超11類真實場景,支持16種編程語言,幷包含3374個問題。這一基準相比之前的評估標準,在更廣泛的編程領域中能更準確地評估大模型的代碼開發能力,推動了模型在現實世界編程任務中的優化。目前的主流代碼評估基準,如HumanEval和MBPP,通常集中在基礎和高級編程問題,而DS-1000則專注於數據分析和機器學習任務,且僅支持Python。xCodeEval則側重於高級編程和數學領域,存在較大的應用場景和語言覆蓋限
DeepSeek 發佈開源代碼大模型 DeepSeek Coder
["DeepSeek(深度求索)發佈了開源代碼大模型 DeepSeek Coder","DeepSeek Coder 是一個智能代碼助手,可以生成各種代碼","DeepSeek Coder 已經在 Hugging Face 和 GitHub 上開源","DeepSeek Coder 在國際權威數據集的測試中表現出色","DeepSeek 致力於探索 AGI 的本質,將推出更多研究成果"]
100 億次下載破紀錄:工信部亮出開源半年報,OpenHarmony設備已超13. 5 億臺
國新辦發佈會上,工信部公佈2026年上半年數據,首次全面量化中國開源生態發展。基礎軟件、工業軟件與開源建設協同推進,爲外界提供明確評估依據。
首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放
阿里通義千問發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,實現從“能說話”到“會表達”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。雙版本中Flash版主打低延遲實時交互(首包約300ms),Plus版專攻高質量自然度與音色還原。
一行GitHub代碼出賣了AMD:Anthropic被曝成其新客戶,算力去英偉達化加速
一行GitHub公開代碼意外暴露Anthropic芯片佈局。AMD AI業務高管提交的代碼中,留下Anthropic將作爲其客戶的痕跡。行業分析機構SemiAnalysis指出,這雖非官方披露,卻釋放出明確信號:Anthropic正主動拓寬算力供應鏈,不再依賴單一芯片供應商。
