歡迎來到【AI日報】欄目!這裏是你每天探索人工智能世界的指南,每天我們爲你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。

新鮮AI產品點擊瞭解https://app.aibase.com/zh

1、黑森林實驗室放出 Flux3:首個原生生成音頻的多模態基礎模型,20 秒音畫同步一次成型

黑森林實驗室發佈的Flux3多模態基礎模型,首次實現了原生音頻生成,並在音視頻同步、圖像生成和動作控制方面表現出色,展現了其在人工智能領域的領先地位。

image.png

【AiBase提要:】

🧠 Flux3是首個支持原生音頻生成的多模態基礎模型,能夠一次生成20秒的音視頻同步片段。

📊 在早期測試中,Flux3在多個基準測試中表現優於其他頂尖模型,如Luma Ray3.2和Runway Gen-4.5。

🤖 Flux3還與Mimic Robotics合作開發了面向機器人領域的動作模型Flux-mimic,已在奧迪工廠進行生產任務測試。

2、Claude Opus現已支持語音模式:從隨口問答升級成能調工具、換語言的實時參謀

Claude 語音模式的升級顯著提升了其處理複雜問題的能力,同時增加了對多種模型和工具的支持,使用戶能夠更高效地利用語音交互完成任務。

image.png

【AiBase提要:】

🧠 Claude 語音模式升級,支持 Opus、Sonnet 和 Haiku 模型,提升複雜問題處理能力。

🛠️ 支持連接 Gmail、Slack 等工具,實現語音指令執行任務,如修改日程、生成文檔等。

🌐 擴展多語言支持,允許用戶在對話中切換語言,但需手動設置。

3、快手入局AI互動內容賽道,開放首批創作者招募

快手正式宣佈推出‘AI互動內容’創作功能,標誌着短視頻平臺競爭從傳統內容時長延伸至交互式體驗領域。該功能依託大模型,允許用戶通過文字輸入、選項選擇主動參與內容走向,打破傳統短視頻單向傳播模式。業內分析認爲,這是快手在短視頻存量競爭下的關鍵落子,旨在提升用戶留存和推薦算法反哺。

【AiBase提要:】

🤖 快手推出AI互動內容創作功能,開放首批合作創作者招募。

🕹️ AI互動內容依託大模型打造,用戶可主動參與內容走向,打破傳統短視頻單向傳播模式。

📈 業內分析認爲,快手此舉是在短視頻存量競爭下的關鍵落子,旨在提升用戶留存和推薦算法反哺。

4、小鵬人形機器人廣州工廠開啓小批量試生產 預計2026年實現量產

小鵬人形機器人廣州工廠正式開啓小批量試生產,標誌着其量產衝刺進入倒計時。公司計劃在2026年實現量產,並逐步應用於全球門店及商業場景,通過整合集團核心能力加速商業化落地。

【AiBase提要:】

🚀 小鵬人形機器人在廣州工廠開啓小批量試生產,量產產線進入最後聯調階段。

💼 小鵬集團董事長何小鵬親自兼任機器人業務CEO,推動商業化落地進程。

🌐 小鵬計劃在2026年實現人形機器人量產,並逐步進駐全球門店及商業場景。

5、騰訊混元合二爲一:多模態與大語言模型部門合併,姚順雨統管衝全模態上限

騰訊宣佈將混元多模態模型部門與大語言模型部門合併,設立基礎模型部,由姚順雨統一管理。此舉旨在提升模型研發與協同效率,探索全模態模型的智能上限。

【AiBase提要:】

🧠 騰訊將混元多模態模型部門與大語言模型部門合併,設立基礎模型部,由姚順雨統一管理。

🚀 合併旨在提升模型研發與協同效率,探索全模態模型的智能上限。

📊 姚順雨此前已兼任大語言模型部負責人,此次合併標誌着騰訊在混元技術路線上的進一步整合。

6、微軟自研雙模型MAI-Image-2.5-Pro與MAI-Voice-2-Flash發佈:不蒸餾第三方,已落地Bing和PowerPoint

微軟推出自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,分別面向高質量圖像生成和高併發語音交互場景,強調訓練數據可追蹤且不依賴第三方模型蒸餾。兩款模型已在多個產品中落地,並顯著提升了效率和成本效益。

image.png

【AiBase提要:】

🧠 MAI-Image-2.5-Pro是微軟自研的高精度圖像生成模型,支持自然語言編輯指令,已在Bing Image Creator和PowerPoint中應用。

🔊 MAI-Voice-2-Flash是優化的語音模型,速度提升2倍,成本降低32%,已應用於T-Mobile等客戶。

📊 MAI-Transcribe-1.5已用於醫療解決方案,處理2800萬次患者問診記錄,支持58種語言,錯誤率下降50%。

7、騰訊甩出 WorkBuddy Bench:一套把代碼、網頁、辦公、安全全裝進來的編碼智能體考場

騰訊推出 WorkBuddy Bench 多領域評測套件,涵蓋代碼、網頁、辦公和安全四個領域,任務均從真實場景逆向工程而來,防止背答案。評測方式多樣,強調抗污染能力,並公開數據集以提升透明度。

【AiBase提要:】

📌 WorkBuddy Bench 跨越代碼、網頁、辦公和安全四大領域,共260個任務,防止背答案。

💡 每個任務均從真實場景逆向工程生成,確保任務提示詞無法通過網絡搜索獲取。

🔒 評測採用多維度評分機制,包括規則檢查、LLM/VLM 評判及智能體評判,確保公平性。

8、阿里開源0.8B文檔解析模型OvisOCR2,端到端方案登頂OmniDocBench

阿里開源的OvisOCR2模型在文檔解析領域取得重大突破,以0.8B參數規模實現端到端解析,超越傳統流水線方法,爲RAG檢索、智能問答和企業知識庫提供高效支持。

image.png

【AiBase提要:】

✅ OvisOCR2是首個全面超越傳統流水線方法的端到端文檔解析模型。

💡 模型結合真實與合成數據,通過多種技術手段提升性能。

🚀 該模型已開源,兼容主流推理框架,降低高精度文檔解析門檻。