歡迎來到【AI日報】欄目!這裏是你每天探索人工智能世界的指南,每天我們爲你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。

新鮮AI產品點擊瞭解https://app.aibase.com/zh

1、MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一

MiniMax發佈通用全模態模型H3,實現了文本、圖像、視頻、音頻的統一理解與生成,標誌着多模態生成模型從專用專家向通用助手邁出關鍵一步。H3在指令遵循、品牌信息呈現、V2V動作遷移等場景下表現出商用級穩定性,已可應用於廣告、電商、遊戲、UI設計等多個商業領域。同時,H3在設計初期就考慮了多款國產芯片的兼容性,其開源將進一步降低國內企業在多模態AI應用上的技術門檻。

image.png

【AiBase提要:】

📹 H3支持原生雙聲道音視頻輸出,最高可生成15秒2K分辨率內容。

🧠 引入Contextual Omni Representation技術,使自然語言成爲連接各類模態的通用橋樑。

📦 MiniMax宣佈將在符合相關法律法規的前提下開源H3模型權重,推動開源生態建設。

2、字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了

字節跳動發佈 Seedance 2.5 視頻生成模型,將單次視頻生成時長提升至 30 秒,並具備長敘事能力、多模態參考和編輯能力,可完成完整創作。

image.png

【AiBase提要:】

🎥 Seedance 2.5 提升視頻生成時長至 30 秒,支持多鏡頭敘事和邏輯關聯的鏡頭組織。

🔄 支持多輪延長能力,保持人物主體、場景、畫面風格及音效一致性。

👥 支持輸入最多 30 張圖片、10 段視頻和音頻,精準還原多人形象與聲音。

3、DeepSeek-V4-Flash正式版上線,130億激活參數撬動Agent戰場

DeepSeek-V4-Flash正式版API公測上線,標誌着其在Agent賽道上的重要進展。該模型在多項基準測試中表現優異,且激活參數僅爲130億,與旗艦模型V4-Pro相比具有顯著成本優勢。同時,其自研Agent框架DeepSeek Harness首次亮相,並支持OpenAI的Responses API格式,便於開發者遷移應用。

【AiBase提要:】

🔥 DeepSeek-V4-Flash正式版上線,性能逼近旗艦模型V4-Pro。

💡 激活參數僅130億,成本優勢顯著,適合Agent場景應用。

🚀 支持OpenAI Responses API格式,便於生態遷移。

4、DeepMind發佈Gemini Robotics ER 2,首次解鎖多機協同

文章介紹了DeepMind發佈的Gemini Robotics ER2模型,該模型在多機器人協同、實時決策和任務監控方面取得重大突破,標誌着具身智能向規模化商用邁出了堅實一步。

image.png

【AiBase提要:】

🧠 新一代具身推理模型Gemini Robotics ER2實現多機器人協同作業突破

🚀 實現實時決策與持續任務監控,提升任務執行效率

🤝 引入多機器人協作機制,推動具身智能規模化商用

5、谷歌將 Nano Banana2集成至 Google Earth,支持在線AI生成地理場景圖像

谷歌宣佈將最新Nano Banana2 AI圖像生成模型集成至Google Earth,面向全球用戶開放AI圖像生成功能,提升地理空間內容的可視化能力。

image.png

【AiBase提要:】

🌍 谷歌將Nano Banana2 AI圖像生成模型集成至Google Earth,提升地理空間內容的可視化能力。

🎨 用戶可通過輸入場景描述生成高精度自定義圖像,適用於教育、專業應用及個人創作等多個場景。

🚀 生成式AI進一步融入數字地圖和空間計算平臺,爲教育、城市規劃、建築設計等行業帶來更豐富的可視化應用空間。

6、華爲開源5050億參數openPangu-2.0-Pro模型,權重與推理代碼同步開放

華爲正式開源盤古AI模型品牌openPangu旗下openPangu-2.0-Pro大模型,同步開放模型權重、基礎推理代碼及技術報告,進一步推進昇騰AI生態建設,爲開發者和企業提供基於昇騰原生訓練與推理技術的最佳實踐。

【AiBase提要:】

🧠 openPangu-2.0-Pro是基於昇騰NPU訓練的大規模混合專家(MoE)語言模型,總參數規模約505B(5050億)

🚀 模型支持512K上下文長度,訓練數據規模約34T Tokens,並通過後訓練階段提升綜合性能

🌐 華爲開源openPangu-2.0-Pro模型,進一步推進昇騰AI生態建設,爲開發者和企業提供最佳實踐

詳情鏈接:https://www.huaweicloud.com/product/modelarts/studio

7、阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景最後一公里

阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景最後一公里。新模型在五大維度實現升級,包括長音頻上下文記憶、內置多行業詞庫、分級熱詞定製、集成語音潤色以及多語言支持。該模型已在多個領域廣泛應用,如會議紀要、實時字幕、教育錄播和智能客服等。

【AiBase提要:】

🧠 長音頻上下文記憶,轉寫時可參考前文語義,幾小時會議中的人名、技術概念全程保持一致。

💼 內置多行業詞庫,醫療場景專業詞召回率達95.36%,IT編程達91.87%。

🌐 一套模型覆蓋30餘種語言,七語種平均語義錯誤率17.09%,優於Azure、Gemini等同業模型。

8、特斯拉中國車機正式接入豆包大模型

特斯拉中國正式推送2026.14.13版本的車機軟件更新,其中最引人注目的是引入了豆包大模型,提升了車機系統的智能交互體驗。不過,該功能需要用戶開通高級車載娛樂服務才能使用。

【AiBase提要:】

✅ 特斯拉中國開始推送2026.14.13版本車機軟件更新。

🤖 此次更新引入了豆包大模型,提升智能交互體驗。

🔑 需要開通高級車載娛樂服務才能使用AI大模型功能。