【AI日報】へようこそ!ここは毎日、人工知能の世界を探索するためのガイドです。毎日、AI分野のホットな情報を紹介し、開発者に焦点を当てて、技術トレンドや革新的なAI製品の応用を理解するお手伝いをします。

新規のAI製品クリックして詳細を確認https://app.aibase.com/zh

1、MiniMaxが汎用型マルチモーダルモデルH3をリリース、15秒2K音声映像生成のコストが主流モデルの3分の1未満

MiniMaxが汎用型マルチモーダルモデルH3をリリースしました。このモデルはテキスト、画像、動画、音声の統一的な理解と生成を実現し、マルチモーダル生成モデルが専門家から汎用アシスタントへの転換において重要な一歩を踏み出しました。H3は指示に従う能力、ブランド情報の表示、V2V動作移行などのシーンで商用レベルの安定性を示しており、広告、EC、ゲーム、UIデザインなど多くの商業分野に応用可能です。また、H3は初期段階から複数の国内チップの互換性を考慮しており、オープンソース化により国内企業におけるマルチモーダルAIアプリケーションの技術的ハードルをさらに下げます。

image.png

【AiBase要約:】

📹 H3はネイティブのステレオ音声映像出力をサポートし、最高で15秒間の2K解像度のコンテンツを生成できます。

🧠 Contextual Omni Representation技術を導入し、自然言語をさまざまなモーダルを結ぶ共通のブリッジとしています。

📦 MiniMaxは関連する法規制に準拠した上でH3モデルの重みをオープンソース化し、オープンエコシステムの建設を推進します。

2、ビーティー(字節跳動)がSeedance 2.5をリリース:30秒のワンカット、AI動画が物語を話せるようになりました

ビーティーはSeedance 2.5という動画生成モデルをリリースしました。これにより、一度に生成される動画の長さが30秒にまで向上し、長編の物語構成、マルチモーダルな参照および編集機能を持つことで、完全な創作が可能になります。

image.png

【AiBase要約:】

🎥 Seedance 2.5では動画生成時間は30秒まで延長され、複数のシーンの物語構成と論理的なシーンの構成が可能です。

🔄 複数回の延長機能をサポートし、人物主体、場面、画面スタイルおよびサウンドの一致を維持します。

👥 最大30枚の画像、10本の動画および音声を入力可能で、多人のイメージおよび声を正確に再現できます。

3、DeepSeek-V4-Flash正式版公開、130億のアクティベートパラメータでエージェント戦場に参戦

DeepSeek-V4-Flashの正式版APIテストが開始され、エージェント分野での重要な進展を示しています。このモデルはいくつかのベンチマークテストで優れた性能を示し、エージェント用途に適したコスト上の優位性を持っています。また、独自のエージェントフレームワーク「DeepSeek Harness」が初めて登場し、OpenAIのResponses APIフォーマットをサポートすることで、開発者のアプリケーションの移行が容易になります。

【AiBase要約:】

🔥 DeepSeek-V4-Flash正式版が公開され、エージェント用途に適した性能を実現しています。

💡 アクティベートパラメータは130億で、コストの優位性が顕著です。

🚀 OpenAI Responses APIフォーマットをサポートし、エコシステムへの移行が容易です。

4、DeepMindがGemini Robotics ER 2を発表、初の多機種協働を実現

DeepMindが発表したGemini Robotics ER2モデルは、多ロボット協働、リアルタイム意思決定、タスク監視において大きな突破を遂げました。これは、身体知能が商業化に向けて大きく前進したことを意味します。

image.png

【AiBase要約:】

🧠 新世代の身体的推論モデルGemini Robotics ER2が多ロボット協働作業の突破を実現しました。

🚀 実時間意思決定と継続的なタスクモニタリングを実現し、タスク実行効率を向上させます。

🤝 多ロボット協働メカニズムを導入し、身体知能の商業化を推進します。

5、グーグルがNano Banana2をGoogle Earthに統合、オンラインAIで地理的な画像生成をサポート

グーグルは最新のNano Banana2 AI画像生成モデルをGoogle Earthに統合し、世界中のユーザー向けにAI画像生成功能を開放しました。これにより、地理空間内容の可視化能力が向上します。

image.png

【AiBase要約:】

🌍 グーグルがNano Banana2 AI画像生成モデルをGoogle Earthに統合し、地理空間内容の可視化能力を向上させます。

🎨 ユーザーはシーンの説明を入力することで高精度なカスタム画像を生成でき、教育、専門的応用、個人的な創作などの様々な場面で利用可能です。

🚀 生成型AIがデジタルマップや空間計算プラットフォームにさらに深く浸透し、教育、都市計画、建築設計などの業界に豊富な可視化応用の可能性をもたらします。

6、華為が5050億パラメータのopenPangu-2.0-Proモデルを開源、重みと推論コードを同時に公開

華為は盤古AIブランドのopenPangu-2.0-Pro大規模モデルを正式にオープンソース化しました。モデルの重み、基本的な推論コードおよび技術報告書も同時に公開され、昇騰AIエコシステムの建設をさらに推進し、昇騰NPUに基づいた最適な実践例を開発者と企業に提供します。

【AiBase要約:】

🧠 openPangu-2.0-Proは昇騰NPUで訓練された大規模な混合エキスパート(MoE)言語モデルであり、総パラメータ数は約505B(5050億)です。

🚀 モデルは512Kのコンテキスト長をサポートし、訓練データ量は約34T Tokensで、後期訓練フェーズを通じて全体的な性能を向上させています。

🌐 华為はopenPangu-2.0-Proモデルを開源し、昇騰AIエコシステムの建設をさらに推進し、開発者と企業に最適な実践例を提供します。

詳細リンク:https://www.huaweicloud.com/product/modelarts/studio

7、アリババがQwen-Audio-3.0-ASR-Flashをリリース、音声認識が専門的なシーンの最後の1マイルを克服

アリババがQwen-Audio-3.0-ASR-Flashをリリースし、音声認識が専門的なシーンの最後の1マイルを克服しました。この新しいモデルは5つの側面でアップグレードされており、長時間の音声文脈記憶、内蔵の多業界辞書、段階的なヒートワードカスタマイズ、音声修飾の統合、多言語対応が含まれます。このモデルはすでに会議録、リアルタイム字幕、教育録画、スマートカスタマーサービスなどの多くの分野で広く応用されています。

【AiBase要約:】

🧠 長時間の音声文脈記憶を備え、数時間の会議中の人名や技術的概念を常に一致させることができます。

💼 内蔵の多業界辞書により、医療シーンでは専門用語の検出率が95.36%、ITプログラミングでは91.87%に達しています。

🌐 一つのモデルで30以上の言語をカバーし、7つの言語の平均語義誤り率は17.09%で、AzureやGeminiなどの競合モデルよりも優れています。

8、テスラ中国車載システムがドゥーパオ大規模モデルを接続

テスラ中国は2026.14.13バージョンの車載ソフトウェア更新を正式に配信し、注目すべき点はドゥーパオ大規模モデルの導入です。これにより、車載システムのスマートインタラクション体験が向上します。ただし、この機能は上級車載エンターテインメントサービスを有効にする必要があります。

【AiBase要約:】

✅ テスラ中国は2026.14.13バージョンの車載ソフトウェア更新を配信を開始しました。

🤖 この更新ではドゥーパオ大規模モデルが導入され、スマートインタラクション体験が向上しています。

🔑 ドゥーパオ大規模モデル機能を使用するには、上級車載エンターテインメントサービスを有効にする必要があります。