【AI日報】へようこそ!ここは毎日あなたが人工知能の世界を探索するためのガイドです。毎日、AI分野の注目ニュースをお届けし、開発者に焦点を当てて技術トレンドや革新的なAI製品の応用についてご案内します。

新しいAI製品詳しく見るhttps://app.aibase.com/zh

1. ブラックフォレストラボがFlux3を公開:最初のネイティブ音声生成を備えたマルチモーダルベースモデルで、20秒の音声と映像を一度に作成可能

ブラックフォレストラボがリリースしたFlux3マルチモーダルベースモデルは、初めてネイティブな音声生成を実現し、音声と映像の同期、画像生成および動作制御において優れた性能を示しており、人工知能分野でのリーダーシップを示しています。

image.png

【AiBase要約:】

🧠 Flux3は、ネイティブな音声生成をサポートする最初のマルチモーダルベースモデルであり、一度に20秒の音声と映像の同期されたセグメントを生成できます。

📊 初期テストでは、Flux3はLuma Ray3.2やRunway Gen-4.5などのトップモデルよりも優れたパフォーマンスを示しました。

🤖 Flux3はMimic Roboticsと協力して、ロボット業界向けの動作モデルFlux-mimicを開発しており、アウディ工場で生産タスクのテストを行っています。

2. Claude Opusが音声モードをサポート:会話からツール操作や言語変更に対応するリアルタイムのアシスタントへ進化

Claudeの音声モードのアップデートにより、複雑な問題処理能力が大幅に向上し、複数のモデルやツールへの対応も追加され、ユーザーが音声インターフェースを通じて効率的にタスクを完了できるようになりました。

image.png

【AiBase要約:】

🧠 Claudeの音声モードがアップグレードされ、Opus、Sonnet、Haikuモデルをサポートし、複雑な問題処理能力が向上しました。

🛠️ Gmail、Slackなどとの接続が可能となり、音声指令でスケジュールの変更やドキュメントの生成などのタスクを実行できます。

🌐 多言語サポートが拡張され、ユーザーは会話中に言語を切り替えることができますが、手動設定が必要です。

3. 快手がAIインタラクティブコンテンツ市場に参入:初のクリエイター募集を開始

快手は「AIインタラクティブコンテンツ」の創作機能を正式に発表し、これは動画プラットフォーム競争が従来のコンテンツ長さからインタラクティブ体験へと拡大していることを示しています。この機能は大規模モデルを基盤としており、ユーザーがテキスト入力やオプション選択を通じてコンテンツの進行を積極的に参加できるようにし、従来の単方向的な動画配信モデルを打ち破ります。業界分析では、これは快手が動画市場の既存競争の中で重要な戦略的布石であり、ユーザーの定着率と推薦アルゴリズムの反哺を目的としていると考えられています。

【AiBase要約:】

🤖 快手はAIインタラクティブコンテンツの創作機能を導入し、初のコラボレーションクリエイターの募集を開始しました。

🕹️ AIインタラクティブコンテンツは大規模モデルによって構築され、ユーザーがコンテンツの進行に積極的に関与できるようにし、従来の動画配信の単方向性を打破します。

📈 分析によると、快手のこの動きは動画市場の既存競争における重要な布石であり、ユーザーの定着率と推薦アルゴリズムの改善を目指しています。

4. 小鵬の人形ロボットが広州工場で小量試作を開始:2026年に量産を予定

小鵬の人形ロボットの広州工場は小量試作を開始し、これにより量産への道が最終段階に入りました。企業は2026年に量産を実施し、全世界の店舗や商業シーンに徐々に導入していく予定で、グループの核心的な能力を統合することで商業化の進展を加速させます。

【AiBase要約:】

🚀 小鹏人形ロボットは広州工場で小量試作を開始し、量産ラインが最終調整段階に入っています。

💼 小鹏グループ会長の何小鹏氏がロボット事業のCEOを兼務し、商業化の進展を推進しています。

🌐 小鹏は2026年に人形ロボットの量産を実施し、全世界の店舗および商業シーンへの導入を計画しています。

5. 腾讯が混元多モーダルモデル部門と大規模言語モデル部門を統合:姚順雨が統括し、全モーダルの上限を目指す

腾讯は混元多モーダルモデル部門と大規模言語モデル部門を統合し、基礎モデル部を設立し、姚順雨氏が統括します。この統合は、モデルの開発と協調効率を高め、全モーダルモデルの知能上限を探求することを目的としています。

【AiBase要約:】

🧠 腾讯は混元多モーダルモデル部門と大規模言語モデル部門を統合し、基礎モデル部を設立し、姚順雨氏が統括します。

🚀 統合により、モデル開発と協調効率が向上し、全モーダルモデルの知能上限の探求が進められます。

📊 姚順雨氏は以前から大規模言語モデル部の責任者を兼任しており、今回の統合は腾讯が混元技術路線をさらに統合するものとなっています。

6. マイクロソフトが自社開発の2つのモデルMAI-Image-2.5-ProとMAI-Voice-2-Flashを発表:第三者モデルを蒸留しない、BingやPowerPointに実装済み

マイクロソフトは自社開発のAIモデルMAI-Image-2.5-ProとMAI-Voice-2-Flashをリリースしました。それぞれ高品質な画像生成と高同時接続の音声インタラクションに特化しており、トレーニングデータは追跡可能で、第三者モデルの蒸留に依存していないことを強調しています。これらのモデルは複数の製品で実装されており、効率とコスト効果を大きく向上させています。

image.png

【AiBase要約:】

🧠 MAI-Image-2.5-Proは、自然言語編集指令をサポートする高精度画像生成モデルであり、Bing Image CreatorとPowerPointで使用されています。

🔊 MAI-Voice-2-Flashは最適化された音声モデルで、速度が2倍になり、コストが32%低下し、T-Mobileなどの顧客にも適用されています。

📊 MAI-Transcribe-1.5は医療ソリューションで使用され、2,800万回の患者問診記録を処理し、58言語をサポートし、誤り率が50%低下しています。

7. 腾讯がWorkBuddy Benchを発表:コード、ウェブ、オフィス、セキュリティをすべて含むエンコーディングインテリジェントエージェントの評価環境

腾讯はWorkBuddy Benchという多分野の評価セットを発表しました。このセットはコード、ウェブ、オフィス、セキュリティの4分野をカバーしており、すべてのタスクは現実的なシナリオから逆設計されており、答えを覚えておくことを防ぎます。評価方法は多様で、汚染耐性を重視し、データセットを公開して透明性を高めています。

【AiBase要約:】

📌 WorkBuddy Benchはコード、ウェブ、オフィス、セキュリティの4分野をカバーし、260のタスクがあり、答えを覚えておくことを防ぎます。

💡 各タスクは現実的なシナリオから逆設計されており、ネットワーク検索で取得できないタスクの説明文を確保しています。

🔒 評価は多面的なスコアリングメカニズムを採用しており、ルールチェック、LLM/VLMによる評価、インテリジェントエージェントによる評価を含み、公平性を確保しています。

8. アリババが0.8Bのドキュメント解析モデルOvisOCR2をオープンソース化:OmniDocBenchで首位を獲得

アリババがオープンソース化したOvisOCR2モデルはドキュメント解析分野で大きな突破を遂げました。0.8Bパラメータ規模でエンドツーエンドの解析を実現し、従来のパイプライン方式を上回り、RAG検索、スマート質問応答、企業知識ベースに対して効率的な支援を提供しています。

image.png

【AiBase要約:】

✅ OvisOCR2は、従来のパイプライン方式を全面的に超えるエンドツーエンドドキュメント解析モデルです。

💡 モデルは実際のデータと合成データを組み合わせ、さまざまな技術手段によりパフォーマンスを向上させています。

🚀 このモデルはオープンソース化されており、主流の推論フレームワークと互換性があり、高精度ドキュメント解析のハードルを低下させています。