【AI日報】へようこそ!ここは毎日あなたが人工知能の世界を探索するためのガイドです。毎日、AI分野の注目ニュースをお届けし、開発者に焦点を当てて技術トレンドや革新的なAI製品の応用について理解を深めます。
新規のAI製品:クリックして詳細を確認:https://app.aibase.com/zh
1. JDがリアルタイム動画編集モデルをオープンソース化:30フレーム/秒で即座に処理、見ながら編集する新たな動画制作方式
JD(京東)は自社開発のリアルタイムストリーミング動画編集モデル「JoyAI-Video-Edit」をオープンソース化しました。このモデルは処理速度と動画長さにおいて大きな進歩を遂げており、動画を見ながら編集することができるようになりました。また、ロボットの訓練データ合成にも新たな技術的アプローチを提供しています。

【AiBaseの要約:】
🎥 動画のリアルタイム編集が可能、見ながら編集できる
🚀 720P解像度で1秒間に30フレームの推論速度
🤖 ロボットの訓練データ合成にも対応
2. アリババのQwen-Image-3.0画像生成モデルが公開、APIも開放され0.18元/枚
アリババのQwen-Image-3.0画像生成モデルが正式リリースされ、ユーザーに対して完全にAPIを開放しました。このモデルは文生図ランキングで国内第1位を記録しており、超長テキストの理解と高度なレンダリングをサポートし、さまざまな芸術スタイルと言語に対応しています。商用ワークフローに適した価格設定となっています。

【AiBaseの要約:】
🧠 超長テキストの理解が可能、最大4.5kトークンの入力に対応。
🎨 100種類以上の芸術スタイルと12カ国語のナチュラルなレンダリング。
💰 価格は手頃、Standard版は0.18元/枚から。
詳細リンク:https://platform.qianwenai.com/try-ai?scene=image&models=qwen-image-3.0-pro
3. 腾讯混元がHy ASR 3.0プレビュー版を発表:音声認識は文字単位ではなく、本当に文脈を理解する
腾讯混元が発表したHy ASR 3.0プレビュー版は、音声認識と意味理解において大きな進歩を遂げており、多言語の認識精度を向上させ、専門的な場面への適合性を最適化しています。

【AiBaseの要約:】
🧠 音声認識と意味理解の統合により、認識精度が向上。
📊 多言語の誤字率(WER)が顕著に低下。
💼 専門的な場面に最適化され、ホットワードの挿入をサポート。
4. 字节 Seed が SeedRealtime を発表:音声・映像の双方向大規模モデルが豆包に搭載、見る・聞く・話すことがスムーズに
字节 Seed チームが発表した SeedRealtime は、音声・映像・テキストを統合した双方向の大型モデルであり、すでに豆包アプリにリリースされ、リアルタイムでの相互作用の自然さと滑らかさが大きく向上しました。

【AiBaseの要約:】
🧠 SeedRealtime は音声、映像、テキストを同時に処理可能な統一構造の双方向モデル。
🔄 伝統的な連鎖型手法と比較して、SeedRealtime のエンドツーエンドモデルは話しのペース問題を減らし、インタラクティブな自然さを向上。
💡 SeedRealtime はリアルタイム環境において良好なバランス感を持ち、ユーザーに自然に停止を促す機能を持つ。
5. マスクが発言:Grok 4.6 が来週登場、SpaceXの過去すべてのデータがモデル訓練に投入される
マスク氏はSpaceXの初の決算電話会議で、Grokの最新進展を明らかにし、Grok4.6とGrok4.7のリリース予定を発表しました。また、SpaceXの過去のデータをGrokの学習に組み込むことを強調し、モデルの能力を向上させる予定です。

【AiBaseの要約:】
🚀 マスク氏はGrok4.6が来週リリースされ、その後数週間以内にGrok4.7がリリースされる予定。
📊 SpaceXはGrokの学習にすべての過去データを提供し、モデルの能力を向上。
🧠 Grokの次なるステップはSpaceXのプライベートデータに依存し、公開されたデータのみに依拠しない。
6. シャイシ(影石)とアリババ千問のAIハードウェア提携:Go Ultraポータブルカメラに最初にKira音声アシスタントが搭載
シャイシ(影石)はAI技術をハードウェア製品に統合しており、特にGo Ultraシリーズのポータブルカメラに注力しています。自社技術とアリババ千問の大規模モデルを融合させることで、AI音声アシスタントKiraを導入し、ユーザーによりスマートなインタラクション体験を提供します。

【AiBaseの要約:】
シャイシ(影石)はGo UltraシリーズにAI音声アシスタントKiraを導入し、ユーザーのインタラクション体験を向上。
Kiraは自社技術とアリババ千問のマルチモーダルモデルを統合し、音声識別とクラウド質問応答機能を実現。
地域ごとに異なる大規模モデルを使用し、翻訳と読み上げの正確性を確保。
7. MistralがShieldstralを発表:3Bパラメータモデルで16GBGPUでマルチモーダル審査を実行、オープンソースSOTAを達成
Mistral AIはShieldstralというコンテンツレビューモデルを発表しました。このモデルは30億のパラメータを持ち、Apache 2.0ライセンスに基づいて公開されており、12の言語をサポートしています。さらに、単一の16GB GPUで動作可能です。Shieldstralの特徴は、レビューのポリシーを入力に直接含めることで柔軟なレビュー体制を実現している点です。また、プロンプト分類、回答レビュー、毒性検出などのレビュータスクをカバーし、マルチモーダルコンテンツレビュー分野で現在の最高水準を達成しています。

【AiBaseの要約:】
🧠 Shieldstralはコンテンツレビュー用のモデルで、12の言語をサポートし、1枚の16GB GPUで動作可能。
🔒 审査ポリシーを入力に含めることで、柔軟な審査システムを構築。
📊 プロンプト分類、回答レビュー、毒性検出などの複数の審査タスクに対応。
詳細リンク:https://huggingface.co/mistralai/Shieldstral-1.0-3B
8. 約5万2千円の契約!ロボットのスター企業宇樹科技が科创板上場を目指し、発行価格が100円を超える見込み
中国国内の人形ロボットのリーディングカンパニーである宇樹科技は、科创板へのIPOを正式に開始しました。総額40億元以上を資金調達する計画で、発行価格は1株あたり104元になる見込みです。これは、身体知能とロボット業界の資本化が全面的に加速されていることを示しています。

【AiBaseの要約:】
🤖 宇樹科技は科创板IPOの初期見積もりを開始し、時間は8月5日9:30から15:00まで。
💰 この回では4044.64万股を発行予定で、資金調達目標は42.02億元、予想発行価格は約104元/株。
🚀 宇樹科技は「A株人形ロボット第一号」として、身体知能とロボット業界の資本化进程が全面的に加速。
