【AI日報】へようこそ!ここは毎日あなたが人工知能の世界を探索するためのガイドです。毎日、AI分野の注目ニュースをお届けし、開発者に焦点を当てて技術トレンドや革新的なAI製品の応用を理解するお手伝いをします。

新鮮なAI製品:クリックして詳細を確認https://app.aibase.com/zh

1、World Labsは世界初のマルチモーダルワールドモデル「Atlas」をリリース。ピクセルレベルのカメラ制御で映画のような「弾丸時間」のビデオを作成。

World LabsがリリースしたAtlasモデルは、世界初のマルチモーダルワールドモデルであり、その核心的な進歩はピクセルレベルでのカメラ制御により高品質な画像および動画を生成し、3次元空間の正確な再構築を実現することです。このモデルは複数の画像から3Dモデルを生成できるだけでなく、テキストから画像およびパンラミックビューを生成する機能も備えています。これにより、強力なワールド生成・再構築・シミュレーション能力を示しています。

image.png

【AiBaseのポイント:】

🖼️ Atlasモデルはピクセルレベルの正確なカメラ制御によって画像と動画フレームを生成し、3次元空間において完全な再構築を実現します。

🎥 このモデルは単一または複数の入力画像から明確な3Dモデルを出力でき、再構築効果は多くのトップクラスのオープンソースモデルを凌駕しています。

📽️ Atlasは時空間シミュレーション機能を持ち、ビデオを再構図してドラマティックな視覚効果を強化し、テキストから画像および360度パノラマを生成することも可能です。

2、腾讯WorkBuddyはプラットフォームを開設し、エージェントベースの機能を全面的に開放。

腾讯WorkBuddyはプラットフォームを開設し、エージェントベースの機能を全面的に開放し、より多くの機能をつなぎ、より多くのシーンに参入し、すべてのツールを担うプラットフォームとなることを目指しています。

image.png

【AiBaseのポイント:】

🤖 腾讯WorkBuddyのプラットフォームが正式に開設され、最初に100以上のエコシステムパートナーが導入されました。

💼 9機種の共同ブランドスマートハードウェアが初めて登場し、複数の業界分野をカバーしています。

🚀 腾讯クラウド副社長は、WorkBuddyがエージェント時代向けのオペレーティングシステムを構築すると述べました。

3、ネット情報管理弁公室はAI換顔、名著の改変などに対する重点整備を行い、豆包、元宝、千問、文心一言が不正コンテンツの出力を厳しく制限。

中央ネット情報管理弁公室は「清朗・AIアプリケーションの乱用を整治する特別行動」を開始し、AI技術の乱用問題に対して深く対策を講じており、違法な情報を整理し、違法アカウントを処理し、違法なサイトやアプリケーションを処置しています。各地のネット情報管理部門は精密な対策を講じており、主流プラットフォームは技術を強化し、インテリジェントな検出効率を向上させています。また、大規模モデルプラットフォームは原始的な語料の内容を厳格に審査し、アプリストアは開発者のアクセス規範を引き締め、AI生成コンテンツの違法な拡散を防止しています。

image.png

【AiBaseのポイント:】

🧠 AI技術の乱用問題が重点的に整治され、偽情報の作成や低俗なコンテンツの伝播などが含まれます。

🛡️ 各地のネット情報管理部門は精密な対策を講じ、違法コンテンツの識別と処置能力を向上させています。

🔒 こうした取り組みにより、AI生成コンテンツの違法な拡散を効果的に抑止しています。

4、豆包スマホが9月に販売:名称は努比亚 NaviX Ultra、世界初のAIエージェントフラッグシップ端末。

努比亚NaviX Ultraは世界初のAIエージェントフラッグシップスマートフォンであり、大規模モデルエージェントをシステムの基盤に埋め込むことで、従来のAIスマートフォンとの本質的な違いを実現しています。その強力な知能操作能力和プライバシー保護機能により、ユーザーに新たな体験を提供しています。

image.png

【AiBaseのポイント:】

📱 AIネイティブなスマートフォンアーキテクチャ:大規模モデルエージェントをシステムの基盤に埋め込み、より効率的な操作体験を実現。

✈️ 知能操作能力:AIが予約などの複雑なタスクを自動的に完了し、ユーザーの手動操作を必要としません。

🔒 プライバシー保護:すべての計算と記憶はローカルで行われ、データはクラウドにアップロードされません。

5、Metaの初のリアルタイム音声認識モデルが登場:20人以上が同時に話してもトラックごとに転写可能、1000分あたり3ドル。

MetaがリリースしたMuse Voice Transcribeは、リアルタイム音声認識、話者分離、エンドポイント検出をサポートする世界初のリアルタイム音声認識モデルです。会議記録や通話字幕などの場面に適しています。このモデルは20人以上の話者の録音を処理でき、70以上の言語をサポートし、速度と精度のバランスを取るために自己調整遅延メカニズムを導入しています。

image.png

【AiBaseのポイント:】

🎙️ 実時間音声認識モデル、話しながら文字起こしが可能。

👥 20人以上の話者を分離し、自動的にトラックごとに転写。

🌐 70以上の言語をサポートし、自己調整遅延メカニズムで精度を向上。

6、地球最大のモデルが価格戦争を始めました!AnthropicがFable 5.1を発表:性能は急騰し、コストは40%減少。

Anthropicは新世代のエース大規模モデルであるFable5.1を発表しました。このモデルは性能とコストの両方で大きな向上を遂げています。Fable5.1はいくつかのベンチマークテストで前世代や競合を上回り、特にエージェント化された複雑なタスクではコスト削減が最高で45%に達しています。これはAI大規模モデルの「軍備競争」が究極的なコストパフォーマンスに広がっていることを示しています。

image.png

【AiBaseのポイント:】

🔥 Fable5.1はいくつかのベンチマークテストで前世代および競合を全面的に超えています。

💰 使用コストは25%低下し、複雑なタスクでは最大45%のコスト削減が可能です。

🚀 Anthropicの上場のために強力な技術的支援を提供しており、IPO資金調達記録を更新する可能性があります。

7、OpenAIとAnthropicとの決戦!グーグルGemini 3.8 Flash内側テストコード名「Skimaki」、最速で水曜日にリリース。

グーグルは人工知能分野で重要な製品更新を実施し、Gemini 3.8 Flashモデルをリリースしました。このモデルはプログラミング能力が大幅に向上し、DeepMindチームは人事調整を経験し、グーグルは強化学習への投資を増やしています。

image.png

【AiBaseのポイント:】

🧠 グーグルがリリースしたGemini 3.8 Flashモデル、内部コード名は「Skimaki」と呼ばれ、プログラミング能力が向上。

🔄 DeepMindチームは人事調整を経験し、Koray Kavukcuoglu氏が上級副社長となり、実行速度の向上を求める。

🚀 グーグルは強化学習にさらなる研究時間と計算リソースを割り当てており、Barret Zoph氏が技術的な困難を克服するために採用されています。

8、グーグルAI画像編集ツールPicsが正式リリース:Docs、Slidesで画像をクリックするだけで編集可能。

グーグルはAI画像デザインおよび編集ツール「Google Pics」をリリースしました。ユーザーはウェブ版やGoogle Docs、Slidesで使用でき、素材のアップロード、オブジェクトのセグメンテーション、テキストの修正などの機能を備えています。個人および企業ユーザーは段階的にアクセス権を獲得できます。

image.png

【AiBaseのポイント:】

🖼️ ユーザーは素材をアップロードしたり、プロンプトを入力して画像を生成でき、Google DocsとGoogle Slidesで直接編集可能です。

📐 ツールは正確なオブジェクトセグメンテーション機能を持っており、画像内のオブジェクトやテキスト要素を個別に調整することが可能です。

👥 個人および企業ユーザーは特定のアカウントやサブスクリプションを通じて段階的にアクセス権を得られます。