百度は最近、3Bパラメータ規模のエンドツーエンドOCRモデル「
技術的に見ると、
OmniDocBench v1.6のベンチマークテストにおいて、このモデルは93.92%という成績を記録し、新たな記録を樹立しました。実際のシナリオでは、DeepSeek OCRよりも推論速度が約12.7%向上し、6000トークンの出力長では速度の優位性が35%まで広がっています。これにより、膨大なドキュメントのデジタル化や大規模モデルの長期記憶管理に新たな道を開きました。

百度は最近、3Bパラメータ規模のエンドツーエンドOCRモデル「
技術的に見ると、
OmniDocBench v1.6のベンチマークテストにおいて、このモデルは93.92%という成績を記録し、新たな記録を樹立しました。実際のシナリオでは、DeepSeek OCRよりも推論速度が約12.7%向上し、6000トークンの出力長では速度の優位性が35%まで広がっています。これにより、膨大なドキュメントのデジタル化や大規模モデルの長期記憶管理に新たな道を開きました。
マスクはXプラットフォームで、今後10日以内にGrok4.7モデルを発表すると予告している。このモデルのパラメータ規模は2.1兆に達し、前バージョンであるGrok4.6の1.5兆に比べて40%増加しており、xAIがパラメータ規模と性能の進化において加速して取り組んでいることを示している。ツイートではサービスの速度などの詳細も述べられたが、関連情報は完全には公表されていない。
グーグルはブログ記事を通じて、AIによる画像デザインおよび編集ツール「Google Pics」が正式リリースされたことを発表しました。ユーザーは、pics.newのウェブ版またはDocsやSlides内で直接呼び出して使用可能です。このツールは素材をアップロードしてさらに編集できるため、空白のキャンバスから始める必要がなく、招待状やポスターなどの視覚的なコンテンツを作成するのに適しています。このツールは、今年5月のI/O開発者カンファレンスで登場した「Nano Banana」画像生成モデルにより駆動されており、今後も拡充が予定されています。
グーグルはクリエイティブデザイン分野への参入を発表し、AIによる画像創作と編集ツール「Google Pics」を公開しました。このツールはGoogle Workspaceの企業版および上級ユーザーのエコシステムに深く統合されており、日常的なオフィス作業や生活デザインの場面を対象としています。コアには「Nano Banana」という画像生成モデルが搭載されており、従来のデザインプラットフォームとは異なり、プロンプトを直接使用して画像を生成・編集することを特徴としています。
グーグルは今週水曜日にも、プログラミング能力が大幅に向上した新しいモデル「Gemini 3.8 Flash」をリリースする予定です。このモデルの内部コードネームは「Skimaki」です。Jetskiプログラミングツールでの比較テストにおいて、エンジニアによる評価はAnthropicのOpusモデルを上回りました。これにより、グーグルがアンソロピックとの間に大きな開きを生じさせているコアなプログラミング能力において、その差が顕著に縮まっていることが示されています。
9月1日、Anthropic は Claude Fable 5.1 と Mythos 5.1 を発表しました。これらは、最も進んだプログラミングおよび知識作業向けのモデルとされています。2つのモデルは同じベースモデルを基盤としていますが、セキュリティの分類が異なります。Fable 5.1 はすべてのユーザーを対象としており、Mythos 5.1 は審査を受けたサイバーセキュリティおよび生命科学機関のみに公開されています。ベンチマークテストでは前世代を大幅に上回り、価格もより安いです。