百度飛槳チームは、文心大模型に基づく汎用的な画像キー情報抽出ツール「PP-ChatOCR」を発表しました。
このツールは、OCR文字認識と大規模言語モデル技術を組み合わせることで、様々な場面で画像内の重要な情報を抽出できます。
PP-ChatOCRは既にPaddleXで公開されており、開発者はこのプラットフォームでトレーニングや微調整を行い、高性能な環境への展開が可能です。
このツールは、複数の場面で高い精度と安定性を示しています。

百度飛槳チームは、文心大模型に基づく汎用的な画像キー情報抽出ツール「PP-ChatOCR」を発表しました。
このツールは、OCR文字認識と大規模言語モデル技術を組み合わせることで、様々な場面で画像内の重要な情報を抽出できます。
PP-ChatOCRは既にPaddleXで公開されており、開発者はこのプラットフォームでトレーニングや微調整を行い、高性能な環境への展開が可能です。
このツールは、複数の場面で高い精度と安定性を示しています。
字节跳动がパラメータ数5兆以上の大規模言語モデルを検討中と報道。実現すれば通義千問(2.4兆)やKimi K3(2.8兆)を超え国内最大に。Seed Foundation責任者の項亮氏が主導、初期段階で公開時期未定。....
今年のピュリツァー賞では、8人が受賞者あるいはノミネート者としてAIを活用したことを明らかにし、昨年から導入されたAIに関する申告ルール以来で最高記録となりました。そのうち5人は最終的な受賞者でした。報道によると、今回の応募者は、大量のドキュメント検索やデータ整理および相互確認などの基本的な編集作業において、生成型AIと大規模モデルをより頻繁に使用しています。
テンセント混元が音声認識モデルHy ASR3.0previewを発表。大規模言語モデルHy3の意味理解を初統合し、逐次文字起こしから「文脈理解・ワンクリック出力」へ進化。中国語標準語、英語、広東語の単語誤り率は各3.34%、2.62%、3.12%、全体約3%と高性能。....
CodeBuddyとWorkBuddyは、Hy3大規模言語モデルの無料利用キャンペーンを2026年8月31日まで延長。ユーザーの好評を受けての措置。Hy3はテキスト処理専用でマルチモーダル非対応。画像・動画生成などを両製品経由で要求すると、自動で対応マルチモーダルモデルに切り替わり、通常のポイント消費ルールが適用される。....
TaiXu-Admin V0.1.2は、大規模言語モデル対話、検索拡張生成(RAG)、エージェント連携を同一バックエンドに統合。主な更新:LLM Wiki解析・検索の追加による文書処理の強化、ホットコンパイル置換機構を導入し、コード変更が再起動不要で反映。分散した大規模モデル機能を整理し、統一的なアプリケーション管理フレームワークを構築する試み。....