浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。

浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。
Metaは300億パラメータのオープンソースマルチモーダルモデル「Muse Glimmer」を発表。Apache 2.0ライセンスで、ローカルエージェントワークフローに最適化され、多段階推論とツール呼び出し能力を強化。テキストと画像処理に対応。Llama 4以来初のモデル重み公開で、オープンソースAIエコシステムを推進。....
商湯科技は軽量統一マルチモーダルモデルSenseNova U1.5-Lite-Previewをコミュニティにオープンソース公開。単一アーキテクチャで視覚理解・推論・生成・編集を統合し、8B-MoEパラメータで4K解像度・リアルな質感・複雑な視覚制御を実現。U1が統一構造の可能性を検証し、U1.5が軽量高パフォーマンスの突破を達成。....
商湯、軽量マルチモーダルモデルSenseNova U1.5-Lite-Previewをオープンソース化。8B-MoTパラメータのNEO-unifyアーキテクチャ採用、ネイティブ4K画像生成、精細テクスチャ、正確な日中英文字生成、安定した画像編集を実現。長文自然言語と構造化視覚指示の理解を強化し、複雑な要求にも高精度なマルチモーダル生成を可能にする。....
バイトダンスがマルチモーダルAI「Seedream5.0 Pro」を発表。画像生成からデザインへ進化し、テキスト整合性・構成・文字描画・画質が向上。複雑な情報の可視化を突破し、意図を正確に解析。データや概念、高密度テキストを専門的なビジュアルへ変換する。....
元OpenAI研究員の田永龍氏が騰訊(テンセント)に加入、混元マルチモーダル・視覚言語モデル開発を担当。2025年9月には姚順雨氏も首席AI科学者として加わり、両氏は再び共闘する。....