浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。

浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。
智谱がオープンソースのマルチモーダルモデルGLM-5.3-Flash(320B-A18B)を公開。性能と低価格でAI普及を推進。評価57点でClaude Opus4.8と同等、プログラミング能力も匹敵し、総合性能はGLM-5.2超え。公開前は匿名「Ox-Alpha」でテストし、OpenCode/OpenRouterで首位。....
Metaは300億パラメータのオープンソースマルチモーダルモデル「Muse Glimmer」を発表。Apache 2.0ライセンスで、ローカルエージェントワークフローに最適化され、多段階推論とツール呼び出し能力を強化。テキストと画像処理に対応。Llama 4以来初のモデル重み公開で、オープンソースAIエコシステムを推進。....
商湯科技は軽量統一マルチモーダルモデルSenseNova U1.5-Lite-Previewをコミュニティにオープンソース公開。単一アーキテクチャで視覚理解・推論・生成・編集を統合し、8B-MoEパラメータで4K解像度・リアルな質感・複雑な視覚制御を実現。U1が統一構造の可能性を検証し、U1.5が軽量高パフォーマンスの突破を達成。....
商湯、軽量マルチモーダルモデルSenseNova U1.5-Lite-Previewをオープンソース化。8B-MoTパラメータのNEO-unifyアーキテクチャ採用、ネイティブ4K画像生成、精細テクスチャ、正確な日中英文字生成、安定した画像編集を実現。長文自然言語と構造化視覚指示の理解を強化し、複雑な要求にも高精度なマルチモーダル生成を可能にする。....
バイトダンスがマルチモーダルAI「Seedream5.0 Pro」を発表。画像生成からデザインへ進化し、テキスト整合性・構成・文字描画・画質が向上。複雑な情報の可視化を突破し、意図を正確に解析。データや概念、高密度テキストを専門的なビジュアルへ変換する。....