身体知能のトレンドの進化に伴い、
商湯科技がオープンソースする日日新 SenseNova U1 はマルチモーダルネイティブな統一アーキテクチャを実現


身体知能のトレンドの進化に伴い、
商湯がオープンソースした8Bの軽量統一マルチモーダルモデル「SenseNova U1.5Lite」は、コアな視覚タスクにおいて同クラスを超えており、一部の複雑なレイアウトやテキストレンダリングでは大規模な商用モデルに匹敵します。ネイティブに3〜4Kのコンテキストをサポートしており、オブジェクト、数、空間的関係性、テキスト、レイアウト、スタイルなど、複数の制約を同時に処理可能です。
商湯科技は軽量統一マルチモーダルモデルSenseNova U1.5-Lite-Previewをコミュニティにオープンソース公開。単一アーキテクチャで視覚理解・推論・生成・編集を統合し、8B-MoEパラメータで4K解像度・リアルな質感・複雑な視覚制御を実現。U1が統一構造の可能性を検証し、U1.5が軽量高パフォーマンスの突破を達成。....
商湯科技が7Bパラメータの多目的視覚モデルSenseNova-Vision-7B-MoTをオープンソース化。物体検出、OCR、深度推定、法線推定、画像分割、多視点処理を単一アーキテクチャに統合し、視覚理解とGUIエージェント開発の高効率基盤を提供。....
商湯は「日日新SenseNova-Vision」ビジョン大モデルを発表し、オープンソース化しました。このモデルの核心はビジョン能力をナチュラルに汎用ベースモデルに組み込むことで、従来の検出やセグメンテーションなどの専門モデルを束ねる分断されたアプローチを打ち破りました。このモデルは単一モデルとして、複数の評価で4つの分野においてパフォーマンスを圧倒し、ビジョンタスクにおける統一ナチュラル構造への重要なアップグレードを示しています。
商湯科技は「多モーダル大規模モデルU1Pro」を機密裏に開発中で、デザインシーン向けに設計されており、チーフサイエンティストの林達華がリードしている。このモデルは「日日新」というシリーズに属し、OpenAIのGPT-Image2と対抗する目標を持つ。長距離論理と思考能力を強調しており、7月に内製テストを開始し、商用化を目指している。