アリババのEMOフレームワークは、音声プロンプトと顔の動きとの関連性に注目することで、ヘッドビデオ生成のリアルさ、自然さ、表現力を向上させます。EMOは、さまざまな言語の歌や音声の生成に対応しており、キャラクターのアバターに豊かな表情と動きを与えることができます。さらに、EMOは異なるキャラクター間の連携も実現し、ビデオ生成の可能性を広げます。
関連推奨
アリババ・ダモ研究院が食道癌用AIモデル「DAMO EAGLE」を発表:挿管不要、通常のCT画像で早期癌を検出可能
阿里達摩院が複数病院と共同で食道がんスクリーニングAI「DAMO EAGLE」を発表。挿管造影不要で単純CTのみで食道がん・早期病変を識別。3カ国8万例以上で検証、感度90%、特異度99.2%。論文はNature Medicineに掲載。....
アリババは劉大一恒をQwenプロジェクトの責任者に任命
アリババはベテランのAI研究者である劉大一恒をトウイチエンの巨大言語モデルプロジェクトの責任者に任命しました。この人事変更は複数回の組織再編後に発表され、Qwenチームの管理構造がさらに明確になりました。雲栖大会は火曜日に開幕し、公式ウェブサイトの講師リストによると、劉大一恒の写真が特設展示されており、グループ会長の蔡崇信と最高経営責任者(CEO)に次いで目立ちます。
アリババグループの創業者である陳航がCEOを辞任し、現在は10万元の年収で百望股份の非執行取締役に就任
百望股份の公告によると、臨時株主総会で陳航の非執行取締役への任命が全員一致で承認され、即日効力が発生し、今回の取締役会の任期終了まで有効であり、再選挙が可能。年収は10万元で、会議の手当はなし。陳航はアリババグループ内でアリババを統括していた創業元老で、今回の任命は象徴的な役職と見られている。
アリババがQwen3.8-Omni-Flashを発表:ナチュラルなマルチモーダル、百万のコンテキスト 音声コストは98%削減
アリババのQwenチームがナチュラルなマルチモーダルモデル「Qwen3.8-Omni-Flash」を発表しました。このモデルはテキスト、画像、音声、動画の4種類の入力をサポートし、コンテキストウィンドウが100万トークンに達しています。29のベンチマークで前バージョンと比較して平均で25%以上の向上が見られます。最大の変化は処理方法において、音声や画像認識を単純に結合するのではなく、モデルレベルでマルチモーダル理解とAIスマートエージェントの能力をネイティブに統合した点です。
アリババが新しいQoderを発表:AIプログラミングツールから全員向けのエージェントワークステーションへとアップグレード
アリババが新Qoderを発表。AIプログラミングIDEをコーディング能力を中核とするエージェントワークベンチへ刷新。自然言語で目標を伝えると、文脈理解・計画・ツール実行・検証まで自動化し、全工程を確認・調整・引継ぎ可能。公開1年で累計600万ユーザー超、10万社超に提供。新バージョンは3つの協業パラダイムシフトが背景。....
VIP会員