大模型在多模態領域的競爭正在向更高清、更長時的視頻生成方向快速演進。當地時間8月27日,谷歌正式發佈了全新的Gemini Omni1.1Flash視頻生成AI模型,該模型不僅最高支持輸出4K超高清分辨率,還在場景擴展、運鏡控制以及生成效率上實現了全面升級。

作爲面向開發者和專業創作者的高性能工具,Gemini Omni1.1Flash在功能設計上帶來了多項亮眼亮點。在場景擴展方面,用戶可以直接基於已有視頻的結尾處無縫銜接並繼續生成後續畫面,每次擴展步長爲10秒,累計最長時長可達40秒;在運鏡控制上,通過指定鏡頭的起始幀與結束幀,即可輕鬆實現平滑自然的轉場效果與專業運鏡。此外,新模型支持引入最長3秒的參考視頻片段,從而在構建新場景時精準維持畫面的上下文背景與角色一致性。

image.png

在畫質與運行效率的平衡上,該模型提供了多檔分辨率選項以滿足不同場景需求。其中,360p預覽模式相較於標準720p分辨率,生成速度最高可提升60%,成本僅爲原有的三分之一,非常適合用於快速原型驗證、分鏡腳本迭代以及高速渲染;而最高則可直接輸出畫質細膩、細節完善的1080p或4K最終成片。

在具體的計費標準方面,Gemini Omni1.1Flash根據不同輸出分辨率採用了階梯式定價策略。其中,生成360p視頻每秒0.03美元(約合0.2元人民幣),生成720p視頻每秒0.1美元(約合0.67元人民幣),生成1080p視頻每秒0.15美元(約合1元人民幣),而最高檔的4K視頻生成費用則爲每秒0.3美元(約合2元人民幣)。這一靈活的階梯定價與多分辨率選擇,將進一步降低各類創意團隊和開發者使用前沿視頻生成技術的門檻。