Google($GOOGL)推出影片生成AI模型「Gemini Omni 1.1 Flash」,新增最高4K「升頻」、場景延伸與指定「首尾影格」等功能。生成式AI的製作流程,正從文字與圖片為主,逐步擴大到影片剪輯與反覆試作的領域。
根據Google官方部落格27日(當地時間)的說法,Gemini Omni 1.1 Flash已可在Google AI Studio的Gemini API與Gemini Enterprise代理平台使用。Google Flow方面,已對Google AI Plus、Pro、Ultra訂閱用戶全球開放;Gemini App則提供場景延伸功能。
這款新模型以文字、圖片、影片作為輸入,用來生成新影片或編輯既有影片。Google開發者文件顯示,模型代號為「gemini-omni-1.1-flash」,支援文字、圖片、影片三種輸入資料格式。
用於編輯與延伸的上傳影片,長度上限為10秒;輸出影片則介於3秒至10秒之間。這樣的架構,正好對應把多段短片接續銜接、調整場景節奏的製作方式。
此次更新的核心,在於讓創作者能更直接掌控場景走向。使用者可以在既有影片後方接續新場景,模型會參考前一段最長10秒的內容,延續動作、人物與場景走勢。Google在官方部落格提到,可以每次10秒為單位持續延伸,最長可累積到40秒。
指定「首尾影格」也是新增功能之一。只要放入起始影像與結束影像,系統就能把兩個畫面串成一段連貫影片。這項設計,主要用於鏡頭運動、縮放轉場、循環播放等需要畫面銜接感的製作情境。
參考影片輸入功能,則用於需要保留人物動作或視覺情境的製作。使用者最多可輸入3秒的參考影片來生成新影片,等於是把單張靜態圖片難以傳達的動作資訊與場景氛圍,一併提供給模型參考。
支援的解析度包括360p、720p、1080p與4K。Google開發者文件說明,720p為預設解析度,1080p與4K則是透過「升頻」方式呈現。雖然官方主打4K輸出,但實際製作流程更偏向先以低解析度製作草稿,再進行高解析度後製。
Google表示,以系統處理量計算,360p草稿生成速度最快可比720p快60%,成本則僅為後者的三分之一。創作者可以先在低解析度反覆測試多個版本,再挑選需要的成果重新輸出為高解析度版本。這也是外界認為,影片生成AI的競爭,正從畫質延伸到反覆製作成本的原因。評論來看,此舉等於把「試錯成本」納入產品設計的核心考量。
收費以付費API為準。Google開發者文件顯示,影片輸出費用為每100萬token 17.5美元;以720p影片換算,每秒約消耗5792個token,等於每秒費用約0.1美元。
南韓媒體《Digital Today》報導,依解析度不同,API收費分別為360p每秒0.03美元、720p每秒0.1美元、1080p每秒0.15美元、4K每秒0.3美元。
影片生成模型的使用習慣,經常是同一組提示詞反覆測試、再從中挑選成果。也因此,草稿製作單價與反覆試作速度,與最終成品的解析度同樣重要。同時主打360p草稿生成與4K升頻,可解讀為Google希望在製作成本與畫質之間,提供更大的調整空間。
這次發表,與Google生成式AI產品線由文字、圖片為主,逐步擴展到影片製作的方向一致。本媒體先前報導指出,Google在Gemini與Flow中開放了關閉AI生成內容「可見浮水印」的設定;不過該報導也提到,南韓地區用戶會自動套用可見浮水印,實際功能開放範圍會因帳號所在地區與產品設定而有所不同。
對台灣的創作者與開發者而言,功能開放範圍與收費方式是關鍵。Google Flow與Gemini API在台灣地區帳號的開放程度、依解析度計費的方式,以及浮水印政策,都可能成為實際製作環境的選擇依據。
留言 0