Google 在美國時間 8 月 27 日發表 Gemini Omni 1.1 Flash,這是旗下多模態影片生成模型 Omni Flash 的重大更新。新版本加入場景延長、首尾幀插值、360p 快速預覽、4K 升頻與影片參考等多項功能,定位從「實驗性工具」轉向「製作就緒」的開發者平台。Google DeepMind 產品經理 Anish Nangia 與 Alisa Fortin 在官方部落格寫道,Omni 1.1 讓生成式影片「更可控、迭代更快、適於實際部署」。Gemini API 負責人 Logan Kilpatrick 也在 X 上公布更新內容,強調這是「anything in, anything out」世界模型的新版本。
Google Gemini Omni 1.1 Flash 發表:場景延長、4K 輸出、首尾幀控制
場景延長:最長 40 秒,上下文從 1 秒拉到 10 秒
Omni 1.1 最核心的新能力是場景延長(Scene Extension)。開發者可以從一段既有影片的結尾繼續生成,每次以 10 秒為單位遞增,累計最長可達 40 秒。模型能分析最多 10 秒的前段上下文,相較前代只參考最後 1 秒,視覺一致性與故事連貫性有明顯提升。
這項功能讓開發者能從一個短片段出發,逐步延伸出更長的影片內容。官方展示中包含戲劇性的鏡頭運動場景,例如 dolly-zoom、360 度軌道旋轉等複雜攝影機控制,都是透過連續的場景延長指令實現。不過,場景延長在每次生成時都需要消耗完整的影片輸出 token,因此累計 40 秒的長影片成本會相當可觀,這也是 360p 草稿模式存在的原因。
首尾幀指定:精準控制鏡頭運動與轉場
另一項重要功能是首尾幀插值(First and Last Frame)。開發者可以指定一個鏡頭的起始幀和結束幀,Omni 1.1 會在兩者之間生成連續影片,適合用來製作軌道運鏡、縮放轉場或無縫循環片段。
這項功能解決了生成式影片長久以來的痛點:鏡頭運動難以精準控制。過去開發者只能用文字提示描述想要的畫面,實際生成的結果往往與預期有落差。首尾幀指定讓精準的畫面構圖成為可能,開發者可以先準備好起始和結束的關鍵幀,中間的過渡動畫由模型自動補齊,大幅減少了反覆調整提示詞的時間。
360p 快速預覽:速度快 60%、成本降三分之二
Omni 1.1 新增 360p 解析度的草稿模式,生成速度比標準 720p 快最多 60%,成本僅為三分之一。這對需要反覆試錯的創作流程特別有用,開發者可以先用 360p 快速生成多個版本比較,確認方向後再用高解析度輸出最終成品。
官方展示了「Draft Room」概念應用:在同一個畫面中並排 3 到 4 個 360p 草稿,每次只調整一個變數,方便創作者比較不同設定的效果差異。
4K 升頻與影片參考
在輸出品質方面,Omni 1.1 支援將生成結果升頻至 1080p 或 4K 解析度,達到可直接用於專業製作的水準。
此外,新版本加入影片參考(Video Reference)功能,開發者在生成時最多可輸入 3 秒的參考影片,讓模型根據參考內容維持視覺脈絡與角色一致性。這項功能在需要多個鏡頭保持風格統一的場景中特別實用。
合作夥伴已投入生產環境
Google 在發表文章中公布了多位合作夥伴的實際應用案例:
- Adobe Firefly:已將 Gemini Omni Flash 整合至 Firefly 平台,用於影片生成與編輯
- Figma Weave:創意總監 Itay Schiff 表示,Omni Flash 是 Weave 平台上「最強的影片模型之一」,場景延長、更豐富的素材參考和 4K 解析度讓團隊「從生成影片進化到導演影片」
- Runway:創意長 Jamie Umpherson 指出,Omni Flash 與 Runway 現有的「從提示詞、圖片或影片出發,再生成或編輯」的工作流程自然契合
- GMI Cloud:行銷副總裁 Louisa Guo 表示,Omni Flash 的「精準度經得起檢驗」,對教育和解說類內容創作者而言,這種可靠性比任何單一功能都重要
定價與取得方式
Omni 1.1 Flash 的 API 定價與前代相同:輸入(文字、圖片、影片、音訊)每百萬 token 1.50 美元,影片輸出每百萬 token 17.50 美元。 以 720p 影片計算,約為每秒 0.10 美元(約新台幣 3.25 元)。360p 草稿的 token 消耗更低,每秒 1,931 個 token(720p 為 5,792 個)。
取得管道方面,開發者可透過 Google AI Studio 直接使用,企業客戶可透過 Gemini Enterprise Agent Platform API 存取。 一般使用者方面,Google AI Plus、Pro、Ultra 訂閱用戶即日起可在 Google Flow 中使用 Omni 1.1,場景延長功能也在 Gemini 應用程式中開放。
從定價結構來看,Google 維持了與前代相同的費率,沒有因為功能升級而加價。這顯示 Google 的策略是用穩定的價格吸引開發者生態系,而非在模型更新時拉高單價。相較之下,Runway、Pika 等競品的影片生成服務通常以訂閱制計費,每次生成的邊際成本較難估算。Omni 1.1 的按量計費模式對需要大量生成測試的開發者來說更有彈性。
結語
Gemini Omni 1.1 Flash 的更新方向很清楚:Google 要讓 AI 影片生成從「展示用」走向「製作用」。場景延長解決了長度限制,首尾幀控制解決了精準度問題,360p 草稿降低了迭代成本,4K 升頻則補上了輸出品質的最後一塊拼圖。加上 Adobe、Figma、Runway 等合作夥伴的實際採用,Omni Flash 正在從技術展示轉變為創作工具鏈的基礎。
對開發者而言,最實際的改變是工作流程的效率提升。過去要生成一段可用的影片,往往需要反覆調整提示詞、多次生成、再從中挑選最佳結果。360p 草稿模式讓這個試錯過程的成本和時間都大幅縮短,而首尾幀指定則讓精準控制變得可行。當影片生成工具從「碰運氣」變成「可控的創作流程」,才有機會被整合進專業的內容製作管線中。



