Google Flow 最近導入全新的 Gemini Omni 模型,令 AI 影片生成不再只是「輸入一句文字,等系統吐出一段短片」。Omni 的重點,是把 Gemini 的邏輯推理、多模態理解和影片生成能力結合起來,讓創作者可以用文字、圖片、聲音,甚至現有影片素材,逐步打造出更符合物理邏輯、更有鏡頭感的動態短片。
簡單來說,如果 Veo 是負責生成高質感影片的引擎,Google Flow 是給創作者使用的 AI 影片工作台,那 Gemini Omni 就更像是「懂得跟你對話、理解參考素材、逐步修改影片」的新一代影片創作模型。
今次更新最值得留意的,不只是影片畫質提升,而是創作方式改變:由一次性生成,走向可對話、可修改、可參考多種素材的 AI video workflow。
文章重點摘要
Gemini Omni 是 Google 推出的多模態 AI 影片模型,可同時理解文字、圖片、影片及聲音,用於生成及編輯影片。
Google Flow 是主要創作工作台,適合做較完整的 AI 影片項目、鏡頭設計、素材管理及多步驟編輯。
Gemini App 亦可使用 Omni 影片功能,適合較輕量的日常生成、概念視覺化及快速測試想法。
Omni 的最大分別是對話式編輯,使用者可以逐步要求修改畫面、角色、鏡頭、物件或風格,而不是每次重新生成。
創作者使用前仍要留意限制,包括地區、帳戶方案、credits、影片長度、支援功能及生成內容政策,實際可用功能以帳戶介面為準。
Google Gemini Omni 是甚麼?
Gemini Omni 是 Google DeepMind 推出的 AI 影片生成與編輯模型。官方形容它是「Create anything from any input」,即可以由不同輸入開始創作影片,包括文字、圖片、影片和聲音。
與一般文字生成影片工具相比,Omni 的重點不只是把 prompt 變成影片,而是能夠理解不同素材之間的關係,並在多輪對話中維持畫面一致性。官方亦將 Omni 形容為「像 Nano Banana,但用於影片」:你可以先生成一段影片,再逐步要求它修改指定位置,例如更換物件、改變鏡頭角度、調整場景,或加入與畫面同步的聲音。
Omni 另一個重要方向,是「world understanding」。它不只是生成漂亮畫面,也嘗試理解物理、歷史、科學、文化背景和敘事邏輯,令影片更接近真實世界規則。例如物件移動、重力、流體、鏡頭運動和角色互動,都會比單純圖像拼貼更重要。
Google Flow、Gemini App 有甚麼分別?
今次很多人會混淆兩個入口:Gemini App 和 Google Flow。
Gemini App:適合快速生成和日常測試
Gemini App 內的影片生成功能,適合用戶快速將文字、圖片或概念變成短片。你可以把它理解成比較輕量的入口,適合測試創意、製作簡單視覺概念、生成社交媒體素材初稿,或快速看看某個畫面方向是否可行。
Google 官方 Help 頁指出,Gemini Apps 可使用 Gemini Omni 生成影片,但使用者需要符合帳戶、年齡及方案要求。個人帳戶一般需要 Google AI plan;工作或學校帳戶則視乎 Workspace 方案及功能可用性。
Google Flow:適合完整 AI 影片工作流
Google Flow 則更像一個 AI creative studio。它是為影片創作者、內容團隊和設計工作流而設,可以處理更完整的影片項目,例如鏡頭、場景、角色、參考素材、影片編輯和多步驟創作。
官方文件提到,Google Flow 支援不同模型和功能,包括 Veo 系列、Gemini Omni Flash、Gemini,以及 image generation / editing models。Flow 亦提供 prompt box settings,讓使用者在生成前檢查目前使用的模型和 credits 成本。
所以,如果你只是想快速生成一段影片,可以先用 Gemini App;如果你想做完整 project、管理不同素材、逐步編輯影片,Google Flow 會更適合。
Gemini Omni 有甚麼特別?
1. 可以用自然語言編輯影片
Omni 最重要的功能,是 conversational editing。你不用每次重新生成整段影片,而是可以像同創作助手對話一樣,逐步修改影片。
例如你可以先生成一段產品影片,再要求:
「保持原本鏡頭和背景,只把產品外殼改成金屬材質。」
或者:
「不要改變人物,只將背景轉成夜晚城市街道,並加入微弱霓虹光。」
這種方式對創作者很重要,因為影片製作往往不是一次完成,而是不斷調整角色、場景、鏡頭、節奏和細節。
2. 支援文字、圖片、影片和聲音參考
Omni 的另一個重點是 multimodal input。使用者可以提供不同類型素材,例如產品圖、角色圖、參考影片、聲音或文字描述,讓模型整合成一段影片。
例如你可以上傳一張產品圖片,再要求它生成一段 10 秒短片,展示產品放在香港咖啡店桌面上,有自然光、手部互動和微距鏡頭。
亦可以提供一段現有影片,要求它保留動作和構圖,但改變風格、環境或物件。
3. 更重視物理邏輯和鏡頭一致性
官方強調 Gemini Omni 結合 Gemini 的世界知識,能理解物理、科學和文化脈絡。這代表它不只是追求畫面漂亮,而是嘗試令物件移動、角色互動和鏡頭變化更合理。
對內容創作者來說,這會影響影片是否「可信」。例如產品是否有重量感、液體是否自然流動、人物動作是否連貫、鏡頭是否像真實拍攝,而不是每一秒都像獨立生成的動畫。
4. 可在 Google Flow 做更完整的影片工作
Google Flow 不只是單一 prompt 生成器。它更適合將想法拆成素材、場景、鏡頭和版本。當 Omni 加入 Flow 後,使用者可以在同一個工作台中進行創作、參考素材、生成影片、修改影片和測試不同方向。
這對 marketing、education、product demo、社交媒體短片和品牌內容尤其重要,因為這些內容通常需要多輪修改,而不是一次生成就完成。
Google Flow 教學:由文字到影片的基本流程
以下是一個適合初學者的 Google Flow 使用流程。實際介面可能會因帳戶、地區和版本而不同,請以你的帳戶畫面為準。
Step 1:進入 Google Flow
先登入 Google 帳戶,進入 Google Flow。使用前需確認自己是否符合年齡、地區及訂閱方案要求。Google Flow 需要使用者年滿 18 歲、位於支援地區,並視乎功能需要 Google AI Plus、Pro 或 Ultra 等方案。
Step 2:建立新影片項目
進入 Flow 後,建立新的影片項目。你可以先選擇文字生成影片,或上傳圖片、影片、聲音等素材作為參考。
如果你是第一次使用,建議先由簡單文字 prompt 開始,不要一次過要求太多角色、太多場景和太複雜的鏡頭。

Step 3:選擇模型及設定
在 prompt box settings 中檢查目前使用的模型。Google Flow 支援不同模型和功能,包括 Veo 3.1 系列和 Gemini Omni Flash。不同模型支援的影片長度、影片功能、video-to-video editing 和 references 可能不同。
如果你想做對話式影片編輯、上傳影片後再修改,或使用更複雜的參考素材,應留意是否正在使用 Gemini Omni Flash,以及該功能是否在你的地區和方案可用。
Step 4:輸入 Prompt
Prompt 不應只寫「幫我生成一條好看的影片」。比較好的做法,是寫清楚主體、場景、動作、鏡頭、風格、聲音和限制。
例如:
生成一段 10 秒的產品展示短片。主角是一隻黑色智能錄音筆,放在香港共享工作空間的木桌上。鏡頭由近距離慢慢推近,展示產品按鍵、金屬邊框和錄音燈。畫面風格要真實、乾淨、商務感,有自然窗光。不要加入文字,不要加入誇張特效。環境聲保持輕微辦公室背景聲。
這種 prompt 比「智能錄音筆宣傳片」更容易控制結果。
Step 4:進入 Scene Builder,安排影片時間軸
生成或上傳素材後,可以進入 Scene Builder 場景編輯器。這裡是 Google Flow 用來整理影片片段的核心介面。
你會見到畫面下方有一條時間軸,上面排列著不同影片片段的縮圖。當你將多個 AI 生成短片或上傳素材串成較完整的影片時,就可以在這裡安排片段次序、檢查節奏和預覽整體效果。
如果你的目標是社交平台短片,例如 TikTok、Instagram Reels 或 YouTube Shorts,可以留意畫面左側是否顯示 9:16,代表目前正在以直式短影音比例預覽構圖。
Step 5:用 Describe your edits 進行對話式修改
Scene Builder 底部會有一個輸入框,寫著 Describe your edits。這是 Flow 配合 Omni Flash 的 prompt-to-edit 編輯入口。
你可以不用像傳統剪輯軟件一樣手動調整每個細節,而是直接用自然語言描述修改方向。例如:
Edit the uploaded source video using the reference video as the primary reference for pacing, graphic language, motion and transitions. Keep the speaker and original message unchanged, but make the video more suitable for a 9:16 short-form social media format.
這類指令可以讓 Flow 根據參考影片的節奏、視覺語言、動態和轉場方式,去精修目前影片。對創作者來說,重點不是一次生成完成,而是先把素材放入時間軸,再用 Omni Flash 一步步修改成可發布的短片。
可複製 Prompt 範例
以下 Prompt 可直接作為 Google Flow / Gemini Omni 測試起點。使用時請按自己的產品、行業和素材修改。
Prompt 1:產品展示短片
請生成一段 10 秒的產品展示短片。
主角:
[產品名稱],外觀特徵是 [顏色/材質/主要設計]。
場景:
香港辦公室桌面,背景有電腦、筆記本、咖啡杯和自然窗光,整體乾淨、專業、有科技感。
鏡頭:
由近距離慢慢推近產品,先展示整體外觀,再展示一個細節位,例如按鍵、螢幕、接口或材質紋理。
動作:
產品保持在桌面中央,可以有輕微手部互動,但不要遮擋產品重點。
風格:
真實拍攝感、商務短片、自然光、淺景深、穩定鏡頭。
聲音:
加入輕微辦公室環境聲,不要加入旁白,不要加入音樂。
限制:
不要生成任何文字、logo 或價格;不要改變產品外觀;不要加入誇張特效。
Prompt 2:把產品圖變成動態短片
請根據我上傳的產品圖片,生成一段 8 至 10 秒的動態展示短片。
請保留產品的外觀、顏色、比例和主要設計,不要自行改變品牌標誌或按鍵位置。
場景設定:
產品放在 [場景,例如:香港咖啡店桌面/辦公室會議室/展覽攤位/創作者工作室]。
鏡頭設計:
第一段由遠至近展示產品所在環境;
第二段慢慢推近產品;
第三段展示產品最重要的功能細節。
視覺風格:
真實攝影、自然光、乾淨背景、商業產品廣告質感。
請不要加入錯誤文字,不要生成多餘配件,不要改變產品結構。
Prompt 3:對現有影片做局部修改
請根據我上傳的影片進行編輯。
請保留:
原本人物動作、鏡頭節奏、主體位置和主要構圖。
請修改:
將背景改成 [新背景,例如:夜晚香港街道/高級辦公室/未來感展覽空間]。
請注意:
不要改變主體外觀;
不要改變原本動作;
不要讓人物邊緣變形;
不要加入不必要文字;
新背景要與原本光線方向一致。
輸出風格:
真實、自然、連貫,像重新拍攝而不是硬合成。
Prompt 4:社交媒體短片開場
請生成一段 6 至 8 秒的社交媒體短片開場。
主題:
[主題,例如:AI 工具教學/新產品發布/課程宣傳/案例展示]
畫面:
一個香港創作者在桌面前準備開始工作,桌上有手機、電腦、筆記本和產品素材。鏡頭由桌面物件滑向電腦畫面,營造「即將開始教學」的感覺。
風格:
節奏明快、乾淨、現代、有科技感,但不要太誇張。
聲音:
輕微鍵盤聲、環境聲,不要加入旁白。
限制:
不要加入錯字,不要出現不清楚的 UI 文字,不要加入真實品牌 logo。
Prompt 5:多輪修改用 Prompt
第一輪生成後,如果畫面方向正確但需要微調,可以使用:
保留上一版影片的主體、鏡頭節奏和整體構圖,只作以下修改:
1. 將光線調整得更自然,不要太強烈。
2. 背景保持乾淨,但增加少量辦公室細節。
3. 產品外觀不要改變。
4. 動作要更慢、更穩定。
5. 不要加入任何文字或 logo。
請只修改以上部分,其他內容盡量保持不變。
使用 Gemini Omni 前要注意甚麼?
Gemini Omni 和 Google Flow 雖然令影片生成變得更容易,但正式用於商業內容前,仍要留意幾點。
第一,功能可用性會因地區、方案和帳戶不同而變。Google Flow Help 頁提醒,使用前應在 prompt box settings 檢查目前模型及 credit costs。
第二,不同模型支援的功能不同。例如文字生成影片、frames to video、ingredients / references to video、video-to-video editing、影片長度和延伸功能,未必全部由同一模型支援。
第三,AI 影片仍可能出現細節錯誤。尤其是手部、文字、品牌標誌、人物臉部、產品比例和物理動作,需要人手覆核。
第四,商業用途要小心版權和肖像權。如果使用真實人物、品牌素材、音樂、聲音或第三方影片作參考,應先確認使用權限。
第五,Google 表示使用 Omni 在 Gemini App、Google Flow 或 YouTube 生成或編輯的內容會包含 SynthID 數碼水印及 C2PA Content Credentials,以提高 AI 內容透明度。
總結:Omni 的重點不是影片生成,而是影片工作流
Google Gemini Omni 的真正重點,不只是「AI 影片更靚」,而是影片創作方式開始變成可對話、可修改、可參考素材、可逐步打磨的 workflow。
對創作者來說,這代表你可以先用 Gemini App 快速測試概念,再用 Google Flow 建立更完整的影片項目;先生成初稿,再透過多輪 prompt 修改角色、背景、鏡頭、動作和聲音。
不過,Omni 仍然不是完全取代影片製作。它更適合用來加快概念設計、產品展示、教學短片、社交媒體開場、廣告初稿和內容測試。真正發布前,仍要由人處理品牌判斷、事實核實、版權、畫面細節和商業責任。
如果你想系統學會如何把 Google Flow、Gemini Omni、Veo、ChatGPT、NotebookLM、Google Workspace 及其他最新 AI 工具,變成真正可落地的內容製作與工作流程,可以了解 AI-in-One 全年 AI 學習通行證。
DotAI 會持續更新最新 AI 工具教學、實戰案例、Prompt 模板及可直接套用的 workflow,幫你由「識用 AI 工具」進一步變成「用 AI 建立內容與工作方法」。
DotAI Spot
AI 實戰成長社群
DotAI 全新學習體驗,陪伴您跨越 AI 學習迷惘



其他文章













