Google 發布 Gemini 3.5 Flash 和 Gemini Omni 後,最實際的問題不是 benchmark,而是普通使用者和開發者到底怎麼用,哪些入口免費,哪些入口只是低門檻試用。
先說結論:
- 想聊天、寫作、看圖、日常問答:優先用 Gemini app。
- 想測試 Gemini 3.5 Flash 參數、提示詞和多模態輸入:用 Google AI Studio。
- 想寫程式呼叫 Gemini 3.5 Flash:用 AI Studio 產生 API key。
- 想在終端機裡免費試用:可以看 Gemini CLI。
- 想體驗 Gemini Omni 的影片編輯:優先看 Gemini app 和 Google Flow。
- 想做正式生產:不要依賴免費額度,應該轉到付費 API 或 Vertex AI。
注意:免費額度、地區開放、訂閱層級和模型下拉選單會隨時間變化。本文寫作時間是 2026 年 5 月 20 日,正式使用前要以 Google 當前頁面為準。
Gemini 3.5 Flash 免費用法一:Gemini app
最簡單的入口是 Gemini app:
使用方式很直接:
- 打開 Gemini。
- 登入 Google 帳號。
- 在模型選擇裡找
3.5 Flash。 - 直接開始對話。
這個入口適合普通使用者。你可以用它做寫作、總結、圖片理解、檔案內容分析、日常問答和簡單規劃。根據公開報導,Gemini 3.5 Flash 已面向全球使用者開放,並可在 Gemini 的模型下拉選單中選擇。
限制也很明確:免費使用者通常會有每日訊息數量、地區和功能限制。如果超過限制,就需要等待額度刷新或升級訂閱。
Gemini 3.5 Flash 免費用法二:Google AI Studio
如果你不是只想聊天,而是想調提示詞、看參數、測試結構化輸出,Google AI Studio 更合適:
基本流程:
- 登入 Google AI Studio。
- 新建 prompt。
- 在模型下拉選單裡選擇
gemini-3.5-flash。 - 輸入提示詞並執行。
AI Studio 的好處是控制能力更強。你可以調溫度、系統指令、結構化輸出、多圖輸入,還能把測試好的提示詞匯出成程式碼或 API 呼叫。
對開發者來說,AI Studio 是免費的試驗台。先在這裡把提示詞和輸入格式調好,再進入 API 接入,會少浪費很多額度。
Gemini 3.5 Flash 免費用法三:免費 API key
開發者最關心的是 API。AI Studio 可以建立 Gemini API key,用來呼叫 gemini-3.5-flash。
基本流程:
- 打開 Google AI Studio。
- 找到
Get API key。 - 選擇或建立專案。
- 建立 API key。
- 把 key 儲存到本機環境變數。
Python 範例:
|
|
Node.js 範例:
|
|
curl 範例:
|
|
公開資料顯示,AI Studio 免費層通常會給 Gemini Flash 模型一定的每日請求額度。不同時間、地區和帳號狀態可能不同,常見說法包括每天約 1,500 次請求、每分鐘請求數限制和 token 限制。不要把這些數字寫死進生產計畫,正式上線前要查看 Google AI 當前定價和限制頁面。
Gemini 3.5 Flash 免費用法四:Gemini CLI
如果你喜歡命令列,可以看 Gemini CLI。它適合臨時腳本、程式碼庫摘要、檔案讀取和終端機裡的快速問答。
安裝方式通常是:
|
|
然後執行:
|
|
CLI 更適合個人開發者日常使用,不適合生產整合。生產環境還是應該使用 API key、服務帳號、權限控制和可稽核的呼叫方式。
Gemini Omni 免費或低門檻用法:Gemini app 和 Google Flow
Gemini Omni 是面向影片創作和編輯的多模態模型。它的核心能力不是普通文字問答,而是用自然語言多輪修改影片,並引用圖像、文字、影片、音訊等輸入。
Google DeepMind 頁面給出的入口包括:
- Gemini app。
- Google Flow。
- YouTube Shorts。
頁面也說明,需要 Google AI 訂閱,功能會因訂閱層級和地區不同而變化。因此,Gemini Omni 的「免費用法」要更謹慎理解:有些入口可能允許免費使用者看到或試用部分能力,但完整影片編輯能力可能需要訂閱、地區開放或產品灰度。
如果你只是想體驗,建議按這個順序試:
- 先打開 Gemini app,查看是否有 Gemini Omni 或相關影片編輯入口。
- 再打開 Google Flow:https://flow.google/
- 如果你做短影片內容,再關注 YouTube Shorts 裡是否出現 Omni 相關編輯能力。
如果入口不可見,通常不是你操作錯了,而是帳號、地區、訂閱層級或灰度範圍暫時不滿足。
Gemini Omni 適合怎麼用
Gemini Omni 更適合創作者,而不是普通聊天。
你可以嘗試這些方向:
- 上傳或選擇一段影片,讓它改變風格。
- 讓影片中的某個動作變得更誇張。
- 用一張參考圖替換場景裡的物體或角色。
- 分多輪修改鏡頭、動作、環境和風格。
- 把草圖、參考圖、音訊或影片組合成一個新輸出。
提示詞可以寫得像給剪輯師提要求:
|
|
多輪編輯時,不要一次塞太多要求。更穩妥的做法是:
- 先改主體動作。
- 再改風格。
- 再改鏡頭角度。
- 最後調節聲音、文字和節奏。
這樣更容易保持一致性,也更容易定位是哪一步出了問題。
Gemini Omni Flash 開發者接入
Gemini Omni Flash 能做什麼
官方文件把 Gemini Omni Flash 定位為高效能多模態模型,核心能力可以概括為三類:
- 文生影片:輸入文字提示,生成帶音訊的影片。
- 圖生影片:上傳參考圖片,再用提示描述動作、鏡頭與氛圍。
- 有狀態影片編輯:基於上一輪生成的影片繼續修改,不必完整重述所有畫面細節。
它和傳統影片模型的差異主要在「互動」。透過 Gemini API 的 Interactions API,一次生成或編輯會成為一個 interaction。後續請求可以引用之前的 interaction,讓模型理解上下文,並盡量保留未被要求修改的內容。
最小呼叫方式
Gemini Omni Flash 使用 interactions.create 呼叫。最簡單的文生影片請求只需要模型名稱和提示詞:
|
|
如果直接走 REST API,請注意回應結構和 SDK 有差異。SDK 會提供 interaction.output_video 這樣的便利欄位;REST 回應裡通常需要從 steps 陣列中的 model_output 找到影片內容。
控制畫幅和輸出
預設輸出是橫向 16:9。如果要生成直式影片,可以在 response_format 中設定 aspect_ratio:
|
|
這對短影片、廣告素材和行動端內容尤其重要。建議在產品層把橫向和直式作為明確選項,而不是只讓使用者在提示詞裡描述,因為參數比自然語言更穩定。
圖生影片怎麼接入
圖生影片的輸入是圖片加文字。圖片可以作為動作參考、主體參考、風格參考或起始幀。最基本的輸入結構是:
|
|
實際使用時,不要只寫「讓它動起來」。更好的提示應說明動作、鏡頭、場景、光效和需要保留的元素。例如產品圖生成短影片時,可以寫清楚產品應保持外觀一致、鏡頭如何移動、背景如何變化,以及不要改變品牌標識。
如果輸入裡有多張圖片,建議用 video_config.task 指明任務類型,減少模型猜測:
|
|
task 可用於區分 text_to_video、image_to_video、reference_to_video 和 edit。對應用開發來說,這是一個值得暴露給進階使用者或內部範本系統的參數。
有狀態影片編輯
有狀態編輯是 Gemini Omni Flash 更像「創作工具」而不是「單次生成介面」的地方。第一輪生成影片後,第二輪可以用 previous_interaction_id 引用上一輪結果:
|
|
這裡的關鍵不是寫長提示,而是寫準改動。官方提示指南也強調,影片編輯通常更適合短指令。要修改某個局部元素時,可以追加 Keep everything else the same.,減少模型把其他畫面也一起改掉的機率。
編輯自己的影片
如果要編輯使用者上傳的影片,官方建議先透過 Files API 上傳影片,再把檔案 URI 作為輸入傳給 Gemini Omni Flash。原因很簡單:影片檔案可能很大,直接塞 base64 不利於請求體大小和穩定性。
接入這類功能時,產品層至少要處理四件事:
- 上傳後輪詢檔案狀態,確認不再是
PROCESSING。 - 處理
FAILED狀態,並給使用者可理解的失敗原因。 - 對大檔案、長影片和高解析度素材設定明確限制。
- 在不支援上傳影片編輯的地區隱藏或降級該功能。
官方文件也提醒,並非所有地區都支援編輯上傳影片。面向全球使用者時,不要把「可編輯模型生成影片」和「可編輯使用者上傳影片」混為一談。
大影片建議使用 URI 傳送
如果生成影片超過 4MB,建議在 response_format 裡使用 delivery: "uri"。這樣回應返回的是 Google 託管 URI,客戶端再輪詢狀態並下載影片,而不是在 JSON 裡直接返回一大段 base64。
這對 Web 應用很實用:前端可以先顯示任務進度,後端負責輪詢和下載,避免瀏覽器處理巨大的內嵌回應。需要注意的是,官方文件提到 GET /v1beta/interactions/{id} 目前可能仍會在 data 欄位返回內嵌 base64,uri 欄位只保證在初始建立回應或 SSE 串流裡提供。因此如果你的流程依賴 URI,最好在建立請求的回應階段就保存好相關資訊。
提示詞寫法:把鏡頭說清楚
Gemini Omni Flash 預設可能生成多個鏡頭。如果你需要單鏡頭,要明確寫:
- 單個不間斷場景;
- 連續鏡頭;
- 不要場景剪輯。
如果你需要控制節奏,可以用自然語言描述時間點,例如「3 秒後人物進入畫面」,也可以寫成 [0-3s]、[3-6s] 這樣的時間段。對廣告、教學和產品展示來說,這比只描述畫面更可控。
影片裡需要文字時,也應該把文字內容直接寫清楚。模型可以嘗試渲染可讀文字,但如果提示裡沒有定義招牌、字幕或螢幕文字,它可能會生成不穩定或無意義的文字。
目前限制
Gemini Omni Flash 預覽版還有不少邊界,接入前需要認真看一遍:
- 歐洲經濟區、瑞士和英國不支援上傳和編輯包含未成年人的圖片。
- 某些可識別人物的圖片不支援上傳和編輯。
- 歐洲經濟區、瑞士和英國使用者目前不能編輯上傳影片,但可以編輯模型生成的影片。
- 目前 API 不支援上傳音訊參考。
- 不支援跨多個影片進行引用或推理。
- 不支援影片延伸、影片插值和語音編輯。
- 不支援預配吞吐量。
- 不支援系統指令、溫度、
top_p、停止序列和負面提示等常見生成參數。 - 不支援把 YouTube 影片作為媒體來源。
這些限制會直接影響產品設計。比如面向企業使用者時,要把地區、人物素材、上傳影片、審核策略和失敗提示都放進流程,而不是只做一個輸入框和生成按鈕。
開發者接入建議
如果你準備把 Gemini Omni Flash 接進自己的應用,可以按這個順序做:
- 先做文生影片 MVP,只支援
16:9和9:16兩種畫幅。 - 增加圖生影片,限制上傳圖片格式和大小,並提供提示範本。
- 再做有狀態編輯,把每輪
interaction.id存到任務記錄裡。 - 對大影片啟用 URI 傳送,避免 base64 回應拖垮前後端。
- 把地區限制、內容安全失敗、檔案處理失敗和逾時都做成明確狀態。
- 最後再開放多圖片參考、時間碼、文字渲染和更複雜的鏡頭範本。
它現在更適合「創意工作流工具」而不是普通聊天介面。好的產品體驗應該圍繞任務來組織:生成短廣告、讓產品圖動起來、替換背景、修改光效、加字幕、做直式版本,而不是把所有能力都塞進一個自由文字框。
Gemini Omni 的定位與能力
它解決的核心問題
傳統影片編輯往往需要時間軸、圖層、遮罩、關鍵影格、調色、音軌和大量手動操作。AI 影片生成工具雖然可以從提示詞生成片段,但經常存在兩個問題:
- 一次生成後不容易精細修改。
- 多輪修改時人物、場景、風格和動作容易漂移。
Gemini Omni 想解決的是第二步:不是只生成一段影片,而是讓使用者像和剪輯師溝通一樣,持續提出修改要求。
頁面給出的說法是,它可以透過自然、分步驟的對話編輯任何影片。每次編輯都建立在前一次結果上,目標是保持一個連貫、統一的場景。
主要能力
Gemini Omni 的能力可以分成幾類。
第一類是自然語言影片編輯。使用者可以直接要求模型改變影片裡的美學風格、動作或特效。例如讓鏡子像液體一樣泛起波紋,讓人物變成線稿、毛氈玩偶、透明全息線框,或者讓整個環境變成 3D voxel art。
第二類是重構動作。它可以改變影片中發生的事情,例如放大手部形成的孔洞、讓玩具發出對應動物聲音、讓建築燈光隨音樂點亮。
第三類是基於參考圖像編輯真實影片。使用者可以給出圖像參考,再要求模型把某種建築、太陽、飛行器或其他物體放進真實影片場景裡。
第四類是多輪編輯保持一致性。頁面展示了把小提琴手移動到參考圖像環境、讓小提琴消失、再把鏡頭改成越肩角度的連續編輯流程。這比一次性提示詞更接近真實創作過程。
第五類是多輸入引用。Gemini Omni 可以把圖像、文字、影片、音訊等輸入整合成一個輸出,支援風格遷移、動作遷移、角色替換、草圖轉影片等任務。
為什麼它強調世界知識
Google 在頁面裡反覆強調,Gemini Omni 不只是「畫面變得真實」,而是結合 Gemini 的世界知識、物理直覺、歷史、科學和敘事邏輯。
這點很重要。影片模型如果只追求畫面質感,容易出現動作不合邏輯、物體關係混亂、文字和畫面不同步的問題。Gemini Omni 的目標是讓影片不僅看起來像,還要在故事、物理和語義上更連貫。
頁面中的例子包括:
- 大理石在連鎖反應軌道上滾動。
- 用 claymation 解釋蛋白質折疊。
- 用擬物化 stop motion 解釋海馬體工作方式。
- 讓字母和畫面裡的物體對應出現。
- 讓螢幕文字按節奏逐詞出現。
這些例子說明它不是單純的短影片特效工具,而是試圖把知識表達、敘事和視聽生成放在一起。
和 Veo、Flow、Nano Banana 的關係
從 Google 目前產品線看,Gemini Omni 更像是多模態創作和編輯能力的一層入口。
Veo 更偏影片生成模型本身,強調電影感影片和音訊生成。Google Flow 是面向創作者的 AI 創意工作室,適合組織鏡頭、素材和影片專案。Nano Banana 更偏圖像建立和細節編輯。Gemini Omni 則強調「從任意輸入到一致輸出」的多模態編輯,尤其是影片上的多輪自然語言控制。
簡單理解:
- 想生成高品質影片:關注 Veo。
- 想在創作工作流裡組織影片專案:關注 Google Flow。
- 想編輯圖像:關注 Nano Banana。
- 想用對話方式修改影片,並引用圖片、文字、影片、音訊:關注 Gemini Omni。
使用入口
頁面給出的入口包括:
- Gemini app。
- Google Flow。
- YouTube Shorts。
不過頁面也說明,需要 Google AI 訂閱,功能會因訂閱層級和地區而不同。也就是說,並不是所有使用者在所有地區都能立即使用完整能力。
對創作者來說,最值得關注的入口可能是 Google Flow,因為它更接近完整創意工作台。對普通使用者來說,Gemini app 和 YouTube Shorts 可能是更低門檻的體驗入口。
安全和內容標記
Gemini Omni 頁面專門提到安全流程。Gemini Omni Flash 的開發與內部安全、安全責任團隊合作,並進行了自動化評估、人工評估、人工紅隊、自動化紅隊和發布前倫理安全審查。
內容透明度方面,頁面說明透過 Omni 在 Gemini app、Google Flow 或 YouTube 建立或編輯的內容,會包含不可感知的 SynthID 數位浮水印和 C2PA Content Credentials。使用者可以透過 Gemini app 驗證內容,後續也會擴展到 Chrome 和搜尋。
這部分對影片模型尤其關鍵。影片生成和影片編輯越真實,越需要內容來源標識、濫用防護和驗證工具。
適合哪些人
Gemini Omni 適合幾類使用者:
- 想用自然語言快速修改影片的內容創作者。
- 需要把草圖、參考圖、音訊、影片素材整合成成片的設計團隊。
- 做短影片、廣告概念、教育解釋影片和產品視覺稿的人。
- 想在 Google Flow 中構建 AI 影片工作流的創作者。
- 關注多模態影片編輯能力邊界的開發者和研究者。
但它也不一定適合所有場景。嚴肅商業片、品牌主視覺、影視製作、產品發布影片仍然需要人工審片、版權檢查、事實校對和素材管理。AI 可以明顯加速概念生成和初稿迭代,但不應替代最終審核。
免費使用時最容易踩的坑
第一,免費額度不是生產額度。免費 API key 適合測試、個人工具和原型,不適合承諾穩定服務。
第二,不要把敏感資料發到免費或第三方入口。尤其是未公開程式碼、客戶資料、合約、密鑰、財務表格和內部文件。
第三,注意資料使用設定。免費層可能有不同的資料使用策略,使用前要查看 AI Studio 或 Google 帳號裡的相關設定。
第四,影片能力通常比文字能力更受限。Gemini Omni 這類影片編輯功能可能受訂閱、地區、排隊、時長、解析度和內容安全策略影響。
第五,第三方「無限免費 API」要謹慎。很多閘道會限速、轉發請求、記錄日誌,甚至要求不透明的支付方式。敏感任務不建議走這類入口。
應該選哪個入口
如果你是普通使用者:
- Gemini 3.5 Flash:用 Gemini app。
- Gemini Omni:先看 Gemini app,再看 Google Flow。
如果你是創作者:
- 用 Google Flow 體驗 Omni 影片工作流。
- 用 Gemini app 做腳本、分鏡、提示詞和素材說明。
如果你是開發者:
- 用 AI Studio 除錯提示詞。
- 用 API key 接入
gemini-3.5-flash。 - 用 Gemini CLI 做個人終端機工作流。
- 生產環境考慮 Vertex AI 或付費 API。
如果你是企業:
- 不要依賴免費額度。
- 重點看權限、日誌、稽核、資料駐留、合規和密鑰管理。
- 影片生成和編輯還要補充浮水印、內容審核和版權流程。
小結
Gemini 3.5 Flash 的免費使用路徑比較清楚:Gemini app、Google AI Studio、AI Studio API key、Gemini CLI 都可以作為低門檻入口。它適合聊天、寫作、編程、Agent 原型和多模態測試。
Gemini Omni 的重點是影片編輯和多模態創作,入口主要在 Gemini app、Google Flow 和 YouTube Shorts,但完整能力更可能受訂閱和地區限制。它適合創作者先做體驗和概念驗證,不適合一開始就按穩定生產服務來規劃。
最穩妥的策略是:文字和程式碼任務先用 Gemini 3.5 Flash 免費層試通;影片創作先用 Gemini Omni 在 Gemini app 或 Flow 裡驗證效果;真正要上線,再轉向可稽核、可計費、可控權限的正式方案。
參考來源: