Google 发布 Gemini 3.5 Flash 和 Gemini Omni 后,最实际的问题不是 benchmark,而是普通用户和开发者到底怎么用,哪些入口免费,哪些入口只是低门槛试用。
先说结论:
- 想聊天、写作、看图、日常问答:优先用 Gemini app。
- 想测试 Gemini 3.5 Flash 参数、提示词和多模态输入:用 Google AI Studio。
- 想写程序调用 Gemini 3.5 Flash:用 AI Studio 生成 API key。
- 想在终端里免费试用:可以看 Gemini CLI。
- 想体验 Gemini Omni 的视频编辑:优先看 Gemini app 和 Google Flow。
- 想做正式生产:不要依赖免费额度,应该转到付费 API 或 Vertex AI。
注意:免费额度、地区开放、订阅层级和模型下拉菜单会随时间变化。本文写作时间是 2026 年 5 月 20 日,正式使用前要以 Google 当前页面为准。
Gemini 3.5 Flash 免费用法一:Gemini app
最简单的入口是 Gemini app:
使用方式很直接:
- 打开 Gemini。
- 登录 Google 账号。
- 在模型选择里找
3.5 Flash。 - 直接开始对话。
这个入口适合普通用户。你可以用它做写作、总结、图片理解、文件内容分析、日常问答和简单规划。根据公开报道,Gemini 3.5 Flash 已面向全球用户开放,并可在 Gemini 的模型下拉菜单中选择。
限制也很明确:免费用户通常会有每日消息数量、地区和功能限制。如果超过限制,就需要等待额度刷新或升级订阅。
Gemini 3.5 Flash 免费用法二:Google AI Studio
如果你不是只想聊天,而是想调提示词、看参数、测试结构化输出,Google AI Studio 更合适:
基本流程:
- 登录 Google AI Studio。
- 新建 prompt。
- 在模型下拉菜单里选择
gemini-3.5-flash。 - 输入提示词并运行。
AI Studio 的好处是控制能力更强。你可以调温度、系统指令、结构化输出、多图输入,还能把测试好的提示词导出成代码或 API 调用。
对开发者来说,AI Studio 是免费的试验台。先在这里把提示词和输入格式调好,再进入 API 接入,会少浪费很多额度。
Gemini 3.5 Flash 免费用法三:免费 API key
开发者最关心的是 API。AI Studio 可以创建 Gemini API key,用来调用 gemini-3.5-flash。
基本流程:
- 打开 Google AI Studio。
- 找到
Get API key。 - 选择或创建项目。
- 创建 API key。
- 把 key 保存到本地环境变量。
Python 示例:
|
|
Node.js 示例:
|
|
curl 示例:
|
|
公开资料显示,AI Studio 免费层通常会给 Gemini Flash 模型一定的每日请求额度。不同时间、地区和账号状态可能不同,常见说法包括每天约 1,500 次请求、每分钟请求数限制和 token 限制。不要把这些数字写死进生产计划,正式上线前要查看 Google AI 当前定价和限制页面。
Gemini 3.5 Flash 免费用法四:Gemini CLI
如果你喜欢命令行,可以看 Gemini CLI。它适合临时脚本、代码库摘要、文件读取和终端里的快速问答。
安装方式通常是:
|
|
然后运行:
|
|
CLI 更适合个人开发者日常使用,不适合生产集成。生产环境还是应该使用 API key、服务账号、权限控制和可审计的调用方式。
Gemini Omni 免费或低门槛用法:Gemini app 和 Google Flow
Gemini Omni 是面向视频创作和编辑的多模态模型。它的核心能力不是普通文本问答,而是用自然语言多轮修改视频,并引用图像、文本、视频、音频等输入。
Google DeepMind 页面给出的入口包括:
- Gemini app。
- Google Flow。
- YouTube Shorts。
页面也说明,需要 Google AI 订阅,功能会因订阅层级和地区不同而变化。因此,Gemini Omni 的“免费用法”要更谨慎理解:有些入口可能允许免费用户看到或试用部分能力,但完整视频编辑能力可能需要订阅、地区开放或产品灰度。
如果你只是想体验,建议按这个顺序试:
- 先打开 Gemini app,查看是否有 Gemini Omni 或相关视频编辑入口。
- 再打开 Google Flow:https://flow.google/
- 如果你做短视频内容,再关注 YouTube Shorts 里是否出现 Omni 相关编辑能力。
如果入口不可见,通常不是你操作错了,而是账号、地区、订阅层级或灰度范围暂时不满足。
Gemini Omni 适合怎么用
Gemini Omni 更适合创作者,而不是普通聊天。
你可以尝试这些方向:
- 上传或选择一段视频,让它改变风格。
- 让视频中的某个动作变得更夸张。
- 用一张参考图替换场景里的物体或角色。
- 分多轮修改镜头、动作、环境和风格。
- 把草图、参考图、音频或视频组合成一个新输出。
提示词可以写得像给剪辑师提要求:
|
|
多轮编辑时,不要一次塞太多要求。更稳妥的做法是:
- 先改主体动作。
- 再改风格。
- 再改镜头角度。
- 最后调节声音、文字和节奏。
这样更容易保持一致性,也更容易定位是哪一步出了问题。
Gemini Omni Flash 开发者接入
Gemini Omni Flash 能做什么
官方文档把 Gemini Omni Flash 定位为高性能多模态模型,核心能力可以概括为三类:
- 文生视频:输入文字提示,生成带音频的视频。
- 图生视频:上传参考图片,再用提示描述动作、镜头和氛围。
- 有状态视频编辑:基于上一轮生成的视频继续修改,不必完整重述所有画面细节。
它和传统视频模型的差异主要在“交互”。通过 Gemini API 的 Interactions API,一次生成或编辑会成为一个 interaction。后续请求可以引用之前的 interaction,让模型理解上下文,并尽量保留未被要求修改的内容。
最小调用方式
Gemini Omni Flash 使用 interactions.create 调用。最简单的文生视频请求只需要模型名和提示词:
|
|
如果直接走 REST API,请注意响应结构和 SDK 有差异。SDK 会提供 interaction.output_video 这样的便捷字段;REST 响应里通常需要从 steps 数组里的 model_output 找到视频内容。
控制画幅和输出
默认输出是横屏 16:9。如果要生成竖屏视频,可以在 response_format 中设置 aspect_ratio:
|
|
这对短视频、广告素材和移动端内容尤其重要。建议在产品层把横屏和竖屏作为明确选项,而不是让用户只在提示词里描述,因为参数比自然语言更稳定。
图生视频怎么接入
图生视频的输入是图片加文本。图片可以作为动作参考、主体参考、风格参考或起始帧。最基本的输入结构是:
|
|
实际使用时,不要只写“让它动起来”。更好的提示应说明动作、镜头、场景、光效和需要保留的元素。例如产品图生成短视频时,可以写清楚产品应保持外观一致、镜头如何移动、背景如何变化,以及不要改变品牌标识。
如果输入里有多张图片,建议用 video_config.task 指明任务类型,减少模型猜测:
|
|
task 可用于区分 text_to_video、image_to_video、reference_to_video 和 edit。对应用开发来说,这是一个值得暴露给高级用户或内部模板系统的参数。
有状态视频编辑
有状态编辑是 Gemini Omni Flash 更像“创作工具”而不是“单次生成接口”的地方。第一轮生成视频后,第二轮可以用 previous_interaction_id 引用上一轮结果:
|
|
这里的关键不是写长提示,而是写准改动。官方提示指南也强调,视频编辑通常更适合短指令。要修改某个局部元素时,可以追加 Keep everything else the same.,减少模型把其他画面也一起改掉的概率。
编辑自己的视频
如果要编辑用户上传的视频,官方建议先通过 Files API 上传视频,再把文件 URI 作为输入传给 Gemini Omni Flash。原因很简单:视频文件可能很大,直接塞 base64 不利于请求体大小和稳定性。
接入这类功能时,产品层至少要处理四件事:
- 上传后轮询文件状态,确认不再是
PROCESSING。 - 处理
FAILED状态,并给用户可理解的失败原因。 - 对大文件、长视频和高分辨率素材设置明确限制。
- 在不支持上传视频编辑的地区隐藏或降级该功能。
官方文档也提醒,并非所有地区都支持编辑上传视频。面向全球用户时,不要把“可编辑模型生成视频”和“可编辑用户上传视频”混为一谈。
大视频建议使用 URI 传送
如果生成视频超过 4MB,建议在 response_format 里使用 delivery: "uri"。这样响应返回的是 Google 托管 URI,客户端再轮询状态并下载视频,而不是在 JSON 里直接返回一大段 base64。
这对 Web 应用很实用:前端可以先显示任务进度,后端负责轮询和下载,避免浏览器处理巨大的内嵌响应。需要注意的是,官方文档提到 GET /v1beta/interactions/{id} 目前可能仍会在 data 字段返回内嵌 base64,uri 字段只保证在初始创建响应或 SSE 流里提供。因此如果你的流程依赖 URI,最好在创建请求的响应阶段就保存好相关信息。
提示词写法:把镜头说清楚
Gemini Omni Flash 默认可能生成多个镜头。如果你需要单镜头,要明确写:
- 单个不间断场景;
- 连续镜头;
- 不要场景剪辑。
如果你需要控制节奏,可以用自然语言描述时间点,例如“3 秒后人物进入画面”,也可以写成 [0-3s]、[3-6s] 这样的时间段。对广告、教程和产品展示来说,这比只描述画面更可控。
视频里需要文字时,也应该把文字内容直接写清楚。模型可以尝试渲染可读文字,但如果提示里没有定义招牌、字幕或屏幕文字,它可能会生成不稳定或无意义的文本。
当前限制
Gemini Omni Flash 预览版还有不少边界,接入前需要认真看一遍:
- 欧洲经济区、瑞士和英国不支持上传和编辑包含未成年人的图片。
- 某些可识别人物的图片不支持上传和编辑。
- 欧洲经济区、瑞士和英国用户目前不能编辑上传视频,但可以编辑模型生成的视频。
- 当前 API 不支持上传音频参考。
- 不支持跨多个视频进行引用或推理。
- 不支持视频扩展、视频插值和语音编辑。
- 不支持预配吞吐量。
- 不支持系统指令、温度、
top_p、停止序列和负面提示等常见生成参数。 - 不支持把 YouTube 视频作为媒体来源。
这些限制会直接影响产品设计。比如面向企业用户时,要把地区、人物素材、上传视频、审核策略和失败提示都放进流程,而不是只做一个输入框和生成按钮。
开发者接入建议
如果你准备把 Gemini Omni Flash 接进自己的应用,可以按这个顺序做:
- 先做文生视频 MVP,只支持
16:9和9:16两种画幅。 - 增加图生视频,限制上传图片格式和大小,并提供提示模板。
- 再做有状态编辑,把每轮
interaction.id存到任务记录里。 - 对大视频启用 URI 传送,避免 base64 响应拖垮前后端。
- 把地区限制、内容安全失败、文件处理失败和超时都做成明确状态。
- 最后再开放多图片参考、时间码、文字渲染和更复杂的镜头模板。
它现在更适合“创意工作流工具”而不是普通聊天接口。好的产品体验应该围绕任务来组织:生成短广告、让产品图动起来、替换背景、修改光效、加字幕、做竖屏版本,而不是把所有能力都塞进一个自由文本框。
Gemini Omni 的定位与能力
它解决的核心问题
传统视频编辑往往需要时间线、图层、遮罩、关键帧、调色、音轨和大量手动操作。AI 视频生成工具虽然可以从提示词生成片段,但经常存在两个问题:
- 一次生成后不容易精细修改。
- 多轮修改时人物、场景、风格和动作容易漂移。
Gemini Omni 想解决的是第二步:不是只生成一个视频,而是让用户像和剪辑师沟通一样,持续提出修改要求。
页面给出的说法是,它可以通过自然、分步骤的对话编辑任何视频。每次编辑都建立在前一次结果上,目标是保持一个连贯、统一的场景。
主要能力
Gemini Omni 的能力可以分成几类。
第一类是自然语言视频编辑。用户可以直接要求模型改变视频里的审美风格、动作或特效。例如让镜子像液体一样泛起波纹,让人物变成线稿、毛毡玩偶、透明全息线框,或者让整个环境变成 3D voxel art。
第二类是重构动作。它可以改变视频中发生的事情,例如放大手部形成的孔洞、让玩具发出对应动物声音、让建筑灯光随音乐点亮。
第三类是基于参考图像编辑真实视频。用户可以给出图像参考,再要求模型把某种建筑、太阳、飞行器或其它物体放进真实视频场景里。
第四类是多轮编辑保持一致性。页面展示了把小提琴手移动到参考图像环境、让小提琴消失、再把镜头改成越肩角度的连续编辑流程。这比一次性提示词更接近真实创作过程。
第五类是多输入引用。Gemini Omni 可以把图像、文本、视频、音频等输入整合成一个输出,支持风格迁移、动作迁移、角色替换、草图转视频等任务。
为什么它强调世界知识
Google 在页面里反复强调,Gemini Omni 不只是“画面变得真实”,而是结合 Gemini 的世界知识、物理直觉、历史、科学和叙事逻辑。
这点很重要。视频模型如果只追求画面质感,容易出现动作不合逻辑、物体关系混乱、文本和画面不同步的问题。Gemini Omni 的目标是让视频不仅看起来像,还要在故事、物理和语义上更连贯。
页面中的例子包括:
- 大理石在链式反应轨道上滚动。
- 用 claymation 解释蛋白质折叠。
- 用拟物化 stop motion 解释海马体工作方式。
- 让字母和画面里的物体对应出现。
- 让屏幕文字按节奏逐词出现。
这些例子说明它不是单纯的短视频特效工具,而是试图把知识表达、叙事和视听生成放在一起。
和 Veo、Flow、Nano Banana 的关系
从 Google 当前产品线看,Gemini Omni 更像是多模态创作和编辑能力的一层入口。
Veo 更偏视频生成模型本身,强调电影感视频和音频生成。Google Flow 是面向创作者的 AI 创意工作室,适合组织镜头、素材和视频项目。Nano Banana 更偏图像创建和细节编辑。Gemini Omni 则强调“从任意输入到一致输出”的多模态编辑,尤其是视频上的多轮自然语言控制。
简单理解:
- 想生成高质量视频:关注 Veo。
- 想在创作工作流里组织视频项目:关注 Google Flow。
- 想编辑图像:关注 Nano Banana。
- 想用对话方式修改视频,并引用图片、文字、视频、音频:关注 Gemini Omni。
使用入口
页面给出的入口包括:
- Gemini app。
- Google Flow。
- YouTube Shorts。
不过页面也说明,需要 Google AI 订阅,功能会因订阅层级和地区而不同。也就是说,并不是所有用户在所有地区都能立即使用完整能力。
对创作者来说,最值得关注的入口可能是 Google Flow,因为它更接近完整创意工作台。对普通用户来说,Gemini app 和 YouTube Shorts 可能是更低门槛的体验入口。
安全和内容标记
Gemini Omni 页面专门提到安全流程。Gemini Omni Flash 的开发与内部安全、安全责任团队合作,并进行了自动化评估、人工评估、人工红队、自动化红队和发布前伦理安全审查。
内容透明度方面,页面说明通过 Omni 在 Gemini app、Google Flow 或 YouTube 创建或编辑的内容,会包含不可感知的 SynthID 数字水印和 C2PA Content Credentials。用户可以通过 Gemini app 验证内容,后续也会扩展到 Chrome 和搜索。
这部分对视频模型尤其关键。视频生成和视频编辑越真实,越需要内容来源标识、滥用防护和验证工具。
适合哪些人
Gemini Omni 适合几类用户:
- 想用自然语言快速修改视频的内容创作者。
- 需要把草图、参考图、音频、视频素材整合成成片的设计团队。
- 做短视频、广告概念、教育解释视频和产品视觉稿的人。
- 想在 Google Flow 中构建 AI 视频工作流的创作者。
- 关注多模态视频编辑能力边界的开发者和研究者。
但它也不一定适合所有场景。严肃商业片、品牌主视觉、影视制作、产品发布视频仍然需要人工审片、版权检查、事实校对和素材管理。AI 可以明显加速概念生成和初稿迭代,但不应替代最终审核。
免费使用时最容易踩的坑
第一,免费额度不是生产额度。免费 API key 适合测试、个人工具和原型,不适合承诺稳定服务。
第二,不要把敏感数据发到免费或第三方入口。尤其是未公开代码、客户资料、合同、密钥、财务表格和内部文档。
第三,注意数据使用设置。免费层可能有不同的数据使用策略,使用前要查看 AI Studio 或 Google 账号里的相关设置。
第四,视频能力通常比文本能力更受限。Gemini Omni 这类视频编辑功能可能受订阅、地区、排队、时长、分辨率和内容安全策略影响。
第五,第三方“无限免费 API”要谨慎。很多网关会限速、转发请求、记录日志,甚至要求不透明的支付方式。敏感任务不建议走这类入口。
应该选哪个入口
如果你是普通用户:
- Gemini 3.5 Flash:用 Gemini app。
- Gemini Omni:先看 Gemini app,再看 Google Flow。
如果你是创作者:
- 用 Google Flow 体验 Omni 视频工作流。
- 用 Gemini app 做脚本、分镜、提示词和素材说明。
如果你是开发者:
- 用 AI Studio 调试提示词。
- 用 API key 接入
gemini-3.5-flash。 - 用 Gemini CLI 做个人终端工作流。
- 生产环境考虑 Vertex AI 或付费 API。
如果你是企业:
- 不要依赖免费额度。
- 重点看权限、日志、审计、数据驻留、合规和密钥管理。
- 视频生成和编辑还要补充水印、内容审核和版权流程。
小结
Gemini 3.5 Flash 的免费使用路径比较清楚:Gemini app、Google AI Studio、AI Studio API key、Gemini CLI 都可以作为低门槛入口。它适合聊天、写作、编程、Agent 原型和多模态测试。
Gemini Omni 的重点是视频编辑和多模态创作,入口主要在 Gemini app、Google Flow 和 YouTube Shorts,但完整能力更可能受订阅和地区限制。它适合创作者先做体验和概念验证,不适合一开始就按稳定生产服务来规划。
最稳妥的策略是:文本和代码任务先用 Gemini 3.5 Flash 免费层试通;视频创作先用 Gemini Omni 在 Gemini app 或 Flow 里验证效果;真正要上线,再转向可审计、可计费、可控权限的正式方案。
参考来源: