Gemini 3.5 Flash 和 Gemini Omni 怎么免费用:普通用户与开发者入口整理

整理 Gemini 3.5 Flash 和 Gemini Omni 的免费或低门槛使用方式:Gemini app、Google AI Studio、免费 API key、Gemini CLI、Google Flow,以及使用限制和注意事项。

Google 发布 Gemini 3.5 Flash 和 Gemini Omni 后,最实际的问题不是 benchmark,而是普通用户和开发者到底怎么用,哪些入口免费,哪些入口只是低门槛试用。

先说结论:

  • 想聊天、写作、看图、日常问答:优先用 Gemini app。
  • 想测试 Gemini 3.5 Flash 参数、提示词和多模态输入:用 Google AI Studio。
  • 想写程序调用 Gemini 3.5 Flash:用 AI Studio 生成 API key。
  • 想在终端里免费试用:可以看 Gemini CLI。
  • 想体验 Gemini Omni 的视频编辑:优先看 Gemini app 和 Google Flow。
  • 想做正式生产:不要依赖免费额度,应该转到付费 API 或 Vertex AI。

注意:免费额度、地区开放、订阅层级和模型下拉菜单会随时间变化。本文写作时间是 2026 年 5 月 20 日,正式使用前要以 Google 当前页面为准。

Gemini 3.5 Flash 免费用法一:Gemini app

最简单的入口是 Gemini app:

https://gemini.google.com/

使用方式很直接:

  1. 打开 Gemini。
  2. 登录 Google 账号。
  3. 在模型选择里找 3.5 Flash
  4. 直接开始对话。

这个入口适合普通用户。你可以用它做写作、总结、图片理解、文件内容分析、日常问答和简单规划。根据公开报道,Gemini 3.5 Flash 已面向全球用户开放,并可在 Gemini 的模型下拉菜单中选择。

限制也很明确:免费用户通常会有每日消息数量、地区和功能限制。如果超过限制,就需要等待额度刷新或升级订阅。

Gemini 3.5 Flash 免费用法二:Google AI Studio

如果你不是只想聊天,而是想调提示词、看参数、测试结构化输出,Google AI Studio 更合适:

https://aistudio.google.com/

基本流程:

  1. 登录 Google AI Studio。
  2. 新建 prompt。
  3. 在模型下拉菜单里选择 gemini-3.5-flash
  4. 输入提示词并运行。

AI Studio 的好处是控制能力更强。你可以调温度、系统指令、结构化输出、多图输入,还能把测试好的提示词导出成代码或 API 调用。

对开发者来说,AI Studio 是免费的试验台。先在这里把提示词和输入格式调好,再进入 API 接入,会少浪费很多额度。

Gemini 3.5 Flash 免费用法三:免费 API key

开发者最关心的是 API。AI Studio 可以创建 Gemini API key,用来调用 gemini-3.5-flash

基本流程:

  1. 打开 Google AI Studio。
  2. 找到 Get API key
  3. 选择或创建项目。
  4. 创建 API key。
  5. 把 key 保存到本地环境变量。

Python 示例:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
import os
from google import genai

client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])

response = client.models.generate_content(
    model="gemini-3.5-flash",
    contents="用三句话解释 Gemini 3.5 Flash 适合什么场景。"
)

print(response.text)

Node.js 示例:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });

const response = await ai.models.generateContent({
  model: "gemini-3.5-flash",
  contents: "用三句话解释 Gemini 3.5 Flash 适合什么场景。"
});

console.log(response.text);

curl 示例:

1
2
3
4
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Hello Gemini 3.5 Flash"}]}]}'

公开资料显示,AI Studio 免费层通常会给 Gemini Flash 模型一定的每日请求额度。不同时间、地区和账号状态可能不同,常见说法包括每天约 1,500 次请求、每分钟请求数限制和 token 限制。不要把这些数字写死进生产计划,正式上线前要查看 Google AI 当前定价和限制页面。

Gemini 3.5 Flash 免费用法四:Gemini CLI

如果你喜欢命令行,可以看 Gemini CLI。它适合临时脚本、代码库摘要、文件读取和终端里的快速问答。

安装方式通常是:

1
npm install -g @google/gemini-cli

然后运行:

1
gemini

CLI 更适合个人开发者日常使用,不适合生产集成。生产环境还是应该使用 API key、服务账号、权限控制和可审计的调用方式。

Gemini Omni 免费或低门槛用法:Gemini app 和 Google Flow

Gemini Omni 是面向视频创作和编辑的多模态模型。它的核心能力不是普通文本问答,而是用自然语言多轮修改视频,并引用图像、文本、视频、音频等输入。

Google DeepMind 页面给出的入口包括:

  • Gemini app。
  • Google Flow。
  • YouTube Shorts。

页面也说明,需要 Google AI 订阅,功能会因订阅层级和地区不同而变化。因此,Gemini Omni 的“免费用法”要更谨慎理解:有些入口可能允许免费用户看到或试用部分能力,但完整视频编辑能力可能需要订阅、地区开放或产品灰度。

如果你只是想体验,建议按这个顺序试:

  1. 先打开 Gemini app,查看是否有 Gemini Omni 或相关视频编辑入口。
  2. 再打开 Google Flow:https://flow.google/
  3. 如果你做短视频内容,再关注 YouTube Shorts 里是否出现 Omni 相关编辑能力。

如果入口不可见,通常不是你操作错了,而是账号、地区、订阅层级或灰度范围暂时不满足。

Gemini Omni 适合怎么用

Gemini Omni 更适合创作者,而不是普通聊天。

你可以尝试这些方向:

  • 上传或选择一段视频,让它改变风格。
  • 让视频中的某个动作变得更夸张。
  • 用一张参考图替换场景里的物体或角色。
  • 分多轮修改镜头、动作、环境和风格。
  • 把草图、参考图、音频或视频组合成一个新输出。

提示词可以写得像给剪辑师提要求:

1
保持原视频的人物和房间结构不变,把镜子触碰后的效果改成液体波纹,动作要自然,光线不要突然变化。

多轮编辑时,不要一次塞太多要求。更稳妥的做法是:

  1. 先改主体动作。
  2. 再改风格。
  3. 再改镜头角度。
  4. 最后调节声音、文字和节奏。

这样更容易保持一致性,也更容易定位是哪一步出了问题。

Gemini Omni Flash 开发者接入

Gemini Omni Flash 能做什么

官方文档把 Gemini Omni Flash 定位为高性能多模态模型,核心能力可以概括为三类:

  • 文生视频:输入文字提示,生成带音频的视频。
  • 图生视频:上传参考图片,再用提示描述动作、镜头和氛围。
  • 有状态视频编辑:基于上一轮生成的视频继续修改,不必完整重述所有画面细节。

它和传统视频模型的差异主要在“交互”。通过 Gemini API 的 Interactions API,一次生成或编辑会成为一个 interaction。后续请求可以引用之前的 interaction,让模型理解上下文,并尽量保留未被要求修改的内容。

最小调用方式

Gemini Omni Flash 使用 interactions.create 调用。最简单的文生视频请求只需要模型名和提示词:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
import base64
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A marble rolling fast on a chain reaction style track, continuous smooth shot."
)

with open("marble.mp4", "wb") as f:
    f.write(base64.b64decode(interaction.output_video.data))

如果直接走 REST API,请注意响应结构和 SDK 有差异。SDK 会提供 interaction.output_video 这样的便捷字段;REST 响应里通常需要从 steps 数组里的 model_output 找到视频内容。

控制画幅和输出

默认输出是横屏 16:9。如果要生成竖屏视频,可以在 response_format 中设置 aspect_ratio

1
2
3
4
5
6
7
8
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A futuristic city with neon lights and flying cars, cyberpunk style",
    response_format={
        "type": "video",
        "aspect_ratio": "9:16"
    }
)

这对短视频、广告素材和移动端内容尤其重要。建议在产品层把横屏和竖屏作为明确选项,而不是让用户只在提示词里描述,因为参数比自然语言更稳定。

图生视频怎么接入

图生视频的输入是图片加文本。图片可以作为动作参考、主体参考、风格参考或起始帧。最基本的输入结构是:

1
2
3
4
5
6
7
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input=[
        {"type": "image", "data": base64_image, "mime_type": "image/jpeg"},
        {"type": "text", "text": "Turn this into realistic footage, using the drawing only as a guide for movement."}
    ],
)

实际使用时,不要只写“让它动起来”。更好的提示应说明动作、镜头、场景、光效和需要保留的元素。例如产品图生成短视频时,可以写清楚产品应保持外观一致、镜头如何移动、背景如何变化,以及不要改变品牌标识。

如果输入里有多张图片,建议用 video_config.task 指明任务类型,减少模型猜测:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input=[
        {"type": "image", "data": base64_image, "mime_type": "image/jpeg"},
        {"type": "text", "text": "Use this image as a reference and generate a cinematic product shot."}
    ],
    generation_config={
        "video_config": {
            "task": "image_to_video"
        }
    },
)

task 可用于区分 text_to_videoimage_to_videoreference_to_videoedit。对应用开发来说,这是一个值得暴露给高级用户或内部模板系统的参数。

有状态视频编辑

有状态编辑是 Gemini Omni Flash 更像“创作工具”而不是“单次生成接口”的地方。第一轮生成视频后,第二轮可以用 previous_interaction_id 引用上一轮结果:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
first = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A woman playing violin outdoors."
)

second = client.interactions.create(
    model="gemini-omni-flash-preview",
    previous_interaction_id=first.id,
    input="Make the violin invisible. Keep everything else the same."
)

这里的关键不是写长提示,而是写准改动。官方提示指南也强调,视频编辑通常更适合短指令。要修改某个局部元素时,可以追加 Keep everything else the same.,减少模型把其他画面也一起改掉的概率。

编辑自己的视频

如果要编辑用户上传的视频,官方建议先通过 Files API 上传视频,再把文件 URI 作为输入传给 Gemini Omni Flash。原因很简单:视频文件可能很大,直接塞 base64 不利于请求体大小和稳定性。

接入这类功能时,产品层至少要处理四件事:

  • 上传后轮询文件状态,确认不再是 PROCESSING
  • 处理 FAILED 状态,并给用户可理解的失败原因。
  • 对大文件、长视频和高分辨率素材设置明确限制。
  • 在不支持上传视频编辑的地区隐藏或降级该功能。

官方文档也提醒,并非所有地区都支持编辑上传视频。面向全球用户时,不要把“可编辑模型生成视频”和“可编辑用户上传视频”混为一谈。

大视频建议使用 URI 传送

如果生成视频超过 4MB,建议在 response_format 里使用 delivery: "uri"。这样响应返回的是 Google 托管 URI,客户端再轮询状态并下载视频,而不是在 JSON 里直接返回一大段 base64。

这对 Web 应用很实用:前端可以先显示任务进度,后端负责轮询和下载,避免浏览器处理巨大的内嵌响应。需要注意的是,官方文档提到 GET /v1beta/interactions/{id} 目前可能仍会在 data 字段返回内嵌 base64,uri 字段只保证在初始创建响应或 SSE 流里提供。因此如果你的流程依赖 URI,最好在创建请求的响应阶段就保存好相关信息。

提示词写法:把镜头说清楚

Gemini Omni Flash 默认可能生成多个镜头。如果你需要单镜头,要明确写:

  • 单个不间断场景;
  • 连续镜头;
  • 不要场景剪辑。

如果你需要控制节奏,可以用自然语言描述时间点,例如“3 秒后人物进入画面”,也可以写成 [0-3s][3-6s] 这样的时间段。对广告、教程和产品展示来说,这比只描述画面更可控。

视频里需要文字时,也应该把文字内容直接写清楚。模型可以尝试渲染可读文字,但如果提示里没有定义招牌、字幕或屏幕文字,它可能会生成不稳定或无意义的文本。

当前限制

Gemini Omni Flash 预览版还有不少边界,接入前需要认真看一遍:

  • 欧洲经济区、瑞士和英国不支持上传和编辑包含未成年人的图片。
  • 某些可识别人物的图片不支持上传和编辑。
  • 欧洲经济区、瑞士和英国用户目前不能编辑上传视频,但可以编辑模型生成的视频。
  • 当前 API 不支持上传音频参考。
  • 不支持跨多个视频进行引用或推理。
  • 不支持视频扩展、视频插值和语音编辑。
  • 不支持预配吞吐量。
  • 不支持系统指令、温度、top_p、停止序列和负面提示等常见生成参数。
  • 不支持把 YouTube 视频作为媒体来源。

这些限制会直接影响产品设计。比如面向企业用户时,要把地区、人物素材、上传视频、审核策略和失败提示都放进流程,而不是只做一个输入框和生成按钮。

开发者接入建议

如果你准备把 Gemini Omni Flash 接进自己的应用,可以按这个顺序做:

  1. 先做文生视频 MVP,只支持 16:99:16 两种画幅。
  2. 增加图生视频,限制上传图片格式和大小,并提供提示模板。
  3. 再做有状态编辑,把每轮 interaction.id 存到任务记录里。
  4. 对大视频启用 URI 传送,避免 base64 响应拖垮前后端。
  5. 把地区限制、内容安全失败、文件处理失败和超时都做成明确状态。
  6. 最后再开放多图片参考、时间码、文字渲染和更复杂的镜头模板。

它现在更适合“创意工作流工具”而不是普通聊天接口。好的产品体验应该围绕任务来组织:生成短广告、让产品图动起来、替换背景、修改光效、加字幕、做竖屏版本,而不是把所有能力都塞进一个自由文本框。

Gemini Omni 的定位与能力

它解决的核心问题

传统视频编辑往往需要时间线、图层、遮罩、关键帧、调色、音轨和大量手动操作。AI 视频生成工具虽然可以从提示词生成片段,但经常存在两个问题:

  • 一次生成后不容易精细修改。
  • 多轮修改时人物、场景、风格和动作容易漂移。

Gemini Omni 想解决的是第二步:不是只生成一个视频,而是让用户像和剪辑师沟通一样,持续提出修改要求。

页面给出的说法是,它可以通过自然、分步骤的对话编辑任何视频。每次编辑都建立在前一次结果上,目标是保持一个连贯、统一的场景。

主要能力

Gemini Omni 的能力可以分成几类。

第一类是自然语言视频编辑。用户可以直接要求模型改变视频里的审美风格、动作或特效。例如让镜子像液体一样泛起波纹,让人物变成线稿、毛毡玩偶、透明全息线框,或者让整个环境变成 3D voxel art。

第二类是重构动作。它可以改变视频中发生的事情,例如放大手部形成的孔洞、让玩具发出对应动物声音、让建筑灯光随音乐点亮。

第三类是基于参考图像编辑真实视频。用户可以给出图像参考,再要求模型把某种建筑、太阳、飞行器或其它物体放进真实视频场景里。

第四类是多轮编辑保持一致性。页面展示了把小提琴手移动到参考图像环境、让小提琴消失、再把镜头改成越肩角度的连续编辑流程。这比一次性提示词更接近真实创作过程。

第五类是多输入引用。Gemini Omni 可以把图像、文本、视频、音频等输入整合成一个输出,支持风格迁移、动作迁移、角色替换、草图转视频等任务。

为什么它强调世界知识

Google 在页面里反复强调,Gemini Omni 不只是“画面变得真实”,而是结合 Gemini 的世界知识、物理直觉、历史、科学和叙事逻辑。

这点很重要。视频模型如果只追求画面质感,容易出现动作不合逻辑、物体关系混乱、文本和画面不同步的问题。Gemini Omni 的目标是让视频不仅看起来像,还要在故事、物理和语义上更连贯。

页面中的例子包括:

  • 大理石在链式反应轨道上滚动。
  • 用 claymation 解释蛋白质折叠。
  • 用拟物化 stop motion 解释海马体工作方式。
  • 让字母和画面里的物体对应出现。
  • 让屏幕文字按节奏逐词出现。

这些例子说明它不是单纯的短视频特效工具,而是试图把知识表达、叙事和视听生成放在一起。

和 Veo、Flow、Nano Banana 的关系

从 Google 当前产品线看,Gemini Omni 更像是多模态创作和编辑能力的一层入口。

Veo 更偏视频生成模型本身,强调电影感视频和音频生成。Google Flow 是面向创作者的 AI 创意工作室,适合组织镜头、素材和视频项目。Nano Banana 更偏图像创建和细节编辑。Gemini Omni 则强调“从任意输入到一致输出”的多模态编辑,尤其是视频上的多轮自然语言控制。

简单理解:

  • 想生成高质量视频:关注 Veo。
  • 想在创作工作流里组织视频项目:关注 Google Flow。
  • 想编辑图像:关注 Nano Banana。
  • 想用对话方式修改视频,并引用图片、文字、视频、音频:关注 Gemini Omni。

使用入口

页面给出的入口包括:

  • Gemini app。
  • Google Flow。
  • YouTube Shorts。

不过页面也说明,需要 Google AI 订阅,功能会因订阅层级和地区而不同。也就是说,并不是所有用户在所有地区都能立即使用完整能力。

对创作者来说,最值得关注的入口可能是 Google Flow,因为它更接近完整创意工作台。对普通用户来说,Gemini app 和 YouTube Shorts 可能是更低门槛的体验入口。

安全和内容标记

Gemini Omni 页面专门提到安全流程。Gemini Omni Flash 的开发与内部安全、安全责任团队合作,并进行了自动化评估、人工评估、人工红队、自动化红队和发布前伦理安全审查。

内容透明度方面,页面说明通过 Omni 在 Gemini app、Google Flow 或 YouTube 创建或编辑的内容,会包含不可感知的 SynthID 数字水印和 C2PA Content Credentials。用户可以通过 Gemini app 验证内容,后续也会扩展到 Chrome 和搜索。

这部分对视频模型尤其关键。视频生成和视频编辑越真实,越需要内容来源标识、滥用防护和验证工具。

适合哪些人

Gemini Omni 适合几类用户:

  • 想用自然语言快速修改视频的内容创作者。
  • 需要把草图、参考图、音频、视频素材整合成成片的设计团队。
  • 做短视频、广告概念、教育解释视频和产品视觉稿的人。
  • 想在 Google Flow 中构建 AI 视频工作流的创作者。
  • 关注多模态视频编辑能力边界的开发者和研究者。

但它也不一定适合所有场景。严肃商业片、品牌主视觉、影视制作、产品发布视频仍然需要人工审片、版权检查、事实校对和素材管理。AI 可以明显加速概念生成和初稿迭代,但不应替代最终审核。

免费使用时最容易踩的坑

第一,免费额度不是生产额度。免费 API key 适合测试、个人工具和原型,不适合承诺稳定服务。

第二,不要把敏感数据发到免费或第三方入口。尤其是未公开代码、客户资料、合同、密钥、财务表格和内部文档。

第三,注意数据使用设置。免费层可能有不同的数据使用策略,使用前要查看 AI Studio 或 Google 账号里的相关设置。

第四,视频能力通常比文本能力更受限。Gemini Omni 这类视频编辑功能可能受订阅、地区、排队、时长、分辨率和内容安全策略影响。

第五,第三方“无限免费 API”要谨慎。很多网关会限速、转发请求、记录日志,甚至要求不透明的支付方式。敏感任务不建议走这类入口。

应该选哪个入口

如果你是普通用户:

  • Gemini 3.5 Flash:用 Gemini app。
  • Gemini Omni:先看 Gemini app,再看 Google Flow。

如果你是创作者:

  • 用 Google Flow 体验 Omni 视频工作流。
  • 用 Gemini app 做脚本、分镜、提示词和素材说明。

如果你是开发者:

  • 用 AI Studio 调试提示词。
  • 用 API key 接入 gemini-3.5-flash
  • 用 Gemini CLI 做个人终端工作流。
  • 生产环境考虑 Vertex AI 或付费 API。

如果你是企业:

  • 不要依赖免费额度。
  • 重点看权限、日志、审计、数据驻留、合规和密钥管理。
  • 视频生成和编辑还要补充水印、内容审核和版权流程。

小结

Gemini 3.5 Flash 的免费使用路径比较清楚:Gemini app、Google AI Studio、AI Studio API key、Gemini CLI 都可以作为低门槛入口。它适合聊天、写作、编程、Agent 原型和多模态测试。

Gemini Omni 的重点是视频编辑和多模态创作,入口主要在 Gemini app、Google Flow 和 YouTube Shorts,但完整能力更可能受订阅和地区限制。它适合创作者先做体验和概念验证,不适合一开始就按稳定生产服务来规划。

最稳妥的策略是:文本和代码任务先用 Gemini 3.5 Flash 免费层试通;视频创作先用 Gemini Omni 在 Gemini app 或 Flow 里验证效果;真正要上线,再转向可审计、可计费、可控权限的正式方案。

参考来源: