GoogleがGemini 3.5 FlashとGemini Omniを公開したあと、実用面で重要なのはbenchmarkではなく、一般ユーザーや開発者が実際にどう使うか、どの入口が無料で、どの入口が低いハードルの試用にすぎないかです。
まず結論です。
- チャット、文章作成、画像理解、日常的な質問:まずGemini app。
- Gemini 3.5 Flashのパラメータ、プロンプト、マルチモーダル入力を試す:Google AI Studio。
- プログラムからGemini 3.5 Flashを呼び出す:AI StudioでAPI keyを作成。
- ターミナルで無料試用する:Gemini CLIを確認。
- Gemini Omniの動画編集を体験する:Gemini appとGoogle Flowを優先。
- 本番利用する:無料枠に依存せず、有料APIまたはVertex AIへ移行。
注意点として、無料枠、地域ごとの提供状況、サブスクリプション階層、モデル選択メニューは時間とともに変わります。この記事の執筆日は2026年5月20日です。正式に使う前に、Googleの最新ページを確認してください。
Gemini 3.5 Flashを無料で使う方法1:Gemini app
最も簡単な入口はGemini appです。
使い方はシンプルです。
- Geminiを開く。
- Googleアカウントでログインする。
- モデル選択で
3.5 Flashを探す。 - そのまま対話を始める。
この入口は一般ユーザーに向いています。文章作成、要約、画像理解、ファイル内容の分析、日常的な質問、簡単な計画づくりに使えます。公開情報によると、Gemini 3.5 Flashは世界中のユーザー向けに提供されており、Geminiのモデル選択メニューから選べます。
制限も明確です。無料ユーザーには通常、1日のメッセージ数、地域、機能の制限があります。上限を超えた場合は、枠が回復するのを待つか、サブスクリプションをアップグレードする必要があります。
Gemini 3.5 Flashを無料で使う方法2:Google AI Studio
単にチャットしたいのではなく、プロンプトを調整したり、パラメータを見たり、構造化出力を試したりしたい場合は、Google AI Studioのほうが適しています。
基本的な流れは次の通りです。
- Google AI Studioにログインする。
- 新しいpromptを作成する。
- モデル選択で
gemini-3.5-flashを選ぶ。 - プロンプトを入力して実行する。
AI Studioの利点は、制御できる範囲が広いことです。温度、システム指示、構造化出力、複数画像入力を調整でき、試したプロンプトをコードやAPI呼び出しとして書き出すこともできます。
開発者にとって、AI Studioは無料の実験台です。ここでプロンプトと入力形式を整えてからAPI連携に進むと、無駄な枠消費を減らせます。
Gemini 3.5 Flashを無料で使う方法3:無料API key
開発者が最も気にするのはAPIです。AI Studioでは、gemini-3.5-flash を呼び出すためのGemini API keyを作成できます。
基本的な流れは次の通りです。
- Google AI Studioを開く。
Get API keyを探す。- プロジェクトを選ぶか作成する。
- API keyを作成する。
- keyをローカルの環境変数に保存する。
Pythonの例:
|
|
Node.jsの例:
|
|
curl の例:
|
|
公開情報では、AI Studioの無料枠はGemini Flashモデルに一定の1日あたりリクエスト枠を提供することが多いとされています。時期、地域、アカウント状態によって異なり、よくある説明には1日約1,500リクエスト、分あたりリクエスト制限、token制限などがあります。これらの数字を本番計画に固定してはいけません。正式公開前にはGoogle AIの最新の料金と制限ページを確認してください。
Gemini 3.5 Flashを無料で使う方法4:Gemini CLI
コマンドラインが好きなら、Gemini CLIを見てみる価値があります。臨時スクリプト、コードベースの要約、ファイル読み取り、ターミナルでの素早い質問に向いています。
通常のインストール方法は次の通りです。
|
|
その後、実行します。
|
|
CLIは個人開発者の日常利用に向いており、本番統合には向いていません。本番環境ではAPI key、サービスアカウント、権限制御、監査可能な呼び出し方式を使うべきです。
Gemini Omniを無料または低いハードルで使う方法:Gemini appとGoogle Flow
Gemini Omniは動画制作と編集に向けたマルチモーダルモデルです。中心的な機能は通常のテキストQ&Aではなく、自然言語で動画を複数回編集し、画像、テキスト、動画、音声などの入力を参照することです。
Google DeepMindのページでは、次の入口が示されています。
- Gemini app。
- Google Flow。
- YouTube Shorts。
ページでは、Google AIのサブスクリプションが必要であり、機能は契約階層や地域によって変わるとも説明されています。そのため、Gemini Omniの「無料利用」は慎重に理解する必要があります。一部の入口では無料ユーザーが一部機能を見たり試したりできる可能性がありますが、完全な動画編集機能にはサブスクリプション、地域提供、段階的ロールアウトが必要な場合があります。
試してみたいだけなら、次の順番がおすすめです。
- まずGemini appを開き、Gemini Omniまたは関連する動画編集入口があるか確認する。
- 次にGoogle Flowを開く:https://flow.google/
- ショート動画を作る場合は、YouTube ShortsにOmni関連の編集機能が出ているか確認する。
入口が見えない場合、通常は操作ミスではありません。アカウント、地域、サブスクリプション階層、ロールアウト対象がまだ条件を満たしていないだけのことがあります。
Gemini Omniに向いている使い方
Gemini Omniは通常のチャットより、クリエイター向けです。
次のような使い方を試せます。
- 動画をアップロードまたは選択し、スタイルを変更する。
- 動画内の特定の動きをより誇張する。
- 参照画像を使って、シーン内の物体やキャラクターを置き換える。
- 複数回に分けてカメラ、動き、環境、スタイルを修正する。
- スケッチ、参照画像、音声、動画を組み合わせて新しい出力を作る。
プロンプトは編集者への指示のように書けます。
|
|
複数回編集する場合、一度に多くの要求を詰め込まないほうが安定します。より安全な進め方は次の通りです。
- まず主体の動きを変える。
- 次にスタイルを変える。
- 次にカメラ角度を変える。
- 最後に音、文字、リズムを調整する。
こうすると一貫性を保ちやすく、どの段階で問題が出たかも特定しやすくなります。
Gemini Omni Flash の開発者向け統合
Gemini Omni Flash でできること
公式ドキュメントでは、Gemini Omni Flash は高性能なマルチモーダルモデルとして位置づけられています。主な機能は次の 3 つです。
- テキストから動画:テキストプロンプトを入力し、音声付きの動画を生成する。
- 画像から動画:参照画像をアップロードし、動き、カメラ、雰囲気をプロンプトで指定する。
- 状態を引き継ぐ動画編集:前回生成した動画をもとに編集を続け、すべての画面要素を説明し直さずに済ませる。
従来の動画モデルとの違いは、主に「インタラクション」にあります。Gemini API の Interactions API では、1 回の生成や編集が 1 つの interaction になります。後続のリクエストは以前の interaction を参照できるため、モデルは文脈を理解し、変更を要求されていない内容をできるだけ維持できます。
最小の呼び出し方
Gemini Omni Flash は interactions.create で呼び出します。最もシンプルなテキストから動画のリクエストでは、モデル名とプロンプトだけを指定します。
|
|
REST API を直接使う場合は、レスポンス構造が SDK と異なる点に注意してください。SDK では interaction.output_video のような便利なフィールドが用意されていますが、REST レスポンスでは通常、steps 配列内の model_output から動画コンテンツを探す必要があります。
アスペクト比と出力を制御する
デフォルトの出力は横長の 16:9 です。縦長動画を生成したい場合は、response_format で aspect_ratio を設定します。
|
|
これは短尺動画、広告素材、モバイル向けコンテンツで特に重要です。プロダクト側では、横長と縦長を明確な選択肢として用意するほうがよいです。自然言語プロンプトだけに任せるより、パラメータのほうが安定します。
画像から動画を組み込む
画像から動画では、画像とテキストを組み合わせて入力します。画像は、動きの参照、被写体の参照、スタイルの参照、または開始フレームとして使えます。基本的な入力構造は次のとおりです。
|
|
実際に使うときは、「動かして」とだけ書かないほうがよいです。より良いプロンプトでは、動き、ショット、場面、ライティング、保持すべき要素を明確にします。たとえば製品画像から短い動画を生成する場合、製品の外観とブランドロゴを変えないこと、カメラをどう動かすか、背景をどう変えるかを指定します。
入力に複数の画像がある場合は、video_config.task でタスク種別を明示し、モデルの推測を減らすのがおすすめです。
|
|
task は text_to_video、image_to_video、reference_to_video、edit を区別するために使えます。アプリ開発では、上級ユーザーや社内テンプレートシステムに公開する価値のあるパラメータです。
状態を引き継ぐ動画編集
状態を引き継ぐ編集は、Gemini Omni Flash を単発の生成 API ではなく、制作ツールらしく見せる部分です。1 回目で動画を生成したあと、2 回目のリクエストでは previous_interaction_id で前回の結果を参照できます。
|
|
ここで大事なのは長いプロンプトを書くことではなく、変更点を正確に書くことです。公式のプロンプトガイドでも、動画編集では短い指示のほうが適していることが多いとされています。局所的な要素を変更するときは、Keep everything else the same. を追加すると、関係ない画面まで変わってしまう可能性を下げられます。
自分の動画を編集する
ユーザーがアップロードした動画を編集する場合、公式ドキュメントでは、まず Files API で動画をアップロードし、そのファイル URI を Gemini Omni Flash に渡す方法が推奨されています。理由は単純です。動画ファイルは大きくなりやすく、base64 を直接リクエストに入れると、サイズと安定性の面で扱いづらくなるからです。
この機能を組み込む場合、プロダクト層では少なくとも次の 4 点を扱う必要があります。
- アップロード後にファイル状態をポーリングし、
PROCESSINGではなくなったことを確認する。 FAILED状態を処理し、ユーザーが理解できる失敗理由を表示する。- 大きなファイル、長い動画、高解像度素材に明確な制限を設ける。
- アップロード動画の編集に対応していない地域では、この機能を非表示または縮退させる。
公式ドキュメントでも、すべての地域でアップロード動画の編集がサポートされるわけではないと説明されています。グローバル向けのプロダクトでは、「モデルが生成した動画を編集できる」ことと「ユーザーがアップロードした動画を編集できる」ことを同じ機能として扱わないほうがよいです。
大きな動画では URI 配信を使う
生成される動画が 4MB を超える場合は、response_format で delivery: "uri" を使うのがおすすめです。これにより、レスポンスには Google がホストする URI が返り、クライアントは状態をポーリングして動画をダウンロードできます。巨大な base64 を JSON に埋め込む必要がありません。
Web アプリでは特に便利です。フロントエンドはタスク進行状況を表示し、バックエンドがポーリングとダウンロードを担当できます。ブラウザで巨大なインラインレスポンスを処理する必要がなくなります。ただし注意点があります。公式ドキュメントによると、GET /v1beta/interactions/{id} は現時点で data フィールドに埋め込み base64 を返す場合があり、uri フィールドが保証されるのは初回作成レスポンスまたは SSE ストリームです。URI に依存するフローでは、作成レスポンスの段階で関連情報を保存しておくべきです。
プロンプト:ショットを明確にする
Gemini Omni Flash はデフォルトで複数ショットを生成することがあります。単一ショットが必要なら、明確に書きます。
- 単一の途切れないシーン。
- 連続したショット。
- シーンカットなし。
テンポを制御したい場合は、「3 秒後に人物がフレームに入る」のように自然言語で時間を説明できます。[0-3s]、[3-6s] のような時間範囲を書いてもよいです。広告、チュートリアル、製品紹介では、画面だけを説明するより制御しやすくなります。
動画内に文字を表示したい場合も、文字内容を明確に書くべきです。モデルは読める文字のレンダリングを試みますが、看板、字幕、画面上のテキストをプロンプトで定義していないと、不安定または意味のない文字が生成されることがあります。
現在の制限
Gemini Omni Flash プレビュー版には、導入前に確認すべき制限があります。
- 欧州経済領域、スイス、英国では、未成年者を含む画像のアップロードと編集はサポートされません。
- 識別可能な人物が含まれる一部の画像は、アップロードと編集に対応していません。
- 欧州経済領域、スイス、英国のユーザーは、現時点でアップロード動画を編集できません。ただし、モデルが生成した動画は編集できます。
- 現在の API は、音声参照のアップロードをサポートしていません。
- 複数の動画をまたいだ参照や推論はサポートされません。
- 動画の延長、動画補間、音声編集はサポートされません。
- provisioned throughput はサポートされません。
- システム指示、temperature、
top_p、停止シーケンス、ネガティブプロンプトなどの一般的な生成パラメータはサポートされません。 - YouTube 動画をメディアソースとして使うことはできません。
これらの制限はプロダクト設計に直接影響します。企業向けに提供する場合は、地域、人物素材、アップロード動画、審査ポリシー、失敗時の表示をワークフローに組み込むべきです。入力欄と生成ボタンだけで済ませるべきではありません。
開発者向けの導入ポイント
Gemini Omni Flash を自分のアプリに組み込むなら、次の順番が現実的です。
- まず
16:9と9:16だけをサポートするテキストから動画の MVP を作る。 - 画像から動画を追加し、アップロード形式とサイズを制限し、プロンプトテンプレートを用意する。
- 状態を引き継ぐ編集を追加し、各ターンの
interaction.idをタスク記録に保存する。 - 大きな動画では URI 配信を有効にし、base64 レスポンスでフロントエンドやバックエンドを圧迫しないようにする。
- 地域制限、コンテンツ安全性による失敗、ファイル処理失敗、タイムアウトを明確な状態として扱う。
- 最後に、複数画像参照、タイムコード、文字レンダリング、より複雑なショットテンプレートを開放する。
現時点では、通常のチャットインターフェースよりも「クリエイティブなワークフローツール」に向いています。よいプロダクト体験は、短い広告を作る、製品画像を動かす、背景を差し替える、光を変える、字幕を追加する、縦長版を作る、といったタスクを軸に整理するべきです。すべての機能を 1 つの自由入力欄に詰め込むべきではありません。
Gemini Omni の位置づけと機能
解決しようとしている問題
従来の動画編集には、タイムライン、レイヤー、マスク、キーフレーム、カラーグレーディング、音声トラック、そして多くの手作業が必要です。AI動画生成ツールはプロンプトからクリップを生成できますが、よくある問題が二つあります。
- 一度生成した結果を細かく修正しにくい。
- 複数回編集すると、人物、シーン、スタイル、動きがぶれやすい。
Gemini Omniが狙っているのはこの二つ目の段階です。単に動画を生成するのではなく、編集者と会話するように、ユーザーが継続して修正を依頼できるようにします。
ページでは、自然で段階的な会話を通じて任意の動画を編集できると説明されています。各編集は前回の結果に基づき、連続性のある統一されたシーンを維持することを目指します。
主な機能
Gemini Omniの機能はいくつかに分けられます。
一つ目は自然言語による動画編集です。ユーザーは動画の美的スタイル、動き、エフェクトの変更を直接依頼できます。たとえば、鏡を液体のように波立たせたり、人物を線画、フェルト人形、透明なホログラム風ワイヤーフレームに変えたり、環境全体を 3D voxel art に変換したりできます。
二つ目は動作の再構成です。手で作った穴を拡大する、玩具に対応する動物の鳴き声を出させる、建物の照明を音楽に合わせて点灯させる、といった形で、動画内で起きること自体を変えられます。
三つ目は参照画像に基づく実写動画の編集です。ユーザーは画像を参照として与え、建物、太陽、飛行物体、その他のオブジェクトを実写の動画シーンに配置するよう依頼できます。
四つ目は複数回の編集で一貫性を保つことです。ページでは、バイオリン奏者を参照画像の環境に移動し、バイオリンを消し、さらにショットを肩越しの角度に変える連続編集の流れが紹介されています。一度きりのプロンプトよりも、実際の制作プロセスに近い使い方です。
五つ目は複数入力の参照です。Gemini Omniは画像、テキスト、動画、音声などの入力を一つの出力に統合でき、スタイル転送、動作転送、キャラクター置換、スケッチから動画への変換などに対応します。
なぜ世界知識を強調するのか
Googleはページの中で、Gemini Omniは単に「映像をリアルにする」だけではなく、Geminiの世界知識、物理的直感、歴史、科学、物語の論理を組み合わせると繰り返し強調しています。
これは重要です。動画モデルが画質だけを追求すると、動きが不自然になったり、物体の関係が混乱したり、文字と映像が同期しなかったりしがちです。Gemini Omniの目標は、見た目だけでなく、ストーリー、物理、意味の面でも一貫した動画にすることです。
ページの例には次のようなものがあります。
- ビー玉が連鎖反応のコースを転がる。
- claymationでタンパク質の折りたたみを説明する。
- stop motion風に海馬の働きを説明する。
- 文字と画面内の物体を対応させて表示する。
- 画面上の単語をリズムに合わせて一語ずつ表示する。
これらの例から、Gemini Omniは単なるショート動画向けエフェクトツールではなく、知識表現、物語、映像と音声の生成をまとめようとしていることがわかります。
Veo、Flow、Nano Bananaとの関係
Googleの現在の製品ラインを見ると、Gemini Omniはマルチモーダルな制作と編集機能の入口に近い存在です。
Veo は動画生成モデルそのものに近く、映画的な動画と音声生成を重視します。Google Flow はクリエイター向けのAIクリエイティブスタジオで、ショット、素材、動画プロジェクトを整理する用途に向いています。Nano Banana は画像作成と細部編集に寄っています。Gemini Omniは「任意の入力から一貫した出力へ」というマルチモーダル編集を重視し、とくに動画での自然言語による複数回制御を前面に出しています。
簡単に整理すると、次のようになります。
- 高品質な動画を生成したいなら、Veoに注目。
- 制作ワークフローの中で動画プロジェクトを整理したいなら、Google Flowに注目。
- 画像を編集したいなら、Nano Bananaに注目。
- 会話形式で動画を修正し、画像、テキスト、動画、音声を参照したいなら、Gemini Omniに注目。
利用入口
ページで挙げられている入口は次の通りです。
- Gemini app。
- Google Flow。
- YouTube Shorts。
ただしページでは、Google AIのサブスクリプションが必要であり、機能は契約プランや地域によって異なるとも説明されています。つまり、すべてのユーザーがすべての地域で完全な機能をすぐに使えるわけではありません。
クリエイターにとっては、より完整な制作ワークスペースに近い Google Flow が特に重要な入口になりそうです。一般ユーザーにとっては、Gemini app と YouTube Shorts のほうが試しやすい入口になるでしょう。
安全性とコンテンツ表示
Gemini Omniのページでは安全プロセスにも触れています。Gemini Omni Flashの開発では、社内の安全性および責任あるAIチームと協力し、自動評価、人間による評価、人間のレッドチーミング、自動レッドチーミング、リリース前の倫理・安全レビューが行われたと説明されています。
コンテンツの透明性については、Gemini app、Google Flow、YouTubeでOmniを使って作成または編集されたコンテンツには、不可視の SynthID デジタルウォーターマークと C2PA Content Credentials が含まれるとされています。ユーザーはGemini appでコンテンツを検証でき、今後はChromeや検索にも拡張される予定です。
これは動画モデルでは特に重要です。動画生成と動画編集がリアルになるほど、出所表示、悪用防止、検証ツールの重要性は高まります。
向いているユーザー
Gemini Omniは次のようなユーザーに向いています。
- 自然言語で素早く動画を修正したいコンテンツクリエイター。
- スケッチ、参照画像、音声、動画素材を組み合わせて完成映像を作りたいデザインチーム。
- ショート動画、広告コンセプト、教育向け解説動画、製品ビジュアル案を作る人。
- Google FlowでAI動画ワークフローを構築したいクリエイター。
- マルチモーダル動画編集の限界を観察したい開発者や研究者。
ただし、すべての場面に向いているわけではありません。本格的な商業映像、ブランドのキービジュアル、映像制作、製品発表動画では、人によるレビュー、著作権確認、事実確認、素材管理が依然として必要です。AIはコンセプト生成や初稿の反復を大きく速めますが、最終確認の代わりにはなりません。
無料利用で踏みやすい落とし穴
第一に、無料枠は本番枠ではありません。無料API keyはテスト、個人工具、プロトタイプに向いていますが、安定したサービスを約束する用途には向きません。
第二に、機密データを無料または第三者の入口に送らないことです。未公開コード、顧客情報、契約書、キー、財務表、内部文書は特に注意が必要です。
第三に、データ利用設定を確認することです。無料枠には異なるデータ利用ポリシーがある場合があります。利用前にAI StudioやGoogleアカウントの関連設定を確認してください。
第四に、動画機能は通常、テキスト機能より制限が強くなります。Gemini Omniのような動画編集機能は、サブスクリプション、地域、待ち行列、長さ、解像度、コンテンツ安全ポリシーの影響を受ける可能性があります。
第五に、第三者の「無制限無料API」には注意が必要です。多くのゲートウェイは速度制限、リクエスト転送、ログ記録、不透明な支払い方法を伴います。機密タスクでは使わないほうが安全です。
どの入口を選ぶべきか
一般ユーザーなら:
- Gemini 3.5 Flash:Gemini appを使う。
- Gemini Omni:まずGemini app、次にGoogle Flowを見る。
クリエイターなら:
- Google FlowでOmniの動画ワークフローを試す。
- Gemini appで脚本、絵コンテ、プロンプト、素材説明を作る。
開発者なら:
- AI Studioでプロンプトをデバッグする。
- API keyで
gemini-3.5-flashを組み込む。 - Gemini CLIで個人用ターミナルワークフローを作る。
- 本番環境ではVertex AIまたは有料APIを検討する。
企業なら:
- 無料枠に依存しない。
- 権限、ログ、監査、データ所在地、コンプライアンス、キー管理を重視する。
- 動画生成と編集では、ウォーターマーク、コンテンツ審査、著作権フローも追加する。
まとめ
Gemini 3.5 Flashの無料利用経路は比較的わかりやすいです。Gemini app、Google AI Studio、AI Studio API key、Gemini CLIはいずれも低いハードルの入口になります。チャット、文章作成、プログラミング、Agentプロトタイプ、マルチモーダルテストに向いています。
Gemini Omniの重点は動画編集とマルチモーダル制作です。主な入口はGemini app、Google Flow、YouTube Shortsですが、完全な機能はサブスクリプションや地域制限の影響を受けやすいでしょう。クリエイターがまず体験や概念検証を行うには向いていますが、最初から安定した本番サービスとして計画するには向いていません。
最も堅実な戦略は、テキストとコードのタスクをまずGemini 3.5 Flashの無料枠で試し、動画制作はGemini appまたはFlowのGemini Omniで効果を確認し、本当に公開する段階で監査、課金、権限制御ができる正式な構成へ移行することです。
参考: