Android での Gemma 4 のインストールと実行: 開始するための完全なガイド

Android 12以降にGoogle AI Edge Galleryを導入し、Gemma 4のオフライン推論と内蔵benchmarkを検証する手順。

携帯電話で Gemma 4 をオフラインで体験したい場合は、この記事でインストールから実際の機能までを段階的に説明します。

ステップ 1: アプリを入手する

Google AI Edge Gallery は現在 Google Play から入手でき、Android 12以降が必要です。まず公式ストアを利用してください。

Google Playを利用できない場合だけ、公式GitHub ReleasesからAPKをサイドロードします。第三者のAPKサイトは使わず、インストール後はブラウザの「この提供元を許可」を無効に戻してください。

Android デバイスで次のように入力します。

设置 -> 应用 -> 特殊应用权限 -> 安装未知应用

それから:

  1. 使用しているブラウザ (Chrome や Firefox など) を見つけて、[このソースからの許可] をオンにします。
  2. モバイル ブラウザで Google AI Edge Gallery の GitHub リリース ページを開きます。
  1. 最新の .apk インストール パッケージをダウンロードします。
  2. ダウンロードが完了したら、通知バーまたはファイル マネージャーでインストール パッケージをクリックし、プロンプトに従ってインストールを完了します。

インストールとモデル取得の時間は回線、バージョン、モデルサイズで変わるため、固定の2分という目安は使えません。

ステップ 2: 初めて開いて認証する

AI Edge Gallery を初めて開くと、アプリケーションはモデル ファイルを保存するためのストレージ アクセス許可を要求します。直接許可することをお勧めします。許可しない場合、アプリケーションはモデルをダウンロードまたはロードできません。

通常、ホームページには次の入り口が表示されます。

  • Ask Image: 画像理解タスク (画像の説明、画像に関する質問に答える)
  • AI Chat: 通常のテキスト会話
  • Summarize: テキストを貼り付けて概要を生成します
  • Smart Reply: 返信候補の生成

ほとんどのユーザーが最もよく使用するのは AI Chat です。

ステップ 3: Gemma 4 モデルをダウンロードする

  1. AI Chat」と入力します。
  2. プロンプトに従って「Get Models」をクリックします。
  3. モデルリストで Gemma 4 バージョンを選択します (対応するボリュームが表示されます)。
  4. デバイスの性能に応じてモデルを選択します。電話機が 8GB RAM の場合は、最初に Gemma 4 4B から開始できます。
  5. Download をクリックすると、バックグラウンドでダウンロードが開始されます。

注: モデルが大きいほど、ダウンロード時間は長くなります。複数のモデルをダウンロードし、必要に応じて後で切り替えることもできます。ダウンロードしたモデルはローカルに保存されるため、再度ダウンロードする必要はありません。

ステップ 4: 会話を開始する

モデルのダウンロードが完了したら、次のようにします。

  1. モデル名をクリックしてロードします (モデルのサイズとデバイスの機能に応じて、最初のロードには通常 10 ~ 30 秒かかります)。
  2. チャット ボックスに質問を入力して送信してください。
  3. モデルはローカルで応答を生成し、データはクラウドにアップロードされません。

一般に、最初の応答はわずかに遅くなりますが、これはモデルがウォームアップするときの正常な現象です。通常、同じセッション内での後続の応答はより速くなります。

ステップ 5: ビジュアル機能を体験する (Gemma 4 マルチモーダル)

Gemma 4 マルチモーダル バージョンをダウンロードした場合:

  1. メインメニューに戻り、「Ask Image」と入力します。
  2. 写真を選択するか、直接写真を撮ります。
  3. 尋ねたい質問を入力します (たとえば、「この写真には何が写っていますか?」または「この写真のどのテキストに注意を払う必要がありますか?」)。
  4. モデルがローカルで分析され、結果が返されるまで待ちます。

モデル推論は端末上で実行できますが、外部Skillの通信は個別に確認してください。

Benchmark とオフライン動作の確認

端末、SoC、Androidとアプリのバージョン、完全なモデル名と量子化、空きメモリ、first token時間、継続token/s、クラッシュやサーマルスロットリングを記録します。同じbenchmarkを2回実行し、1回目はロードとウォームアップ、2回目は継続性能として扱います。

モデル取得後に機内モードで固定プロンプトを実行します。生成できれば中核の推論経路はオフラインです。ただし外部Agent Skillsは通信を必要とする場合があります。

ロードできない場合はメモリを解放して小さいモデルを選びます。クラッシュや高温時はコンテキストを減らしてテストを停止します。APKの失敗時はAndroid 12以降、公式配布元、署名の異なる旧版を確認してください。