生成AI · 2026.07.29

Gemini 3.6 Flashと3.5 Flash-Liteはどう使い分ける?7月21日GAの価格・速度・subagent設計を整理する導入判断ガイド【2026年速報】

Gemini 3.6 Flashと3.5 Flash-Liteはどう使い分ける?7月21日GAの価格・速度・subagent設計を整理する導入判断ガイド【2026年速報】

Gemini 3.6 FlashとGemini 3.5 Flash-Liteは、どちらも2026年7月21日にGAとなったGoogleの最新Flash系モデルです。今回の更新で押さえるべきポイントは明快で、3.6 Flashは精度を落とさず出力量と実行ループを減らした主力モデル、3.5 Flash-Liteは大量のsubagent処理や文書抽出を低コストで回すための量産モデル、という役割分担がはっきりしました。すでに3.5 Flashを使っている企業ほど、料金とワークフローの見直し余地が大きい更新です。

Gemini 3.6 Flashと3.5 Flash-Liteで何が変わったのか

Googleの公式発表では、Gemini 3.6 Flashは3.5 Flash比で出力トークン消費を17%削減し、より少ないreasoning stepsとtool callsで複数段階のワークフローを完了できると説明されています。加えて、DeepSWEでは49%対37%、MLE Benchでは63.9%対49.7%、OSWorld-Verifiedでは83.0%対78.4%と、コード修正・研究支援・computer use系の指標でも改善が示されました。つまり今回の価値は、単に新モデルが増えたことではなく、agentic workflowの1タスク当たりコストを下げながら、不要な冗長出力や再実行を減らせる点にあります。

社内のAI導入で、どの業務を3.6 Flashへ寄せ、どこをLiteへ分離すべきか迷う場合は、 HelloCraftAIに相談してください 。PoC段階でモデル選定を誤ると、後から権限設計や予算管理まで巻き戻しになります。

料金と速度はどう見るべきか

料金面では、Gemini Developer APIのPaid Tierで3.6 Flashが入力100万トークン当たり1.50ドル、出力100万トークン当たり7.50ドルです。従来の3.5 Flashは入力1.50ドル、出力9.00ドルなので、入力は同額で出力単価だけ下がっています。3.5 Flash-Liteはさらに軽く、入力0.30ドル、出力2.50ドルです。大量の分岐処理、文書分類、翻訳、簡易抽出、subagentでの前処理のような仕事は、Liteに逃がすだけでAPI予算の圧縮効果が大きくなります。

速度面でも、Googleは3.5 Flash-Liteを高スループット向けに位置付けており、公式ブログではArtificial Analysis Indexベースで毎秒350出力トークンと紹介しています。重要なのは、Liteを『安いが機能が少ない下位互換』と見るのではなく、『大量処理で採算を合わせる専用レーン』として使うことです。逆に、複数ツールをまたぐ調査、コード変更、computer use、chartやPDFを跨いだ分析は3.6 Flashに寄せたほうが、リトライ回数とレビュー工数を減らしやすくなります。

機能差ではなく運用差で選ぶのが正解

3.6 Flashも3.5 Flash-Liteも、公式モデルページ上では入力がtext・image・video・audio・PDF、出力はtext、トークン上限はinput 1,048,576、output 65,536で揃っています。さらに、caching、code execution、computer use(preview)、file search、function calling、Google Maps grounding、search grounding、structured outputs、thinking、URL contextもどちらも対応です。スペック表だけ見ると似ていますが、実務では『同じ機能を持つ2モデル』ではなく『同じ道具箱を違う原価で回す2モデル』と理解したほうが判断しやすいです。

たとえば、営業提案書のたたき台生成、経営会議向けの要約、複数PDFをまたぐ比較、アプリ改修の差分提案は3.6 Flash向きです。一方で、問い合わせ分類、議事録の定型抽出、候補企業の一次スクリーニング、FAQの前処理、RAG前の整形は3.5 Flash-Lite向きです。1本のエージェントで全部を3.6 Flashに載せるより、重い判断だけ3.6 Flash、周辺の量産処理はLiteへ切り出す設計のほうが、予算統制もしやすくなります。

導入前に確認したい3つのチェックポイント

第1に、3.5 Flashから3.6 Flashへ切り替える業務を明確にすることです。特に、出力の長さがコストに直結していた運用では改善幅が見えやすくなります。第2に、subagentや前処理をLiteへ分離できるかを確認することです。部署横断で同じモデルを使い続けると、簡単な処理まで高単価で回りがちです。第3に、groundingやcomputer useを使うタスクでは、モデル単価だけでなく外部検索や操作回数も含めて見積もることです。Google Search groundingは無料枠超過後に従量課金がかかるため、単なる『本体価格比較』で判断すると予算差異が出ます。

よくある質問

Q. 既存の3.5 Flash利用者はすぐ移行すべきですか。A. 出力コストが重い業務、冗長な回答が問題だった業務、tool callが多い業務から優先移行する価値があります。Q. Liteは高性能用途に使えますか。A. できますが、重い判断や長い推論まで任せるより、高頻度の定型処理へ限定したほうが費用対効果は安定します。Q. 企業導入ではどちらを標準にすべきですか。A. 標準は3.6 Flash、ただし量産処理だけLiteを併用する二層構成が現実的です。FAQまで先に決めておくと、現場への説明や稟議資料も作りやすくなります。

結論として、7月21日のGAで見るべき論点は『どちらが高性能か』ではなく、『どこまで3.6 Flashへ寄せ、どこから3.5 Flash-Liteへ分業するか』です。モデル単価、トークン効率、出力の冗長さ、subagentの件数をまとめて設計できる会社ほど差が出ます。社内展開やPoCの整理が必要なら、 こちらからお問い合わせください 。要件に合わせて、生成AIの業務導入設計を支援します。