メインコンテンツへスキップ
← ブログに戻る
お知らせSession 632026年2月20日by K.hirano

【速報・完全版】Gemini 3.1 Pro徹底解説 — 推論2倍超・思考シグネチャ・エージェント時代の幕開け

2026年2月19日リリースのGemini 3.1 Proを完全解説。ARC-AGI-2で77.1%(前世代比2倍超)、SWE-bench 80.6%を達成。Thinking Levels・思考シグネチャ・Context Caching最大90%削減・Batch API・Google Antigravityなど、開発者が知るべき全機能をベンチマーク比較表・料金表・プロンプト例付きで徹底解説。

#Gemini#Google#AI#LLM#速報#LLM比較#エージェント#gemini3

推論2倍超・思考シグネチャ・エージェント時代の幕開け

リリース日: 2026年2月19日 / 最終更新: 2026年2月20日

人工知能の発展において、2026年2月19日は一つの重要な転換点として記録されることとなった。Google DeepMindが発表したGemini 3.1 Proは、単なるマイナーアップデートではなく、AIが「対話の相手」から「実務を遂行する自律的エージェント」へと変貌を遂げるための**核心的な知能(Upgraded Core Intelligence)**として定義されている。

Gemini 1がネイティブなマルチモーダル性を導入し、Gemini 2が「思考(Thinking)」とツール利用の基礎を築いたのに対し、**Gemini 3シリーズはこれら全ての能力を統合し、あらゆるアイデアを具現化するための「核」**としての役割を担う。

1. Gemini 3.0との違いは?ベンチマークで徹底比較

Gemini 3.1 Proの進化を最も雄弁に物語るのは、その厳格なベンチマークスコアだ。

主要ベンチマーク比較(2026年2月時点)

ベンチマーク評価内容Gemini 3.1 ProGemini 3 ProGPT-5.2Claude Opus 4.6
ARC-AGI-2抽象的論理推論77.1%31.1%52.9%68.8%
GPQA Diamond大学院レベルの科学知識94.3%91.9%92.4%91.3%
HLE人間の限界に近い難解な推論44.4%37.5%34.5%40.0%
SWE-Bench Verifiedソフトウェア工学タスク80.6%76.2%80.0%80.8%
Terminal-Bench 2.0端末操作・エージェント機能68.5%56.9%54.0%65.4%
LiveCodeBench Pro競技プログラミング(Elo)288724392393
APEX-Agents長期的な実務タスク33.5%18.4%23.0%29.8%
MMMU-Proマルチモーダル推論80.5%81.0%79.5%73.9%

※ Thinking High モード使用時の数値。MMMU-Proのみ3.0 Proがわずかに上回るトレードオフあり。

特筆すべきは競技プログラミングEloレーティングが2439→2887と大幅上昇した点だ。人間のトップレベルに近い複雑なアルゴリズム設計・デバッグ能力を獲得しつつあることを意味する。

またAPEX-Agents(長期実務タスク)で前世代の18.4%から33.5%へと1.8倍の改善を記録。自律エージェントとしての実用性が劇的に向上している。

2. 技術的新機能:思考を制御する2大革新

2-1. Thinking Levels(推論レベル制御)

Gemini 3.1 Proでは新たに thinking_level パラメータが導入され、タスクの難易度に応じて「思考の深さ」を調整できるようになった。

レベル特徴推奨ユースケース
LOWレイテンシ・コスト最小単純な分類、チャット、高スループット処理
MEDIUM (新設)コスト・速度・精度のバランス日常的な実務タスクの大半
HIGH (デフォルト)最大推論深度多段階計画、コード生成、高度な関数呼び出し

「Medium」レベルの追加が特に重要だ。従来のDeep Thinkが長時間推論を必要としていたのに対し、Mediumは十分な精度を保ちながら実用的な速度でレスポンスを返す。実運用コストを大幅に削減できる。

2-2. 思考シグネチャ(Thought Signatures)

エージェント開発において最も革新的な技術が「思考シグネチャ」だ。モデルの内部推論プロセスを暗号化した形式で表現したもので、マルチターンのやり取りでモデルが「自らの過去の思考」を正確に引き継ぐための鍵となる。

具体的な動作フロー:

  1. エージェントが「航空券を検索」→ thoughtSignature が生成される
  2. 次のステップ「タクシーを予約」の際、前のシグネチャをリクエストに含める
  3. モデルの思考の連鎖が維持され、目的を見失わず一貫した行動を取る

このシグネチャが欠落・順序違いになるとAPIが400エラーを返すほど厳密に管理されており、エージェントが矛盾した行動を取るリスクが大幅に低減されている。

3. マルチモーダル機能の大幅拡張

3-1. アニメーションSVG生成

Gemini 3.1 Proの「アニメーションSVG」生成能力は、従来の画像生成モデルと一線を画す。ピクセルではなく純粋なコードとしてアニメーションを出力するため:

  • どんな解像度でも画質が劣化しない
  • ファイルサイズが極めて小さい
  • Webサイトのコードに直接埋め込み可能

実際のユーザー検証では、「ドラえもん」「ピカチュウ」のSVGや物理演算ベースのアニメーションが商業レベルの品質で生成されている。

3-2. YouTube URL直接解析

YouTubeのURLをプロンプトに含めるだけで、モデルが動画内容を直接解析できるようになった。動画のダウンロード・再アップロードが不要で、解析効率が劇的に向上している。

3-3. ファイル処理の強化

項目Gemini 3 ProGemini 3.1 Pro
ファイルアップロード上限20MB100MB
画像解像度制御なしmedia_resolution(Low/Medium/High)
コンテキストウィンドウ100万トークン100万トークン(出力64,000まで)

media_resolution パラメータにより、PDFのOCR理解にはMedium、詳細な画像解析にはHighを選択するなど、トークン消費と精度の最適化が可能になった。

4. Google Antigravity:エージェント第一のIDE

Google Antigravityは、Gemini 3.1 Proをエンジンとする新しいエージェント開発プラットフォームだ。

主要機能:

  • ミッションコントロール: エージェントの計画・実行・検証・反復を管理する指令室として機能
  • アーティファクト活用: タスクリスト・実装計画・スクリーンショット・ブラウザ記録を成果物として提示。開発者はドキュメントにコメントするようにフィードバックできる
  • 非同期実行: メイン作業をしている間、バックグラウンドでバグ修正・テスト生成・UI改善を並行実行

実際のエンジニアリングワークフロー:

  • セキュリティ監査: OWASP Top 10の問題を探索し、脆弱性シナリオと修正パッチを生成
  • レガシーコードの近代化: 100万トークンのコンテキストでリポジトリ全体を読み込み、古いフレームワークから最新環境への移行を計画・実行
  • 複雑な論理バグ特定: ドメイン固有のビジネスロジックを検証し、真理値表で矛盾点を指摘

5. 料金・コスト削減戦略

API基本料金(Gemini 3 Proと同額)

コンテキスト長入力(/1Mトークン)出力(/1Mトークン)キャッシュ読み取り
〜200,000$2.00$12.00$0.20
200,000〜1,000,000$4.00$18.00$0.40

コスト削減の3戦略

① Context Caching(最大90%削減) 大規模なシステム指示書・長期動画・リポジトリ全体など繰り返しの多いデータ入力は、一度キャッシュしたトークンを再利用することで入力コストを最大90%削減できる。最低4,096トークンから利用可能。

② Batch API(50%割引) リアルタイム性を必要としない大規模処理にはBatch APIが50%割引で使える。1回のバッチジョブで最大200,000件のリクエストを処理でき、24時間以内の完了が保証される。

③ Thinking Levelの使い分け 単純なタスクにはLow/Mediumを使い、不要な推論トークン(Thinking Budget)の消費を抑えることでレイテンシとコストを最適化できる。

APIレートリミット(Tier 1の目安)

項目制限値
RPM(分あたりリクエスト数)15(AI Studio確認可)
TPM(分あたりトークン数)1,000,000
RPD(日あたりリクエスト数)1,500

6. 実際の活用事例とプロンプト設計

科学・数学研究:Aletheia(数学研究エージェント)

Google DeepMindが構築した数学研究エージェント「Aletheia」はGemini 3.1 ProのDeep Thinkモードを原動力とする。自然言語による検証機能を備え、自ら生成した解答の欠陥を特定して反復的に修正。解けない問題に対して「失敗を認める」ことができ、研究者の効率を大幅に向上させている。

ビジネス分析:エグゼクティブレベルの洞察

財務報告を読み込ませた際、モデルは単なる要約を超えて財務シグナルを戦略的リスクと結びつけ、コンサルタントレベルのエグゼクティブメモを作成した。

推奨プロンプト構造(ビジネス分析):

terminal
以下の合成ビジネスレポートに基づき:
1. 利益率低下の根本原因を診断してください
2. 戦略的リスクを特定してください
3. データに基づいた3つのアクションを推奨してください
4. 回答をエグゼクティブ・メモの形式で提示してください

セキュリティ監査プロンプト例

terminal
あなたはセキュリティエンジニアです。以下のコードをOWASP Top 10について監査してください。
報告内容:(1)問題点、(2)深刻度(Low/Med/High)、(3)攻撃シナリオ、(4)コードDiffによる修正案。
関数シグネチャは変更しないでください。コード:

Tips: 環境変数やライブラリのバージョンを詳細に含めると、最初の提案が正解である確率が**63%→78%**に向上する。

ドメイン別の強みと留意点

ドメイン主な強み留意点
ソフトウェア開発長文精度84.9%・複雑なリファクタリングに強い特定ゲームのブロック名等で稀に幻覚あり
データサイエンス50MB超のJSON出力・統計解析と視覚化が正確巨大出力時の生成速度はやや遅め
カスタマーサポートツール呼び出しミス30%削減・関連性10%向上多言語meeting要約の話者識別が50%以上向上

7. 安全性評価の透明性

Gemini 3.1 ProはGoogle DeepMindの最新安全性評価基準に基づきテストされており、高度な知能を持ちながらもサイバー攻撃支援・危険情報生成といった「レッドライン」を越えないよう調整されている。

自動安全性評価の結果(3.0 Pro比):

評価軸変化
テキスト安全性+0.10% 改善
多言語安全性+0.11% 改善
不当な拒否(過剰反応)0.08% 削減(使い勝手向上)
画像→テキスト安全性0.33% 微減(偽陽性増加・手動確認でリスクなし)

**Situational Awareness(状況認識能力)**の評価では、他モデルが解決できなかった「最大トークン数の把握」「コンテキストサイズ変更の検知」「監視頻度の認識」をクリア。モデルが自らの動作環境を正確に把握して振る舞う能力が確認されている。

8. PC・自作er・ゲーマーへの影響

AIワークロード向けGPU需要のさらなる拡大

Gemini 3.1 ProのようなフロンティアモデルはクラウドAPIで使えるが、ローカルLLMの高性能化も進んでいる。VRAM 24GB以上のGPU(RTX 4090・RTX 5090等)を搭載した自作PCでのAI推論環境を整えるユーザーが増えることが予想される。

META-MARKのAIワークロード対応ページでは、各ワークロードに最適なGPU構成を解説している。

ゲームへの統合加速

APEX-Agents(長期実務タスク)で33.5%を達成したモデルは、ゲームNPCの自律的な意思決定・自然言語インターフェース・リアルタイム攻略アドバイスなど、ゲーミング体験を根本から変える可能性がある。

開発者コミュニティへの恩恵

SWE-bench 80.6% + GitHub Copilot統合により、日常のコーディング補助の水準が大幅に引き上げられる。Terminal-Bench 2.0でも68.5%を記録しており、ターミナル操作を伴う自動化スクリプトの作成にも強みを発揮する。

まとめ:自律型エージェント時代への招待状

Gemini 3.1 Proは、「.1」という謙虚な名称に反して実質的な世代交代を成し遂げた。

ポイント数値
ARC-AGI-2(抽象推論)77.1%(前世代31.1%の2.5倍)
SWE-bench(コーディング)80.6%
APEX-Agents(長期実務)33.5%(前世代の1.8倍)
Context Caching削減率最大90%
Batch API割引50%
ファイル上限100MB(5倍)

思考シグネチャによる安定したマルチターン対話、Antigravityによるエージェントのミッションコントロール、Context Cachingによる劇的なコスト削減——これらは「自律型エージェント」を現実のプロダクトへと落とし込むための最後のピースとなる。

Googleが目指すのは「より賢いAI」ではなく、人間の意図を読んで複数のツールを駆使し、アイデアを形にする真の実務パートナーをすべての人に届けることだ。Gemini 3.1 Proは、その遠大なビジョンを現実のものとするための、現時点で最も洗練されたフロンティアモデルと言える。

公式・参考リンク:

関連記事: AIワークロード対応GPU一覧 | GPUランキング | GPU性能比較

情報の鮮度: この記事は 2026年2月時点の情報をもとに執筆しています。

関連記事

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か
2026年9月3日
開発ログ

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か

約10時間放置したセッションの再開で 177k トークンが再書き込みされた実測を起点に、Claude Code で1時間キャッシュを空ターンで温め続ける価値を API 単価とサブスク枠の両面から損益分岐で計算しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
2026年9月3日
開発ログ

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
2026年9月3日
開発ログ

Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む

Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。

#Claude#Claude Code#Anthropic#LLM#ベンチマーク
月$200のClaude Codeを$138にした2日間 — z.ai GLM移行で踏んだ罠と、規約の本当の分かれ目
2026年8月27日
開発ログ

月$200のClaude Codeを$138にした2日間 — z.ai GLM移行で踏んだ罠と、規約の本当の分かれ目

Claude Code の接続先を z.ai の GLM へ差し替え、月$200を$138にした2日間の実測記録。踏んだ罠7つ、reasoning effort が外部バックエンドでも効くかの実測、そして「サブスク枠なら白」が成り立たない理由を公式ページの実読から整理します。

#Claude Code#GLM#LLM#コスト削減#実機検証

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。