メインコンテンツへスキップ
← ブログに戻る
開発ログ2026年9月29日by K.hirano

GPT-6.1 Solをeffort別実測:medium 47.8、Astraとの差はどこまで縮むか

GPT-6.1 SolをDevDay 2026の発表とArtificial Analysisのeffort別実測で検証。旧Sol・Astraとの性能、費用、待ち時間から使い分けを判断します。

#GPT-6.1 Sol#GPT-6 Astra#Artificial Analysis#DevDay 2026#Codex#OpenAI API

GPT-6.1 Solは、Astraに近い性能を狙いながら、常用時の費用と待ち時間を抑えたい人にとって、かなり現実的な選択肢になりました。Artificial Analysisの2026年9月30日データでは、mediumが47.8で、旧GPT-6 Solのmax 47.5をすでに上回っています。xhighでも51.0まで伸び、Astra xhighの52.4との差は1.4ポイントです。

ただし、effortを上げれば比例して賢くなるわけではありません。highからxhigh、xhighからmaxの伸びはそれぞれ0.8ポイントに留まり、最初のトークンを待つ時間は大きく増えます。常用設定はmediumまたはhigh、難しい設計や救援だけxhigh、最難関の科学研究はAstraに残す。この線引きが、数字から見える使い方です。

GPT-6.1 SolはAstraとLunaの間を埋めるモデル

OpenAIは2026年9月29日のDevDay 2026で、GPT-6 SolのアップグレードとしてGPT-6.1 Solを発表しました。位置づけは、最上位のAstraと小型のLunaの間です。公式発表では、難易度の高いタスクでAstraに近づきつつ、標準料金をAstraの5分の1に抑えたモデルと説明されています。

API料金は入力が100万トークンあたり2ドル、キャッシュ済み入力が0.10ドル、出力が10ドルです。コンテキストは1,050,000トークンで、最大入力は922,000、最大出力は128,000トークン。reasoning effortはlow、medium、high、xhigh、maxに分かれ、mediumが既定値です。noneとminimalには対応しません。

公式ベンチマークでも、6.1 Solは単なる微調整とは扱われていません。DeepSWE v1.1では、約5分の1のコストでAstraと同等とされ、OSWorld 2.0ではmaxが旧Solを7ポイント上回り、Astraとの差は2.1ポイントでした。一方、Terminal-Bench Science 0.1の最高スコアはAstraの68.1%で、公式自身が最も難しい科学研究にはAstraを推奨しています。

同じDevDayでは、Astra Ultrafast、常時稼働エージェントのdots、Codex CLIの刷新、月額500ドルのProティアなども発表されました。6.1 Solだけを単独の新モデルとして見るより、OpenAIが開発作業をモデル選択とエージェントの組み合わせへ移そうとしている発表群の一部と見たほうが、位置づけをつかみやすいです。

Artificial Analysisの実測ではmediumの費用対効果が最も読みやすい

Artificial Analysisの2026年9月30日データでは、6.1 Solの知能指数はlowの42.1からmaxの51.8まで上がります。ただし、伸び方は均一ではありません。lowからmediumで5.7ポイント増える一方、mediumからhighは2.4ポイント、highからxhighとxhighからmaxは0.8ポイントずつです。

評価1課題あたりの費用は、lowが0.13ドル、mediumが0.21ドル、highが0.32ドル、xhighが0.39ドル、maxが0.72ドルでした。ここでいう費用は、AAのIntelligence Index評価で使われた出力量を基にした評価上の値であり、読者のAPI請求額そのものではありません。評価で使った出力トークンも、mediumの15Mからmaxの67Mまで増えています。

出力速度はmediumが74.1 token/s、highが78.3 token/s、xhighが89.2 token/s、maxが87.4 token/sです。速度だけを見ると上位effortが遅いとは限りませんが、実際に待つべきなのは最初のトークンまでの時間です。mediumは4.13秒、highは19.18秒、xhighは37.54秒、maxは118.50秒。maxは最初の返答まで約2分かかる計算になります。

GPT-6.1 Sol の effort 別の知能指数と評価1課題あたりの費用(参考に GPT-6 Astra xhigh)

出典: Artificial Analysis

GPT-6.1 Solはmediumで旧Sol maxを超えた

前世代のGPT-6 Solは、xhighで44.1、maxで47.5でした。6.1 Solはxhighで51.0となり、同じxhigh同士で6.9ポイント上がっています。しかもmediumの47.8が、旧Solのmax 47.5を上回りました。

費用も単純に上がっていません。旧Solと6.1 Solは標準の入力2ドル、出力10ドルという同じ料金ですが、AAの評価1課題では旧Sol xhighが0.52ドル、6.1 Sol xhighが0.39ドルでした。最初のトークンまでの時間も、旧Sol xhighの33.58秒に対して6.1 Sol xhighは37.54秒なので、待ち時間が常に短くなったわけではありません。この点は「新モデルだから速い」とまとめないほうが安全です。

旧Solから乗り換える判断で迷うとしたら、mediumの手軽さを取るか、xhighまで上げて性能を取りに行くかの二択になりやすいと思います。少なくともAAの数値では、mediumを既定値にしても旧Sol max以上の知能指数が得られます。毎回xhighへ上げる前に、mediumで止める運用を試す意味はあります。

GPT-6.1 SolとAstra xhighの差は1.4ポイント、費用は約6分の1

Astra xhighの知能指数は52.4で、評価1課題あたり2.31ドル、最初のトークンまで74.01秒でした。6.1 Sol xhighは51.0、0.39ドル、37.54秒です。知能指数の差は1.4ポイント、費用は約6分の1、最初のトークンまでの待ちは約半分でした。出力速度も6.1 Sol xhighが89.2 token/s、Astra xhighが53.5 token/sです。

max同士では、6.1 Solが51.8、Astraが52.7です。費用は0.72ドル対3.26ドル、最初のトークンまでの時間は118.50秒対177.90秒でした。maxまで上げてもAstraとの差は0.9ポイントに縮まりますが、mediumからmaxへ移るための費用と待ち時間は大きくなります。

Astraを置き換えてよいかで迷う場合、見るべき差は「最高スコア」だけではありません。設計案の整理、API連携の検討、別系統からの救援といった仕事では、Astraとの差1.4ポイントより、1課題0.39ドルと37.54秒という運用上の軽さが効く場面があります。一方、公式がAstraを残している科学研究のような領域まで、6.1 Solで一律に置き換えられるとは確認できません。

GPT-6.1 Solへ設計役と救援役を移した

私は2026年9月30日、Codexへの委託で、設計役と救援役をGPT-6 AstraのxhighからGPT-6.1 Solのxhighへ入れ替えました。実装役はGPT-6.1 Solのhighにしています。Codex CLIの既定は6.1 Solのmedium、プランモードはxhighです。

判断材料は、xhigh同士の知能指数差が1.4ポイントだったこと、評価1課題の費用が約6分の1だったこと、最初のトークンまでの待ちが約半分だったことです。私の運用では、GPT系の設計役がDB、インフラ、OpenAI系API連携の設計を受け持ちます。救援役は、Claude系が2回以上空振りしたときに別系統の目として呼びます。

これはAstraが不要になったという意味ではありません。最難関の科学研究や、失敗したときの確認コストが非常に高い作業では、Astraの差を買う判断が残ります。逆に、設計のたたき台や実装の分解までAstraへ集約しているなら、6.1 Solへの移行で費用と待ち時間を下げられる余地があります。

GPT-6.1 Solはmedium〜highを常用し、xhigh以上は用途を選ぶ

6.1 Solのeffort選択は、次のように考えると扱いやすいです。

  • medium:既定値。旧Sol maxを上回る47.8で、最初のトークンまで4.13秒。常用の基準にしやすい
  • high:50.2まで上がるが、待ちは19.18秒。mediumで詰まった設計や実装に使う
  • xhigh:51.0。Astra xhighに1.4ポイント差で、費用と待ち時間のバランスが良い上限候補
  • max:51.8。mediumからの伸びは4.0ポイントだが、最初のトークンまで118.50秒。常用より限定用途向け

highから上は、1段上げても知能指数が0.8ポイントずつしか増えません。にもかかわらず、最初のトークンまでの待ちはhighの19.18秒からxhighの37.54秒、maxの118.50秒へ伸びます。性能差を回収できる仕事かどうかを、effort変更の前に決めておく必要があります。

GPT-6.1 Solは、Astraを完全に置き換えるモデルではありません。しかし、旧Solからの更新幅と、Astraに対する価格差を同時に見ると、開発作業の標準モデルとしては明確に使いやすくなっています。私なら、まずmediumを既定にし、highで詰まりを解消し、xhighは設計や救援に限定します。Astraは、公式が推奨する最難関の科学研究と、差額を払う価値を事前に説明できる仕事に残します。

effortを選ぶときは、知能指数だけでなく、最初のトークンまでの秒数と評価上の出力コストを同じ表で確認してください。そこを分けて考えると、6.1 Solは「安いAstra」ではなく、仕事の重さに合わせて待ち時間と費用を調整できるモデルとして見えてきます。

なお、DevDayの振り返りページには6.1 Solの料金をAstraの4分の1とする記述がありますが、GPT-6.1 Solの発表記事と料金表では5分の1です。この記事では、料金の数値に基づき5分の1を採用しました。ChatGPT WorkやCodexにおけるSolとAstraの利用上限の差は、確認できる出典がないため扱っていません。

関連資料として、旧SolとLunaの比較はGPT-6 SolとLunaのeffort別ガイド、Astraとの費用比較はGPT-6 AstraとFable 5.1のタスク単価比較、Claude系との比較はClaude Sonnet 5.5とGPT-6.1 Solの比較にまとめています。

参考リンク

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

GPT-5.6 Luna xhigh: 知能49・タスク単価$0.04・待ち時間40秒、安い理由まで実測
開発ログ2026年7月31日

GPT-5.6 Luna xhigh: 知能49・タスク単価$0.04・待ち時間40秒、安い理由まで実測

2026年7月30日の80%値下げ後、通常セッションのモデルをLunaに切り替えるべきか。OpenAI公式発表と第三者ベンチの実測データ(Intelligence Index、TTFT、タスク単価)から、API従量とCodex定額それぞれの判断材料を整理します。

#OpenAI#GPT-5.6#API#Luna#Terra
Codex CLI 0.112.0→0.114.0 で権限設計が変わった。request_permissions が実務で効く理由
開発ログ2026年3月11日

Codex CLI 0.112.0→0.114.0 で権限設計が変わった。request_permissions が実務で効く理由

Codex CLI 0.112.0から0.114.0で、権限要求の設計が段階的に進化。request_permissions、plugin拡張、承認フロー修正が実務でどう効くかを整理します。

#Codex#codex-cli#OpenAI#ai-agent#changelog
月3万円のCodex Pro 20xはAPI約80万円分?5時間枠を実開発ベースで換算した
開発ログ2026年9月9日

月3万円のCodex Pro 20xはAPI約80万円分?5時間枠を実開発ベースで換算した

Codex Pro 5x・20xの5時間枠をOpenAI公式の25 credits=$1レートでAPI料金へ換算し、Azure上で30日に流れた約4.97億トークンの実測と重ねて「APIで数千ドル」が起きる条件を示します。

#Codex#OpenAI#API料金#AIコーディング#開発環境
GPT-5.6 Sol×Terra、コスパ最強のEffort組み合わせは?実測で検証
チュートリアル2026年7月11日

GPT-5.6 Sol×Terra、コスパ最強のEffort組み合わせは?実測で検証

GPT-5.6 Sol(設計・計画役)とTerra(コーディング実装役)を組み合わせて使う際、どのreasoning effortが最もコスパが良いかをArtificial Analysisの実測データで検証。Solはhighで頭打ち、Terraはhighまで気軽に上げてよい理由を出典付きチャートで確認します。

#GPT-5.6#OpenAI#Artificial Analysis#reasoning effort#Sol

AI年表で詳しく見る

📅

GPT-6.1 Sol

GPT-6.1 Sol——DevDay 2026 で発表、Astra に迫る知能を Astra の5分の1の単価で

→

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。