メインコンテンツへスキップ
← ブログに戻る
開発ログ2026年9月29日by K.hirano

単価は同じでもxhighの評価費用は約7倍:Sonnet 5.5とGPT-6.1 Sol

同じ入力$2・出力$10でも、xhighのAA評価費用は約7倍。速度・賢さの天井・出力トークンから使い分けを判断します。

#Claude#GPT-6.1 Sol#Artificial Analysis#LLM比較#API#dev-log

同じ入力$2・出力$10なら、Claude Sonnet 5.5とGPT-6.1 Solは同じコストで使えるように見えます。実際にArtificial Analysisの同じeffort段を並べると、評価1課題あたりの費用はxhighでSonnet 5.5が$2.74、GPT-6.1 Solが$0.39でした。約7倍の差です。

ただし、安い側がすべて勝つわけではありません。GPT-6.1 Solはmedium〜xhighで、評価費用あたりの知能指数が高くなっています。一方、Sonnet 5.5は最初のトークンまでの速さと、max時の到達点で上回ります。単価ではなく、どこに計算量を使うモデルなのかを見る比較です。

Sonnet 5.5とGPT-6.1 Solは1日違いで登場した同価格帯のモデル

Sonnet 5.5は2026年9月28日、GPT-6.1 Solは9月29日に公開されました。GPT-6.1 SolはOpenAIのDevDay 2026で、Astra Ultrafastや月額500ドルの新Proプランなどと同じ日に発表されたモデルです(DevDay 2026の振り返り)。どちらも入力が1Mトークンあたり$2、出力が1Mトークンあたり$10です。GPT-6.1 Solにはキャッシュ済み入力$0.10という公式情報があります。Sonnet 5.5のキャッシュ料金はSonnet 5と同じと案内されていますが、今回の比較では具体額を扱いません。

両モデルともlow、medium、high、xhigh、maxの5段階を持ちます。APIの既定値はSonnet 5.5がhigh、GPT-6.1 Solがmediumです。名前だけを指定して使う場合、最初から同じ深さで動くわけではありません。

GPT-6.1 Solはmediumで知能指数が高く、費用は約3分の1

2026年9月30日に取得したArtificial Analysisの値では、mediumの知能指数はGPT-6.1 Solが47.8、Sonnet 5.5が40.7でした。評価1課題あたりの費用はそれぞれ$0.21と$0.59で、Solは知能指数が7.1高い一方、費用はSonnet 5.5の約3分の1です。

この差は、APIの入力単価が違うからではありません。評価で生成した出力トークンがSonnet 5.5では29M、GPT-6.1 Solでは15Mだったことが、課題単位の費用差につながっています。出力速度だけでなく、答えを出すまでにどれだけ考え続けるかが請求額に効く構造です。

highでも傾向は変わりません。GPT-6.1 Solは知能指数50.2、費用$0.32で、Sonnet 5.5は46.7、$1.08でした。mediumからhighへ上げたとき、Solは知能指数を2.4伸ばし、Sonnet 5.5は6.0伸ばしています。段を上げたときの伸び方は同じではありません。

Claude Sonnet 5.5・GPT-6.1 Sol・Claude Opus 5.5 の effort 段ごとの知能指数と評価1課題あたりの費用

GPT-6.1 SolとSonnet 5.5はxhighで知能指数が近づくが、費用は約7倍違う

xhighでは差の見え方が変わります。Sonnet 5.5は知能指数51.9、GPT-6.1 Solは51.0で、Sonnet 5.5が0.9上です。ところが評価費用はSonnet 5.5が$2.74、GPT-6.1 Solが$0.39。ほぼ同じ水準に達するための費用は、Sonnet 5.5のほうが約7倍になりました。

出力トークンはSonnet 5.5が100M、GPT-6.1 Solが36Mです。単価が同じでも、生成する量が約2.8倍違えば、課題単位の費用は同じになりません。ここが今回の比較で最初に確認したかった落とし穴です。

なお、ここでいう「評価1課題あたり費用」と「評価で使った出力トークン」は、Artificial AnalysisのIntelligence Index評価における値です。読者のAPI利用時にそのまま発生する請求額ではありません。実際の請求は入力文、出力長、キャッシュ、利用プロバイダーなどで変わります。

Sonnet 5.5はmaxでGPT-6.1 Solより高い到達点に届く

最上段では順位が逆転します。Sonnet 5.5 maxは知能指数56.0、GPT-6.1 Sol maxは51.8で、差は4.2です。Artificial Analysisの全674行ではSonnet 5.5 maxがClaude Opus 5.5 xhighと同点で2番手、GPT-6.1 Sol maxが10位でした。

ただし、Sonnet 5.5 maxは評価費用が$7.60で、出力トークンは410Mです。GPT-6.1 Sol maxは$0.72、67Mでした。Sonnet 5.5はxhighの51.9からmaxの56.0まで4.1伸びますが、Solはxhighの51.0からmaxの51.8まで0.8の伸びにとどまります。上限を買うために、Sonnet 5.5は大きな出力量を使う設計です。

この差は、GPT-6.1 Solの最上段でも届かない「あと一段の推論」が必要な最難関の課題で意味があります。一方、すべての処理をmaxにすると、費用と待ち時間が先に問題になります。この水準を取りに行く場合は、次に見るClaude Opus 5.5も候補に入ります。

Claude Opus 5.5は単価2倍でも、56.0の水準では評価費用が安い

同じ日のArtificial AnalysisにはClaude Opus 5.5の5段もそろっています。Opus 5.5の単価は入力$4・出力$20で、ここまでの2モデルのちょうど2倍です。それでも、評価1課題あたりの費用で並べると、上の水準では順番が入れ替わります。

effortGPT-6.1 SolSonnet 5.5Opus 5.5
low42.1・$0.13未掲載42.3・$0.55
medium47.8・$0.2140.7・$0.5951.2・$1.34
high50.2・$0.3246.7・$1.0853.6・$1.82
xhigh51.0・$0.3951.9・$2.7456.0・$3.46
max51.8・$0.7256.0・$7.6057.6・$5.98

(知能指数・評価1課題あたりの費用。2026年9月30日のArtificial Analysis)

知能指数56.0には、Opus 5.5 xhighとSonnet 5.5 maxが同点で並びます。評価費用はOpus 5.5 xhighが$3.46、Sonnet 5.5 maxが$7.60です。評価で使った出力トークンはOpus 5.5 xhighが100M、Sonnet 5.5 maxが410Mでした。単価が2倍でも、同じ水準に届くまでの出力量が少なければ、課題単位では安くなります。Opus 5.5 maxは57.6で全674行の1位、評価費用は$5.98でした。

一方、51前後の水準ではGPT-6.1 Solが有利なままです。Sol xhighは51.0・$0.39、Opus 5.5 mediumは51.2・$1.34、Sonnet 5.5 xhighは51.9・$2.74でした。Opus 5.5はmediumの段でSolのmax(51.8)とほぼ同じ水準に届きますが、費用はSol xhighの3倍を超えます。

待ち時間は3モデルで最も長くなります。最初のトークンまではmediumで12.75秒、xhighで53.97秒でした。短い応答を速く返したい用途には向きません。

Sonnet 5.5はGPT-6.1 Solより返答開始が速い

最初のトークンまでの時間は、mediumでSonnet 5.5が0.81秒、GPT-6.1 Solが4.13秒でした。xhighでは15.04秒と37.54秒です。最初の一文字が出るまでの待ち時間は、同じ段ならSonnet 5.5のほうが短くなっています。

出力速度も、今回の表では全段でSonnet 5.5が上です。xhighではSonnet 5.5が109.7 tokens/s、GPT-6.1 Solが89.2 tokens/sでした。ただし、出力速度が速くても、考え始めるまでの時間や生成するトークン量が長ければ、完了までの時間は別に見なければなりません。

最初の応答を早く返したい会話、分類、短い委託では、mediumの0.81秒という差が扱いやすさに直結します。ここでSonnet 5.5を選ぶ判断は、知能指数の数字だけでは説明しきれません。

Claude Sonnet 5.5 と GPT-6.1 Sol の effort 段ごとの最初のトークンまでの待ち時間

Claude CodeとCodexで取り次ぎと重い思考を分けている

私はClaudeとChatGPTの両方を契約しています。Claude CodeのメインはOpus 5.5のeffort mediumです。そのうえで、Codexへの取り次ぎ役サブエージェント3体をSonnet 5.5 mediumで動かし、設計・救援はGPT-6.1 Sol xhigh、実装はGPT-6.1 Sol mediumに渡しています。2026年9月30日には、設計役と救援役をGPT-6 AstraからGPT-6.1 Solへ入れ替え、実装役のeffortをhighからmediumへ下げました。mediumの知能指数47.8・評価費用$0.21で、設計書どおりに手を動かす役には足りると判断したからです。

この分け方では、Sonnet 5.5に短い仕事と監視、結果の回収を任せます。返答開始が速いからです。一方で評価費用はmediumでもSolより高いため、長い推論はSonnet 5.5に抱え込ませません。重い設計や救援は、同じ段なら評価費用が低く、medium・highで知能指数も高かったGPT-6.1 Solへ渡します。

これはすべての構成に当てはまる結論ではありません。契約先を一つに絞る場合は、そのサービス内で既定effort、待ち時間、キャッシュ条件まで含めて選ぶ必要があります。

GPT-6.1 SolとSonnet 5.5は払う対象で使い分ける

迷うとしたら、「速く返す役にSonnet 5.5を置くか、最初からSolに寄せるか」と「最難関だけ上の水準へ上げるとき、何を使うか」の二点だと思います。

私の判断では、通常のAPI処理や重い推論を費用効率で回すならGPT-6.1 Solが扱いやすいです。mediumで47.8、xhighで51.0に届き、同じ段のSonnet 5.5より評価費用が低いからです。応答開始の速さを優先する処理ではSonnet 5.5を残します。知能指数の上限を取りに行く用途では、単価が2倍でもClaude Opus 5.5のxhighかmaxを先に検討します。56.0の水準に評価費用$3.46で届き、Sonnet 5.5 maxの$7.60より安いからです。

同じ$2/$10という表示だけで選ぶと、比較の重要な部分を見落とします。GPT-6.1 Solは少ない出力トークンで評価スコアを伸ばし、Sonnet 5.5は応答開始の速さを持ち、Opus 5.5は単価の高さを出力量の少なさで取り返して上の水準を取りに行く。私なら、契約先を決めたあとに、medium・high・xhighを実際の仕事ごとに分けます。

Artificial Analysisの比較条件

  • データ基準日は2026年9月30日。数値はArtificial Analysisの同日データから取得。
  • Sonnet 5.5のAA行はすべてDefault Fallback条件。GPT-6.1 Solとの測定条件が完全に同一とは限らない。
  • Claude Opus 5.5のAA行もすべてDefault Fallback条件。評価費用と出力トークンは各モデルページの記載値(low・high・maxは同日に追加で取得)。
  • Sonnet 5.5のlowは同日未掲載。2026年9月29日の値は知能指数35.8だが、費用と出力トークンは比較対象にしていない。

Sonnet 5.5のeffortごとの読み方はClaude Sonnet 5.5 effortガイド、GPT-6.1 SolはGPT-6.1 Sol effortガイドに分けて整理しています。Opus 5.5との比較条件を確認したい場合はClaude Opus 5.5 effortガイドも参照してください。

出典: Artificial Analysis(Opus 5.5はxhigh・maxほか各effortのモデルページ)。公式仕様はClaude Sonnet 5.5の変更点、Sonnet 5.5のプロンプトガイド、OpenAIによるGPT-6.1 Solの発表、GPT-6.1 Sol APIモデルページを確認しています。

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

Anthropicリーク2連発:Claude MythosとClaude Code流出で見えたKAIROS、BUDDY、Undercover Modeの正体
開発ログ2026年4月1日

Anthropicリーク2連発:Claude MythosとClaude Code流出で見えたKAIROS、BUDDY、Undercover Modeの正体

Anthropicの2週間で2回のリークを整理。Claude Mythosの位置づけ、Claude Code流出の中身、KAIROS/BUDDY/Undercover Modeの意味を分けて読む。

#Anthropic#Claude#Claude Code#リーク#AI開発
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
開発ログ2026年9月3日

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
Claude Code の新effortモード徹底解説|max・ultracode・autoと『呪文ultrathink』の正体
チュートリアル2026年5月30日

Claude Code の新effortモード徹底解説|max・ultracode・autoと『呪文ultrathink』の正体

Claude Code の /effort に増えた max・ultracode・auto と、プロンプトに紛れ込ませる呪文 ultrathink を、公式が明言した『ultracode は API の effort レベルではない』を起点に解剖。overthinking・自律ワークフロー・永続性と優先順位の罠まで、誤解されやすい論点を一次情報で正します。

#Claude#ClaudeCode#Anthropic#AIエージェント#LLM
Claude Code の /effort 完全ガイド|low〜maxの使い分けと『コストが増える本当の理由』
チュートリアル2026年5月30日

Claude Code の /effort 完全ガイド|low〜maxの使い分けと『コストが増える本当の理由』

Claude Code の /effort(low〜max・ultracode・auto)は「賢さ」ではなく「トークンの気前よさ」のレバー。モデル別の推奨スタートと、Opus 4.8 でコストが増えた気がする原因を『トークナイザ』と『effort』の2軸に切り分ける考え方を、公式一次情報と v2.1.156 の実機確認で解説します。

#Claude#ClaudeCode#Anthropic#LLM#AIエージェント

AI年表で詳しく見る

📅

Claude Sonnet 5.5

Claude Sonnet 5.5——料金は Sonnet 5 のまま、「速さと賢さの最良の組み合わせ」をうたう中位モデル

→

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。