メインコンテンツへスキップ
← ブログに戻る
開発ログ2026年9月29日by K.hirano

Sonnet 5.5 xhighは買いか、Claude Opus 5.5 mediumが得か

Claude Sonnet 5.5のeffort別実測と公式指針を整理。Sonnet 5からの破壊的変更、Opus 5.5との費用差、mediumの使いどころを解説します。

#Claude#Claude Sonnet 5.5#Claude Code#AI開発#ベンチマーク

Sonnet 5.5へ移すと、Sonnet 5で動いていた委託やツール呼び出しがそのまま通るのか。effortはmediumのままでよいのか、それともhighやxhighまで上げるべきなのか。この2点で迷う人向けに、公式のプロンプト指針とArtificial Analysis(AA)の2026年9月30日時点のデータを突き合わせました。

先に結論:mediumは取り次ぎ役に効く。成果物を直す仕事には固定しない

会話・分類・取り次ぎのような短い判断を大量に回すなら、Sonnet 5.5 mediumが最初の候補です。AAの知能指数は40.7、最初のトークンまでは0.81秒で、Sonnet 5の最上段max 38.2を上回っています。

ただし、これはmediumで実務品質が改善したという実測結果ではありません。私の環境では、Codexへ仕事を渡す取り次ぎ役のサブエージェント3体にmediumを適用しましたが、適用前後の完了率・停止率・確認漏れは測っていません。

反対に、コードの広範囲な変更、複数箇所にまたがるテスト失敗の原因調査、個人情報の検出のように成果物の正確さを直接問う仕事では、medium固定を前提にしません。途中停止や確認漏れが残るならhighへ上げ、それでもxhigh相当の判断が必要なら、Sonnet 5.5 xhighだけでなくOpus 5.5 mediumも同じ課題で比べます。

xhighの知能指数は51.9で、Opus 5.5 mediumの51.2と近い値です。しかし、AAの評価1課題あたりの費用は2.74ドル対1.34ドルでした。難しい処理を引き上げる場面では、同じClaude内ならOpus 5.5 mediumのほうが費用と待ち時間を読みやすい場合があります。

判断を一言でまとめると、次のとおりです。

  • 会話・分類・取り次ぎ:まずSonnet 5.5 medium
  • 途中停止や確認漏れがある処理:highで再測定
  • xhigh相当の品質が必要:Sonnet 5.5 xhighとOpus 5.5 mediumを同じ課題で比較
  • 広範囲のコード修正や検出精度が重要な処理:mediumのAA値だけで採用を決めない

この記事の判断は、AAの公開値、公式指針、そして私の環境での運用変更に基づくものです。自作のスクリーンショット個人情報隠しツールに公式指針の一文を足した前後の比較は、2026年9月30日時点でまだ実施していません。

Sonnet 5.5はmediumを基準に測り直すモデルです

Sonnet 5.5は2026年9月28日に公開され、モデルIDはclaude-sonnet-5-5です。公式の位置づけは、速さと賢さの組み合わせを狙ったモデルです。入力料金は100万トークンあたり2ドル、出力料金は10ドルで、Sonnet 5と同じです。トークナイザもSonnet 5と同じため、同じ文章を渡した場合のトークン数は変わりません。

ただし、思考の深さは旧モデルの設定をそのまま移せません。適応型思考が既定で有効になり、effortが思考量を決めます。Claude APIの既定値はhighですが、公式指針はSonnet 5の設定を持ち込まず、Sonnet 5.5で改めて測るよう求めています。

この再調整が重要なのは、mediumが単なる軽量設定ではないからです。AAの知能指数はmediumが40.7、highが46.7、xhighが51.9、maxが56.0でした。Sonnet 5のmaxは38.2なので、Sonnet 5.5 mediumは前世代の最上段を超えています。

出力速度はmediumが88.2 tokens/s、highが105.6 tokens/s、xhighが109.7 tokens/s、maxが145.3 tokens/sです。数字だけを見るとmaxが最速に見えますが、最初のトークンまでの時間はmediumの0.81秒からhighの7.65秒、xhighの15.04秒、maxの308.29秒へ伸びます。会話の取り次ぎで問題になるのは、生成中の速度より先に返事が始まるまでの待ち時間です。

今回の数値は、2026年9月30日にAAから取得した値です。知能指数・最初のトークンまでの時間・出力速度はAAの無料APIから、評価1課題あたりの費用と評価で使った出力トークンは各モデルのページから記録しました。AAはSonnet 5.5の各行を「Default Fallback」条件として掲載しています。

ここで注意したいのは、AAの知能指数が特定の実務を直接測る指標ではないことです。40.7と38.2の差はモデル選定の入口にはなりますが、停止率、確認漏れ、修正にかかる時間まで保証するものではありません。実務では同じ課題をmediumとhighで複数回通し、失敗の修正費用まで見て判断します。

出典: Artificial Analysis。数値は2026年9月30日に取得した同サイトのデータです。

Sonnet 5.5はeffortを上げるほど賢くなるが費用と待ち時間も増える

mediumからhighへ上げると知能指数は6.0伸びます。highからxhighでは5.2、xhighからmaxでは4.1の上昇です。ところがAAの評価1課題あたりの費用は、mediumの0.59ドル、highの1.08ドル、xhighの2.74ドル、maxの7.60ドルへ増えました。

特にmaxは、xhighに対して知能指数が4.1高い一方、評価費用は約2.8倍、最初のトークンまでの時間は約20倍です。maxを選べば常に得をする構造ではありません。品質の差が実際の失敗削減につながる作業だけで使う設定です。

ここでいう「評価1課題あたり費用」と「評価で使った出力トークン」は、AAのIntelligence Index評価における値です。読者のAPI請求額をそのまま示すものではありません。Sonnet 5.5では、mediumが29M、highが50M、xhighが100M、maxが410Mの出力トークンを評価で使っています。出力トークンが思考に使われるため、effortを上げると単価が同じでも評価費用が膨らみます。

lowの値を前日のものにしたのは、2026年9月30日のAA表示にlowの知能指数が掲載されていなかったためです。当日値として補間したのではなく、2026年9月29日の35.8を参考値として扱っています。lowを含む比較だけは、他のeffortと同じ日付の比較にならないため、medium以上より確度が一段落ちます。

計測条件は次のとおりです。

  • 基準日:2026年9月30日
  • 条件:AAの「Default Fallback」表示付きデータ
  • low:当日未掲載のため、前日の35.8を2026年9月29日の値として記載
  • 記録項目:知能指数、最初のトークンまでの時間、出力速度、評価1課題あたりの費用、評価で使った出力トークン

実務で私なら、まず同じ課題をmediumとhighで3回ずつ通し、完了率・途中停止・確認漏れ・不要な追加作業を記録します。たとえば「mediumで3回中1回が確認待ちで止まった」なら、知能指数の差よりhighへ上げる理由を説明しやすくなります。

この3回ずつの比較は、この記事で実施済みの実測ではありません。実際に完了しているのはAAのeffort別データの確認と、サブエージェント3体へのmedium適用です。mediumとhighの同一課題比較をまだ行っていないため、停止率や実務品質の差は未測定です。

Claude Sonnet 5.5 の effort 別の知能指数と評価1課題あたりの費用(参考に Opus 5.5 medium)

出典: Artificial Analysis。

Sonnet 5.5 xhighとOpus 5.5 mediumを比較する

Sonnet 5.5 xhighの知能指数は51.9です。同じClaude内のOpus 5.5 mediumは51.2で、評価上の賢さは近い位置にあります。ところが評価1課題あたりの費用は、Sonnet 5.5 xhighが2.74ドル、Opus 5.5 mediumが1.34ドルでした。xhighまで上げたSonnet 5.5は、評価コストではOpus 5.5 mediumの約2倍です。

Opus 5.5 mediumは最初のトークンまで12.75秒、Sonnet 5.5 xhighは15.04秒です。Opusのほうが待ち時間も短く、AAの評価で使った出力トークンも38Mに対してSonnet 5.5 xhighは100Mでした。

Opus 5.5の入力・出力単価はSonnet 5.5の2倍です。それでも同じ程度の評価結果を狙って思考量を増やすと、Sonnet側のトークン消費が増えて差が縮まり、今回のデータでは逆転しています。安いモデルを高いeffortで回せば必ず安い、とは限りません。

迷うとしたら、「Sonnet 5.5をxhighまで上げるか、Opus 5.5をmediumで使うか」の境目です。速度と費用を重く見るなら、Sonnet 5.5はlowからhighの帯で比較し、xhigh相当の品質が必要になった時点でOpus 5.5 mediumも同じ課題にかけるのが現実的です。

ただし、AAの比較だけでOpusへの切り替えを決めるのは早計です。評価課題の構成、実際のプロンプト、ツール呼び出しの回数によって、出力トークンと請求額は変わります。今回の数値は「xhighまで思考量を増やすと、Opus mediumより有利とは限らない」という比較材料として使うのが適切です。

出典: Artificial Analysis。Opus 5.5 mediumの値は知能指数51.2、評価1課題あたり1.34ドル、最初のトークンまで12.75秒、出力トークン38Mです。

Sonnet 5.5の公式指針は思考量・途中停止・過剰な見直しから読む

公式のプロンプト指針は項目が多く見えますが、Sonnet 5.5の運用に直結する部分は3つに整理できます。

1つ目は、思考量をプロンプトで偽装せずeffortで決めることです。「短く考えて」と書いても、思考トークンが確実に減るわけではありません。待ち時間や費用を下げたいならlowまたはmediumへ下げ、品質が必要ならhigh以上へ上げて比較します。

2つ目は、lowとmediumの途中停止です。lowは確認やテストを省きやすく、lowとmediumは長いエージェント作業の途中で止まってユーザーへ確認を求めやすい、と公式指針は説明しています。明確な依頼でも最後まで作業を続けること、依頼内容を検査してから終えることを、2段落で明示します。

私は2026年9月29日、Codexへ仕事を渡す取り次ぎ役のサブエージェント3体をSonnet 5.5 mediumで動かし、この2段落を日本語にして定義へ追加しました。これは定義を変更した事実であり、追加による品質や停止率の改善を測った結果ではありません。mediumを適用したことは確認できますが、品質改善効果は未測定です。

3つ目は、xhighとmaxの過剰な見直しです。高いeffortでは、モデルが追加のレビュー周回やサブエージェントを自分から始めることがあります。公式のテストでは、依頼された作業と検査が終わったら報告して止まる一文を加えることで、maxのコーディング課題にかかったセッション費用が約3分の1減り、品質は変わりませんでした。

つまり、lowとmediumには「最後まで運ぶ」、xhighとmaxには「終わったら止まる」を足します。同じプロンプトを全effortに配るのではなく、症状に応じて文を変えるのがポイントです。

Sonnet 5.5の構造化出力ではeffortより先に一文を確認する

JSONのような構造化出力で数段の推論が必要な課題では、lowやmediumが考えずに答えることがあります。公式指針は、systemメッセージの末尾に「Think the problem through before you answer.」を加える方法を示しています。highでは、この一文によってxhighに近い精度になったテスト結果も示されています。

ただし、stop_reasonがmax_tokensになった応答は、JSONとして読めそうでも失敗扱いにして再試行します。Sonnet 5.5ではmax_tokensに思考分も含まれるため、出力だけを見て上限を判断すると、途中で切れた応答を通してしまいます。

⚠️ 構造化出力をJSONとしてパースできても、stop_reason: "max_tokens"なら成功扱いにしないでください。再試行時はmax_tokensを増やすかeffortを下げ、直前の不完全なJSONを成果物として保存しない実装へ戻します。

私はスクリーンショットの個人情報を隠す自作ツールでSonnet 5.5の構造化出力を使っています。この一文を合成画像で比較する予定ですが、2026年9月30日時点ではまだ実施していません。ここは結果が出るまで保留です。

検索ツールを使う処理にも注意が要ります。Sonnet 5.5は検索手段がある場合でも、訓練時の知識だけで回答することがあります。許可や料金のように変わりうる情報では、検索を抑制する文を消し、必要な事実を検索するよう明示します。逆に、毎回検索させればよいという話ではなく、変動する事実に限定するのが扱いやすい線です。

⚠️ 検索ツールを渡しただけでは、最新情報を参照する保証になりません。料金・許可・仕様のように変わる事実を扱う処理では、検索対象を明示し、検索結果がない場合は回答を確定しない分岐へ戻します。

今も残る不満

構造化出力に公式の一文を足す効果は、自作の個人情報隠しツールではまだ確かめていません。比較用の合成画像テストが未実施だからです。

また、effortを上げれば待ち時間と費用が増える理由は数字で確認できますが、どの種類の失敗がどれだけ減るかは今回のデータだけでは分かりません。AAの知能指数を、そのまま自分のコード修正成功率や個人情報の検出率に読み替えられない点は不満として残ります。

取り次ぎ役のサブエージェント3体へmediumを適用したものの、適用前後の停止率や完了率を測っていない点も残ります。mediumが使いやすそうだという判断と、mediumで品質が改善したという結論は、分けて扱う必要があります。

Sonnet 5から移す前にAPIの差分を確認する

Sonnet 5.5では、既存のClaude Code連携や自作ハーネスの設定がそのまま通らない変更があります。移行前には、次の6点を確認します。

⚠️ thinking: {"type": "disabled"}は使えません。思考をツール間だけに制限する場合はthinking: {"type": "between_tools"}を使います。ただし、between_toolsはlow、medium、highでのみ受け付けられ、xhighとmaxでは400エラーになります。xhighやmaxで400エラーが出たら、between_toolsを外して設定を戻してください。

強制ツール呼び出しも変わりました。tool_choiceのanyとtoolは400エラーになり、autoとnoneが使えます。スキーマどおりの入力を強制したい処理では、strict tool useか構造化出力へ移す必要があります。

⚠️ 既存設定のtool_choice: "any"または"tool"を残すと400エラーになります。移行直後にエラーが出たら、まずautoへ戻して動作を確認し、強制が必要な箇所だけstrict tool useまたは構造化出力へ置き換えます。

思考ブロックはモデルと会話に紐づきます。2026年8月31日以降に作られたアカウントでは、途中でsystem、tools、過去メッセージを編集すると400エラーになる場合があります。会話を追記だけで運ぶ設計に変える必要があります。

⚠️ 会話途中のsystem、tools、過去メッセージの編集で400エラーが出る場合は、メッセージをその場で書き換える方式をやめ、同じ会話へ追記するか、新しい会話として最初から再送する方式へ戻します。

Claude APIとGoogle Cloudでは、旧computer_20251124は使えず、computer_toolset_20260801へ移行します。

⚠️ computer_20251124を残したままモデル名だけを変更しないでください。computerツールのエラーが出た場合は、旧ツール指定へ戻すのではなく、computer_toolset_20260801への移行漏れを確認します。

また、advisorツールではOpus 4.8、Opus 4.7、Sonnet 5を助言役に指定できません。移行時はモデル名だけを差し替えるのではなく、エラーになる設定を先に洗い出してください。

⚠️ advisorの指定モデルで400エラーが出たら、使用不可のモデル名を以前の設定へ戻すのではなく、許可されている助言役へ差し替えるか、advisor呼び出し自体を外して通常の処理へ戻します。

ツール呼び出しの合間に返る文章も見た目が変わります。1〜2文より長い文章がthinkingブロックに入り、既定のdisplay: "omitted"では中身が空になります。textだけを表示するアプリでは、モデルが無言になったように見える可能性があります。サーバー側では、返っているブロックの種類を確認する実装が必要です。

⚠️ textブロックだけを画面へ出す実装では、thinkingブロックへ移った文章を「応答なし」と誤認します。表示が空になったら、まずレスポンス全体のブロック種別をログで確認し、必要ならdisplay設定と表示処理を旧実装へ戻して切り分けます。

Sonnet 5.5 mediumは取り次ぎ役、成果物を直す仕事は別枠で測る

私の判断では、Sonnet 5.5 mediumは「答えを完成させる主役」より、「依頼を分類して、適切な処理へ渡し、結果を短く確認する役」に置くと数字と役割が合います。0.81秒で応答が始まり、知能指数は40.7なので、会話や分類で毎回highを待つ理由は薄いからです。

一方、コードの変更範囲が広い仕事や、テスト失敗の原因を複数箇所から追う仕事ではmedium固定にしません。まずmediumで最後まで進むかを確認し、途中停止や確認漏れが残るならhighへ上げます。それでもxhigh相当の判断が必要なら、Sonnet 5.5 xhighだけでなくOpus 5.5 mediumを同じ課題で比較します。

Claude Codeのメインは、私の環境ではOpus 5.5のeffort mediumです。Sonnet 5.5へ全部移すというより、Codexへ仕事を渡す取り次ぎ役の3体をSonnet 5.5 mediumにしています。これはモデルの優劣を決める話ではなく、契約と役割を分けた結果です。

既存の設定を見直すときは、前世代のeffort名を信じるより、同じ課題をmediumとhighで3回ずつ通して、停止・確認漏れ・不要な追加作業を記録してください。数字の差が小さいのに費用だけ増えるならeffortを下げ、失敗の修正費用が大きいなら上げる。この順番のほうが、ベンチマークの順位より実務に近い判断になります。

本文で実施済みといえる比較は、AAのeffort別データと、2026年9月29日に取り次ぎ役のサブエージェント3体へmediumを適用した運用変更です。mediumとhighの同一課題比較、自作ツールの合成画像比較、停止率の集計は未実施なので、そこから先の優劣は推測として扱います。

Sonnet 5.5はmediumから始め、xhighではOpus 5.5と並べて測る

Sonnet 5.5は、mediumの知能指数40.7でSonnet 5 maxの38.2を超えました。最初のトークンまでは0.81秒で、料金もSonnet 5と同じです。会話、分類、取り次ぎの開始点としてmediumを置く根拠はあります。

ただし、effortを上げるほど得とは限りません。xhighは51.9でOpus 5.5 mediumの51.2に近い一方、AAの評価費用は2.74ドル対1.34ドルです。maxは56.0まで伸びますが、最初のトークンまで308.29秒、評価費用は7.60ドルでした。

移行時に優先するのは、モデル名の置換ではなく、6つのAPI差分とレスポンス表示の確認です。そのうえでmediumには作業完了と検査を促す2段落を足し、xhighやmaxには終わったら止まる一文を足します。Sonnet 5.5は、設定を上げ切るモデルではなく、役割ごとにeffortを切り分けるモデルです。

参考として、前世代の設定差分はClaude Sonnet 5のeffort・コンテキスト解説、Opusとの比較はClaude Opus 5.5のeffort実測、他モデルとの比較はGPT-6.1 Solとの比較にも整理しています。

参考リンク

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

Anthropicリーク2連発:Claude MythosとClaude Code流出で見えたKAIROS、BUDDY、Undercover Modeの正体
開発ログ2026年4月1日

Anthropicリーク2連発:Claude MythosとClaude Code流出で見えたKAIROS、BUDDY、Undercover Modeの正体

Anthropicの2週間で2回のリークを整理。Claude Mythosの位置づけ、Claude Code流出の中身、KAIROS/BUDDY/Undercover Modeの意味を分けて読む。

#Anthropic#Claude#Claude Code#リーク#AI開発
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
開発ログ2026年9月3日

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
開発ログ2026年9月3日

Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む

Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。

#Claude#Claude Code#Anthropic#LLM#ベンチマーク
Claude Fable 5 vs Sonnet 5:料金5倍・知能+7点の実測使い分けガイド
チュートリアル2026年7月11日

Claude Fable 5 vs Sonnet 5:料金5倍・知能+7点の実測使い分けガイド

Fable 5とSonnet 5をArtificial Analysisの知能指数・タスク単価・出力量で比較。料金5倍の差を実務の判断材料に落とし込みます。

#Claude#Claude Code#AI比較#APIコスト#ベンチマーク

AI年表で詳しく見る

📅

Claude Sonnet 5.5

Claude Sonnet 5.5——料金は Sonnet 5 のまま、「速さと賢さの最良の組み合わせ」をうたう中位モデル

→

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。