メインコンテンツへスキップ
← ブログに戻る
事例紹介2026年3月20日by K.hirano

209点/240点——「廉価モデル」Haikuが超えてきたライン

Claude Haiku 4.5を24問ベンチマークで計測。コーディング満点・総合87.1%ランクAという結果が「廉価モデル」という先入観を崩した。ローカル最高Nemotronも超えた実力の内訳を全問解説。

#Claude Haiku#ベンチマーク#LLM比較#Claude#AIモデル評価

「Haikuはサブモデルだから」と決めつけて、ちゃんと測ったことがなかった。測ってみたら、ローカルモデルのほぼ全てを上回り、GPT-5.4 nanoも超えてきた。廉価モデルという言葉が、少し古くなっている。

この記事では Claude Haiku 4.5 のコーディング・論理・日本語力を24問ベンチマークで検証しています。APIモデルの選定やサブエージェントの使い分けを考えているエンジニアの方に向けた内容です。

📋 この記事で使用したテスト問題(全24問)は LLM 24問テストスイート で確認できます。

3行まとめ

  • Claude Haiku 4.5は24問ベンチマークで209点/240点(87.1%)、ランクAを記録
  • コーディング(C)は満点。日本語力(D)が70%で最大の弱点
  • ローカル14Bモデルを超え、GPT-5.4 nanoも超える——「廉価モデル」という括りで軽視するのは損

目次

テスト環境と方法

項目
モデル名Claude Haiku 4.5
バージョンclaude-haiku-4-5-20251001
実施方法Claude Code のサブエージェント機能でHaikuに直接24問を投げる
応答時間24問で約40秒(APIモデルのため速い)
テスト日2026年3月
問題数24問・240点満点(各10点)
カテゴリA(引っかけ)/ B(論理)/ C(コーディング)/ D(日本語力)各6問

実施方法について少し補足しておく。これまでローカルモデルのテストはLiteLLM経由のOllama経由でやっていたが、今回はClaudeのAPIモデルなのでLiteLLMは不要だった。Claude Codeのサブエージェント機能を使い、Haikuに問題を直接渡して解かせた。

モデルの仕様詳細は Anthropic公式のモデル一覧ページ を参照してほしい。claude-haiku-4-5-20251001 が現行の正式なモデルIDだ。

結果サマリー

カテゴリスコア正答率
A(意地悪・引っかけ)52/6086.7%
B(論理・推論パズル)55/6091.7%
C(コーディング・技術)60/60100%
D(日本語力テスト)42/6070.0%
合計209/24087.1%

ランク基準

ランク正答率
S90%以上
A80〜89%
B70〜79%
C60〜69%
D59%以下

Haiku 4.5はランクA。コーディング満点が全体を引き上げた形だが、B(論理)も91.7%あり、実力は「引っかけにも強い、論理もこなせる、日本語は少し甘い」というプロファイルに落ち着いた。

Round A: 意地悪・引っかけ問題(52/60)

6問中、失点は1問のみ。86.7%というのはローカルモデル群と比べても高水準だ。

A6(医者と息子問題)は即答で満点。「担当医は母親だ」と述べた上で、ジェンダーバイアスへの言及まで添えてきた。こういう問いに対してバイアスを自覚した上で答えられるかどうかは、モデルの設計思想がにじみ出るところで、Haikuはここを迷わずクリアした。

失点は1問。詰めが甘かったというよりは確率的なブレの範囲内で、Aカテゴリ全体としては安定していた。

Round B: 論理・推論パズル(55/60)

B4(囚人とパリティ戦略)は満点。99人がパリティ(偶奇)を使って残り全員を確実に救う戦略を正確に説明できた。このパズル、「1人が犠牲になる」という非直感的な前提を含めて正しく処理できるモデルは意外と少ない。Haikuはここを間違えなかった。

B3(水差し4Lと3Lで4L測定)も7ステップ正解。手順の論理性をきちんと追えている。

失点はB6(天秤と偽コイン問題)の5点分。4+4+4に分割するアプローチ自体は正しかった。ただ、2回目の計量で均衡した場合の残り4枚の処理手順が不完全だった。「方針は合っているが、エッジケースの詰めが甘い」という典型的な部分失点だった。

Round C: コーディング(満点)

満点。

これが今回一番「へえ」と思った結果だった。コーディングで満点を取ったモデルはこのシリーズではGPT-5.4 mini以来2モデル目だ。

6問の内訳はSQLインジェクション対策・クロージャの挙動・デフォルト引数の罠・FizzBuzzJazz・再帰関数の改善・正規表現と、いずれもピンポイントの知識と正確な読解力が要る問題だった。

デフォルト引数の罠(Pythonの可変デフォルト引数がミュータブルな場合に状態が引き継がれる問題)あたりは「知っていれば解ける、知らなければ詰まる」という性質で、ここを落とさなかったのは素直に評価できる。

Haikuをコーディングのサブエージェントとして使っている人は多いと思うが、その判断は間違っていない。数字がそれを裏付けた。

Round D: 日本語力——ここで崩れた(42/60)

70%。他のカテゴリと比べると、明らかに落ちる。

特に印象的だったのがD3(慣用句の誤用検出問題)の崩れ方だ。5つの文の中から「誤用されているもの」を選ぶ形式で、正解は「1番(的を得た→的を射た)」と「4番(確信犯)」だった。

Haikuの答えはこうだった。

  • 「的を得た」:正しい用法と判定(実際は誤用)
  • 「役不足」:誤用と判定(正しく使われているのに)
  • 「情けは人のためならず」:誤用と判定(正しく使われているのに)

正しい誤用を見逃し、正しい用法を誤用と断定した。ただのミスではなく、構造的なパターンがある。

「役不足」「情けは人のためならず」はどちらも「よく誤用される表現」として世間で語られることが多い。おそらくHaikuはその「多数派の誤解」をパターンとして学習しており、文中での実際の使われ方を読まずに「これは誤用されやすい言葉だ→誤用と判定」という経路を通っている。私はこれを多数決バイアスと呼んでいる——世間の誤解率が高い表現ほど、文脈を読まずに「誤り」とラベルしてしまう現象だ。

D4(同音異義語)でも「感謝」が正解の箇所を「功績」と独自解釈して失点した。日本語の文脈依存の繊細さは、今のHaikuにはまだ重い。

「廉価モデル」という先入観の話

横断比較を並べてみる。

モデルスコアランク
GPT-5.4 mini223/240 (92.9%)S
Claude Haiku 4.5209/240 (87.1%)A
Nemotron 9B(ローカル)198/240 (82.5%)A
GPT-5.4 nano190/240 (79.2%)A
phi4:14b(ローカル)175/240 (72.9%)B

ローカルで動かしているNemotron 9BやGPT-5.4 nanoを上回り、phi4 14Bには10点以上の差をつけた。

GPT-5.4 miniとHaikuのスコア差(14点・5.8%)の背景については「ローカル最高80% vs クラウド93%——20点差が示す、規模の残酷な現実Blogローカル最高80% vs クラウド93%——20点差が示す、規模の残酷な現実GPT-5.4 mini/nanoを同じ24問ベンチマークで測定。ローカル最高峰Qwen3.5:4bの80.8%に対し、miniは92.9%・nanoは79.2%。スコアの読み方と、正直な限界を書きます。」で詳しく分析している。クラウドAPIモデルとローカルモデルの実力差に興味がある方はあわせて読んでほしい。

「Haikuはサブモデル」という認識でいると、この結果は少し裏切られる感覚がある。API経由なので電気代はかからず、速度は約40秒で24問処理。ローカルでRTX 4070 Tiを回すより速い場面も多い。

もちろんGPT-5.4 miniには14点差(5.8%差)がある。日本語力の差と、論理パズルの詰めの精度差が積み重なった数字だ。「何でもHaikuで」は少し過信だが、「コーディング系はHaikuで十分」はデータとして言える。

コスト面では、Claude Haiku 4.5はOpusやSonnetと比べてはるかに安い。Claude Codeのサブエージェントとして並列で投げるような使い方なら、精度と価格のバランスは実用的な範囲に収まっている。

よくある質問

Q. Claude Haiku 4.5はSonnetと比べてどれくらい安い?

Anthropicの料金体系では、Haiku 4.5はSonnetの大幅に低い価格帯にある。コーディングの自動化タスクや大量のサブエージェント処理では、このコスト差は運用判断に直結する。正確な料金は Anthropicの公式料金ページ で確認してほしい。

Q. ローカルLLM(OllamaなどでのQwen/phi4等)とどちらを選ぶべき?

コーディング精度を重視するならHaiku 4.5が優位。ただしAPIコストが継続的に発生するため、長期の大量処理はローカルモデルのほうが安い場合がある。Qwen3.5:4b 24問テスト——thinkingをOFFにしたらスコアが21%上がった話BlogQwen3.5:4b 24問テスト——thinkingをOFFにしたらスコアが21%上がった話Qwen3.5:4bをOllama上でベンチマーク。thinkingモードが原因で9問が空回答になった。think:falseに切り替えたらスコアが194/240(80.8%)に回復。RTX 4070 Tiで101.5 tok/s出る4Bモデルの実力を24問で徹底検証。14Bで175点・ランクB——phi4:14bに24問ぶつけた正直な結果Blog14Bで175点・ランクB——phi4:14bに24問ぶつけた正直な結果phi4:14bに24問テスト。175/240点(72.9%)ランクB。蛙の季語は正解できたが汚名返上をSwallowと同じく誤用と断言した。4.2 tok/s・VRAM 8.3GB使用の詳細な結果を公開。も参考になる。使用頻度・タスクの性質・日本語の必要度で判断するのが現実的だ。

Q. 日本語ライティング・翻訳タスクにHaiku 4.5は使えるか?

D3(慣用句)とD4(同音異義語)の誤答パターンから見ると、日本語の文脈依存タスクには注意が必要だ。単純な翻訳や要約なら実用範囲だが、ニュアンスが問われる業務文書・メールにはSonnet以上を推奨する。

まとめ——Haikuをどう使うか

測ってみて分かったことをそのまま書く。

コーディングタスクに使う分には、今日時点でHaiku 4.5は十分な水準にある。満点という結果は偶然ではなく、SQLインジェクションからクロージャ、正規表現まで網羅して正解できる実力がある。

日本語の精緻な読解——特に慣用句の文脈判断や同音異義語の使い分け——は苦手と判断した。日本語でニュアンスが問われる場面には、もう一段上のモデルを使ったほうがいい。

「廉価モデル」という言葉は、価格と用途の話であって、能力の全否定ではない。キノコの菌床栽培でいえば、条件が整えば廉価な原木でも十分なものが育つ。問題はどこに置くかだ。

測ってから判断する。それだけのことで、使えるモデルが一つ増えた。

このシリーズのその他のモデル計測結果——24問テストして198点/240点——Nemotron 9Bの正直な成績表Blog24問テストして198点/240点——Nemotron 9Bの正直な成績表ローカルLLM Nemotron-Nano-9B-v2-Japaneseに意地悪な引っかけ・論理パズル・コーディング・日本語力の24問を投げた本気の成績表。RTX 4070 Ti(VRAM 12GB)で63 tok/s、コーディング95%・総合82.5%(ランクA)。弱点も正直に語る。論理パズルは満点、蛙の季語は間違える——Qwen3 4Bのリアルな実力差Blog論理パズルは満点、蛙の季語は間違える——Qwen3 4Bのリアルな実力差Ollama + RTX 4070 Ti でQwen3 4Bに24問テスト。論理・引っかけ問題は95%正解も、蛙の季語を夏と断言。4Bモデルのリアルな実力差を数字で見る。ローカルLLM24問テスト:コード77点・日本語47点——東工大Swallowの意外な素顔BlogローカルLLM24問テスト:コード77点・日本語47点——東工大Swallowの意外な素顔東工大の日本語特化モデルSwallow 8Bを24問でテスト。コード77点・日本語47点という反直感的な結果と、「汚名返上を誤用と言った日本語特化AI」の実態を正直に報告します。——もあわせて参照すると、Haikuの立ち位置がより明確になる。

関連記事

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

この記事は実運用環境でのベンチマーク検証内容をもとに執筆しています。

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か
2026年9月3日
開発ログ

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か

約10時間放置したセッションの再開で 177k トークンが再書き込みされた実測を起点に、Claude Code で1時間キャッシュを空ターンで温め続ける価値を API 単価とサブスク枠の両面から損益分岐で計算しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
2026年9月3日
開発ログ

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
2026年9月3日
開発ログ

Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む

Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。

#Claude#Claude Code#Anthropic#LLM#ベンチマーク
Ox Alpha、GLM説は優勢でも正体不明——トークナイザ証拠が矛盾
2026年8月24日
開発ログ

Ox Alpha、GLM説は優勢でも正体不明——トークナイザ証拠が矛盾

Ox Alphaの正体はZ.aiのGLM-5.3-Flashでした。矛盾するトークナイザ証拠、基準率、標本数、一次実測から匿名モデルの読み方を整理し、答え合わせまで追記しています。

#OpenRouter#Ox Alpha#AIモデル#ベンチマーク

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。