論理パズルは満点、蛙の季語は間違える——Qwen3 4Bのリアルな実力差
Ollama + RTX 4070 Ti でQwen3 4Bに24問テスト。論理・引っかけ問題は95%正解も、蛙の季語を夏と断言。4Bモデルのリアルな実力差を数字で見る。
4Bモデルがモンティホール問題を正解する時代が来た。それは本当だった。ただし「蛙は夏の季語です」とも言い切った。同じモデルが。
📋 この記事で使用したテスト問題(全24問)は LLM 24問テストスイート で確認できます。
テスト環境
| 項目 | 値 |
|---|---|
| モデル名 | Qwen3 4B |
| パラメータ数 | 4.0B |
| 量子化 | Q4_K_M |
| 推論フレームワーク | Ollama v0.17.4 |
| CPU | AMD Ryzen 9 5900(24コア) |
| GPU | NVIDIA RTX 4070 Ti(VRAM 12GB) |
| VRAM使用量 | 約3.5GB |
| 推論速度 | 104.8 tok/s(Thinking含む) |
| 1問あたり平均応答時間 | 23.9秒 |
| コンテキスト長(ctx) | 16,384 tokens |
| テスト時 temperature | 0.3(全問固定) |
| テスト日 | 2026-03-08 |
Ollamaで動かすにはSSHトンネル越しにAPIを叩いた。ポート11434はデフォルトでlocalhostバインドなので、外部から接続する場合はひと手間必要になる。このあたりの話は別の記事で書く。
結果サマリー
| カテゴリ | スコア | 正答率 | 評価 |
|---|---|---|---|
| A: 意地悪・引っかけ | 57 / 60 | 95% | ほぼ完璧。引っかけに強い |
| B: 論理・推論パズル | 57 / 60 | 95% | 囚人の帽子もパリティ戦略を自力構築 |
| C: コーディング・技術 | 37 / 60 | 62% | C2・C6が空回答。max_tokens問題 |
| D: 日本語力テスト | 31 / 60 | 52% | 文化的常識に弱い |
| 合計 | 182 / 240 | 75.8% | ランク A |
LLM性格診断: 「論理番長・日本語は二軍」
論理パズルで全問正解に近い点数を叩き出す。ところが蛙の季語を「夏」と言い切り、「積ん読」を "Stacked reading" と訳した。考えすぎて回答を忘れるのも面白かった(C2・C6で発生)。
Round 1: 意地悪・引っかけ問題
A1: バットとボール問題(10/10 ⭐完璧)
「5円」と即答し、連立方程式で導いた。「10円」という罠に引っかからなかった。判定: 10/10
A2: 太郎の家族問題(10/10 ⭐完璧)
「4人」と正解し、「3人の姉の弟は全員同じ太郎」という核心を説明した。判定: 10/10
A3: 生きている人の墓(7/10 ★惜しい)
「生きている人にはお墓がないため不可能」と前提矛盾に気づいたが、「問いが成立しない」の明確な宣言と生前墓の言及が抜けた。判定: 7/10
A4: りんごを「取った」(10/10 ⭐完璧)
「1番(花子が持っている)」と正解し、「取る=所持を含む動作」と日本語の意味を正確に解釈した。判定: 10/10
A5: 月曜日は何回(10/10 ⭐完璧)
「5回」と正解し、1日・8日・15日・22日・29日まで列挙した。判定: 10/10
A6: 医者と息子(10/10 ⭐完璧)
「担当医は息子の母(女性医師)」と即答し、ジェンダーバイアスにも言及した。判定: 10/10
Round 2: 論理・推論パズル
B1: モンティホール問題(10/10 ⭐完璧)
確率の分析を3ケースで整理し、「変えるべき、ドア2の確率は2/3」と正解。4Bモデルがこれを解くのは正直驚いた。判定: 10/10
B2: 嘘つきと正直者(10/10 ⭐完璧)
「どちらの場合も『Yes』と答える」と即答。両ケースの論理を一文で説明した。判定: 10/10
B3: 水差し問題(10/10 ⭐完璧)
6ステップの手順を正確に記述。状態追跡を間違えなかった。判定: 10/10
B4: 100人の囚人と帽子(10/10 ⭐完璧)
「99人を必ず助けられる」とパリティ戦略を自力で構築した。判定: 10/10
B5: 川渡り問題(10/10 ⭐完璧)
ヤギ→戻る→狼→ヤギ戻す→キャベツ→戻る→ヤギの7ステップを完全記述。判定: 10/10
B6: 天秤と偽コイン(7/10 ★途中で切れた)
正しいアプローチで始まりmax_tokens付近で打ち切られた。判定: 7/10
Round 3: コーディング・技術
C1: FizzBuzz拡張(10/10 ⭐完璧)
for i in range(1, 31):
result = ""
if i % 3 == 0:
result += "Fizz"
if i % 5 == 0:
result += "Buzz"
if i % 7 == 0:
result += "Jazz"
print(result if result else i)
全ケース(FizzJazz・BuzzJazz含む)を網羅。判定: 10/10
C2: JSクロージャの罠(0/10 ✗空回答)
Thinkingで思考しきって回答ゼロ。/no_thinkで改善可能。判定: 0/10
C3: SQLインジェクション検出(10/10 ⭐完璧)
脆弱性を明示しパラメータバインディングで修正。判定: 10/10
C4: 再帰フィボナッチの改善(10/10 ⭐完璧)
O(2^n)を指摘しO(n)イテレーティブ実装で改善。判定: 10/10
C5: Pythonリスト参照の罠(7/10 ★正解だが説明なし)
[1] / [1, 2] / [1, 2, 3] と正確に予測。理由の説明なし。判定: 7/10
C6: 正規表現チャレンジ(0/10 ✗空回答)
C2と同じ。判定: 0/10
Round 4: 日本語力テスト
D1: 敬語の間違い探し(5/10 △部分正解)
問題は指摘し修正も妥当だが「二重敬語」という核心用語に辿り着かなかった。判定: 5/10
D2: 俳句の評価(3/10 ✗季語ミス)
作者=松尾芭蕉は正解。しかし「蛙は夏の季語です」と断言。蛙は春の季語。判定: 3/10
D3: 慣用句の誤用検出(3/10 ✗誤検出多数)
「確信犯」は正しく指摘も、役不足・汚名返上まで間違いと判定した。判定: 3/10
D4: 同音異義語テスト(7/10 ★正解だが読みミス)
漢字選択は全問正解。軌跡の読みを「ききょく」と誤読。判定: 7/10
D5: 翻訳チャレンジ(3/10 ✗積ん読が別物に)
積ん読を「Stacked reading」と直訳。「tsundoku」と音写すれば済む話だった。判定: 3/10
D6: 「やばい」の文脈解釈(10/10 ⭐完璧)
5文すべての肯定・否定を正確に判断。日常語の多義性は意外と解けた。判定: 10/10
最終スコアカード
| カテゴリ | スコア | 正答率 |
|---|---|---|
| A: 意地悪 | 57 / 60 | 95% |
| B: 論理推論 | 57 / 60 | 95% |
| C: コーディング | 37 / 60 | 62% |
| D: 日本語力 | 31 / 60 | 52% |
| 合計 | 182 / 240 | 75.8% |
ランク: A(75〜89%)
所感
論理パズルを4Bで解かせるつもりはなかった。モンティホールとパリティ戦略が正解で返ってきた瞬間は、正直少し驚いた。これはQwen3のThinkingモードが効いている。考えてから答えるというだけで、ここまで変わる。
ただ蛙を夏にしたのは笑った。知識と推論は別物だということが、数字で出た。A・Bカテゴリは論理推論なので思考で補える。D・Cカテゴリは記憶と文化的常識なので、学習データの品質がそのまま出る。
C2・C6の空回答は実用上の問題になり得る。Thinkingモードを有効にしたままだと、複雑な問題で回答が出てこないケースがある。用途に応じて/no_thinkを使うか、シンプルな問題に限定するかの判断が必要だ。
RTX 4070 Ti + Ollama + Qwen3 4Bの組み合わせは、日常の補助ツールとして十分機能する。重要な意思決定の相談役にするには、日本語文化の弱点を理解した上で使うことが前提になる。
関連記事
BlogQwen3:8bは4bより賢いのか?同じ24問で試したら予想外の結果だった前回テストしたQwen3:4b(Rank A・127 tok/s)の上位モデルQwen3:8bを同じ24問で評価。大きいほど賢いはずという期待を、数字が静かに裏切った記録。→
BlogQwen3.5:4b 24問テスト——thinkingをOFFにしたらスコアが21%上がった話Qwen3.5:4bをOllama上でベンチマーク。thinkingモードが原因で9問が空回答になった。think:falseに切り替えたらスコアが194/240(80.8%)に回復。RTX 4070 Tiで101.5 tok/s出る4Bモデルの実力を24問で徹底検証。→
BlogQwen3:4b 24問テスト——コード95点、日本語22点の衝撃格差4Bパラメータの軽量モデルQwen3:4bを24問テスト。論理・コードで95%を叩き出しながら日本語力は22%に沈む衝撃の格差を徹底解剖。→
関連リンク
- 実際の構成を探すなら、GPU 比較ページやローカルLLM向け構成記事もあわせて見ると判断しやすいです。
- ハードウェア候補は用途別の AI 構成ガイドからたどると、単体製品より違和感なく検討できます。
この記事を書いた人
HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!
関連記事
結論、DGX SparkとRTX Sparkは性能でなくOSで選ぶ——2つのSparkの違い
DGX SparkとRTX Sparkの共通仕様と違いを、OS・形態・時期・用途で整理。実機未検証の範囲も明記します。
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。
Gemma 4 26B A4B vs Ornith 1.5、12GBの答えはどちらか
VRAM 12GB の RTX 4070 Ti で Ornith 1.5 9B と Gemma 4 26B A4B を同条件比較。速度 80.0 対 72.9 tok/s、VRAM は 5.9GB 対 11.6GB で Ornith が優位、コーディングは 60点満点で 26B を上回りました。一方 24問テスト総合は 199 対 220 で日本語力に差。長考の末に無回答となる症状は両モデル共通でした。
Gemma 4 26B A4B 実測:12GBのGPUで72.9 tok/s、24問テストは過去最高スコア
VRAM 12GB の RTX 4070 Ti で Gemma 4 26B A4B を実測。llama.cpp の --cpu-moe を -ncmoe 9 に変えるだけで 35.0 → 72.9 tok/s になり、12B を全部GPUに載せた 58.6 tok/s を上回りました。24問テストは 220/240 でランクS。長考時に空応答を返す弱点もあわせて記録しています。
関連AIツール
META-MARK × AI
ローカルAIを動かすGPU、ちゃんと選べていますか?
VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。
PR広告:開発環境・キャリアまわりのサービス