メインコンテンツへスキップ
← ブログに戻る
事例紹介2026年3月15日by K.hirano

ローカルLLM24問テスト:コード77点・日本語47点——東工大Swallowの意外な素顔

東工大の日本語特化モデルSwallow 8Bを24問でテスト。コード77点・日本語47点という反直感的な結果と、「汚名返上を誤用と言った日本語特化AI」の実態を正直に報告します。

#ローカルLLM#Ollama#ベンチマーク#Swallow#東工大#日本語LLM#swallow-llm

日本語特化モデルを名乗るAIが、日本語テストで47点を取りました。正直に言います。「東工大が作った日本語特化LLM」という情報を見たとき、私は少し期待しました。これまでテストしてきたQwen系は中国発で、日本語は"副業"的な位置づけです。でも東京工業大学(現・東京科学大学)が日本語コーパスで鍛えたというSwallowなら、少なくともD(日本語)カテゴリでは差を見せてくれるだろうと。結果は、コード77点・日本語47点でした。

この記事のまとめ

  • 東工大発の日本語特化LLM「Swallow 8B」を24問でテスト
  • スコア: 121/240(50.4%)ランクC / コード77% / 日本語47%
  • 性格診断: ゴリラプログラマ型(SQLインジェクションは即答・俳句の季語は間違える)
  • Qwen3:8b(75%)と比較して約25%のスコア差がある
  • ⚠️ 本テストはRTX 4070 Ti環境での1回実行。環境・バージョンにより結果は異なる可能性があります。

📋 この記事で使用したテスト問題(全24問)は LLM 24問テストスイート で確認できます。

目次

テスト環境 {#test-env}

項目
モデル名schroneko/llama-3.1-swallow-8b-instruct-v0.1
ベースMeta Llama 3.1 8B(東工大が日本語継続学習)
公開元東京科学大学 Swallowプロジェクト
パラメータ数8B
量子化Q4_K_M(Ollama自動)
推論フレームワークOllama v0.17.4(SSHトンネル経由)
CPUAMD Ryzen 9 5900(24コア)
GPUNVIDIA RTX 4070 Ti(VRAM 12GB)
VRAM使用量約8.1GB
推論速度6.8 tok/s
1問あたり平均応答時間約26秒
コンテキスト長(ctx)16,384 tokens
テスト時 temperature0.3(全問固定)
テスト日2026-03-14

速度は6.8 tok/sです。先日テストした自殺相談窓口を貼ってくるAI——Qwen3.5:9bに意地悪問題を24問ぶつけた結果Blog自殺相談窓口を貼ってくるAI——Qwen3.5:9bに意地悪問題を24問ぶつけた結果ローカルLLM Qwen3.5:9b(9.7B Q4_K_M)に意地悪・論理・コード・日本語の24問テストを実施。180/240点(75%)ランクAの「空気読めない秀才型」。お墓問題で相談窓口を貼ってきた話も含めて正直に報告。よりは速いが、Qwen3.5:4b 24問テスト——thinkingをOFFにしたらスコアが21%上がった話BlogQwen3.5:4b 24問テスト——thinkingをOFFにしたらスコアが21%上がった話Qwen3.5:4bをOllama上でベンチマーク。thinkingモードが原因で9問が空回答になった。think:falseに切り替えたらスコアが194/240(80.8%)に回復。RTX 4070 Tiで101.5 tok/s出る4Bモデルの実力を24問で徹底検証。と比べると桁が違います。8Bモデルとしては標準的な数字です。

Swallowは東京工業大学(現・東京科学大学)が公開している日本語特化LLMです。Meta Llama 3.1 8Bをベースに、日本語コーパスで継続学習を行っています。OllamaのPublicレポジトリには公式掲載がなく、有志がGGUF変換・公開したモデルを使用しました。

接続でひとつ詰まりました。 Ollamaのデフォルトは 127.0.0.1 へのバインドのため、LAN越しの 192.168.11.x:11434 に直接アクセスできず、全問タイムアウトになりました。SSHトンネル(ssh -fNL 11434:localhost:11434 192.168.11.x)でローカルに転送して解決しています。同じ構成の方は注意してください。

結果サマリーと性格診断 {#summary}

カテゴリスコア評価
A: 意地悪・引っかけ27/60(45%)凡庸
B: 論理・推論20/60(33%)壊滅
C: コーディング46/60(77%)突出
D: 日本語力28/60(47%)「特化」とは?
合計121/240(50.4%)ランクC

LLM性格診断: 「ゴリラプログラマ型」

FizzBuzzは書ける。SQLインジェクションは即指摘できる。Pythonのリスト参照バグも完璧に解説してくれた。しかし「古池や蛙飛び込む水の音」の季語を「古池・秋」と答え、「汚名返上」を誤用として「汚名挽回」に修正しようとした。

コードを書かせると強い。日本語の古典・慣用句は弱い。日本語専化モデルと言われると首を傾げたくなる数字ですが、それが正直な結果でした。

Swallowベンチマーク スコアカード

Round 1: 意地悪・引っかけ問題(27/60) {#round1}

A1: バットとボール問題(10点)

変数を置いて方程式を立て、「ボールは5円」と正答。計算式も丁寧でした。久しぶりに満点を見た問題です。

A2: 太郎の家族問題(0点)

「3人の姉、それぞれの姉に1人の弟がいる。兄弟姉妹は何人?」という重複カウント問題。正解は「姉3人+太郎=4人」ですが、Swallowは「太郎1人+姉3人+弟3人=計6人」と回答しました。

各姉の「弟」が全員同一人物(太郎本人)だという気づきに至らなかった。

A5: 月曜始まりの月(0点)

問題文に「2026年3月は月曜日始まりです」と明記してあるのに、Swallowは「2026年3月1日は木曜日です」と自分の知識で上書きした上で「月曜は4回」と回答。

問題文の前提を無視する、少し珍しいタイプの失敗です。学習データが問いの理解より先に走ってしまった。

A6: 医者と息子(7点)

「その医師は息子の母親です。」一文のみ。11トークン。正解ではあるが、なぜこれが引っかけ問題なのか——医者を男性と思い込むジェンダーバイアスへの言及が一切ない。答えは出たが、問いを解いていない感じがします。

A6 医者と息子——11トークンで答えが出た

Round 2: 論理・推論パズル(20/60) {#round2}

ここがSwallowの最大の弱点です。

B4: 100人の囚人と帽子(0点)

99人を確実に助ける「パリティ(偶奇性)戦略」を答えるべき問題。Swallowが出した戦略は「前の人の帽子の色をコピーして答える」でした。

これでは約50%の確率で正解するだけで、「必ず助けられる」という要件を満たせません。

B5: 川渡り問題(0点)

農夫・狼・ヤギ・キャベツを川向こうへ運ぶ古典問題。Swallowの回答を整理すると:

  1. 農夫が狼を対岸へ連れていく(ヤギとキャベツが一緒で即アウト)
  2. 農夫が戻ってヤギを対岸へ(狼はすでに向こうにいる)
  3. 再び狼を対岸へ連れていく(狼は3度目の移動)
  4. ヤギとキャベツを一緒に連れていく(1度に1つしか無理)

手順の1ステップ目でゲームオーバーです。複数回の往復で状態をトレースし続ける能力に限界があるようです。

B2: 嘘つきと正直者(5点)

「あなたは正直者ですか?」に対してAはどう答えるか。答えの「はい」は正解でしたが、理由が逆でした。「嘘つきは『はい』と答えることができない。よってAは正直者」という結論。

嘘つきだからこそ「はい」と嘘をつく、という論理が見えていない。答えは偶然当たったが、推論の構造が正反対だった。

Round 3: コーディング・技術(46/60) {#round3}

C3: SQLインジェクション検出(10点)

Pythonのfストリング直結SQLを見せた瞬間に即指摘し、%sプレースホルダーを使った修正コードをすぐ出してきた。ここでの反応速度と正確さは、他モデルと比較しても遜色ない。

C5: Pythonリスト参照の罠(10点)

def add_item(item, lst=[]): の出力を問う問題。「デフォルト引数は関数定義時に一度だけ評価される」という説明付きで [1][1,2][1,2,3] と正確に答えた。満点です。

C1: FizzBuzz拡張(5点)

3・5・7の倍数で「Fizz/Buzz/Jazz」を組み合わせる問題。elifチェーンで実装したため、21(FizzJazz)や35(BuzzJazz)が正しく出力されません。3つの独立したif文でそれぞれ文字を結合する、という一歩先の設計に至らなかった。

C3 SQLインジェクション——最低はFizzBuzzのelif構造ミス

Round 4: 日本語力テスト(28/60) {#round4}

D2: 俳句の評価(3点)

「古池や蛙飛び込む水の音」の季語を問いました。Swallowの回答:「季語は古池で、を表します。」

日本語特化モデルが、日本で最も有名な俳句の季語を間違えました。

正解は「蛙」で春の季語です。田んぼに蛙が出る季節。古池は場所であり、秋とは無関係です。この誤答が今回の結果を象徴していました——日本語コーパスで学習はしているが、文学・古典の知識の精度は高くない。

D1: 敬語の間違い探し(0点)

「ご説明させていただきました」という二重敬語を指摘する問題。Swallowは文末の「ご確認いただければと存じます」を「ご確認ください」に変えるだけで、肝心の二重敬語を通過させました。

見るべきところを見ていなかった。

D3: 慣用句の誤用検出(3点)

5つの文のうち実際に誤用なのは「的を得た」(→的を射た)と「確信犯的に遅刻」のみです。しかしSwallowは全5文を「誤り」として修正し始めました。

  • 「汚名返上」→「汚名挽回」(返上が正しい。挽回が誤り)
  • 「役不足」→削除(問題文の使い方は正しい)
  • 「情けは人のためならず」→「情けは人のためにならない」(意味が正反対)

正しい慣用句を誤りと判定し、誤った修正を行う二重のエラーです。

D6: 「やばい」の文脈解釈(10点)

5文の「やばい」の肯定・否定判定は全問正解。現代語・口語の解釈は本物でした。

「古池の季語が秋になる」一方で、「やばい」の5パターン全てを即答で正確に仕分けた。古典に弱く、現代口語に強い。明確に棲み分けがある。

最終スコアカード {#scorecard}

カテゴリスコア最高回答最低回答
A: 意地悪27/60(45%)A1 バットとボール(10点)A2・A5(各0点)
B: 論理20/60(33%)B1 モンティ・ホール(7点)B4・B5(各0点)
C: コード46/60(77%)C3・C5(各10点)C1 FizzBuzz拡張(5点)
D: 日本語28/60(47%)D6 やばい文脈(10点)D1 敬語(0点)
合計121/240(50.4%)ランクC

他モデルとのスコア比較

同じ8Bクラスと並べると、Qwen3:8bとの差は59点(180点 vs 121点)です。パラメータ数が同じでも、日本語特化という看板とスコアは必ずしも一致しなかった。

ローカルLLMのセットアップ方法やOllama全般についてはOllama導入の罠と解決手順——GPU認識・日本語チャットまでの全記録と結論BlogOllama導入の罠と解決手順——GPU認識・日本語チャットまでの全記録と結論RTX 4070 Ti搭載の自宅サーバーにOllamaをSSHでセットアップした実録。非対話環境でのインストール罠、バイナリ直接DL、systemdサービス化、qwen2.5:7bでの日本語チャットまで。も参考になります。

よくある質問 {#faq}

Q. SwallowはOllamaで使えますか?

A. Ollamaの公式レポジトリには掲載がありませんが、有志がGGUF変換して公開したモデルが存在します(本記事では schroneko/llama-3.1-swallow-8b-instruct-v0.1 を使用)。ただしOllamaのデフォルト設定はloopbackバインドのため、LAN越しのアクセスにはSSHトンネルが必要です。

Q. 日本語LLMの中でSwallowはどのくらいの実力ですか?

A. 本テストでは121/240(50.4%)でした。同規模のQwen3:8bが180/240(75%)なので、単純な点数比較では厳しい結果です。ただし「日本語特化の効果がどの用途に出るか」はテスト設計にも依存するため、慣用句・古典文学が問われない実務用途では別の評価になる可能性もあります。

Q. Swallowのコーディング用途での活用は現実的ですか?

A. コーディングカテゴリは77%(46/60)で、本テスト最高スコアでした。SQLインジェクション検出・Pythonのリスト参照バグ・フィボナッチのメモ化など、実務的な問題で高評価でした。日本語で指示してコードを出力させる用途ならRTX 4070 Ti環境で実用的な速度(6.8tok/s)で動きます。

所感 {#comment}

「日本語特化」という言葉に少し期待したのは事実です。でも実際に触ってみると、日本語D=47%という数字が出た。

フェアに言えば、「日本語特化の対象が何か」によって評価は変わります。会話文・現代文・ウェブ文書のような普通の日本語ならもう少し違う結果かもしれない。テストのD項目には古典俳句・慣用句・敬語の二重表現が含まれていて、これらはビジネス用途の日本語とは別の領域です。

一方でコード(C=77%)は本物でした。SQLインジェクションも、Pythonのリスト参照バグも、きれいに拾ってくれた。

「汚名返上を誤用と言う日本語特化AI」という事実は面白いですが、「SQLインジェクションを即指摘できる日本語対応コーディングAI」という見方もできる。同じモデルの話です。

Swallowは、日本語の得意な部分と苦手な部分を把握した上で使うモデルだと思います。ローカルで動くコーディングアシスタントとして使うなら、意外と悪くないかもしれません。

ただ、「日本語特化だから日本語が得意」と期待して使うと、俳句の季語で裏切られます。

関連記事

関連リンク

  • 実際の構成を探すなら、GPU 比較ページやローカルLLM向け構成記事もあわせて見ると判断しやすいです。
  • ハードウェア候補は用途別の AI 構成ガイドからたどると、単体製品より違和感なく検討できます。

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

結論、DGX SparkとRTX Sparkは性能でなくOSで選ぶ——2つのSparkの違い
NEW
2026年9月6日
チュートリアル

結論、DGX SparkとRTX Sparkは性能でなくOSで選ぶ——2つのSparkの違い

DGX SparkとRTX Sparkの共通仕様と違いを、OS・形態・時期・用途で整理。実機未検証の範囲も明記します。

#DGX Spark#RTX Spark#NVIDIA#ローカルLLM#AI開発
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
2026年9月3日
開発ログ

Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む

Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。

#Claude#Claude Code#Anthropic#LLM#ベンチマーク
Gemma 4 26B A4B vs Ornith 1.5、12GBの答えはどちらか
2026年8月30日
開発ログ

Gemma 4 26B A4B vs Ornith 1.5、12GBの答えはどちらか

VRAM 12GB の RTX 4070 Ti で Ornith 1.5 9B と Gemma 4 26B A4B を同条件比較。速度 80.0 対 72.9 tok/s、VRAM は 5.9GB 対 11.6GB で Ornith が優位、コーディングは 60点満点で 26B を上回りました。一方 24問テスト総合は 199 対 220 で日本語力に差。長考の末に無回答となる症状は両モデル共通でした。

#ローカルLLM#Gemma#Ornith#llama.cpp#GPU
Gemma 4 26B A4B 実測:12GBのGPUで72.9 tok/s、24問テストは過去最高スコア
2026年8月30日
開発ログ

Gemma 4 26B A4B 実測:12GBのGPUで72.9 tok/s、24問テストは過去最高スコア

VRAM 12GB の RTX 4070 Ti で Gemma 4 26B A4B を実測。llama.cpp の --cpu-moe を -ncmoe 9 に変えるだけで 35.0 → 72.9 tok/s になり、12B を全部GPUに載せた 58.6 tok/s を上回りました。24問テストは 220/240 でランクS。長考時に空応答を返す弱点もあわせて記録しています。

#ローカルLLM#Gemma#llama.cpp#GPU#gemma-4

関連AIツール

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。