メインコンテンツへスキップ
← ブログに戻る
開発ログ2026年4月7日by K.hirano

Bonsai 8B実測:世界初の1-bit LLMはなぜランクCか——24問で見えた用途

Bonsai-8Bの24問実機ベンチマークを実測。1.15GBの軽さ、コード満点、日本語文化壊滅という二面性を、用途別に正直に整理します。

#dev-log#LLM#benchmark#1-bit#local-llm#bonsai-8b

今回のベンチマークは、総合スコアだけで見るより、用途別の強弱で見たほうが判断しやすい結果でした。

📋 この記事で使用したテスト問題(全24問)は LLM 24問テストスイート で確認できます。

目次

先に結論:軽い。コードは強い。日本語文化はかなり厳しいです

Bonsai-8Bを24問ベンチマークした結果、見えてきたのはかなり極端な性格でした。

  • コード系は強い
  • レビュー補助も意外といける
  • 日本語の文化・常識・文脈はかなり厳しい
  • Ollama未対応で、実運用の導線はまだ細い
  • PrismMLフォーク経由で触る前提なので、気軽さでは勝てません

つまり、万能モデルではありません。 でも、**「コード職人だけど文化知識ゼロの同僚」**として割り切るなら、かなり面白いです。

24問の実測で見えたのは、得意分野の偏りでした

今回のベンチマークでは、単なる印象ではなく、実際の回答を見て判断しました。 その結果、点数よりも「どこで崩れるか」が重要だと分かります。

ざっくりした評価

項目結果
総合評価ランクC
事実上の強みコード生成・コードレビュー
弱み日本語の文化・慣用表現・文脈理解
実運用ハードルPrismMLフォーク必須、Ollama未対応
モデルサイズ1.15GB

ランクCと聞くと、どうしても「微妙だったのかな」と思われがちです。 ただ、今回はそう単純ではありません。総合点はCでも、用途を絞ると急に実用域に入る。ここが肝です。

知性密度はかなり高い。サイズ効率は本当に強い

個人的に一番見たかったのはここです。 「小さいのに、どれだけ考えられるのか」。

知性密度の計算

  • 98 ÷ 1.15 ≈ 85.2 点/GB
指標
総得点98
モデルサイズ1.15GB
知性密度85.2 点/GB

この85.2点/GBは、かなり強い数字です。 少なくとも「ファイルサイズが小さいから、ただの軽量おもちゃでしょ」という見方は外れます。

過去に読んでくださった方なら、META-MARKの Gemma4 / Nemotron ベンチと比べたときの感覚が近いはずです。 今回は総合点そのものより、どれだけ容量を食わずに実用域へ届くかが目立ちました。

コードは満点。ここは素直に評価していい

ここは素直に評価したいところです。 Bonsai-8Bは、少なくとも今回の範囲ではコード問題で満点でした。

ここで大事なのは、「コードが書ける」だけではなく、

  • 既存コードの意図を読もうとする
  • 破綻したロジックをそれなりに修正する
  • レビュー観点での指摘が出る

このあたりが、軽量モデルとしてはかなり健闘していることです。

もちろん、巨大モデルのような安定感はありません。 ですが、ローカルで常駐させて、コード補助だけに寄せるなら話は変わります。

「GPUが足りないから何もできない」より、小さくても役割を限定して使えるほうが現場では強いです。 用途の切り分けを考えるなら、まずは /ranking?category=gpu で今の選択肢を並べてみるのもありです。

日本語文化はかなり厳しい。ここは無理に擁護しません

一方で、日本語はかなり厳しいです。 単なる翻訳調ではなく、文化的な前提・空気感・言い回しで崩れます。

たとえば、会話の「間」や、少し遠回しな日本語の含み、あるいは背景知識が必要なネタになると、途端に雑になります。 文章としては成立していても、人間が読むと違和感が積み上がるタイプです。

ここは無理に持ち上げません。 日本語の文化理解が必要な用途には使わないほうがいいです。

逆に言うと、文化や文脈を問わない作業、たとえば

  • コード補助
  • コードレビュー
  • ルールベースの整形
  • 技術メモの下書き

このあたりなら、まだ使い道があります。

松尾芭蕉が植野明になったのは、ちょっと笑えました

今回の実測で、個人的にいちばん人間味があったのがここです。 文化・固有名詞の扱いで、松尾芭蕉が植野明になった場面がありました。

責める話ではありません。むしろ、こういうズレ方は面白いです。 モデルが「知っているつもり」で、別の何かに置き換えてしまう感じは、ある意味で1-bitらしい雑さでもあります。

ただ、実務でこれが出ると困ります。 俳句や文学、歴史、人物名の文脈では、安心して任せる段階ではないです。

PrismMLフォーク必須、Ollama未対応。ここは現実に効きます

性能の話だけなら盛り上がります。 でも、実際に使うとなると導線が大事です。

今回のBonsai-8Bは、PrismMLフォーク必須で、しかもOllama未対応です。 この時点で、普段 Ollama を入口にしている人には少し面倒です。

つまり、導入コストはこうなります。

  • すぐ試せるわけではない
  • 普段のローカルLLM運用にそのまま乗らない
  • 検証環境の準備が必要

この「ひと手間」を許容できるかで、評価は変わります。 性能だけで見れば面白い。でも、導入の摩擦はちゃんとある。ここは分けて考えたほうがいいです。

もし自分の環境で「サイズに対してどこまで載せられるか」を見たいなら、試算は /calculator で先に済ませると判断が速いです。

このモデルの価値は、万能性ではなく“役割の狭さ”にあります

Bonsai-8Bを見ていて思ったのは、最近のローカルLLMで大事なのは「何でもできるか」ではない、ということです。 何を捨てて、何を残したかです。

Bonsai-8Bは、

  • サイズを極限まで削る
  • その代わり文化理解をかなり捨てる
  • しかしコードはしっかり残す

という、かなり割り切った設計に見えます。

この割り切りに価値を感じる人は、たぶんこういう人です。

  • エッジに載せたい
  • 小ささが最優先
  • 文章の綺麗さより、コードの補助が欲しい
  • ローカルで完結する補助輪がほしい

逆に、自然言語の雑談や日本語での柔らかい対話を期待すると、かなり肩透かしです。

ランクCは失敗ではなく、用途を決めるための結果でした

ここが今回の一番大事なところです。

ランクCを「微妙」で終わらせるのは簡単です。 でも実際には、Cだからこそ用途を切れるとも言えます。

  • コード用途なら前向きに検討できる
  • 日本語文化用途は切る
  • 運用面では PrismMLフォーク前提を受け入れるかどうか
  • Ollama前提の人は待つか別案を選ぶ

こうやって整理すると、判断はかなりしやすくなります。

1.15GBでコード満点、知性密度85.2点/GB。日本語文化はかなり厳しい。 この二面性を、そのまま受け取るのがいちばん正確です。

次にどうするか

自分なら、次の順で判断します。

  1. コード補助専用の役割で試すか決める
  2. 自分の環境で サイズとメモリの制約 を確認する
  3. 日本語会話や文化系タスクには使わない前提で切る
  4. PrismMLフォークを触るコストを許容できるか見る

そして、RasPi 5 でのテストはかなり気になります。 次回はRasPi5での実用性を確かめる予定です。ここで本当にエッジ向きかが、もう少しはっきりします。

Bonsai-8Bは、世界初の1-bit LLMという看板よりも、実測すると用途がはっきり見えるモデルでした。 万能ではない。でも、役割がハマる場面では十分に面白い。 その意味で、これは「夢のモデル」ではなく、判断材料として価値があるモデルです。

どんな場面で効くか

  • 次に試すローカルLLMを絞り込むために、スコアと用途の両面から判断材料が欲しい場面
  • 使用中のモデルを更新すべきか、具体的な数値を見て判断したい場面

誰には不要か

  • すでにモデル選定が完了していて、ベンチマーク情報が不要な人
  • 特定の用途に絞っていて、汎用スコアより自分の実測結果だけで判断したい人

注意点・制約

  • スコアはテスト設計と採点基準に依存します。他のベンチマークと単純比較はできません。
  • 推論速度はGPU・量子化・同時実行数で大きく変わります。
  • 実機で試すまで、スコアだけで用途を決めないほうが安全です。

どのように検証したか

  • 統一した24問テストセットを使い、カテゴリ別(意地悪・論理・コード・日本語)にスコアを記録しました。
  • 実機環境で確認し、ハードウェア構成・モデル設定・実行日時を併記しました。

よくある質問

スコアが低いと実用にならないですか?

用途を絞れば低スコアでも実用になる場面はあります。カテゴリ別スコアで得意分野を確認するのが判断しやすいです。

自分の環境でも同じ結果になりますか?

GPU・量子化・ランタイムが変わると速度・精度ともに変わります。本記事の環境を参考に、差異を見込んで判断してください。

他のモデルとどう比べればいいですか?

同じテストセットでのスコアが最も比較しやすいです。当サイトの過去ベンチ記事も参照してください。

参考リンク

この記事は、実務で AI ツールを活用している開発者・技術者向けに書いています。

関連記事

関連リンク

  • 実際の構成を探すなら、GPU 比較ページやローカルLLM向け構成記事もあわせて見ると判断しやすいです。
  • ハードウェア候補は用途別の AI 構成ガイドからたどると、単体製品より違和感なく検討できます。

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か
2026年9月3日
開発ログ

Claude Codeを10時間放置で実測:177k再読は空ターン何回分か

約10時間放置したセッションの再開で 177k トークンが再書き込みされた実測を起点に、Claude Code で1時間キャッシュを空ターンで温め続ける価値を API 単価とサブスク枠の両面から損益分岐で計算しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
2026年9月3日
開発ログ

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
2026年9月3日
開発ログ

Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む

Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。

#Claude#Claude Code#Anthropic#LLM#ベンチマーク
月$200のClaude Codeを$138にした2日間 — z.ai GLM移行で踏んだ罠と、規約の本当の分かれ目
2026年8月27日
開発ログ

月$200のClaude Codeを$138にした2日間 — z.ai GLM移行で踏んだ罠と、規約の本当の分かれ目

Claude Code の接続先を z.ai の GLM へ差し替え、月$200を$138にした2日間の実測記録。踏んだ罠7つ、reasoning effort が外部バックエンドでも効くかの実測、そして「サブスク枠なら白」が成り立たない理由を公式ページの実読から整理します。

#Claude Code#GLM#LLM#コスト削減#実機検証

関連AIツール

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。