Bonsai 8B実測:世界初の1-bit LLMはなぜランクCか——24問で見えた用途
Bonsai-8Bの24問実機ベンチマークを実測。1.15GBの軽さ、コード満点、日本語文化壊滅という二面性を、用途別に正直に整理します。
今回のベンチマークは、総合スコアだけで見るより、用途別の強弱で見たほうが判断しやすい結果でした。
📋 この記事で使用したテスト問題(全24問)は LLM 24問テストスイート で確認できます。
目次
- 先に結論:軽い。コードは強い。日本語文化はかなり厳しいです
- 24問の実測で見えたのは、得意分野の偏りでした
- 知性密度はかなり高い。サイズ効率は本当に強い
- コードは満点。ここは素直に評価していい
- 日本語文化はかなり厳しい。ここは無理に擁護しません
- 松尾芭蕉が植野明になったのは、ちょっと笑えました
- PrismMLフォーク必須、Ollama未対応。ここは現実に効きます
- このモデルの価値は、万能性ではなく“役割の狭さ”にあります
- ランクCは失敗ではなく、用途を決めるための結果でした
- 次にどうするか
- どんな場面で効くか
- 誰には不要か
- 注意点・制約
- どのように検証したか
- よくある質問
- 参考リンク
- 関連記事
- 関連リンク
- この記事を書いた人
先に結論:軽い。コードは強い。日本語文化はかなり厳しいです
Bonsai-8Bを24問ベンチマークした結果、見えてきたのはかなり極端な性格でした。
- コード系は強い
- レビュー補助も意外といける
- 日本語の文化・常識・文脈はかなり厳しい
- Ollama未対応で、実運用の導線はまだ細い
- PrismMLフォーク経由で触る前提なので、気軽さでは勝てません
つまり、万能モデルではありません。 でも、**「コード職人だけど文化知識ゼロの同僚」**として割り切るなら、かなり面白いです。
24問の実測で見えたのは、得意分野の偏りでした
今回のベンチマークでは、単なる印象ではなく、実際の回答を見て判断しました。 その結果、点数よりも「どこで崩れるか」が重要だと分かります。
ざっくりした評価
| 項目 | 結果 |
|---|---|
| 総合評価 | ランクC |
| 事実上の強み | コード生成・コードレビュー |
| 弱み | 日本語の文化・慣用表現・文脈理解 |
| 実運用ハードル | PrismMLフォーク必須、Ollama未対応 |
| モデルサイズ | 1.15GB |
ランクCと聞くと、どうしても「微妙だったのかな」と思われがちです。 ただ、今回はそう単純ではありません。総合点はCでも、用途を絞ると急に実用域に入る。ここが肝です。
知性密度はかなり高い。サイズ効率は本当に強い
個人的に一番見たかったのはここです。 「小さいのに、どれだけ考えられるのか」。
知性密度の計算
- 98 ÷ 1.15 ≈ 85.2 点/GB
| 指標 | 値 |
|---|---|
| 総得点 | 98 |
| モデルサイズ | 1.15GB |
| 知性密度 | 85.2 点/GB |
この85.2点/GBは、かなり強い数字です。 少なくとも「ファイルサイズが小さいから、ただの軽量おもちゃでしょ」という見方は外れます。
過去に読んでくださった方なら、META-MARKの Gemma4 / Nemotron ベンチと比べたときの感覚が近いはずです。 今回は総合点そのものより、どれだけ容量を食わずに実用域へ届くかが目立ちました。
コードは満点。ここは素直に評価していい
ここは素直に評価したいところです。 Bonsai-8Bは、少なくとも今回の範囲ではコード問題で満点でした。
ここで大事なのは、「コードが書ける」だけではなく、
- 既存コードの意図を読もうとする
- 破綻したロジックをそれなりに修正する
- レビュー観点での指摘が出る
このあたりが、軽量モデルとしてはかなり健闘していることです。
もちろん、巨大モデルのような安定感はありません。 ですが、ローカルで常駐させて、コード補助だけに寄せるなら話は変わります。
「GPUが足りないから何もできない」より、小さくても役割を限定して使えるほうが現場では強いです。 用途の切り分けを考えるなら、まずは /ranking?category=gpu で今の選択肢を並べてみるのもありです。
日本語文化はかなり厳しい。ここは無理に擁護しません
一方で、日本語はかなり厳しいです。 単なる翻訳調ではなく、文化的な前提・空気感・言い回しで崩れます。
たとえば、会話の「間」や、少し遠回しな日本語の含み、あるいは背景知識が必要なネタになると、途端に雑になります。 文章としては成立していても、人間が読むと違和感が積み上がるタイプです。
ここは無理に持ち上げません。 日本語の文化理解が必要な用途には使わないほうがいいです。
逆に言うと、文化や文脈を問わない作業、たとえば
- コード補助
- コードレビュー
- ルールベースの整形
- 技術メモの下書き
このあたりなら、まだ使い道があります。
松尾芭蕉が植野明になったのは、ちょっと笑えました
今回の実測で、個人的にいちばん人間味があったのがここです。 文化・固有名詞の扱いで、松尾芭蕉が植野明になった場面がありました。
責める話ではありません。むしろ、こういうズレ方は面白いです。 モデルが「知っているつもり」で、別の何かに置き換えてしまう感じは、ある意味で1-bitらしい雑さでもあります。
ただ、実務でこれが出ると困ります。 俳句や文学、歴史、人物名の文脈では、安心して任せる段階ではないです。
PrismMLフォーク必須、Ollama未対応。ここは現実に効きます
性能の話だけなら盛り上がります。 でも、実際に使うとなると導線が大事です。
今回のBonsai-8Bは、PrismMLフォーク必須で、しかもOllama未対応です。 この時点で、普段 Ollama を入口にしている人には少し面倒です。
つまり、導入コストはこうなります。
- すぐ試せるわけではない
- 普段のローカルLLM運用にそのまま乗らない
- 検証環境の準備が必要
この「ひと手間」を許容できるかで、評価は変わります。 性能だけで見れば面白い。でも、導入の摩擦はちゃんとある。ここは分けて考えたほうがいいです。
もし自分の環境で「サイズに対してどこまで載せられるか」を見たいなら、試算は /calculator で先に済ませると判断が速いです。
このモデルの価値は、万能性ではなく“役割の狭さ”にあります
Bonsai-8Bを見ていて思ったのは、最近のローカルLLMで大事なのは「何でもできるか」ではない、ということです。 何を捨てて、何を残したかです。
Bonsai-8Bは、
- サイズを極限まで削る
- その代わり文化理解をかなり捨てる
- しかしコードはしっかり残す
という、かなり割り切った設計に見えます。
この割り切りに価値を感じる人は、たぶんこういう人です。
- エッジに載せたい
- 小ささが最優先
- 文章の綺麗さより、コードの補助が欲しい
- ローカルで完結する補助輪がほしい
逆に、自然言語の雑談や日本語での柔らかい対話を期待すると、かなり肩透かしです。
ランクCは失敗ではなく、用途を決めるための結果でした
ここが今回の一番大事なところです。
ランクCを「微妙」で終わらせるのは簡単です。 でも実際には、Cだからこそ用途を切れるとも言えます。
- コード用途なら前向きに検討できる
- 日本語文化用途は切る
- 運用面では PrismMLフォーク前提を受け入れるかどうか
- Ollama前提の人は待つか別案を選ぶ
こうやって整理すると、判断はかなりしやすくなります。
1.15GBでコード満点、知性密度85.2点/GB。日本語文化はかなり厳しい。 この二面性を、そのまま受け取るのがいちばん正確です。
次にどうするか
自分なら、次の順で判断します。
- コード補助専用の役割で試すか決める
- 自分の環境で サイズとメモリの制約 を確認する
- 日本語会話や文化系タスクには使わない前提で切る
- PrismMLフォークを触るコストを許容できるか見る
そして、RasPi 5 でのテストはかなり気になります。 次回はRasPi5での実用性を確かめる予定です。ここで本当にエッジ向きかが、もう少しはっきりします。
Bonsai-8Bは、世界初の1-bit LLMという看板よりも、実測すると用途がはっきり見えるモデルでした。 万能ではない。でも、役割がハマる場面では十分に面白い。 その意味で、これは「夢のモデル」ではなく、判断材料として価値があるモデルです。
どんな場面で効くか
- 次に試すローカルLLMを絞り込むために、スコアと用途の両面から判断材料が欲しい場面
- 使用中のモデルを更新すべきか、具体的な数値を見て判断したい場面
誰には不要か
- すでにモデル選定が完了していて、ベンチマーク情報が不要な人
- 特定の用途に絞っていて、汎用スコアより自分の実測結果だけで判断したい人
注意点・制約
- スコアはテスト設計と採点基準に依存します。他のベンチマークと単純比較はできません。
- 推論速度はGPU・量子化・同時実行数で大きく変わります。
- 実機で試すまで、スコアだけで用途を決めないほうが安全です。
どのように検証したか
- 統一した24問テストセットを使い、カテゴリ別(意地悪・論理・コード・日本語)にスコアを記録しました。
- 実機環境で確認し、ハードウェア構成・モデル設定・実行日時を併記しました。
よくある質問
スコアが低いと実用にならないですか?
用途を絞れば低スコアでも実用になる場面はあります。カテゴリ別スコアで得意分野を確認するのが判断しやすいです。
自分の環境でも同じ結果になりますか?
GPU・量子化・ランタイムが変わると速度・精度ともに変わります。本記事の環境を参考に、差異を見込んで判断してください。
他のモデルとどう比べればいいですか?
同じテストセットでのスコアが最も比較しやすいです。当サイトの過去ベンチ記事も参照してください。
参考リンク
この記事は、実務で AI ツールを活用している開発者・技術者向けに書いています。
関連記事
BlogGemma 4 E2B vs E4B:24問実測で見えた速度5倍差の使い分け基準Gemma 4 E2B(2B)とE4B(4B)を24問実測比較。スコア差9%・速度差5倍の実態と、VRAM 4GBで動く省電力LLMとして選ぶべき条件を整理。→
Blog格安モデルでも Rank S:Haiku 4.5 × 24問テスト実測(+Advisor で97.5%)Haiku 4.5を24問で実測。単体93%でも十分強く、Advisor(Opus)の2パスで97.5%まで改善。ただし自信満々に間違える盲点も見えました。→
BlogFable 5 は正解集のバグを見つけて、りんご問題で転んだ——24問実測レポートClaude Fable 5 を24問で実測。224点でHaiku 4.5(221点)を僅差で上回るが、中身は別物でした。正解集のバグ発見とA4誤答まで公開します。→
関連リンク
- 実際の構成を探すなら、GPU 比較ページやローカルLLM向け構成記事もあわせて見ると判断しやすいです。
- ハードウェア候補は用途別の AI 構成ガイドからたどると、単体製品より違和感なく検討できます。
この記事を書いた人
HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!
関連記事
Claude Codeを10時間放置で実測:177k再読は空ターン何回分か
約10時間放置したセッションの再開で 177k トークンが再書き込みされた実測を起点に、Claude Code で1時間キャッシュを空ターンで温め続ける価値を API 単価とサブスク枠の両面から損益分岐で計算しました。
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。
Fable 5.1 は『low で旧 max 超え』なのか|公式グラフ5枚をベンチ別に正直に読む
Claude Fable 5.1 の公式グラフ5枚をベンチ別に読み、low が旧 Fable 5 の max を超えたベンチと超えなかったベンチを表にしました。常用 effort の決め方と Pro/Max の課金条件も整理します。
月$200のClaude Codeを$138にした2日間 — z.ai GLM移行で踏んだ罠と、規約の本当の分かれ目
Claude Code の接続先を z.ai の GLM へ差し替え、月$200を$138にした2日間の実測記録。踏んだ罠7つ、reasoning effort が外部バックエンドでも効くかの実測、そして「サブスク枠なら白」が成り立たない理由を公式ページの実読から整理します。
関連AIツール
META-MARK × AI
ローカルAIを動かすGPU、ちゃんと選べていますか?
VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。
PR広告:開発環境・キャリアまわりのサービス