メインコンテンツへスキップ
← ブログに戻る
事例紹介2026年10月4日by K.hirano

GLM 5.3 Flashは歩くことを覚えたが、向きは覚えなかった

GLM 5.3 Flashをヒントなしで砲撃ゲーム20連戦。経験ノートで覚えたこと、最後まで直らなかった失敗を追います。

#AI戦車バトル#GLM 5.3 Flash#LLM#AIエージェント#ケーススタディ

安いAIに同じ作業を何度も任せ、試合後の振り返りメモまで渡したら、本当に上達するのか。ベンチマークの点数だけでは、この問いには答えにくいものです。何を覚えたのか、どの失敗を繰り返したのか。その中身を、ゲーム中の一言と経験ノートの変化で追います。

先に結論を置くと、経験ノートは「試してみること」と「過去の数値を再利用すること」には効きました。一方で、壁や谷を見て移動へ切り替える判断や、渡されていない情報を正しく補うことまでは支えられませんでした。メモが長くなっても、状況認識まで正しくなるわけではありません。

今回から、自作の砲撃ターン制ゲーム「TankTankRevolution」でLLMを戦わせる連載「AI戦車バトル」を始めます。ゲーム自体は4人オンライン対戦の身内用として作ってきたもので、絵と音はすべて自作または生成です。2026年10月3日に、LLM同士やLLM対CPUを戦わせる「AIアリーナ」を企画し、対戦モードとして組み込みました。

第1回は、GLM 5.3 Flashを1モデルだけ使った探索です。試合後にAI自身が経験ノートを書き直し、そのノートだけを次の試合へ持ち越しました。重みを学習させたわけではありません。文章の外部メモを毎回読み直させた、という実験です。n=1、つまり1モデルによる20連戦なので、AI全般の性質とは分けて読んでください。

GLM 5.3 Flashによる20連戦の条件と費用

GLM 5.3 Flashは、8月に正体を伏せて公開された「Ox Alpha」の中身だったZ.aiのモデルです(経緯はOx Alphaの正体を追った記事にまとめています)。今回はOpenRouter経由で呼び出しました。考える量はlow、温度は0、最大出力は4096です。相手はCPUかんたん、機体は双方ともboulder、画面には数字の帯があるB1部門を使いました。

AIに渡したのは、人間向けと同じ「あそびかた」ヘルプ、AI向け付録、そしてゲーム画面の画像です。物理の係数や能力値、弾道式といった攻略情報は渡していません。20試合で539回呼び出し、費用は0.5099ドル、1試合あたりではおよそ0.007〜0.043ドルでした。20試合は途中停止せず完走しています。

成績は5勝14敗1分、勝率25%でした。命中率は7.7%で、CPUかんたんの14%を下回っています。1手あたりの平均時間は10.8秒。不正応答率は1.2%、パス率は2%でした。勝った5試合のうち、2試合目だけは撃破ではなく時間切れの判定勝ちです。

GLM 5.3 Flashは最初の3試合で「試す」動きを増やした

GLM 5.3 Flash の20試合の推移グラフ。命中した数・歩いた回数・強弾と特殊弾を撃った数を試合ごとに並べたもの20試合の推移。●は勝ち、○は引き分け。13試合目から同じ地形の2周目(ゲームの実データから作成)

1試合目、GLM 5.3 Flashは一度も歩きませんでした。32発撃って6発命中し、試合には勝っています。最初の一手は、画面から状況を読みながら観測用の射撃を選んでいました。

GLM 5.3 Flash|1試合目・最初の一手
初弾は観測用。敵は左下にいるので左向き、45度付近で中パワー。右向きの風10で流される分をやや強めに。

1試合目(丘の地形)で GLM 5.3 Flash が風9の中、45度で撃って決着をつけた瞬間のゲーム画面1試合目の決着の一撃。右上が GLM 5.3 Flash(ゲームの実画面)

この試合の後に書いた経験ノートは403字でした。中心にあったのは、風ごとのパワー表です。一方で、次のような移動の提案もすでに書かれていました。

経験ノート(1試合目の後に AI が書いたもの・抜粋)
強弾・特殊弾・アイテムは未使用だったが、とどめや削地形には強弾も有効か。歩行・テレポートで距離610を縮めれば校正が格段に楽になる。

ノートが先に「歩いたほうがよい」と示したあと、2試合目の5手番で初めて歩きました。

GLM 5.3 Flash|2試合目・5手番(初めて歩いた)
45/100でも向かい風11で手前に返された。角度を下げて弾道を低くし風の影響を減らしつつ、右へ歩いて距離を詰める

この2試合目を、実際のゲーム画面で再生した動画です。

ただし、動画を見ると向きが定まっていません。記録を突き合わせると、この試合の敵は左側にいました(AIの弾が初めて当たったのは、左へ大きく移動した後の43手番です)。ところがAIは1手番目に、こう判断しています。

GLM 5.3 Flash|2試合目・1手番
敵は右側の遠方。風11の向かい風で弾が戻されるため、基準77より大きめに入れて挙動を観測する

最初の8発(1〜15手番)は、すべて自分の右側、つまり敵と反対の方向に着弾しました。AIは風とパワーの調整に頭を使っていましたが、それ以前に撃つ向きが敵と反対でした。5手番の「右へ歩いて距離を詰める」も、敵から遠ざかる一歩でした。左へ撃ち始めたのは17手番からで、27・29手番ではまた右へ撃っています。

同じ2試合目の11手番では、初めてアイテムも使っています。

GLM 5.3 Flash|2試合目・11手番(初めてアイテムを使った)
向かい風11が最大の障害。無風アイテムで風を消し、過去の校正値50度/82(距離610)をそのまま使って命中を狙う

2試合目は40発中2発の命中で、時間切れによる判定勝ちでした。勝ち方としてはかなり危うい。初めての一歩は逆向きでしたが、それでも1試合目にはなかった「移動する」「アイテムを使う」という選択肢を、自分から試した点は記録に残ります。歩くことは覚えても、どちらへ歩くかはまだ分かっていなかった、ということです。

2試合目(山の地形)で、山頂に陣取った GLM 5.3 Flash が22発目で初めて命中させた瞬間のゲーム画面2試合目、山頂から22発目でようやく初命中(ゲームの実画面)

3試合目では強弾と特殊弾を初めて使いました。強弾については、次の判断です。

GLM 5.3 Flash|3試合目・33手番(初めて強弾)
45/100通常弾は最大でも×約x820で届かない。強弾は威力も射程も上と期待し、風2追い風で45度/100強弾を試す

特殊弾を選んだ場面では、さらに切迫した判断になっています。

GLM 5.3 Flash|3試合目・35手番(初めて特殊弾)
残りHP20で背水。45/100通常でも280不足だったため、燃料120で右へ寄り、最強の特殊弾45/100追い風4で一か八かの長射程を狙う

結果は35発0命中の引き分けでした。新しい道具を使ったことと、勝てたことは別です。ここは混同しないほうがよいところです。

GLM 5.3 Flashは2周目の開けた地形で弾数と命中を改善した

12種類の地形を一巡したあと、13試合目から同じ地形をもう一度回りました。開けた地形では、1周目より少ない発射数で勝っています。

地形1回目2回目
hills32発・6命中で勝利23発・8命中で勝利
forest26発・6命中で勝利18発・7命中で勝利

命中率で見ると、hillsは18.8%から34.8%、forestは23.1%から38.9%になりました。試合数が少ないため、この数字だけで安定した上達とは言えません。ただ、経験ノートに蓄積した風別の校正値を使い、同じ条件で撃ち直す動きは確認できます。

13試合目(2周目の丘)で GLM 5.3 Flash が23発8命中で勝ちを決めた瞬間のゲーム画面2周目の丘(13試合目)。左が GLM 5.3 Flash、23発8命中で勝利(ゲームの実画面)

17試合目のforestでは、18発中7発が命中して勝利しました。17試合目の後のノートには、次の振り返りが残っています。

振り返り(17試合目の後に AI が書いたもの)
風別の命中P実績(風4:P74、風6:P76等)を基準に同条件連打する校正が機能し、18撃7命中で勝利。

「表を作る」「開けた場所で同じ条件を再利用する」は、今回のノートで機能した部分です。少なくとも、経験を文章に残すことで、再利用できる観測値は増えていきました。

GLM 5.3 Flashは壁と谷をノートに書いても越えられなかった

一方で、地形による失敗は最後まで残りました。castle、canyon、zengarden、demoncastleは、2回とも命中0です。壁や谷など、弾道を遮る地形を攻略できませんでした。

4試合目(渓谷の地形)。谷と崖に阻まれた GLM 5.3 Flash に CPU かんたんがとどめを刺す瞬間のゲーム画面4試合目の渓谷。左の GLM 5.3 Flash は谷を越えられず、CPU かんたんのとどめを受けた(ゲームの実画面)

10試合目の後には、原因をかなり具体的に書いています。

振り返り(10試合目の後に AI が書いたもの)
無風アイテムで壁阻害と判明した後も移動せず高角砲に固執した。

問題は、原因を言語化できなかったことではありません。原因を書いた次の試合でも、その知識が行動に変わらない場面が残ったことです。13試合目の振り返りにも、同じ種類のズレがあります。

振り返り(13試合目の後に AI が書いたもの)
強弾・特殊弾・アイテムを一切使わず、とどめも通常弾のまま。

ノートには強弾や特殊弾の使い道があり、実際に3試合目には試しています。それでも、状況が変わると通常弾へ戻る。文章としての反省と、手番での選択は別の処理になっていました。

迷うとしたら、「メモを書き直させるだけで十分か、それともゲーム状態を構造化して渡す必要があるか」の境目です。今回の結果を見る限り、風とパワーの対応表には効果がありましたが、遮蔽物を見て移動へ切り替える判断までは支えきれませんでした。

GLM 5.3 Flashの最後のノートには渡していない数値が現れた

20試合目の後に保存された最後の経験ノートは604字です。冒頭には、次の指示が置かれていました。

経験ノート(20試合目の後・最後の版の冒頭)
【最優先】①開幕はterrainHeightsで敵x・自分x・距離・高低差・遮蔽物を必ず数値把握。距離誤読が最大敗因(本試合:距約1000を近距離と誤認し17手番浪費)。

ただし、今回の画面部門ではterrainHeightsという数値はAIに渡していません。この語がノートに初めて現れたのは15試合目の後です。最後には、存在しない入力を前提にした作戦が、最優先事項として置かれていました。

20試合目のdemoncastleでは、壁を越えられないまま、AI自身の手番中に落下して撃破されています。発射の記録がないままCPUの勝ちで終了しました。試合後の振り返りはこうです。

20試合目(魔城の地形)。高い壁を越えられず、GLM 5.3 Flash が自分の手番に落下して敗れた場面のゲーム画面20試合目の魔城。中央の GLM 5.3 Flash は左右の高い壁を越えられないまま、この手番で落下した(ゲームの実画面)

振り返り(20試合目の後に AI が書いたもの)
80度P100でも越えられない壁は即移動すべきだった。移動判断が遅すぎた。

反省の方向は合っています。しかし、その前提となる地形数値は渡されていません。経験ノートは長くなり、優先順位も付いていきましたが、入力にない観測を補ってしまう問題は解消しませんでした。

経験ノートが効いた範囲と効かなかった範囲

今回の20連戦から、AIが一般に学習できる、あるいはできないと結論づけることはできません。GLM 5.3 Flashを1モデル、1条件で試しただけです。

私の見立てでは、経験ノートが役に立ったのは、まず試してみることと、数値表を再利用することでした。2試合目に歩行とアイテム(最初の一歩は逆向きでした)、3試合目に強弾と特殊弾を試し、hillsとforestの2周目では少ない弾数で勝っています。文章のメモが、選択肢の存在と過去の校正値を持ち越した形です。

反対に、地形のように画面全体を読み、移動・射撃・アイテム使用を同時に切り替える問題では、メモだけでは足りませんでした。2試合目には敵の左右を取り違えたまま、敵と反対へ撃ち、反対へ歩いていました。「早く移動すべき」と何度書いても、次の試合で同じ場所に留まる。さらに、渡されていない数値を前提にしてしまう。記憶が増えたことと、状況認識が正しくなったことは同じではありません。

第1回の判断材料はここです。経験ノートは、AIに「前に試した条件」を思い出させる仕組みとしては使える。一方で、見えていない情報を正しく補う仕組みでも、書いた反省を必ず実行する仕組みでもない。安いAIに反復作業を任せるなら、メモの長さよりも、次の試合で実際に選択が変わったかを確認したほうがよさそうです。

次回以降は、モデルや条件を変えたときに、ノートの持ち越しが同じように働くのかを見ていきます。なお、AI同士を会話で対決させる別の連載「AIコロシアム」では、AIに相手の実力を判定させる実験をしています。こちらは言葉の勝負、AI戦車バトルは手番の選択の勝負です。

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

Claude Code の新effortモード徹底解説|max・ultracode・autoと『呪文ultrathink』の正体
チュートリアル2026年5月30日

Claude Code の新effortモード徹底解説|max・ultracode・autoと『呪文ultrathink』の正体

Claude Code の /effort に増えた max・ultracode・auto と、プロンプトに紛れ込ませる呪文 ultrathink を、公式が明言した『ultracode は API の effort レベルではない』を起点に解剖。overthinking・自律ワークフロー・永続性と優先順位の罠まで、誤解されやすい論点を一次情報で正します。

#Claude#ClaudeCode#Anthropic#AIエージェント#LLM
Claude Code の /effort 完全ガイド|low〜maxの使い分けと『コストが増える本当の理由』
チュートリアル2026年5月30日

Claude Code の /effort 完全ガイド|low〜maxの使い分けと『コストが増える本当の理由』

Claude Code の /effort(low〜max・ultracode・auto)は「賢さ」ではなく「トークンの気前よさ」のレバー。モデル別の推奨スタートと、Opus 4.8 でコストが増えた気がする原因を『トークナイザ』と『effort』の2軸に切り分ける考え方を、公式一次情報と v2.1.156 の実機確認で解説します。

#Claude#ClaudeCode#Anthropic#LLM#AIエージェント
Claude Opus 4.8 は何が変わった?ベンチより「正直さ」と並列エージェントが本命だった
お知らせ2026年5月29日

Claude Opus 4.8 は何が変わった?ベンチより「正直さ」と並列エージェントが本命だった

Claude Opus 4.8 で本当に変わったのは、ベンチの数ポイントではなく『正直さ』と並列サブエージェントでした。公式ベンチ、4つの新機能、OpenRouter の実トラフィックを重ねて、価格据え置きの今回のアップデートを乗り換え目線で整理します。

#Claude#Anthropic#LLM#AIエージェント#コーディング
effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した
開発ログ2026年9月3日

effort を途中で変えるとキャッシュはどうなる? Fable 5.1 と Opus 5 で実測した

Fable 5.1 の値下げはキャッシュ読みだけ。Claude Code が TTL を決める仕組み、キャッシュを壊す操作と壊さない操作、effort 切替時の再書き込みを Fable 5.1 と Opus 5 の usage で実測しました。

#Claude Code#Claude#Anthropic#LLM#コスト削減

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。