Atari

「Atari」タグの記事(5件)

第7話. TANREN — 負け戦 Atari Bowling が生んだ「参入ゲート」— 走る前に勝敗を測る秤 連載

第7話. TANREN — 負け戦 Atari Bowling が生んだ「参入ゲート」— 走る前に勝敗を測る秤

R2D2・人間基準・DQN は超えたものの、最強RLの74%で頭打ちになった Atari Bowling の記録です。頭打ちの原因が「読める反応型コード」というクラスの構造的な天井だったことを実測で確定させ、以後のすべての実験の入口を守る「参入ゲート」が生まれるまでを書きます。

読む →
第5話. TANREN — Breakout で「トンネル戦法」を自力発見し、届かない理由も計測で確定させた 連載

第5話. TANREN — Breakout で「トンネル戦法」を自力発見し、届かない理由も計測で確定させた

誰にも教わらず「トンネル戦法」を自力発見し、人間基準の約6.1倍のスコアに到達した Breakout の記録です。同時に、最強の強化学習に届かなかった理由を憶測ではなく計測で確定させ、「読める数十行のコード」という手法の適用範囲に境界線を引きます。

読む →
第8話. TANREN — 「超えた」と言いかけた数字を、自分で取り下げた話 — Atari Freeway と測定の誠実さ 連載

第8話. TANREN — 「超えた」と言いかけた数字を、自分で取り下げた話 — Atari Freeway と測定の誠実さ

一度は「DQN 超え」に見えた 31.9 が、公表側と同じ評価条件で測り直すと 28.6 に下がりました。数字を取り下げ、検証器を修理し、正しい条件で進化をやり直して 31.2 — 人間と DQN を超え、Agent57 の96%に到達するまでの記録です。評価プロトコルの誠実さを主題にした一本です。

読む →
第6話. TANREN — 深層RL最難関の Atari Skiing で、読める Python が公表全RLに全勝した 連載

第6話. TANREN — 深層RL最難関の Atari Skiing で、読める Python が公表全RLに全勝した

Agent57 が人間超えに約780億フレームの学習を要した Atari Skiing で、読める Python 約130行が最終判定 −3310.7 を記録し、公表されている全RLエージェントと人間基準に勝ちました。走る前に勝算を測る「参入ゲート」、進化が自力で加えた工夫、1日・API数ドルというコストの対比を記載します。

読む →
第1話. TANREN — Atari Pong 21–0 と、進化のループが自力で見つけたキルショット 連載

第1話. TANREN — Atari Pong 21–0 と、進化のループが自力で見つけたキルショット

安価な LLM がコードを書き、決定論の検証器が採点する進化のループが、128 バイトの RAM だけを頼りに Atari Pong の理論上限(40 試合すべてで 21–0)に届き、誰にも教わらず「必殺の一打」を発見するまで。正直なプロトコルと、数ドルで成立させた診断ループも記載します。

読む →