TANREN

「TANREN」タグの記事(8件)

第7話. TANREN — 負け戦 Atari Bowling が生んだ「参入ゲート」— 走る前に勝敗を測る秤 連載

第7話. TANREN — 負け戦 Atari Bowling が生んだ「参入ゲート」— 走る前に勝敗を測る秤

R2D2・人間基準・DQN は超えたものの、最強RLの74%で頭打ちになった Atari Bowling の記録です。頭打ちの原因が「読める反応型コード」というクラスの構造的な天井だったことを実測で確定させ、以後のすべての実験の入口を守る「参入ゲート」が生まれるまでを書きます。

読む →
第5話. TANREN — Breakout で「トンネル戦法」を自力発見し、届かない理由も計測で確定させた 連載

第5話. TANREN — Breakout で「トンネル戦法」を自力発見し、届かない理由も計測で確定させた

誰にも教わらず「トンネル戦法」を自力発見し、人間基準の約6.1倍のスコアに到達した Breakout の記録です。同時に、最強の強化学習に届かなかった理由を憶測ではなく計測で確定させ、「読める数十行のコード」という手法の適用範囲に境界線を引きます。

読む →
第2話. TANREN — 20年の古典キャッシュに、本番トレースの「未来」で 11勝1敗 連載

第2話. TANREN — 20年の古典キャッシュに、本番トレースの「未来」で 11勝1敗

キャッシュの追い出し(満杯になったとき何を捨てるか)は、20年以上研究されてきた分野です。その分野で、進化的探索が生成した53行の Python 関数が、Twitter の本番トレースの未来区間で ARC・LIRS・W-TinyLFU を上回りました。一度は特定時期への過適合で負けた経緯、それを解決した「離れた2窓」での訓練、誰でも再現できる公開コードまでを紹介します。

読む →
第8話. TANREN — 「超えた」と言いかけた数字を、自分で取り下げた話 — Atari Freeway と測定の誠実さ 連載

第8話. TANREN — 「超えた」と言いかけた数字を、自分で取り下げた話 — Atari Freeway と測定の誠実さ

一度は「DQN 超え」に見えた 31.9 が、公表側と同じ評価条件で測り直すと 28.6 に下がりました。数字を取り下げ、検証器を修理し、正しい条件で進化をやり直して 31.2 — 人間と DQN を超え、Agent57 の96%に到達するまでの記録です。評価プロトコルの誠実さを主題にした一本です。

読む →
第6話. TANREN — 深層RL最難関の Atari Skiing で、読める Python が公表全RLに全勝した 連載

第6話. TANREN — 深層RL最難関の Atari Skiing で、読める Python が公表全RLに全勝した

Agent57 が人間超えに約780億フレームの学習を要した Atari Skiing で、読める Python 約130行が最終判定 −3310.7 を記録し、公表されている全RLエージェントと人間基準に勝ちました。走る前に勝算を測る「参入ゲート」、進化が自力で加えた工夫、1日・API数ドルというコストの対比を記載します。

読む →
第4話. TANREN — 進化したスケジューラを vLLM に差し込んだら、重負荷でテール応答が半減した 連載

第4話. TANREN — 進化したスケジューラを vLLM に差し込んだら、重負荷でテール応答が半減した

LLM サービングの心臓部であるスケジューラを進化で作り、本物の vLLM に組み込んで実機 A/B 測定した記録です。実トレース 16 構成で既定の FCFS に 15 勝(p=2.6×10⁻⁴)、重負荷では mean/p99 とも 35〜49% 短縮、空いているときは悪影響ゼロでした。一度では勝てず、未知データで 0 勝 6 敗の全敗から原因分析を 6 周した過程も記載します。

読む →
第3話. TANREN — 進化したキャッシュ方策を、本物の vLLM に差し込んで測る 連載

第3話. TANREN — 進化したキャッシュ方策を、本物の vLLM に差し込んで測る

シミュレーションで勝った追い出し方策を、稼働中の vLLM に組み込んで実機で測りました。一度は「シミュレーションの勝ちが実機で消える」という失敗を経て、測る場所と指標を見直し、メモリ圧下のテール応答(p99 TTFT)を 13〜16% 短縮するに至った記録です。試作実装の代償や、効果が出ない条件も実測のまま記載します。

読む →
第1話. TANREN — Atari Pong 21–0 と、進化のループが自力で見つけたキルショット 連載

第1話. TANREN — Atari Pong 21–0 と、進化のループが自力で見つけたキルショット

安価な LLM がコードを書き、決定論の検証器が採点する進化のループが、128 バイトの RAM だけを頼りに Atari Pong の理論上限(40 試合すべてで 21–0)に届き、誰にも教わらず「必殺の一打」を発見するまで。正直なプロトコルと、数ドルで成立させた診断ループも記載します。

読む →