vLLM

「vLLM」タグの記事(3件)

第2話. TANREN — 20年の古典キャッシュに、本番トレースの「未来」で 11勝1敗 連載

第2話. TANREN — 20年の古典キャッシュに、本番トレースの「未来」で 11勝1敗

キャッシュの追い出し(満杯になったとき何を捨てるか)は、20年以上研究されてきた分野です。その分野で、進化的探索が生成した53行の Python 関数が、Twitter の本番トレースの未来区間で ARC・LIRS・W-TinyLFU を上回りました。一度は特定時期への過適合で負けた経緯、それを解決した「離れた2窓」での訓練、誰でも再現できる公開コードまでを紹介します。

読む →
第4話. TANREN — 進化したスケジューラを vLLM に差し込んだら、重負荷でテール応答が半減した 連載

第4話. TANREN — 進化したスケジューラを vLLM に差し込んだら、重負荷でテール応答が半減した

LLM サービングの心臓部であるスケジューラを進化で作り、本物の vLLM に組み込んで実機 A/B 測定した記録です。実トレース 16 構成で既定の FCFS に 15 勝(p=2.6×10⁻⁴)、重負荷では mean/p99 とも 35〜49% 短縮、空いているときは悪影響ゼロでした。一度では勝てず、未知データで 0 勝 6 敗の全敗から原因分析を 6 周した過程も記載します。

読む →
第3話. TANREN — 進化したキャッシュ方策を、本物の vLLM に差し込んで測る 連載

第3話. TANREN — 進化したキャッシュ方策を、本物の vLLM に差し込んで測る

シミュレーションで勝った追い出し方策を、稼働中の vLLM に組み込んで実機で測りました。一度は「シミュレーションの勝ちが実機で消える」という失敗を経て、測る場所と指標を見直し、メモリ圧下のテール応答(p99 TTFT)を 13〜16% 短縮するに至った記録です。試作実装の代償や、効果が出ない条件も実測のまま記載します。

読む →