Triton
- 125B MoE を 3090 3 枚で運用する vLLM 最適化編
前回 80 tok/s で動作した Qwen3.8-Flash-Next を実運用に入れたところ、初回の TTFT が 100 秒、prefix caching を有効にすると KV 容量が 3 割減少、本番構成の decode は 60〜70 tok/s だった。1 並列 95-99 tok/s、4 並列 243 tok/s、画像入力、MTP 対応までに追加したパッチ 11 本の内容と、試して採用しなかった案をまとめる