<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Triton on minamism</title><link>https://minamism.com/ja/tags/triton/</link><description>Recent content in Triton on minamism</description><generator>Hugo</generator><language>ja-JP</language><lastBuildDate>Fri, 25 Sep 2026 05:00:00 +0900</lastBuildDate><atom:link href="https://minamism.com/ja/tags/triton/index.xml" rel="self" type="application/rss+xml"/><item><title>125B MoE を 3090 3 枚で運用する vLLM 最適化編</title><link>https://minamism.com/ja/posts/flash-next-vllm-optimization/</link><pubDate>Fri, 25 Sep 2026 05:00:00 +0900</pubDate><guid>https://minamism.com/ja/posts/flash-next-vllm-optimization/</guid><description>前回 80 tok/s で動作した Qwen3.8-Flash-Next を実運用に入れたところ、初回の TTFT が 100 秒、prefix caching を有効にすると KV 容量が 3 割減少、本番構成の decode は 60〜70 tok/s だった。1 並列 95-99 tok/s、4 並列 243 tok/s、画像入力、MTP 対応までに追加したパッチ 11 本の内容と、試して採用しなかった案をまとめる</description></item></channel></rss>