2026年9月11日 · 5 min · llm, vllm, quantization, qwen, gpu
vLLM は INT5/6/7 の重みをネイティブに実行できる。この強さと、 embed_tokens / lm_head を 量子化してもロスが少ない結果を解説する。