Cuda
- FP8 / NVFP4 の weight-only 推論で RTX 3090 が失っているものは無い
FP8 / FP4 のテンソルコアが使われるのは、アクティベーションも FP8 / FP4 に量子化したときだけである。weight-only (A16) では、RTX 3090 も Blackwell も BF16 のテンソルコアで計算する。vLLM のコード、5090 用にビルドされた SASS、3090 での実測 (カーネル時間・クロック固定・Nsight Compute) で根拠を示し、3090 が実際に失っているもの (W8A8 / W4A4 の prefill の演算上限) と、想定される反論への回答をまとめる。