Exllamav3
- 3090x3で 314 万コンテキスト; KVキャッシュをホストRAMに置けるアーキテクチャの偉大さ
Qwen Sparse Attention は、文脈がどれだけ長くても1ステップで読むトークン数が変わらない。このおかげで、KVキャッシュはホストRAMに置ける。同じGPU 3枚のまま上限が 23.4 万から 314 万トークンになった。
Qwen Sparse Attention は、文脈がどれだけ長くても1ステップで読むトークン数が変わらない。このおかげで、KVキャッシュはホストRAMに置ける。同じGPU 3枚のまま上限が 23.4 万から 314 万トークンになった。