怎么看这个结果
权重优先采用指定公开 GGUF 文件字节数;BF16 按参数量×2。Q4_K_M 等混合量化不冒充单一 bpw。运行时预留仅作规划参考,不用于“能否装下”的结论。
对于当前混合注意力模型,“已知显存下界”只包含权重和 full-attention KV;未核实的 recurrent state、分配器、量化尺度/对齐、后端工作区等额外开销不会被伪装成已知。下界未超显存不等于能加载;只有下界已超显存时才能确定超出。
LOCAL LLM / VRAM PLANNER
选择显卡和模型,直接查看不同量化、上下文与 KV Cache 的显存下界。默认按单卡、单并发估算。
RESULT
·
KV Q4/Q8 是每值字节数的下界,量化尺度、对齐及后端实现可能增加占用。
| Context | KV 未量化 | KV Q8 | KV Q4 |
|---|
当前选择的上下文和 KV 类型下,各权重量化档位的已知下界。
| 量化 | 权重 | 已知下界 | 结论 |
|---|
权重优先采用指定公开 GGUF 文件字节数;BF16 按参数量×2。Q4_K_M 等混合量化不冒充单一 bpw。运行时预留仅作规划参考,不用于“能否装下”的结论。
对于当前混合注意力模型,“已知显存下界”只包含权重和 full-attention KV;未核实的 recurrent state、分配器、量化尺度/对齐、后端工作区等额外开销不会被伪装成已知。下界未超显存不等于能加载;只有下界已超显存时才能确定超出。
模型仓库:官方 Hugging Face 仓库 · 固定 revision 的 config.json
GGUF 量化文件:Unsloth GGUF 仓库;逐档来源:
显卡显存依据 NVIDIA/AMD 产品规格;2080 Ti 22GB、3080 20GB 为非官方改装容量。
未找到 NVIDIA 官方“4090 D V2”型号,因此不自动替换为其他显卡。
页面未覆盖用户提到的其他衍生模型;没有对应架构和权重文件证据前,不声称支持。