Skip to content
Charles
Go back

大模型量化框架对比

Edit page

本文只比较模型权重、激活和 KV Cache 的量化方案;推理部署、微调和智能体编排分别见对应专题文章。

量化框架对比

框架/方法核心技术亮点量化精度支持精度损失易用性典型速度/显存收益典型适用场景主要短板
GPTQ层级后训练量化(one-shot)INT4 / INT3 / INT2较小中等极高(2-4×)权重量化后离线部署不支持动态量化、对称性要求高
AWQ激活感知权重量化INT4 主力极小(SOTA之一)高精度 INT4 需求场景主要针对权重量化
bitsandbytesNF4 / FP4 + 双重量化8bit / 4bit(NF4)小~中等高(HF 集成)中~高训练时量化 + 推理(QLoRA 常用)推理速度不如专用内核
llama.cpp / GGUF混合精度 + k-quants(Q4_K_M 等)Q8_0 ~ Q2_K中等~较大中等高(CPU/GPU 均可)本地/边缘/低配机器量化部署精度损失相对明显
HQQHalf-Quadratic QuantizationINT4/2bit 等极小中等很高追求极致低比特高精度场景生态尚在快速发展
llm-compressorvLLM官方压缩库,支持混合精度、KV Cache/Attention量化FP8/NVFP4/Mixed 等极小高(与vLLM无缝)极高vLLM生产部署优化、MoE/大模型主要服务vLLM生态

量化框架推荐

过时项目(存量)

项目状态处理建议
AutoAWQ上游曾停更并存在归档风险新项目优先使用 AWQ 官方路径或 vLLM 生态;存量项目先锁定版本
相关主题:项目选型

Edit page
Share this post:

Previous Post
AI Coding Plan 对比
Next Post
大模型推理与部署框架对比