程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24 +0800 CST
views 7
(见附件markdown文件)
复制全文
生成海报
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
推荐文章