程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
int8量化 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
llama.cpp GGUF 量化:Q8_0 生成速度低于 Q4_K_M,以及 imatrix 与 --tensor-type 的用法
编程
llama.cpp GGUF 量化:Q8_0 生成速度低于 Q4_K_M,以及 imatrix 与 --tensor-type 的用法
2026-09-27 00:04:53
llama.cpp 的 GGUF 量化实操:两阶段流程(convert_hf_to_gguf + llama-quantize)、imatrix 重要性矩阵、--pure/--allow-requantize 风险、--tensor-type 正则与多模态 mmproj 单独量化。附 Llama 3.1-8B 各量化档位的体积与速度对照,Q8_0 生成速度反低于 Q4_K_M 的反直觉点。
int8量化
GGUF
llama.cpp
Q8_0
imatrix
模型量化
vLLM INT8 W8A8 量化:Blackwell 卡不支持,环境还得和推理分开
编程
vLLM INT8 W8A8 量化:Blackwell 卡不支持,环境还得和推理分开
2026-09-27 00:03:47
用 llm-compressor 把 LLM 量化为 INT8 W8A8 并在 vLLM 加载的完整流程:加载模型、准备校准数据、SmoothQuant+GPTQ oneshot、lm_eval 评估。含硬件边界(INT8 仅支持 CC>7.5,Blackwell CC>=10.0 需改用 FP8)、vLLM 与 llm-compressor 分环境、忽略 lm_head、add_bos_token 评估坑与常见报错排查。
int8量化
vLLM
llm-compressor
W8A8
GPTQ
SmoothQuant
模型量化
Moonshine 深度解剖:27M 参数挑战 Whisper——可变长度推理、RoPE 与毫秒级流式延迟的边缘 ASR 工程真相
编程
Moonshine 深度解剖:27M 参数挑战 Whisper——可变长度推理、RoPE 与毫秒级流式延迟的边缘 ASR 工程真相
2026-07-25 13:44:10
深度拆解 Moonshine 边缘端语音识别模型:可变长度推理如何免除 Whisper 的 30 秒填充税、RoPE 与卷积波形前端的架构决策、34ms 流式延迟原理,附 Python/ONNX/浏览器三条部署路线与量化调优实战。
Moonshine
语音识别
ASR
Whisper
边缘计算
RoPE
ONNX
INT8量化
流式识别
开源
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调