程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
量化 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
faster-whisper:Whisper 推理提速 4 倍、显存砍半的 CTranslate2 实现
编程
faster-whisper:Whisper 推理提速 4 倍、显存砍半的 CTranslate2 实现
2026-09-12 09:46:57
faster-whisper 基于 CTranslate2 重写 OpenAI Whisper 推理引擎:13 分钟音频转写从 2 分 23 秒降到 59 秒(批量模式 16 秒),显存占用降低约 38%,内置 Silero VAD 防幻觉,API 与官方版几乎一致,迁移只需改几行代码。
faster-whisper
Whisper
语音识别
CTranslate2
量化
Qdrant 1.19 深度拆解:当向量数据库把内存成本「榨」到极限——从 HNSW 图、TurboQuant 量化到内存分层与分布式 Raft 的全链路实战
编程
Qdrant 1.19 深度拆解:当向量数据库把内存成本「榨」到极限——从 HNSW 图、TurboQuant 量化到内存分层与分布式 Raft 的全链路实战
2026-08-19 02:14:48
深度拆解 Qdrant 1.19:从 HNSW 分层可导航小世界图、TurboQuant 混合量化、Memory Tiers 内存分层到 Raft 分布式与原地过滤,配可运行代码与生产调优清单。
Qdrant
向量数据库
HNSW
TurboQuant
量化
RAG
内存分层
分布式
Rust
近似最近邻
llmfit 深度拆解:Rust 写就的本地大模型选型神器——一行命令把"显存够不够跑"从玄学变成算术
编程
llmfit 深度拆解:Rust 写就的本地大模型选型神器——一行命令把"显存够不够跑"从玄学变成算术
2026-08-18 08:15:14
llmfit 是一款 Rust 编写的本地大模型选型工具,一行命令自动检测硬件配置,精确计算显存占用,给出 Fit 评分和速度估算,支持 Ollama、llama.cpp、MLX 等多运行时,配可运行代码与最佳实践。
llmfit
Rust
TUI
本地大模型
LLM推理
Ollama
llama.cpp
模型选型
量化
Apple Silicon
GPU
显存计算
MLX
命令行工具
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
编程
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
2026-08-12 11:14:56
深度拆解 2026 年四大主流推理框架 vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 的核心技术、性能对比与选型指南,涵盖 PagedAttention、Continuous Batching、量化优化、分布式推理与生产踩坑清单。
vLLM
TensorRT-LLM
TGI
DeepSpeed-MII
大模型推理
KV Cache
PagedAttention
推理优化
量化
分布式推理
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
编程
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
2026-08-06 06:16:32
深度拆解2026年四大主流LLM推理框架:vLLM 0.5 PagedAttention进化、TGI 2.0流式输出优化、TensorRT-LLM 1.8算子融合、DeepSpeed-MII 0.9自动优化,含完整架构分析、代码实战、性能基准测试与成本计算
LLM
vLLM
TensorRT-LLM
推理框架
PagedAttention
量化
GPU
H100
大模型
DeepSpeed
TGI
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
编程
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
2026-08-03 10:45:17
深度拆解llama.cpp四大核心架构:GGUF模型格式设计、GGML计算引擎、8种多后端抽象层、K-Quant/I-Quant量化技术体系,附完整代码示例与性能基准测试
llama.cpp
GGUF
GGML
量化
端侧推理
LLM
C++
推理引擎
多后端
K-Quant
DeepSeek V4 架构全拆解:MLA 压缩、MoE 动态路由与 1.6T 参数的工程哲学——从训练到推理的全栈重构
编程
DeepSeek V4 架构全拆解:MLA 压缩、MoE 动态路由与 1.6T 参数的工程哲学——从训练到推理的全栈重构
2026-08-03 00:13:26
深度拆解 DeepSeek V4 四大核心架构创新:MLA 16x KV Cache 压缩、MoE-Routing v2 Token级动态路由、HAAA混合注意力、antirez ds4.c推理引擎,附完整代码示例与生产部署指南
DeepSeek
MoE
MLA
KV Cache
大模型
AI推理
开源
性能优化
混合注意力
量化
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
编程
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
2026-07-24 18:44:04
深度拆解 GitHub Trending 开源工具 llmfit:四维评分系统、量化自动试探、MoE 精算、带宽速度模型、Plan 模式与 bench 众包校准,从第一性原理讲透本地大模型的硬件适配方法论。
llmfit
本地大模型
LLM
Rust
量化
Ollama
llama.cpp
Apple Silicon
硬件适配
开源
llmfit 深度拆解:一条命令算清你的机器能跑哪个大模型,Rust 硬件探测与适配度评分引擎全解析
编程
llmfit 深度拆解:一条命令算清你的机器能跑哪个大模型,Rust 硬件探测与适配度评分引擎全解析
2026-07-24 07:14:55
深度拆解 GitHub Trending 破万星的 llmfit:Rust 硬件探测、权重与 KV cache 显存估算公式、内存带宽速度模型、MoE offload 运行模式,附 100 行 Python 复现 mini-llmfit 与工程集成实战。
llmfit
Rust
本地大模型
Ollama
llama.cpp
量化
KV cache
MoE
硬件选型
开源
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
编程
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
2026-07-19 14:42:08
深度拆解 colibrì 项目:一位意大利开发者用 10 天、1300 行纯 C 代码,在 25GB 笔记本上运行 7440 亿参数大模型的工程全貌。涵盖 MoE 稀疏推理、NVMe 流式专家、MLA 注意力、MTP 推测解码等核心技术的完整解析。
C语言
MoE
大模型
NVMe
量化
GPU
深度学习
GLM-5.2
推理引擎
推测解码
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
编程
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
2026-07-19 09:14:11
纯C语言实现的大模型推理引擎,仅用1300行代码在25GB内存笔记本上运行744B参数的GLM-5.2 MoE模型,含完整代码示例与技术解析
C语言
GLM-5.2
MoE
大模型推理
量化
AVX2
MLA注意力
推测解码
Apple Silicon
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
编程
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
2026-07-18 13:17:37
深度拆解 vLLM 0.5 的 PagedAttention 核心原理、连续批处理架构、MoE 推理优化、分布式部署策略,以及 2026 年四大推理框架生产级性能横评。
vLLM
PagedAttention
LLM推理
ContinuousBatching
MoE
FusedMoE
量化
分布式推理
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
编程
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
2026-07-18 12:44:38
深度拆解 Google AI Edge Gallery 开源项目:LiteRT 推理引擎架构、INT4 量化原理、多模态支持、模型转换实战、企业级落地场景,配完整 Kotlin 代码示例与性能优化指南。
Google AI Edge Gallery
LiteRT
端侧AI
大模型
Android
量化
多模态
离线推理
移动端部署
GenAI
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
编程
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
2026-07-16 12:50:04
深度对比 llama.cpp 与 LiteBox 两大本地 LLM 推理框架:GGUF 格式设计、K-Quant 量化内核、KV cache 管理、多后端抽象、并发架构,配完整代码实战与性能实测数据。
llama.cpp
LiteBox
GGUF
量化
KV cache
本地LLM
推理框架
Rust
C/C++
模型压缩
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
编程
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
2026-07-16 11:45:03
从 Ollama 6500 万美元融资事件切入,深度拆解 2026 年本地大模型运行时生态:Ollama、llama.cpp、LocalAI、LiteBox、vLLM 的架构设计、性能对比、API 设计、适用场景,配完整代码实战与生产部署踩坑指南。
Ollama
本地大模型
llama.cpp
LocalAI
LiteBox
本地LLM
推理引擎
量化
GGUF
MCP
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
编程
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
2026-07-10 17:44:16
深度对比2026年四大主流LLM推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,涵盖PagedAttention、FP8量化、ZeRO-3、连续批处理等核心技术原理,配生产级代码示例与实测性能数据。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
量化
AI部署
万字深度解析 NVIDIA Blackwell 架构:当 GPU 编程遇见「Tile 抽象革命」——从 CUDA 13.1 Python 内核生成到 Blackwell Ultra 30 倍推理加速的完整技术指南(2026)
编程
万字深度解析 NVIDIA Blackwell 架构:当 GPU 编程遇见「Tile 抽象革命」——从 CUDA 13.1 Python 内核生成到 Blackwell Ultra 30 倍推理加速的完整技术指南(2026)
2026-07-02 07:45:18
深度解析 NVIDIA Blackwell GPU 架构与 CUDA 13.1 Tile 编程模型,涵盖 FP4 量化、Tensor Core v5、NVLink 5.0、DeepSeek V4 推理优化等核心技术,提供完整 Python 实战代码。
Blackwell
CUDA
GPU编程
AI推理
性能优化
深度学习
并行计算
NVIDIA
量化
Tensor Core
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
下一页
共 3 页
到第
页
确定