程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 497
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 185
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
TensorRT-LLM 1.0 深度实战:当 PyTorch 架构成为默认体验,NVIDIA 的 LLM 推理引擎正式走向成熟
编程
TensorRT-LLM 1.0 深度实战:当 PyTorch 架构成为默认体验,NVIDIA 的 LLM 推理引擎正式走向成熟
2026-07-22 10:46:37 +0800 CST
view 182
深度解析 TensorRT-LLM 1.0:PyTorch 架构正式稳定、LLM API 稳定化、多模态 VLM 原生支持、Qwen3 MoE 优化、LoRA 生产级管理、trtllm-serve 推理服务化,配完整部署实战代码。
TensorRT-LLM
LLM推理
GPU加速
PyTorch
NVIDIA
深度学习
模型部署
推理优化
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
编程
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
2026-05-30 15:42:55 +0800 CST
view 612
深度解析 LLM 推理优化的核心技术:PagedAttention 内存管理革命、投机解码加速策略、INT4/FP8 量化技术、MoE 架构优化,从架构原理到代码实战,让大模型推理成本下降 70%。
LLM
推理优化
vLLM
PagedAttention
投机解码
量化
MoE
WorldMonitor 深度拆解:73K Stars 的「全球态势感知」仪表盘,凭什么不用任何前端框架?
编程
WorldMonitor 深度拆解:73K Stars 的「全球态势感知」仪表盘,凭什么不用任何前端框架?
2026-07-27 08:44:14 +0800 CST
view 393
深度拆解一周涨1万Star的WorldMonitor:500+信源聚合、双地图引擎、零框架Vanilla TS前端、一套代码6个站点变体、本地Ollama兜底与MCP/SDK全家桶,附自托管与mini复刻实战。
WorldMonitor
开源
态势感知
Vanilla TypeScript
deck.gl
MCP
Ollama
Tauri
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
编程
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
2026-08-03 09:43:58 +0800 CST
view 169
深度拆解vLLM V1引擎四大核心架构:PagedAttention V2融合块表与前缀树缓存、分离式推理Prefill/Decode架构、KV Connector标准化接口、LMCache三层KV Cache管理,附完整部署配置与性能基准测试
vLLM
PagedAttention
LMCache
分离式推理
大模型推理
KV Cache
推理引擎
LLM Serving
GPU优化
开源
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 535
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
编程
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
2026-08-03 10:45:17 +0800 CST
view 328
深度拆解llama.cpp四大核心架构:GGUF模型格式设计、GGML计算引擎、8种多后端抽象层、K-Quant/I-Quant量化技术体系,附完整代码示例与性能基准测试
llama.cpp
GGUF
GGML
量化
端侧推理
LLM
C++
推理引擎
多后端
K-Quant
给 AI 编码 Agent 装上「谷歌级工程纪律」:深度解析 Addy Osmani 的 agent-skills,从 Skill 解剖学到亲手写一个生产级技能
编程
给 AI 编码 Agent 装上「谷歌级工程纪律」:深度解析 Addy Osmani 的 agent-skills,从 Skill 解剖学到亲手写一个生产级技能
2026-07-10 02:47:04 +0800 CST
view 291
深度解析 Addy Osmani 开源的 agent-skills:如何把 Google 级工程规范编译成 AI 编码 Agent 可执行的技能,涵盖 Skill 解剖学、六阶段生命周期、七命令映射、Hooks 闸门,并手搓一个生产级「数据库迁移安全检查」技能(含完整代码)。
agent-skills
AI 编程
Claude Code
工程化
Skill
提示工程
Python
SGLang vs vLLM:2026年大模型推理框架深度对比与选型指南
编程
SGLang vs vLLM:2026年大模型推理框架深度对比与选型指南
2026-04-08 15:51:53 +0800 CST
view 2149
深度对比SGLang与vLLM两大LLM推理框架,从架构设计、核心原理、性能实测、适用场景多维度解析,附2026年选型建议
LLM
SGLang
vLLM
推理优化
大模型
Karpathy Skills 深度解析:187K Star 的 AI 编程四原则——从错误假设到工程级代码的完整进化指南
编程
Karpathy Skills 深度解析:187K Star 的 AI 编程四原则——从错误假设到工程级代码的完整进化指南
2026-07-04 13:14:42 +0800 CST
view 422
深度解析 Andrej Karpathy Skills 项目:187K Star 的 AI 编程四原则,从错误假设、过度工程化、附带损伤、验证缺失四大痛点出发,详细阐述 Think Before Coding、Simplicity First、Surgical Changes、Goal-Driven Execution 四原则的技术原理、工程实践与代码示例。
Karpathy Skills
AI编程
CLAUDE.md
Claude Code
Cursor
提示工程
代码质量
LLM编程
四原则
工程实践
Ollama 本地大模型部署实战:从零到生产级应用的完全指南(2026)
编程
Ollama 本地大模型部署实战:从零到生产级应用的完全指南(2026)
2026-06-10 01:20:57 +0800 CST
view 709
2026年Ollama本地大模型部署完全指南:从架构原理、GGUF量化、ModelFile自定义、多语言集成(Python/JS/Go)、RAG实战到Docker/K8s生产部署,8500字深度长文。
Ollama
本地部署
大模型
LLM
生产级
GGUF
量化
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
编程
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
2026-07-16 12:50:04 +0800 CST
view 249
深度对比 llama.cpp 与 LiteBox 两大本地 LLM 推理框架:GGUF 格式设计、K-Quant 量化内核、KV cache 管理、多后端抽象、并发架构,配完整代码实战与性能实测数据。
llama.cpp
LiteBox
GGUF
量化
KV cache
本地LLM
推理框架
Rust
C/C++
模型压缩
从零构建企业级本地化RAG系统:Ollama与RAGFlow深度实战
编程
从零构建企业级本地化RAG系统:Ollama与RAGFlow深度实战
2026-06-29 01:46:19 +0800 CST
view 600
深入探讨如何基于Ollama和RAGFlow构建完全本地化的RAG系统,涵盖架构设计、部署实战、代码实现和性能优化。
RAG
Ollama
RAGFlow
本地部署
LLM
分布式 LLM 推理架构深度实战:从 vLLM 单节点到 llm-d 多集群的生产级演进全链路解析
编程
分布式 LLM 推理架构深度实战:从 vLLM 单节点到 llm-d 多集群的生产级演进全链路解析
2026-05-09 03:39:58 +0800 CST
view 768
深度解析分布式 LLM 推理架构,从 vLLM 单节点到 llm-d 多集群的生产级演进。涵盖推理引擎层、编排调度层、Kubernetes 多机多卡部署实战、性能优化技巧及成本优化策略。
LLM
vLLM
分布式推理
Kubernetes
Ray
推理引擎
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
编程
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
2026-07-04 18:15:46 +0800 CST
view 414
深度解析 vLLM 0.5 的 PagedAttention 架构原理,涵盖 KV Cache 分页管理、MoE 优化、分布式推理、量化技术,并通过代码实战和性能对比,帮助开发者掌握生产级 LLM 推理最佳实践。
vLLM
PagedAttention
LLM推理
CUDA
KV Cache
深度学习
AI基础设施
Python
生产部署
性能优化
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
编程
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
2026-08-12 11:14:56 +0800 CST
view 58
深度拆解 2026 年四大主流推理框架 vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 的核心技术、性能对比与选型指南,涵盖 PagedAttention、Continuous Batching、量化优化、分布式推理与生产踩坑清单。
vLLM
TensorRT-LLM
TGI
DeepSpeed-MII
大模型推理
KV Cache
PagedAttention
推理优化
量化
分布式推理
mattpocock/skills 深度拆解:两个月 18 万 Star,TypeScript 教父用一堆 Markdown 宣告「方法论可以被 git push」
编程
mattpocock/skills 深度拆解:两个月 18 万 Star,TypeScript 教父用一堆 Markdown 宣告「方法论可以被 git push」
2026-07-28 04:42:50 +0800 CST
view 195
深度拆解两个月狂揽 18 万 Star 的 mattpocock/skills:SKILL.md 结构解剖、grill-me/tdd/diagnose 工程流水线、小而可组合 vs 全流程框架之争,附团队私有技能库落地实战与三个真实的坑。
mattpocock/skills
AI Agent
Claude Code
Skill
TDD
工程方法论
Prompt工程
开发者工具
TypeScript
开源
PostgreSQL 18 深度实战:从异步I/O到增量备份——全球最强开源数据库的九大革命性升级与生产级实践
编程
PostgreSQL 18 深度实战:从异步I/O到增量备份——全球最强开源数据库的九大革命性升级与生产级实践
2026-05-22 12:18:04 +0800 CST
view 669
PostgreSQL 18 深度解析:异步I/O、多列索引跳过扫描、虚拟生成列、UUIDv7、内置增量备份、JSON_TABLE、OAuth 2.0认证、逻辑复制冲突日志、全面可观测性——附生产级代码实战与升级指南
PostgreSQL
数据库
云原生
性能优化
Scrapling 深度解析:下一代自适应 Python 爬虫框架——从反反爬到大规模并发抓取、从 Cloudflare 绕过到智能元素定位的完整技术指南(2026)
编程
Scrapling 深度解析:下一代自适应 Python 爬虫框架——从反反爬到大规模并发抓取、从 Cloudflare 绕过到智能元素定位的完整技术指南(2026)
2026-07-04 20:11:27 +0800 CST
view 611
深度解析 Scrapling 自适应 Python 爬虫框架:从 Fetcher/StealthyFetcher/DynamicFetcher 三大抓取引擎,到自适应解析引擎的元素自愈能力,从 Cloudflare 绕过到大规模并发 Spider 框架,完整代码实战与生产级部署指南。
Scrapling
Python爬虫
自适应爬虫
反反爬
Cloudflare绕过
StealthyFetcher
Web Scraping
数据采集
Pgrx 深度解析:用 Rust 为 PostgreSQL 打造高性能扩展——从入门到生产级实战
编程
Pgrx 深度解析:用 Rust 为 PostgreSQL 打造高性能扩展——从入门到生产级实战
2026-04-28 14:24:36 +0800 CST
view 556
深度解析 Pgrx(4.5k+ Stars)框架:用 Rust 为 PostgreSQL 编写高性能扩展,涵盖类型映射、内存管理、代码实战与生产部署完整指南。
Rust
PostgreSQL
数据库扩展
高性能
开源
系统编程
Pgrx
Zerostack 深度实战:7k 行 Rust 打造 8MB 内存占用的 Unix 哲学 AI 编码代理
编程
Zerostack 深度实战:7k 行 Rust 打造 8MB 内存占用的 Unix 哲学 AI 编码代理
2026-05-22 12:46:54 +0800 CST
view 607
Zerostack 用 7k 行 Rust 代码和 8MB 内存占用挑战传统 AI 编码工具。本文深入解析其 Unix 管道式架构、tree-sitter 代码分析、Rust 零成本抽象实现,以及与 Claude Code 的性能对比。
Rust
AI 编码代理
Unix 哲学
性能优化
tree-sitter
PostgreSQL 19 深度实战:当关系数据库学会图查询——从 SQL/PGQ 到并行 Autovacuum 的生产级完全指南
编程
PostgreSQL 19 深度实战:当关系数据库学会图查询——从 SQL/PGQ 到并行 Autovacuum 的生产级完全指南
2026-06-10 08:47:34 +0800 CST
view 730
PostgreSQL 19 Beta 1 深度解析:SQL/PGQ 图查询、并行 Autovacuum、在线校验和切换、外键性能提升、LZ4 默认 TOAST 压缩等核心特性,含架构分析与代码实战
PostgreSQL
SQL/PGQ
图查询
Autovacuum
数据库
PostgreSQL 18 深度解析:异步 I/O 革命与开发者的下一代数据库体验
编程
PostgreSQL 18 深度解析:异步 I/O 革命与开发者的下一代数据库体验
2026-07-10 16:14:06 +0800 CST
view 334
深度剖析 PostgreSQL 18 的核心新特性:AIO 异步 I/O 子系统(io_uring 3 倍性能提升)、Skip Scan 多列索引优化、虚拟生成列、UUIDv7 时间有序 ID、temporal constraints 时间约束、OAuth 2.0 原生认证,配合 Go 代码示例与生产级调优指南。
PostgreSQL
数据库
异步I/O
性能优化
存储引擎
GIN索引
UUID
OAuth
企业级
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
67
68
69
70
71
...
101
下一页