程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
编程
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
2026-07-17 11:13:32 +0800 CST
view 556
深度拆解 PyTorch 2.13:FlexAttention 在 Apple Silicon 上提速 12 倍、CUTeDSL 为 Inductor 引入第二条代码生成路径、nn.LinearCrossEntropyLoss 将大词汇量模型显存降低 4 倍、torchcomms 重塑分布式训练通信层、ExecuTorch 正式并入核心,配完整生产级代码实战。
PyTorch
深度学习
AI框架
Metal
FlexAttention
Apple Silicon
分布式训练
PyTorch 2.13 深度解析:一次把框架换心与跨平台革命讲透
编程
PyTorch 2.13 深度解析:一次把框架换心与跨平台革命讲透
2026-07-14 01:14:51 +0800 CST
view 558
2026年7月PyTorch 2.13重磅发布:FlexAttention在Apple Silicon实现12倍加速、CuTeDSL提供CUTLASS级GEMM代码生成、融合损失函数将大词汇量训练峰值显存削减4倍、torchcomms革新分布式通信后端、ExecuTorch正式并入核心,深度拆解六大核心更新与实战代码。
PyTorch
深度学习
机器学习框架
GPU
Distributed Training
FlexAttention
CUDA
GEMM
ROCm
Apple Silicon
MPS
OmniVoice 深度实战:当小米 k2-fsa 团队用扩散语言模型重塑语音合成——从零样本克隆到 600 语言高保真 TTS 的生产级完全指南(2026)
编程
OmniVoice 深度实战:当小米 k2-fsa 团队用扩散语言模型重塑语音合成——从零样本克隆到 600 语言高保真 TTS 的生产级完全指南(2026)
2026-06-15 14:21:23 +0800 CST
view 742
深入解析小米 k2-fsa 团队开源的 OmniVoice 单阶段扩散语言模型 TTS 系统,0.8B 参数支持 600+ 语言,零样本克隆仅需 3-10 秒参考音频,RTF 低至 0.025,Apache-2.0 免费商用。
TTS
语音合成
OmniVoice
k2-fsa
扩散模型
零样本克隆
多语言
MachineLearning
Audio
小米
Go 语言 Web 开发深度实战:从 net/http 标准库到 Gin/Echo/Fiber 的架构取舍,以及 Go 1.26 性能革命下的工程实践
编程
Go 语言 Web 开发深度实战:从 net/http 标准库到 Gin/Echo/Fiber 的架构取舍,以及 Go 1.26 性能革命下的工程实践
2026-07-10 19:12:54 +0800 CST
view 360
深度实战 Go Web 开发:对比 net/http、Gin、Echo、Fiber、Chi 的架构取舍,结合 Go 1.26 的 Green Tea GC、容器感知 GOMAXPROCS、json/v2,给出可运行代码与性能优化手册。
Go Web
net/http
Gin
Echo
Fiber
Go 1.26
性能优化
Stanford CS336 深度实战:从零实现大语言模型——数据清洗、Transformer 架构、FlashAttention 系统优化到 RL 对齐的完全指南(2026)
编程
Stanford CS336 深度实战:从零实现大语言模型——数据清洗、Transformer 架构、FlashAttention 系统优化到 RL 对齐的完全指南(2026)
2026-06-02 20:14:38 +0800 CST
view 822
Stanford CS336 课程深度解读:从零实现大语言模型,覆盖 Tokenizer、Transformer、FlashAttention-2、FSDP 分布式训练、Scaling Law、Common Crawl 数据清洗去重、SFT 与 GRPO 对齐,配完整代码示例。
LLM
Transformer
Stanford CS336
FlashAttention
PyTorch
AI工程
分布式训练
强化学习
gsplat深度解析:3D高斯泼溅的CUDA加速革命——从伯克利/英伟达开源库到生产级实时渲染
编程
gsplat深度解析:3D高斯泼溅的CUDA加速革命——从伯克利/英伟达开源库到生产级实时渲染
2026-06-30 15:18:05 +0800 CST
view 1156
深度解析UC伯克利/NVIDIA等机构联合开发的gsplat开源库:CUDA加速的3D高斯泼溅渲染引擎,节省4倍显存、缩短15%训练时间,涵盖数学原理、CUDA架构、训练流程、性能优化与生产应用。
gsplat
3D Gaussian Splatting
CUDA
图形渲染
3D重建
NeRF
实时渲染
PyTorch
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
编程
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
2026-08-09 02:16:55 +0800 CST
view 147
深度拆解 LLM 推理的 KV Cache 工程体系:为什么北极星指标必须从 Throughput 换成 Goodput、PagedAttention 的链式 hash 与前缀树实现、PD 分离的盈亏平衡方程(长输入短输出为何是负优化)、KVConnector 逐层流水传输、分层存储的盈亏平衡带宽公式与运行时决策函数、缓存感知路由,含可运行代码、调优清单与十条踩坑。
KV Cache
vLLM
PD分离
PagedAttention
LLM推理
Goodput
前缀缓存
RDMA
分层存储
性能优化
AI驱动的智能客服呼叫中心系统SmartCall,让每一通电话都被智慧对待
代码
AI驱动的智能客服呼叫中心系统SmartCall,让每一通电话都被智慧对待
2026-07-02 13:27:29 +0800 CST
view 368
SmartCall是一套基于AI大模型+Asterisk的智能客服呼叫中心系统,支持AI智能应答、IVR流程编排、批量外呼、坐席管理,采用Apache-2.0开源协议。
AI
开源
智能客服
呼叫中心
Asterisk
IVR
ASR
TTS
外呼
Apache
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 427
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 244
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 566
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 234
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 604
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
用 Obsidian + Claude 整了个 AI 记忆外挂:claude-obsidian 深度测评
编程
用 Obsidian + Claude 整了个 AI 记忆外挂:claude-obsidian 深度测评
2026-07-04 16:22:16 +0800 CST
view 555
claude-obsidian是GitHub上8.5K Stars的开源AI知识引擎,将PDF/文本自动整理为wiki知识图谱,hot.md持久化跨会话记忆,autoresearch三轮自主研究+归档,支持PARA/LYT/Zettelkasten四种知识组织方法论,MIT协议数据不锁死。
Obsidian
Claude
AI第二大脑
知识图谱
claude-obsidian
hot缓存
autoresearch
PARA
LYT
Zettelkasten
Markdown
MIT
开源
Agent-Reach 深度解析:给 AI Agent 装上互联网的「万能眼睛」——从脚手架架构到 11 平台全覆盖、从零成本接入到生产级部署的完整技术指南(2026)
编程
Agent-Reach 深度解析:给 AI Agent 装上互联网的「万能眼睛」——从脚手架架构到 11 平台全覆盖、从零成本接入到生产级部署的完整技术指南(2026)
2026-07-04 16:42:45 +0800 CST
view 653
深度解析 Agent-Reach 项目:给 AI Agent 装上互联网能力的脚手架工具,覆盖 11 大平台,零成本接入,包含完整技术指南和生产部署最佳实践。
Agent-Reach
AI Agent
互联网访问
Claude Code
OpenClaw
Cursor
MCP
GitHub
Twitter
YouTube
脚手架
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
编程
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
2026-07-04 18:15:46 +0800 CST
view 501
深度解析 vLLM 0.5 的 PagedAttention 架构原理,涵盖 KV Cache 分页管理、MoE 优化、分布式推理、量化技术,并通过代码实战和性能对比,帮助开发者掌握生产级 LLM 推理最佳实践。
vLLM
PagedAttention
LLM推理
CUDA
KV Cache
深度学习
AI基础设施
Python
生产部署
性能优化
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
编程
2026 大模型推理框架选型实战:从 vLLM、TGI 到 TensorRT-LLM 的全链路架构拆解与性能防线
2026-08-12 11:14:56 +0800 CST
view 190
深度拆解 2026 年四大主流推理框架 vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 的核心技术、性能对比与选型指南,涵盖 PagedAttention、Continuous Batching、量化优化、分布式推理与生产踩坑清单。
vLLM
TensorRT-LLM
TGI
DeepSpeed-MII
大模型推理
KV Cache
PagedAttention
推理优化
量化
分布式推理
SGLang 深度拆解:当 RadixAttention 把 KV Cache 变成一棵可复用的「记忆树」——从前缀缓存、零开销调度到生产级推理服务的全链路实战
编程
SGLang 深度拆解:当 RadixAttention 把 KV Cache 变成一棵可复用的「记忆树」——从前缀缓存、零开销调度到生产级推理服务的全链路实战
2026-08-18 21:45:21 +0800 CST
view 135
深度拆解 SGLang 推理引擎:从 RadixAttention 前缀缓存、零开销 CPU 调度、约束解码到 PD 分离与量化,配可运行代码与生产调优清单。
SGLang
RadixAttention
KV Cache
LLM推理
前缀缓存
结构化生成
Caddy深度拆解:Go写的Web服务器,自动HTTPS两行配置替代NGINX证书管理
编程
Caddy深度拆解:Go写的Web服务器,自动HTTPS两行配置替代NGINX证书管理
2026-07-25 21:18:33 +0800 CST
view 189
Caddy(Go写的Web服务器):56K Star、自动申请Let's Encrypt证书+自动续期、Caddyfile两行配置搞定HTTPS、内置反向代理/负载均衡/健康检查/重试机制、支持WebSocket代理、插件系统(xcaddy)扩展DNS验证/限流/缓存、相比NGINX配置更简单学习成本更低、适合个人项目/小团队/API网关/静态文件服务/本地HTTPS开发。
Caddy
Web服务器
反向代理
自动HTTPS
Go
NGINX替代
负载均衡
Let's Encrypt
Web服务器
Caddyfile
万字深度解析 Understand-Anything:当代码库遇见知识图谱革命——从Tree-sitter解析到LLM语义理解、从7个专业Agent到15平台一键集成的完整技术指南(2026)
编程
万字深度解析 Understand-Anything:当代码库遇见知识图谱革命——从Tree-sitter解析到LLM语义理解、从7个专业Agent到15平台一键集成的完整技术指南(2026)
2026-07-03 00:44:41 +0800 CST
view 437
深度解析Understand-Anything代码知识图谱工具:Tree-sitter+LLM双引擎、7专业Agent并行流水线、三种知识图谱视图、15平台集成,含完整实战指南
Understand-Anything
Code Knowledge Graph
Tree-sitter
LLM
Agent
Code Analysis
Knowledge Graph
AI Coding
C++26 反射系统深度拆解:当这门语言终于拥有「自省」能力——从元对象协议到十年火箭引擎的全链路实战
编程
C++26 反射系统深度拆解:当这门语言终于拥有「自省」能力——从元对象协议到十年火箭引擎的全链路实战
2026-08-12 15:23:32 +0800 CST
view 157
深度拆解 C++26 反射系统:从元对象协议(MOP)、std::meta::info 命名空间、属性系统,到编译期序列化框架、DI容器、对象转储器的全链路实战,含15条生产踩坑清单
C++26
反射
reflection
元对象协议
MOP
编译期
序列化
DI容器
std::meta
Herb Sutter
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
编程
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
2026-06-29 17:16:04 +0800 CST
view 681
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
编程
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
2026-06-29 17:17:00 +0800 CST
view 416
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
MCP 2026-07-28 深度拆解:当 Anthropic 决定「干掉 MCP 的全部会话状态」——从有状态双连接到无状态请求响应,一个 18 个月的协议如何被彻底重写为企业级 AI 工具总线
编程
MCP 2026-07-28 深度拆解:当 Anthropic 决定「干掉 MCP 的全部会话状态」——从有状态双连接到无状态请求响应,一个 18 个月的协议如何被彻底重写为企业级 AI 工具总线
2026-08-04 19:47:29 +0800 CST
view 438
深度拆解MCP 2026-07-28第5版规范:从有状态双连接全面转向无状态架构的核心变革,Streamable HTTP传输层、基于请求头路由、可缓存列表结果、MCP Apps与Tasks扩展框架、OAuth 2.0企业级安全,附完整生产级代码示例与迁移指南
MCP
Model Context Protocol
无状态架构
AI工具集成
Anthropic
Streamable HTTP
OAuth 2.0
企业级部署
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
7
8
9
10
11
...
50
下一页