程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
编程
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
2026-06-29 17:17:00 +0800 CST
view 352
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
DSpark深度解析:DeepSeek如何用半自回归推测解码将大模型推理速度提升85%
编程
DSpark深度解析:DeepSeek如何用半自回归推测解码将大模型推理速度提升85%
2026-07-05 13:43:59 +0800 CST
view 400
深度解析DeepSeek联合北大发布的DSpark推理加速框架,详解半自回归推测解码、动态推测窗口、置信度调度三大核心创新,在DeepSeek-V4上实现60%-85%推理速度提升。
DeepSeek
DSpark
推测解码
推理加速
大模型优化
半自回归
GPU加速
Qdrant 深度实战:当 Rust 写的向量数据库统治 AI 检索层——从 HNSW 到 GPU 加速、从混合搜索到生产级 K8s 部署的完全指南(2026)
编程
Qdrant 深度实战:当 Rust 写的向量数据库统治 AI 检索层——从 HNSW 到 GPU 加速、从混合搜索到生产级 K8s 部署的完全指南(2026)
2026-07-17 13:21:10 +0800 CST
view 175
2026年深度实战 Qdrant v1.13+:Rust 编写的高性能向量数据库核心架构、HNSW 算法原理与参数调优、GPU 加速索引构建、稀疏+密集混合搜索与 RRF 融合、Docker/Kubernetes StatefulSet 生产部署、Go 高性能客户端实战、AI Agent 记忆系统完整实现,12000字完全指南。
Qdrant
向量数据库
Rust
HNSW
GPU
RAG
AI
混合搜索
分布式
量化压缩
Kubernetes
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
编程
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
2026-06-02 09:36:52 +0800 CST
view 776
从vLLM到TensorRT-LLM,一次讲透vLLM、SGLang、TensorRT-LLM、llama.cpp四大LLM推理框架的架构哲学、核心原理、生产级部署实战与选型决策树。
LLM
vLLM
TensorRT-LLM
llama.cpp
SGLang
推理优化
GPU
Qdrant v1.13+ 深度实战:Rust 向量引擎 + GPU 加速 + 混合搜索 + K8s 全栈指南——2026 年 AI 检索层最优解
编程
Qdrant v1.13+ 深度实战:Rust 向量引擎 + GPU 加速 + 混合搜索 + K8s 全栈指南——2026 年 AI 检索层最优解
2026-07-17 13:22:42 +0800 CST
view 235
2026年深度实战 Qdrant:Rust 编写的高性能向量数据库核心架构、HNSW 算法与参数调优、GPU 加速索引构建、稀疏+密集混合搜索、RRF 融合、Kubernetes StatefulSet 生产部署与 AI Agent 记忆系统实战。
Qdrant
Rust
HNSW
GPU
RAG
AI
混合搜索
分布式
量化压缩
Kubernetes
Pascal Editor 深度实战:当 WebGPU 遇见 3D 建筑可视化——从浏览器零安装到生产级架构的完全指南(2026)
编程
Pascal Editor 深度实战:当 WebGPU 遇见 3D 建筑可视化——从浏览器零安装到生产级架构的完全指南(2026)
2026-06-16 15:34:34 +0800 CST
view 356
Pascal Editor 是一个基于 WebGPU 和 React Three Fiber 构建的开源 3D 建筑编辑器,运行在浏览器中无需安装。本文深度解析其 Monorepo 架构、场景状态管理、WebGPU 渲染管线、CSG 布尔运算和性能优化策略。
WebGPU
Three.js
React Three Fiber
Pascal Editor
3D编辑器
Turborepo
Bun
Monorepo
CSG
前端工程化
SGLang深度解析:RadixAttention架构下的大模型推理革命——从零到生产的高性能LLM服务框架实战指南
编程
SGLang深度解析:RadixAttention架构下的大模型推理革命——从零到生产的高性能LLM服务框架实战指南
2026-07-05 18:13:38 +0800 CST
view 500
深度解析SGLang高性能大模型推理框架:RadixAttention自动前缀缓存、零开销C++调度器、PD分离架构、多LoRA批处理、推测解码。含完整代码实战与vLLM/TensorRT-LLM对比。
SGLang
RadixAttention
LLM
推理引擎
大模型
vLLM
GPU
高并发
AI基础设施
性能优化
vLLM 深度实战:当 PagedAttention 终结 GPU 显存浪费——从推理引擎原理到生产级高并发部署的完全指南(2026)
编程
vLLM 深度实战:当 PagedAttention 终结 GPU 显存浪费——从推理引擎原理到生产级高并发部署的完全指南(2026)
2026-06-11 03:16:24 +0800 CST
view 570
深度解析vLLM推理引擎的PagedAttention原理、连续批处理、量化优化,以及从零搭建生产级高并发部署的完整实战指南(2026版)
vLLM
PagedAttention
大模型推理
GPU优化
AI部署
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
编程
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
2026-08-04 19:22:29 +0800 CST
view 106
深度拆解SGLang 27K Star开源LLM推理框架:RadixAttention基数树前缀缓存实现3-8倍加速、自研FlashInfer CUDA Kernel、Prefill-Decode分离架构、GB300 NVL72上25倍性能飞跃、DFlash投机采样、多LoRA热切换,附完整部署与调优指南
SGLang
LLM推理
RadixAttention
FlashInfer
GPU加速
大模型部署
推理引擎
PagedAttention
PD分离
投机采样
CUDA
开源
TileKernels 深度解析:DeepSeek 用 80 行代码榨干 GPU,算子开发范式的降维打击
编程
TileKernels 深度解析:DeepSeek 用 80 行代码榨干 GPU,算子开发范式的降维打击
2026-04-30 03:22:15 +0800 CST
view 936
深度解析 DeepSeek 开源的高性能 GPU 算子库 TileKernels:基于 TileLang DSL 用 80 行代码实现手写 CUDA 级性能,覆盖 MoE Gating/Routing、FP8/FP4 量化、Engram 门控等七大算子家族,首次原生支持 NVIDIA Blackwell 架构,并通过 TVM 编译器打通昇腾等国产芯片。
DeepSeek
TileKernels
GPU
CUDA
TileLang
MoE
算子优化
vLLM 0.17 深度实战:PagedAttention与连续批处理如何把GPU吞吐量提升4倍——从KV Cache原理到生产级大模型推理部署完全指南(2026)
编程
vLLM 0.17 深度实战:PagedAttention与连续批处理如何把GPU吞吐量提升4倍——从KV Cache原理到生产级大模型推理部署完全指南(2026)
2026-06-11 03:17:21 +0800 CST
view 936
深度解析vLLM推理引擎的PagedAttention原理、连续批处理、量化优化,以及从零搭建生产级高并发部署的完整实战指南(2026版)
vLLM
PagedAttention
大模型推理
GPU优化
AI部署
Linux 7.2 内核深度解析:Intel Xe3 架构驱动 Arc B390 核显性能跃升 12% 的技术内幕
编程
Linux 7.2 内核深度解析:Intel Xe3 架构驱动 Arc B390 核显性能跃升 12% 的技术内幕
2026-07-23 20:15:41 +0800 CST
view 993
深度解析 Linux 7.2 内核如何让 Intel Xe3 架构的 Arc B390 核显性能提升 12%。涵盖 Xe3 架构设计、GuC 批量命令提交、显存预分配策略、智能电源管理、AI 推理优化实战。
Linux
Intel
Xe3
Arc B390
GPU
i915
内核优化
图形驱动
光线追踪
AI推理
Warp 深度拆解:当 Rust 决定「干掉全部传统终端模拟器」——一个 64K Star 的开源终端如何用 GPU 渲染、块状输入和多 Agent 编排重新定义「命令行」的终极形态
编程
Warp 深度拆解:当 Rust 决定「干掉全部传统终端模拟器」——一个 64K Star 的开源终端如何用 GPU 渲染、块状输入和多 Agent 编排重新定义「命令行」的终极形态
2026-08-04 20:17:43 +0800 CST
view 127
深度拆解64K Star开源终端Warp:Rust+GPU硬件加速渲染、块状输入系统重构命令行交互、Warp Agent多模型编码、Oz云端Agent编排平台、Warp Drive知识协作系统,重新定义开发者命令行体验的终极形态
Warp
Rust
GPU加速
终端模拟器
AI终端
Agent编排
开源
命令行
块状输入
Oz平台
Warp Agent
谷歌 LiteRT.js 深度实战:当 WebAssembly + WebGPU 重写 TensorFlow.js 的心脏,浏览器 AI 推理提速 3 倍背后的技术真相
编程
谷歌 LiteRT.js 深度实战:当 WebAssembly + WebGPU 重写 TensorFlow.js 的心脏,浏览器 AI 推理提速 3 倍背后的技术真相
2026-07-11 14:16:10 +0800 CST
view 379
2026年7月谷歌发布LiteRT.js,用WebAssembly+WebGPU/WebNN替代TensorFlow.js的JavaScript内核,M4 MacBook Pro上推理速度提升3倍。本文深度拆解架构设计、性能优化原理、迁移路径与实战代码。
LiteRT.js
WebGPU
WebNN
WebAssembly
TensorFlow.js
浏览器AI
机器学习
前端
LiteRT-LM:Google端侧大模型推理引擎的革命性架构——从TensorFlow Lite的困境到LLM原生推理的全链路解析
编程
LiteRT-LM:Google端侧大模型推理引擎的革命性架构——从TensorFlow Lite的困境到LLM原生推理的全链路解析
2026-04-19 22:17:39 +0800 CST
view 1107
深入解析Google LiteRT-LM端侧LLM推理引擎的核心架构:分层内存池、KV Cache量化、算子融合、WebGPU运行时。与TensorFlow Lite、llama.cpp、MLX横向对比,提供生产级部署实战指南。
Google
端侧AI
LiteRT-LM
WebGPU
量化
KV Cache
TensorFlow Lite
LLM推理
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
编程
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
2026-04-30 14:21:13 +0800 CST
view 661
深度解析MCP 2026基准测试框架,拆解TensorRT-LLM、vLLM、Triton三大推理引擎的12个隐性耗时陷阱,提供可落地的诊断方法与修复路径。
AI推理
性能优化
TensorRT-LLM
vLLM
Triton
MCP2026
GPU优化
Kubernetes 1.36 AI工作负载调度深度实战:当容器编排终于懂GPU——从NUMA感知、拓扑调度到GPU碎片率下降42.6%的生产级完全指南
编程
Kubernetes 1.36 AI工作负载调度深度实战:当容器编排终于懂GPU——从NUMA感知、拓扑调度到GPU碎片率下降42.6%的生产级完全指南
2026-07-11 18:16:08 +0800 CST
view 412
深度剖析 Kubernetes 1.36 在 AI 工作负载调度上的核心突破:用户命名空间 GA、可变准入策略 GA、ML-aware 调度器插件、Device Plugin 增强,配生产级调优实战,实现 P99 延迟下降 27.3%、GPU 碎片率下降 42.6%。
Kubernetes
AI调度
GPU
NUMA
拓扑感知
DRA
Device Plugin
容器编排
云原生
深度学习
tinygrad 深度解剖:一套算子、ShapeTracker 与惰性图,凭什么用几千行代码把 PyTorch 的活干了
编程
tinygrad 深度解剖:一套算子、ShapeTracker 与惰性图,凭什么用几千行代码把 PyTorch 的活干了
2026-07-24 04:46:04 +0800 CST
view 208
深度拆解 tinygrad:如何用极少数原子算子+惰性图+编译器重写深度学习框架。涵盖瘦算子哲学、ShapeTracker零拷贝视图、UOp图与PatternMatcher重写、多后端renderer、reverse-mode autograd、TinyJit与BEAM搜索调优,配完整可运行代码。
tinygrad
深度学习框架
George Hotz
kernel融合
ShapeTracker
自动微分
编译器
GPU
Python
开源
W3C震撼官宣:WebAssembly正式成为Web一等编程语言——从 "JavaScript小弟" 到 "原生级性能霸主" 的完整技术解析
编程
W3C震撼官宣:WebAssembly正式成为Web一等编程语言——从 "JavaScript小弟" 到 "原生级性能霸主" 的完整技术解析
2026-05-16 21:49:12 +0800 CST
view 682
2026年3月W3C正式将WebAssembly定为Web一等编程语言。本文深度解析WASM如何打破JavaScript垄断,直接DOM操作、多语言支持(Rust/C++/Go/Python)、并行计算与GPU加速,以及Blazor从4.2秒优化到300ms的实战案例。
WebAssembly
WASM
Rust
性能优化
浏览器
WASI
边缘计算
并行计算
GPU加速
GPU上的无畏并发:cuTile Rust如何用Rust所有权系统破解GPU安全编程难题
编程
GPU上的无畏并发:cuTile Rust如何用Rust所有权系统破解GPU安全编程难题
2026-07-29 10:46:05 +0800 CST
view 165
深度拆解NVIDIA cuTile Rust:用Rust所有权系统实现GPU内核的编译期安全保证,7TB/s元素级操作、2PFlop/s GEMM达到cuBLAS 96%性能。
Rust
GPU编程
cuTile
内存安全
无数据竞争
CUDA
所有权系统
NVIDIA
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
编程
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
2026-07-24 07:44:31 +0800 CST
view 221
KTransformers 通过 CPU/GPU 异构计算,让一块 RTX 5090(32GB 显存)能跑起 100B+ MoE 大模型,且无需量化压缩,保持原精度 FP16。实测比 llama.cpp Q8_0 快 4.5 倍。本文深度拆解其专家细粒度卸载、异步预取、DMA 优化等核心技术,以及实战部署指南。
KTransformers
LLM推理
MoE
异构计算
DeepSeek
SGLang
CPU Offload
本地部署
GPU优化
Kubernetes v1.36 Haru 深度解析:从"灵活框架"到"企业级平台"的安全与AI双重跨越
编程
Kubernetes v1.36 Haru 深度解析:从"灵活框架"到"企业级平台"的安全与AI双重跨越
2026-05-17 00:47:08 +0800 CST
view 543
2026年首个Kubernetes重要版本深度解析:70项增强全面解读,包含User Namespaces GA、可变准入策略、AI工作负载感知抢占、DRA GPU分区等核心技术突破
Kubernetes
k8s
云原生
容器
DRA
AI训练
GPU调度
Kimi K3 深度拆解:当月之暗面决定「把开源模型的天花板从 1.6T 抬到 2.8T」——KDA 注意力、Stable LatentMoE 与自进化 GPU 内核如何重新定义 3 万亿级开源大模型的终极形态
编程
Kimi K3 深度拆解:当月之暗面决定「把开源模型的天花板从 1.6T 抬到 2.8T」——KDA 注意力、Stable LatentMoE 与自进化 GPU 内核如何重新定义 3 万亿级开源大模型的终极形态
2026-08-05 03:45:07 +0800 CST
view 134
深度拆解2.8万亿参数全球最大开源模型Kimi K3:KDA混合线性注意力机制、Stable LatentMoE稀疏专家路由、Attention Residuals选择性深度表示、Per-Head Muon逐头优化器,附完整架构分析与部署指南
Kimi K3
月之暗面
开源大模型
KDA注意力
MoE
2.8万亿参数
AI Agent
GPU内核优化
Figma 从 WebGL 到 WebGPU:一场浏览器图形引擎的工业级迁移实录
编程
Figma 从 WebGL 到 WebGPU:一场浏览器图形引擎的工业级迁移实录
2026-05-23 15:45:10 +0800 CST
view 699
深入剖析全球顶级设计工具Figma从WebGL迁移到WebGPU的全过程,涵盖着色器自动转换、缓冲区管理、性能优化、跨平台兼容性等核心工程实践。
WebGPU
Figma
图形渲染
前端性能优化
WGSL
Shader
浏览器
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
4
5
6
7
8
...
81
下一页