程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 551
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 531
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度解析 Nano-vLLM:当1200行Python代码重构大模型推理——从架构设计到性能超越vLLM的完整技术指南(2026)
编程
万字深度解析 Nano-vLLM:当1200行Python代码重构大模型推理——从架构设计到性能超越vLLM的完整技术指南(2026)
2026-07-01 14:44:55 +0800 CST
view 217
Nano-vLLM:用约1200行Python代码实现的轻量级vLLM替代方案。深度解析KV Cache管理、GQA注意力、RoPE位置编码、Continuous Batching等核心技术,Benchmark性能超越vLLM 5.3%。适合学习大模型推理原理和内网轻量级部署。
Nano-vLLM
大模型推理
LLM
Tensor Parallelism
KV Cache
Continuous Batching
Python
PyTorch
Qwen2
开源项目
AI应用可观测性工程2026:LLM调用追踪、评估体系与成本监控全栈实践
编程
AI应用可观测性工程2026:LLM调用追踪、评估体系与成本监控全栈实践
2026-06-18 18:33:15 +0800 CST
view 390
系统介绍2026年AI应用可观测性工程:从OpenTelemetry Tracing、LLM Judge评估、Token成本监控到智能告警,涵盖Python/Go/TypeScript全栈代码实践。
AI可观测性
OpenTelemetry
LLM监控
LangFuse
成本优化
Grafana
分布式追踪
ES2026 深度实战:Temporal 终结 Date 时代、using 资源管理与 Set 家族全面进化——JavaScript 十年来最大语法升级完全指南
编程
ES2026 深度实战:Temporal 终结 Date 时代、using 资源管理与 Set 家族全面进化——JavaScript 十年来最大语法升级完全指南
2026-05-29 02:07:11 +0800 CST
view 471
ES2026深度解析:Temporal API终结Date对象29年设计缺陷,using/await using引入确定性资源管理,Set方法家族补齐集合运算,Promise.try统一异步异常处理
ES2026
JavaScript
Temporal
using
Set
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
编程
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
2026-07-15 10:13:07 +0800 CST
view 139
深度拆解 vLLM 核心架构:从 PagedAttention 分页内存管理、Continuous Batching 动态调度,到 Speculative Decoding、Prefix Caching 等高级特性,配完整代码示例与生产部署指南。
vLLM
PagedAttention
LLM推理
深度学习
GPU优化
Continuous Batching
DuckDB 深度实战:从向量化执行引擎到 Quack 客户端-服务端,一只鸭子如何把整个 Lakehouse 吞进同一个进程
编程
DuckDB 深度实战:从向量化执行引擎到 Quack 客户端-服务端,一只鸭子如何把整个 Lakehouse 吞进同一个进程
2026-07-10 13:46:21 +0800 CST
view 214
从向量化执行引擎到 Quack 客户端-服务端与 DuckLake,深度拆解 DuckDB 如何从进程内 OLAP 进化成完整 Lakehouse 平台,附可运行代码与性能对决。
DuckDB
OLAP
向量化执行
列存数据库
Lakehouse
DuckLake
Quack
数据分析
SQLite for Analytics
vLLM 深度实战:当 PagedAttention 遇上生产级 LLM 推理——从内存革命到分布式部署的完全指南(2026)
编程
vLLM 深度实战:当 PagedAttention 遇上生产级 LLM 推理——从内存革命到分布式部署的完全指南(2026)
2026-06-10 10:17:56 +0800 CST
view 362
深度解析 vLLM 的核心架构 PagedAttention 和 Continuous Batching,从内存管理原理到生产级分布式部署的完全指南。
vLLM
LLM推理
PagedAttention
GPU优化
大模型部署
AI推理
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
编程
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
2026-07-10 17:44:16 +0800 CST
view 282
深度对比2026年四大主流LLM推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,涵盖PagedAttention、FP8量化、ZeRO-3、连续批处理等核心技术原理,配生产级代码示例与实测性能数据。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
量化
AI部署
eBPF 可观测性革命:从内核无侵入采集到生产级全链路追踪的深度实战
编程
eBPF 可观测性革命:从内核无侵入采集到生产级全链路追踪的深度实战
2026-07-23 03:43:51 +0800 CST
view 32
深度解析 eBPF 如何在不改一行业务代码的前提下,从内核态无侵入采集系统调用、网络与文件 I/O,并用 bpftrace、BCC、Aya 实战构建生产级可观测性与零埋点分布式追踪。
eBPF
可观测性
内核
bpftrace
BCC
Aya
分布式追踪
OpenTelemetry
Go 1.26 深度实战:Green Tea GC、new(expr)、Secret 模式与生产级迁移全链路解析
编程
Go 1.26 深度实战:Green Tea GC、new(expr)、Secret 模式与生产级迁移全链路解析
2026-05-09 07:37:34 +0800 CST
view 567
从生产环境视角深度解析 Go 1.26 全部核心特性:Green Tea GC 性能实测、new(expr) 语法实战、Secret 安全执行域、SIMD 向量计算、后量子加密 HPKE、goroutine 泄漏检测,以及完整的生产级迁移检查清单。
Go
GC
Green Tea
runtime
SIMD
HPKE
泛型
生产迁移
Temporal 深度实战:当分布式工作流从「工程噩梦」变成「写代码一样简单」
编程
Temporal 深度实战:当分布式工作流从「工程噩梦」变成「写代码一样简单」
2026-06-16 08:51:07 +0800 CST
view 295
深入解析 Temporal 分布式工作流引擎:从原理、架构到 Go/TS 生产级实战,涵盖 Workflow 确定性、Activity 设计、Signal/Query、补偿事务、性能优化等核心内容
Temporal
分布式
工作流
Go
微服务
架构设计
eBPF 深度实战:把 Linux 内核变成可编程数据平面——从 bpf() 系统调用、Verifier 到 Cilium / Tetragon 生产落地
编程
eBPF 深度实战:把 Linux 内核变成可编程数据平面——从 bpf() 系统调用、Verifier 到 Cilium / Tetragon 生产落地
2026-07-11 01:43:47 +0800 CST
view 151
从 bpf() 生命周期、Verifier、Maps、CO-RE 拆到 Cilium/Tetragon 生产架构,配 bpftrace、BCC、Go 三套可运行代码,讲透 eBPF 如何把 Linux 内核变成可编程数据平面。
eBPF
Cilium
云原生
Linux内核
可观测性
eBPF实战
Tetragon
Turso/LibSQL 深度实战:当 SQLite 遇上边缘计算——从单文件数据库到全球分布式架构的完全指南(2026)
编程
Turso/LibSQL 深度实战:当 SQLite 遇上边缘计算——从单文件数据库到全球分布式架构的完全指南(2026)
2026-06-10 14:50:06 +0800 CST
view 309
深度解析 Turso 和 libSQL:如何将 SQLite 从单文件数据库扩展为全球分布式架构,包含嵌入式副本原理、多语言 SDK 实战、边缘博客系统构建与性能优化指南
SQLite
Turso
LibSQL
边缘计算
分布式数据库
Go
TypeScript
DataBuff深度解析:AI原生OpenTelemetry APM如何重新定义可观测性
编程
DataBuff深度解析:AI原生OpenTelemetry APM如何重新定义可观测性
2026-07-23 07:44:51 +0800 CST
view 25
深度解析DataBuff AI原生OpenTelemetry APM:从三组件极简架构到七层AIOps能力,多Agent协同根因分析、自动巡检、SSH运维修复,让APM从看得见进化到会诊断会修。
APM
OpenTelemetry
AI
可观测性
DataBuff
多Agent
分布式追踪
AIOps
Temporal Replay 2026深度实战:当Durable Execution遇上AI Agent——从持久执行范式到生产级多智能体编排的完全指南
编程
Temporal Replay 2026深度实战:当Durable Execution遇上AI Agent——从持久执行范式到生产级多智能体编排的完全指南
2026-06-10 15:21:36 +0800 CST
view 599
2026年6月9日,Temporal 在 Replay 2026 大会上发布 Serverless Workers、Standalone Activities、Workflow Streams 等重磅更新。本文深入解析 Durable Execution 核心原理,对比 AI Agent 四大失败模式,并提供生产级 Deep Research Agent 完整代码实战。
Temporal,Durable Execution,AI Agent,工作流引擎,多智能体
Context-Mode 深度实战:当 AI 编程成本暴涨到让人肉疼——MCP 插件用沙盒隔离将 Token 消耗砍掉 98%
编程
Context-Mode 深度实战:当 AI 编程成本暴涨到让人肉疼——MCP 插件用沙盒隔离将 Token 消耗砍掉 98%
2026-06-16 09:22:57 +0800 CST
view 428
Context-Mode 是一个登顶 GitHub 和 Hacker News 的开源 MCP 插件,通过沙盒隔离、语义检索、Think in Code 三大核心机制,将 AI 编程的 Token 消耗降低 98%,连续编程时间从 30 分钟拉到 3 小时。本文从架构设计、代码实战、多平台接入到性能优化,全面拆解这个被 24 万开发者采用的项目。
MCP
AI编程
Token优化
Context-Mode
开源项目
上下文管理
MCP 协议史上最大修订:2026年从AI工具调用协议到生产级智能体基础设施的蜕变
编程
MCP 协议史上最大修订:2026年从AI工具调用协议到生产级智能体基础设施的蜕变
2026-07-23 09:14:29 +0800 CST
view 30
深度解析MCP协议2026-07-28候选规范:OIDC身份认证、W3C分布式追踪、多Agent协作协议、声明式扩展、Policy Engine与审计日志,从工具调用协议到生产级智能体基础设施的完整蜕变
MCP
Model Context Protocol
AI Agent
智能体协议
OpenID Connect
分布式追踪
Node.js 26 深度解析:Temporal API 原生支持与 V8 14.6 引擎升级——后端 JavaScript 的时间处理革命
Node.js 26 深度解析:Temporal API 原生支持与 V8 14.6 引擎升级——后端 JavaScript 的时间处理革命
2026-05-09 12:47:12 +0800 CST
view 1083
Node.js 26 于 2026 年 5 月 5 日发布,最重磅特性是 Temporal API 默认启用。本文深入解析 Temporal API 的十大核心类型、不可变设计、IANA 时区支持、夏令时处理,以及从 Date 的渐进迁移指南,附性能基准测试和实战案例。
Node.js
Temporal API
JavaScript
V8
后端开发
MCP协议深度解析:从架构原理到AI Agent实战开发
编程
MCP协议深度解析:从架构原理到AI Agent实战开发
2026-07-05 09:42:31 +0800 CST
view 192
从协议规范、架构设计、通信机制到Python/TypeScript双语言实战,彻底搞懂MCP——不只是比喻,而是能落地到生产环境的完整开发指南。
MCP
AI Agent
Model Context Protocol
JSON-RPC
Python
TypeScript
ECMAScript 2026 正式获批:深度拆解 17 个新特性与开发实战指南
编程
ECMAScript 2026 正式获批:深度拆解 17 个新特性与开发实战指南
2026-07-11 05:14:52 +0800 CST
view 302
2026年6月ECMAScript 2026正式获批,本文深度拆解17个新特性:using资源管理、Error.isError、Array.fromAsync、Math.sumPrecise、Iterator.concat、Map新方法、Uint8Array编码、Temporal API、Records & Tuples、Pattern Matching,配完整代码示例与生产迁移指南
ES2026
JavaScript
ECMAScript
Temporal
前端开发
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
编程
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
2026-07-17 11:13:32 +0800 CST
view 239
深度拆解 PyTorch 2.13:FlexAttention 在 Apple Silicon 上提速 12 倍、CUTeDSL 为 Inductor 引入第二条代码生成路径、nn.LinearCrossEntropyLoss 将大词汇量模型显存降低 4 倍、torchcomms 重塑分布式训练通信层、ExecuTorch 正式并入核心,配完整生产级代码实战。
PyTorch
深度学习
AI框架
Metal
FlexAttention
Apple Silicon
分布式训练
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
编程
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
2026-06-29 17:16:04 +0800 CST
view 454
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
Node.js 原生 SQLite 深度实战:从 node:sqlite 到零依赖数据库——同步 API、WASM 引擎与百万级写入优化的完全指南(2026)
编程
Node.js 原生 SQLite 深度实战:从 node:sqlite 到零依赖数据库——同步 API、WASM 引擎与百万级写入优化的完全指南(2026)
2026-06-02 07:24:55 +0800 CST
view 416
Node.js 原生 SQLite 模块深度实战:从 node:sqlite 架构原理到百万级写入优化,涵盖同步 API、WASM 引擎、事务管理、全文搜索、备份恢复与 better-sqlite3 迁移完全指南
Node.js
SQLite
WASM
数据库
性能优化
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
46
47
48
49
50
...
99
下一页