程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
EchoChat:Go语言音视频会议直播系统,控制面与媒体面分离架构设计
编程
EchoChat:Go语言音视频会议直播系统,控制面与媒体面分离架构设计
2026-05-14 08:41:45 +0800 CST
view 579
EchoChat是基于Go语言开发的实时音视频会议直播系统,控制面与媒体面分离架构,Go处理信令+mediasoup C++ SFU转发媒体流,uniapp多端适配,支持即时聊天、多人会议、互动直播。
音视频
开源项目
Go
mediasoup
SFU
直播
SpacetimeDB 深度实战:当数据库就是服务器——从零基础设施架构到生产级实时应用完全指南(2026)
编程
SpacetimeDB 深度实战:当数据库就是服务器——从零基础设施架构到生产级实时应用完全指南(2026)
2026-06-06 07:37:51 +0800 CST
view 582
SpacetimeDB 深度解析:数据库即服务器的架构革命,从核心概念到生产级实时白板应用实战
SpacetimeDB
Rust
实时数据库
数据库
全内存
WASM
实时同步
多人游戏
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 390
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
Zed 1.0 深度实战:Atom 原班人马用 Rust 重塑编辑器——从 GPUI 架构到 AI 原生协作的全链路解析
编程
Zed 1.0 深度实战:Atom 原班人马用 Rust 重塑编辑器——从 GPUI 架构到 AI 原生协作的全链路解析
2026-05-07 01:08:06 +0800 CST
view 1074
深度解析 Zed 1.0 编辑器:从 Electron 到 Rust+GPUI 的架构革命,Rope 数据结构与增量编辑,Tree-sitter 语法高亮,CRDT 实时协作,LSP 集成,AI 原生编辑,性能优化实战。
Rust
编辑器
Zed
GPUI
性能优化
AI编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 176
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
sched_ext 源码级深度拆解:把 Linux 调度器变成可热插拔的 BPF 程序——从 DSQ 状态机到手写一个大小核感知调度器(附完整 C 实现)
编程
sched_ext 源码级深度拆解:把 Linux 调度器变成可热插拔的 BPF 程序——从 DSQ 状态机到手写一个大小核感知调度器(附完整 C 实现)
2026-08-02 02:19:25 +0800 CST
view 132
深度拆解 Linux 6.12 主线 sched_ext 可扩展调度器类:为什么 CFS/EEVDF 在异构硬件下失灵、sched_class 层级与 struct_ops 加载机制、DSQ 三件套与回调时序状态机,手写 v1~v4 四个逐步进化的 BPF 调度器(含完整可编译 C 代码与大小核感知实现),附 verifier 十条纪律、scx_lavd/scx_layered/scx_rusty 选型决策树、可观测调试与十条生产踩坑清单。
sched_ext
Linux内核
BPF
CPU调度器
eBPF
EEVDF
scx
性能优化
异构计算
云原生
sqlite-vec 深度实战:当 SQLite 遇见向量搜索,AI 应用的轻量级记忆系统从此有了标准答案(2026)
编程
sqlite-vec 深度实战:当 SQLite 遇见向量搜索,AI 应用的轻量级记忆系统从此有了标准答案(2026)
2026-07-22 01:16:13 +0800 CST
view 200
深度解析 sqlite-vec:一个纯C实现的SQLite向量搜索扩展,让SQLite直接支持语义搜索。涵盖核心架构、HNSW索引原理、SQL API完全指南、Python实战案例(知识库检索系统、AI Agent长期记忆、RAG系统)、性能优化、常见问题解决方案以及LangChain/LlamaIndex生态集成。
sqlite-vec
SQLite
向量搜索
AI应用
语义检索
RAG
Embedding
HNSW
AI Agent
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
编程
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
2026-07-15 10:13:07 +0800 CST
view 244
深度拆解 vLLM 核心架构:从 PagedAttention 分页内存管理、Continuous Batching 动态调度,到 Speculative Decoding、Prefix Caching 等高级特性,配完整代码示例与生产部署指南。
vLLM
PagedAttention
LLM推理
深度学习
GPU优化
Continuous Batching
万字深度解析 WebAssembly 服务端运行时:从 WASI 到组件模型,WasmEdge 与 Spin 如何把轻量级沙箱推向生产——从冷启动原理到 AOT 编译优化的完整技术指南(2026)
编程
万字深度解析 WebAssembly 服务端运行时:从 WASI 到组件模型,WasmEdge 与 Spin 如何把轻量级沙箱推向生产——从冷启动原理到 AOT 编译优化的完整技术指南(2026)
2026-07-09 04:25:16 +0800 CST
view 279
从 WASI 能力模型到 Component Model,深入拆解 WasmEdge/Wasmtime/Spin 的运行时架构、embeddings 实战与冷启动/AOT 性能优化,讲清 WASM 服务端化的工程落地。
WebAssembly
WASI
WasmEdge
Spin
服务端运行时
组件模型
vLLM 深度实战:当 LLM 推理遇上 PagedAttention——从 KV 缓存管理到生产级高并发服务的完全指南(2026)
编程
vLLM 深度实战:当 LLM 推理遇上 PagedAttention——从 KV 缓存管理到生产级高并发服务的完全指南(2026)
2026-06-08 22:52:24 +0800 CST
view 763
深度解析vLLM推理框架的核心原理、PagedAttention创新机制、分布式推理架构,以及生产环境部署的最佳实践。
vLLM
PagedAttention
LLM推理
KV缓存
分布式推理
2026 年 vLLM 推理服务实战:PagedAttention 原理、分布式部署与性能调优完全指南
编程
2026 年 vLLM 推理服务实战:PagedAttention 原理、分布式部署与性能调优完全指南
2026-06-08 22:53:03 +0800 CST
view 488
深度解析vLLM推理框架的核心原理、PagedAttention创新机制、分布式推理架构,以及生产环境部署的最佳实践。
vLLM
PagedAttention
LLM推理
KV缓存
分布式推理
SpacetimeDB 深度实战:当数据库学会了「吃掉服务器」——从内存计算到实时状态同步的生产级完全指南(2026)
编程
SpacetimeDB 深度实战:当数据库学会了「吃掉服务器」——从内存计算到实时状态同步的生产级完全指南(2026)
2026-06-14 23:49:48 +0800 CST
view 462
SpacetimeDB深度实战:详解数据库即服务器架构、Rust模块开发、BSATN二进制协议、客户端集成与性能优化,附BitCraft Online真实生产案例。
SpacetimeDB
Rust
实时数据库
游戏后端
内存计算
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
编程
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
2026-07-03 13:49:04 +0800 CST
view 465
深度对比 vLLM 0.5、TensorRT-LLM 1.8、TGI 2.0、DeepSpeed-MII 0.9 四大推理框架,从核心技术原理、性能数据、成本账本到生产部署实战,帮你做出正确的框架选型决策。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
大模型部署
GPU优化
AI代码编辑器深度解析:Cursor 2.0、Windsurf Cascade、Zed AI 的技术原理与实战对比
编程
AI代码编辑器深度解析:Cursor 2.0、Windsurf Cascade、Zed AI 的技术原理与实战对比
2026-07-09 06:46:11 +0800 CST
view 240
深入对比 Cursor 2.0、Windsurf Cascade、Zed AI 三款 AI 代码编辑器的技术原理、核心架构与实战场景,包含性能基准测试和选型建议。
AI编辑器
Cursor
Windsurf
Zed
编程工具
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 500
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
Go 标准库即将支持自动ETag:静态文件缓存终于不用手写了
编程
Go 标准库即将支持自动ETag:静态文件缓存终于不用手写了
2026-05-21 16:30:11 +0800 CST
view 624
Go团队接受提案#60940,在io/fs中新增HashFileInfo接口,让embed.FS和net/http.FileServer自动生成和校验ETag,Go 1.27起静态文件服务不再需要手动管理HTTP缓存。
Go语言
标准库
ETag
HTTP缓存
Go1.27
io/fs
embed
Web服务
Zed 1.0 深度实战:Rust 重写的代码编辑器为何被称为 VS Code 终结者——从 GPUI 架构到 AI Agent 全栈指南(2026)
编程
Zed 1.0 深度实战:Rust 重写的代码编辑器为何被称为 VS Code 终结者——从 GPUI 架构到 AI Agent 全栈指南(2026)
2026-05-30 10:38:50 +0800 CST
view 902
Zed 1.0 深度实战,从 GPUI 架构原理到 AI Agent 原生集成,全面解析 Rust 重写的代码编辑器
Zed
Rust
VS Code
GPUI
代码编辑器
AI Agent
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
编程
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
2026-07-04 03:13:57 +0800 CST
view 442
2026年6月百度开源Unlimited OCR,5天GitHub Star破1万。深度解析R-SWA机制、3B参数模型架构、KV Cache压缩原理,含完整部署代码与生产级应用案例。
百度
Unlimited OCR
OCR
R-SWA
KV Cache
长文档识别
端到端OCR
多模态模型
百度 Unlimited OCR 深度实战:30亿参数仅激活5亿、R-SWA注意力革命——长文档OCR端到端SOTA完全指南(2026)
编程
百度 Unlimited OCR 深度实战:30亿参数仅激活5亿、R-SWA注意力革命——长文档OCR端到端SOTA完全指南(2026)
2026-06-28 06:43:54 +0800 CST
view 598
百度2026年6月开源Unlimited OCR:30亿参数仅激活5亿,R-SWA注意力把KV Cache压成常数,一次前向推理处理几十页文档,OmniDocBench v1.6得分93.92%刷新SOTA。
百度 Unlimited OCR
OCR
R-SWA
长文档
端到端
MoE
SGLang
Zed 深度实战:当编辑器学会「Rust 速度 + AI 原生」——从 GPUI 渲染引擎到终端 Thread 与实时协作的生产级完全指南(2026)
编程
Zed 深度实战:当编辑器学会「Rust 速度 + AI 原生」——从 GPUI 渲染引擎到终端 Thread 与实时协作的生产级完全指南(2026)
2026-06-15 08:18:31 +0800 CST
view 544
Zed编辑器深度实战:从GPUI GPU渲染引擎架构到终端Thread AI工作流、CRDT实时协作、WASM插件沙箱,以及与VS Code的全面对比与迁移指南
Zed
编辑器
Rust
GPUI
AI编程
VS Code
代码编辑器
协作
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
编程
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
2026-05-30 15:42:55 +0800 CST
view 615
深度解析 LLM 推理优化的核心技术:PagedAttention 内存管理革命、投机解码加速策略、INT4/FP8 量化技术、MoE 架构优化,从架构原理到代码实战,让大模型推理成本下降 70%。
LLM
推理优化
vLLM
PagedAttention
投机解码
量化
MoE
AGIBOT WORLD 2026:智元开源全球首个具身智能全域数据集,机器人「大脑」终于有了真实世界教材
编程
AGIBOT WORLD 2026:智元开源全球首个具身智能全域数据集,机器人「大脑」终于有了真实世界教材
2026-04-08 14:12:17 +0800 CST
view 918
具身智能
AGIBOT
机器人学习
模仿学习
数据集开源
Embodied AI
vLLM 深度拆解:当大模型推理学会「分页注意力」——PagedAttention、连续批处理与 V1 引擎如何重写 GPU 推理服务的心智模型
编程
vLLM 深度拆解:当大模型推理学会「分页注意力」——PagedAttention、连续批处理与 V1 引擎如何重写 GPU 推理服务的心智模型
2026-07-16 04:19:16 +0800 CST
view 255
从工程师视角深度拆解 vLLM:PagedAttention 分页注意力、连续批处理、V1 引擎架构、KV Cache 管理、量化与投机解码,配 OpenAI 兼容服务、引导解码与生产调优实战。
vLLM
PagedAttention
连续批处理
大模型推理
GPU推理服务
KV缓存
V1引擎
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 540
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
13
14
15
16
17
...
83
下一页