程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 442
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24 +0800 CST
view 72
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04 +0800 CST
view 76
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16 +0800 CST
view 83
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 14
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 90
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
Zig 深度拆解:当 C 学会「编译期执行」——comptime、分配器模型与 zig build 统一工具链,一份写给系统程序员的全景指南(2026)
编程
Zig 深度拆解:当 C 学会「编译期执行」——comptime、分配器模型与 zig build 统一工具链,一份写给系统程序员的全景指南(2026)
2026-07-17 05:44:44 +0800 CST
view 154
从工程师视角深度拆解 Zig:comptime 编译期执行、显式分配器模型、错误联合与 errdefer、zig build 统一工具链与开箱即用交叉编译,配 RingBuffer 泛型、配置读取、C 互调等完整可运行代码与性能优化实战。
Zig
系统编程
comptime
内存管理
Rust
交叉编译
zig build
编译期执行
性能优化
C语言
wasm-pack 1.0 深度解析:Rust WASM 端侧计算的内存管理与性能调优实战
编程
wasm-pack 1.0 深度解析:Rust WASM 端侧计算的内存管理与性能调优实战
2026-04-19 08:16:43 +0800 CST
view 683
深度解析 wasm-pack 1.0 发布后 Rust WASM 的内存管理与性能调优实战,涵盖零拷贝传递、内存泄漏防护、WebGPU 结合等技术要点。
WebAssembly
wasm-pack
Rust
性能优化
内存管理
WebGPU
前端架构
Go 1.26 Green Tea GC 深度拆解:10%~40% GC 开销消失的背后,Go 团队做对了什么?
编程
Go 1.26 Green Tea GC 深度拆解:10%~40% GC 开销消失的背后,Go 团队做对了什么?
2026-07-29 00:45:39 +0800 CST
view 59
深度拆解 Go 1.26 默认启用的 Green Tea 垃圾回收器:分代复制算法如何让 GC CPU 开销降低 10-40%,附完整代码实战与迁移指南。
Go语言
Green Tea GC
垃圾回收
Go 1.26
性能优化
内存管理
Go 1.27 的小对象分配革命:当编译器学会为每个尺寸定制 malloc
编程
Go 1.27 的小对象分配革命:当编译器学会为每个尺寸定制 malloc
2026-07-05 16:38:18 +0800 CST
view 217
Go 1.27编译器为小于80字节的小对象生成尺寸特化分配代码,绕过mallocgc通用路径,直接内联分配逻辑。小对象分配延迟降低约30%,整体免费1%性能提升,无需改代码。解析Swiss Tables/Green Tea GC/栈分配的基础建设如何促成这一优化。
Go
Go 1.27
编译器
性能优化
内存管理
malloc
小对象分配
尺寸特化
mallocgc
GreenTeaGC
SwissTables
栈分配
GOEXPERIMENT
Rust 中的所有权机制
编程
Rust 中的所有权机制
2024-11-18 20:54:50 +0800 CST
view 1755
Rust采用独特的所有权机制进行内存管理,避免了垃圾回收和手动管理的缺陷。通过借用检查器确保内存安全,Rust在编译时防止内存泄漏和悬空指针等问题。其内存模型包括栈和堆的使用,以及所有权的转移,确保高效且安全的内存管理。开发者可以利用这些机制编写高性能的代码。
编程
Rust
内存管理
软件开发
系统编程
Python foreach 循环与生成器表达式的高效结合
编程
Python foreach 循环与生成器表达式的高效结合
2024-11-19 09:28:14 +0800 CST
view 1751
本文介绍了Python中的foreach循环的实现方式以及生成器表达式的概念和优势。通过示例展示了如何使用for循环遍历列表,以及生成器表达式如何节省内存和支持懒惰计算。文中还提供了处理大数据集的实战案例,强调了生成器在处理大量数据时的高效性和灵活性。
Python
编程
数据处理
效率
内存管理
Zig 深度实战:向 AI 代码说「不」的系统编程语言——从 comptime 元编程到手动内存管理的完全指南(2026)
编程
Zig 深度实战:向 AI 代码说「不」的系统编程语言——从 comptime 元编程到手动内存管理的完全指南(2026)
2026-06-03 06:47:06 +0800 CST
view 834
Zig 语言深度实战指南:从 comptime 编译期计算、手动内存管理、错误处理到 C 无缝互操作,完整代码示例与 HTTP 服务器实战项目
Zig
系统编程
comptime
内存管理
C互操作
Go 1.24 三板斧重塑工程边界:Swiss Table 革新底层性能、weak.Pointer 解锁内存效率革命、后量子密码 ML-KEM 引领安全未来
编程
Go 1.24 三板斧重塑工程边界:Swiss Table 革新底层性能、weak.Pointer 解锁内存效率革命、后量子密码 ML-KEM 引领安全未来
2026-07-12 15:16:22 +0800 CST
view 190
深度解析 Go 1.24 三大重磅更新:Swiss Table 让 map 性能提升 20-30%,weak.Pointer 补全内存管理版图,crypto/mlkem 引领后量子密码时代
Go语言
后量子密码
SwissTable
性能优化
内存管理
工程实践
Zig 0.14 深度实战:从 comptime 编译时元编程到跨平台 C 互操作——2026 年系统编程新锐的工程化完全指南
编程
Zig 0.14 深度实战:从 comptime 编译时元编程到跨平台 C 互操作——2026 年系统编程新锐的工程化完全指南
2026-05-24 08:35:12 +0800 CST
view 679
深入剖析 Zig 0.14 核心特性:comptime 编译时元编程、错误联合类型、分配器设计、泛型实现、C 互操作、交叉编译,以及与 Bun/Rust/Go 的对比分析,附完整代码实战。
Zig
系统编程
comptime
C互操作
LLVM
交叉编译
内存管理
WebAssembly 3.0 多内存架构深度解析:当「内存隔离」成为前端性能的新引擎
编程
WebAssembly 3.0 多内存架构深度解析:当「内存隔离」成为前端性能的新引擎
2026-04-12 21:27:18 +0800 CST
view 511
本文深入解析WebAssembly3.0引入的多内存架构,从单内存模型的困境(内存越界、容量限制、安全模糊)出发,详细阐述多内存特性的设计目标、技术原理(内存索引、访问控制、安全隔离)及工程实践。通过浪潮软件的前端渲染专利案例,展示三层内存架构(GPU内存、SIMD内存、CPU内存)带来的显著性能提升(渲染帧率+37%,计算加速6.7倍)。结合Rust工具链、内存管理最佳实践及Rust1.96链接器变更,探讨多内存在在线设计工具、数据处理等场景的应用,并展望组件模型与64位地址空间的未来发展方向。
WebAssembly
前端性能
内存管理
并行计算
浏览器技术
Zig 0.16 深度解剖:comptime 元编程、无隐藏控制流与手动内存管理的工程真相
编程
Zig 0.16 深度解剖:comptime 元编程、无隐藏控制流与手动内存管理的工程真相
2026-07-25 07:44:29 +0800 CST
view 79
从第一性原理深度拆解 Zig:comptime 一统泛型与反射、allocator 显式化内存模型、error union 与 errdefer 错误处理、无隐藏控制流哲学、@cImport 与 zig cc 交叉编译神器,以及 Zig vs Rust 的诚实选型冷思考。
Zig
comptime
系统编程
内存管理
allocator
错误处理
C互操作
交叉编译
Rust
性能优化
Zig 0.16.0 深度实战:当「无隐藏魔法」遇上系统编程——从显式内存管理到生产级 C 替代方案的完全指南(2026)
编程
Zig 0.16.0 深度实战:当「无隐藏魔法」遇上系统编程——从显式内存管理到生产级 C 替代方案的完全指南(2026)
2026-06-13 05:48:13 +0800 CST
view 511
深入剖析 Zig 0.16.0 的核心特性:显式分配器模型、错误联合类型、编译期编程,并通过完整 HTTP 服务器案例展示生产级应用。
Zig
系统编程
内存管理
编译期计算
C语言替代
Linux Swap 子系统现代化重构:当 18 个月的内核攻坚重塑内存管理底层架构
编程
Linux Swap 子系统现代化重构:当 18 个月的内核攻坚重塑内存管理底层架构
2026-04-13 06:55:20 +0800 CST
view 843
深入剖析腾讯工程师主导的 Linux Swap 子系统现代化重构——从 XArray 到 swap table,从 swap map 到统一元数据管理,这场跨越 18 个月的内核级架构革新带来 5%-20% 性能提升和 30% 元数据内存节省。
Linux
内核
内存管理
Swap
性能优化
Go 1.26 Green Tea GC 深度拆解:从 runtime 源码看「延迟扫描 + span 批处理」如何砍掉 40% GC 开销
编程
Go 1.26 Green Tea GC 深度拆解:从 runtime 源码看「延迟扫描 + span 批处理」如何砍掉 40% GC 开销
2026-07-31 04:18:59 +0800 CST
view 36
Go 1.26 默认启用 Green Tea GC,官方称 GC 开销降低 10-40%。本文从 runtime 源码拆解其双位图设计、span 内联 mark bits、FIFO 队列与三态所有权协议、spanSPMC 工作窃取与 SIMD 扫描,并给出可复现的压测方案、GOGC 重校准脚本、runtime/metrics 监控代码,以及 goroutine 泄漏 profile 的 CI 集成与能力边界冷思考。
Go
Green Tea GC
垃圾回收
runtime
性能优化
goroutine泄漏
Go1.26
SIMD
内存管理
并发编程
Zig 语言 2026 深度实战:当「没有隐藏糖」遇上 LLVM 18 与 stage3 编译器——一次把系统级编程新范式讲透
编程
Zig 语言 2026 深度实战:当「没有隐藏糖」遇上 LLVM 18 与 stage3 编译器——一次把系统级编程新范式讲透
2026-07-13 17:16:14 +0800 CST
view 201
深度拆解 Zig 0.14 稳定版与 stage3 自举编译器:从零糖设计哲学、LLVM 18 后端、comptime 编译时计算到高性能 HTTP 代理实战,配完整代码与横评。
Zig
stage3
系统编程
LLVM
编译器
内存管理
并发编程
性能优化
Go 1.23 中的新包:unique
编程
Go 1.23 中的新包:unique
2024-11-18 12:32:57 +0800 CST
view 1699
Go1.23引入了unique包,提供工具用于对可比较值进行规范化处理。该包通过Handle[T]实现了内存优化和高效比较,支持多种可比较类型。unique包的设计借鉴了Lisp中的符号驻留概念,允许在内存中只保留一个规范化副本。尽管与字符串驻留有所不同,unique包为构建内存高效缓存提供了新的可能性。
编程
Go语言
内存管理
Go语言黑科技,空结构体的神奇应用大揭秘!
编程
Go语言黑科技,空结构体的神奇应用大揭秘!
2024-11-19 05:59:31 +0800 CST
view 1603
本文深入探讨了Go语言中空结构体的应用与优势,强调其作为占位符和信号传递工具的灵活性。空结构体不占用内存空间,适合用于集合操作和并发编程,提升代码的简洁性和效率。通过示例展示了如何在实际编程中有效利用空结构体,帮助开发者更好地理解这一重要概念。
编程
Go语言
数据结构
内存管理
并发编程
PHP内存管理终极指南:从引用计数到生产环境监控
编程
PHP内存管理终极指南:从引用计数到生产环境监控
2025-08-26 06:42:40 +0800 CST
view 1007
本文深入探讨了PHP内存管理的核心机制,包括引用计数、写时复制、垃圾回收及循环引用处理。通过示例代码,展示了内存泄漏的常见模式及其预防措施,强调了在高并发应用中内存优化的重要性。还介绍了生产环境的内存监控策略和最佳实践,帮助开发者编写高性能、稳定的PHP应用。
PHP
内存管理
性能优化
开发实践
编程技巧
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
...
13
下一页