程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
编程
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
2026-07-07 16:15:25 +0800 CST
view 112
深入解析2026年大模型推理中的KV Cache优化技术栈:从PagedAttention虚拟分页管理、Prefix Caching缓存复用、Speculative Decoding并行验证,到INT8量化与Continuous Batching生产实践,配合代码示例与性能对比,助你系统性掌握LLM推理优化的核心要领。
LLM
KV Cache
PagedAttention
Prefix Caching
vLLM
推理优化
Speculative Decoding
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
编程
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
2026-07-03 08:43:53 +0800 CST
view 249
深度解析 Ollama v0.20 的 Tool Calling 能力:从 JSON Schema 协议原理、HTTP API 调用循环,到生产级多工具 Agent 系统的完整实战(天气查询/数据库查询/Web搜索),配套 LangChain4j 集成方案与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
生产级实战
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
编程
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
2026-07-03 08:44:52 +0800 CST
view 193
深度解析 Ollama v0.20 的 Tool Calling 能力,从 JSON Schema 协议原理到生产级多工具 Agent 实战,含安全防护与性能基准测试。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
万字深度解析 Nano-vLLM:当1200行Python代码重构大模型推理——从架构设计到性能超越vLLM的完整技术指南(2026)
编程
万字深度解析 Nano-vLLM:当1200行Python代码重构大模型推理——从架构设计到性能超越vLLM的完整技术指南(2026)
2026-07-01 14:44:55 +0800 CST
view 241
Nano-vLLM:用约1200行Python代码实现的轻量级vLLM替代方案。深度解析KV Cache管理、GQA注意力、RoPE位置编码、Continuous Batching等核心技术,Benchmark性能超越vLLM 5.3%。适合学习大模型推理原理和内网轻量级部署。
Nano-vLLM
大模型推理
LLM
Tensor Parallelism
KV Cache
Continuous Batching
Python
PyTorch
Qwen2
开源项目
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 297
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
编程
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
2026-07-24 18:44:04 +0800 CST
view 95
深度拆解 GitHub Trending 开源工具 llmfit:四维评分系统、量化自动试探、MoE 精算、带宽速度模型、Plan 模式与 bench 众包校准,从第一性原理讲透本地大模型的硬件适配方法论。
llmfit
本地大模型
LLM
Rust
量化
Ollama
llama.cpp
Apple Silicon
硬件适配
开源
TypeScript 7.0 RC 深度解析:微软用 Go 重写编译器,十年自举信仰一夜崩塌,10倍性能飞跃背后的血腥革命
编程
TypeScript 7.0 RC 深度解析:微软用 Go 重写编译器,十年自举信仰一夜崩塌,10倍性能飞跃背后的血腥革命
2026-06-29 15:46:09 +0800 CST
view 346
2026年6月微软发布TypeScript 7.0 RC,用Go语言重写了整个编译器,性能提升10倍。本文深度解析Go选型逻辑、并行检查架构、Breaking Changes与迁移实战。
TypeScript
TypeScript 7
Go
Golang
编译器
性能优化
前端工程化
Breaking Changes
Scrapling 深度实战:从自适应解析到生产级爬虫架构——现代 Web 数据采集的工程化完全指南(2026)
编程
Scrapling 深度实战:从自适应解析到生产级爬虫架构——现代 Web 数据采集的工程化完全指南(2026)
2026-06-03 18:18:58 +0800 CST
view 451
Scrapling 52K Star 自适应爬虫框架深度实战
Scrapling
Web Scraping
Python
Adaptive Scraping
爬虫
MCP
AI Agent
Superpowers 深度实战:让 AI 编程从「随意发挥」到「工程化落地」——204K Star 的 AI Agent 软件开发方法论完全指南(2026)
编程
Superpowers 深度实战:让 AI 编程从「随意发挥」到「工程化落地」——204K Star 的 AI Agent 软件开发方法论完全指南(2026)
2026-06-26 05:13:28 +0800 CST
view 235
Superpowers 是 GitHub 204K Star 的 AI 编程 Agent 软件开发方法论框架,通过可组合的技能系统让 AI 像资深工程师一样先思考、再规划、后编码、必验证。
Superpowers
AI编程
Claude Code
软件开发方法论
Agentic Engineering
Vibe Coding
TDD
代码评审
Spring Boot 4.1.0 深度实战:50+ 依赖升级背后的架构演进与性能优化完全指南
编程
Spring Boot 4.1.0 深度实战:50+ 依赖升级背后的架构演进与性能优化完全指南
2026-06-26 16:14:20 +0800 CST
view 431
2026年6月Spring Boot 4.1.0深度实战指南:50+依赖升级、WritableJson内存优化、JWT安全加固、7项安全修复、迁移实战,万字长文带你掌握4.x系列的稳定之锚。
Spring Boot
Spring Framework
Hibernate
Spring Security
Java
微服务
性能优化
GraalVM
Caveman 深度实战:一句「穴居人」指令省 65% Token 背后的 AI Agent 输出经济学
编程
Caveman 深度实战:一句「穴居人」指令省 65% Token 背后的 AI Agent 输出经济学
2026-07-14 16:42:10 +0800 CST
view 209
深度拆解 Caveman 开源项目:从技术架构、压缩等级、基准测试到生态版图,一次把「让 AI 输出省 65% Token」的穴居人哲学讲透,附完整代码实战与避坑指南。
Caveman
AI Agent
Token优化
开源
Prompt Engineering
GitHub Trending
Claude Code
Kubernetes 1.36 深度实战:用户命名空间 GA、可变准入策略与 Ingress NGINX 退役——2026 年云原生生产级升级完全指南
编程
Kubernetes 1.36 深度实战:用户命名空间 GA、可变准入策略与 Ingress NGINX 退役——2026 年云原生生产级升级完全指南
2026-06-27 14:12:40 +0800 CST
view 222
Kubernetes 1.36(代号Haru)深度实战指南:详解用户命名空间GA、可变准入策略GA、Ingress NGINX退役三大核心变更,附带完整代码示例、生产级升级流程和性能优化建议。
Kubernetes 1.36
User Namespaces
Mutating Admission Policies
Ingress NGINX
云原生
容器安全
K8s升级
生产级部署
Envoy Gateway
Security Context
caveman 深度解析:当 Claude Code 用「穴居人语言」砍掉 75% Token 消耗,AI 编程正式进入「极简主义」时代
编程
caveman 深度解析:当 Claude Code 用「穴居人语言」砍掉 75% Token 消耗,AI 编程正式进入「极简主义」时代
2026-04-10 00:14:55 +0800 CST
view 1622
深度解析 caveman 开源项目:一个让 Claude Code 用「穴居人语言」说话的 skill,砍掉 75% Token 消耗同时保持 100% 技术准确率。
Claude Code
Token优化
AI编程
Prompt Engineering
LLM效率
开源工具
程序员工具
代码审查
Headroom深度解析:AI Agent上下文压缩层的架构革命——Token成本暴降95%与可逆压缩的完整实战指南
编程
Headroom深度解析:AI Agent上下文压缩层的架构革命——Token成本暴降95%与可逆压缩的完整实战指南
2026-07-05 21:12:46 +0800 CST
view 358
深度解析Headroom上下文压缩中间层:六大压缩算法(SmartCrusher/CodeCompressor/Kompress-base/ImageCompressor/IntelligentContext/CacheAligner)、CCR可逆压缩、跨Agent记忆共享、KV Cache命中率优化。含完整代码实战、基准测试对比、竞品分析与生产部署指南。
Headroom
AI Agent
上下文压缩
Token优化
CCR
可逆压缩
Context Engineering
KV Cache
LLM
Python
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
编程
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
2026-05-23 18:44:14 +0800 CST
view 573
2026年深度长文,从PagedAttention分页思想、Continuous Batching调度算法、Speculative Decoding并行验证机制到CUDA Kernel底层实现,全面拆解vLLM推理引擎内核架构,附生产级部署实战与框架横向对比。
vLLM
PagedAttention
Continuous Batching
Speculative Decoding
GPU推理
大模型部署
深度学习
CUDA
TradingAgents 深度解析:63K Star 的多智能体金融交易框架——从架构设计到 LLM 协作的全链路技术实战
编程
TradingAgents 深度解析:63K Star 的多智能体金融交易框架——从架构设计到 LLM 协作的全链路技术实战
2026-05-04 07:54:03 +0800 CST
view 513
深度解析 63K Star 的 TradingAgents 多智能体金融交易框架,从架构设计、LLM 协作机制、多空辩论到实战部署的全链路技术实战
TradingAgents
多智能体
LLM
量化交易
LangGraph
金融科技
Python
Andrej Karpathy Skills 深度实战:用CLAUDE.md让AI遵守工程纪律告别四大编程陷阱
编程
Andrej Karpathy Skills 深度实战:用CLAUDE.md让AI遵守工程纪律告别四大编程陷阱
2026-06-28 03:45:41 +0800 CST
view 329
深度解析 Andrej Karpathy Skills 如何通过一份 CLAUDE.md 文件让 Claude Code 等 AI 编程助手遵守软件工程纪律,告别过度复杂化、跳过测试、乱改代码等四大编程陷阱。
Andrej Karpathy Skills
CLAUDE.md
AI编程
软件工程
Prompt Engineering
60行配置文件斩获5万星:Karpathy如何用四条原则终结AI编程的混乱时代
编程
60行配置文件斩获5万星:Karpathy如何用四条原则终结AI编程的混乱时代
2026-04-18 14:44:57 +0800 CST
view 1175
andrej-karpathy-skills项目60行CLAUDE.md文件斩获54k星标,四条原则Think Before Coding、Simplicity First、Surgical Changes、Goal-Driven Execution如何终结AI编程的混乱时代
AI编程
Claude Code
Prompt Engineering
LLM
软件工程
Rolldown 1.0 深度实战:当 Vite 用 Rust 重写打包器,10–30 倍性能背后到底发生了什么?
编程
Rolldown 1.0 深度实战:当 Vite 用 Rust 重写打包器,10–30 倍性能背后到底发生了什么?
2026-07-11 00:44:38 +0800 CST
view 183
2026年6月 Rolldown 1.0 正式发布,作为 Vite 8 默认打包器比 Rollup 快 10-30 倍。本文从架构、代码、性能三维度深度拆解:双引擎原罪、OXC 并行解析、bitset 可达性 tree-shaking、智能分块,配可运行实战与迁移指南。
Rolldown
Vite 8
Rust
前端工程化
打包器
构建工具
OXC
Rollup
性能优化
Tree Shaking
SGLang深度解析:RadixAttention架构下的大模型推理革命——从零到生产的高性能LLM服务框架实战指南
编程
SGLang深度解析:RadixAttention架构下的大模型推理革命——从零到生产的高性能LLM服务框架实战指南
2026-07-05 18:13:38 +0800 CST
view 374
深度解析SGLang高性能大模型推理框架:RadixAttention自动前缀缓存、零开销C++调度器、PD分离架构、多LoRA批处理、推测解码。含完整代码实战与vLLM/TensorRT-LLM对比。
SGLang
RadixAttention
LLM
推理引擎
大模型
vLLM
GPU
高并发
AI基础设施
性能优化
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
编程
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
2026-06-30 11:16:18 +0800 CST
view 256
深度解析 SGLang 大模型推理框架:RadixAttention 前缀缓存、零开销 CPU 调度器、结构化输出约束、推测解码、PD 分离等核心技术,对比 vLLM/TensorRT-LLM 选型,提供完整代码示例与生产级部署实践
SGLang
大模型推理
RadixAttention
前缀缓存
结构化输出
推测解码
PD分离
vLLM
TensorRT-LLM
SGLang 深度解析:RadixAttention 前缀缓存与结构化 LLM 推理革命——从 RAG/Agent 场景到生产级部署的完整指南
编程
SGLang 深度解析:RadixAttention 前缀缓存与结构化 LLM 推理革命——从 RAG/Agent 场景到生产级部署的完整指南
2026-06-30 11:17:15 +0800 CST
view 292
深度解析 SGLang 大模型推理框架:RadixAttention 前缀缓存、零开销 CPU 调度器、结构化输出约束、推测解码、PD 分离等核心技术,对比 vLLM/TensorRT-LLM 选型,提供完整代码示例与生产级部署实践
SGLang
大模型推理
RadixAttention
前缀缓存
结构化输出
推测解码
PD分离
vLLM
TensorRT-LLM
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 585
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 588
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
28
29
30
31
32
...
66
下一页