程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 387
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 153
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
编程
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
2026-07-03 08:45:53 +0800 CST
view 303
深度解析 Ollama v0.20 Tool Calling,从协议原理到生产级多工具 Agent 实战,含天气查询、数据库查询、Web搜索三大实战案例与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
编程
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
2026-07-03 08:47:18 +0800 CST
view 302
深度长文:Ollama v0.20 Tool Calling 从协议原理到生产级多工具 Agent 实战,含天气查询、数据库操作、Web搜索三大案例与安全防护策略(2026)。
Ollama
AI Agent
Tool Calling
本地大模型
生产级
DeerFlow 2.0 深度实战:字节跳动 49K Star 的超级智能体运行时——从 LangGraph DAG 到沙箱隔离的全链路架构解析
编程
DeerFlow 2.0 深度实战:字节跳动 49K Star 的超级智能体运行时——从 LangGraph DAG 到沙箱隔离的全链路架构解析
2026-05-07 04:37:34 +0800 CST
view 994
深度拆解字节跳动开源的 DeerFlow 2.0 超级智能体框架,从 LangGraph DAG 工作流到 11 层中间件链,从动态子智能体到 Docker/K8s 沙箱隔离,从三层记忆架构到六大 IM 渠道接入,全链路架构解析与生产级部署实战。
DeerFlow
AI Agent
LangGraph
字节跳动
智能体
沙箱
开源
MCP 深度拆解:当 AI Agent 学会「插拔」——Model Context Protocol 如何用 JSON-RPC 2.0 重写 AI 工具调用的心智模型
编程
MCP 深度拆解:当 AI Agent 学会「插拔」——Model Context Protocol 如何用 JSON-RPC 2.0 重写 AI 工具调用的心智模型
2026-07-15 09:42:17 +0800 CST
view 252
从工程师视角深度拆解 MCP 协议:三大核心原语、传输层机制(stdio/SSE)、Python/TypeScript SDK 实战、生产架构设计,以及它对 AI Agent 生态的深远影响。
MCP
Model Context Protocol
JSON-RPC
AI Agent
Tool Calling
sqlite-vec 深度实战:当 SQLite 遇见向量搜索,AI 应用的轻量级记忆系统从此有了标准答案(2026)
编程
sqlite-vec 深度实战:当 SQLite 遇见向量搜索,AI 应用的轻量级记忆系统从此有了标准答案(2026)
2026-07-22 01:16:13 +0800 CST
view 192
深度解析 sqlite-vec:一个纯C实现的SQLite向量搜索扩展,让SQLite直接支持语义搜索。涵盖核心架构、HNSW索引原理、SQL API完全指南、Python实战案例(知识库检索系统、AI Agent长期记忆、RAG系统)、性能优化、常见问题解决方案以及LangChain/LlamaIndex生态集成。
sqlite-vec
SQLite
向量搜索
AI应用
语义检索
RAG
Embedding
HNSW
AI Agent
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
编程
vLLM 深度拆解:当 KV Cache 学会「分页」——用操作系统智慧重写 LLM 推理的心智模型
2026-07-15 10:13:07 +0800 CST
view 236
深度拆解 vLLM 核心架构:从 PagedAttention 分页内存管理、Continuous Batching 动态调度,到 Speculative Decoding、Prefix Caching 等高级特性,配完整代码示例与生产部署指南。
vLLM
PagedAttention
LLM推理
深度学习
GPU优化
Continuous Batching
LangChain4j:把LangChain的能力带入Java世界,一个库搞定LLM集成、RAG、Agent
编程
LangChain4j:把LangChain的能力带入Java世界,一个库搞定LLM集成、RAG、Agent
2026-04-16 19:11:21 +0800 CST
view 762
LangChain4j是Java世界的LangChain,简化Java应用集成大语言模型,支持OpenAI/Claude/DeepSeek等模型,提供RAG、Agent、Tool Calling、Memory等完整能力,Apache 2.0协议。
Java
LangChain
AI
LLM
RAG
Agent
开源
工具调用
DeerFlow 2.0 深度解析:字节跳动开源的智能体时代操作系统
编程
DeerFlow 2.0 深度解析:字节跳动开源的智能体时代操作系统
2026-04-17 05:39:08 +0800 CST
view 1040
DeerFlow 2.0 是字节跳动开源的 Super Agent 运行时基础设施,登顶 GitHub Trending 榜首。本文深度解析其架构设计、核心原理、实战部署与性能优化。
DeerFlow
AI Agent
字节跳动
LangGraph
MCP
开源项目
DeerFlow 2.0 深度解析:63K Star 的超级智能体执行底座,从架构哲学到生产实战
编程
DeerFlow 2.0 深度解析:63K Star 的超级智能体执行底座,从架构哲学到生产实战
2026-04-26 13:13:17 +0800 CST
view 893
深度解析字节跳动开源DeerFlow 2.0超级智能体执行底座:63K Star背后的架构设计哲学,从LangGraph编排引擎、渐进式技能加载、隔离式子智能体到Docker/K8s沙箱安全隔离,含完整代码实战与生产部署指南
DeerFlow
AI Agent
字节跳动
LangGraph
超级智能体
沙箱
多智能体编排
ECC(Everything Claude Code)深度解析:Claude Code 生产级增强框架——从技能编排到记忆持久化、从上下文压缩到多工具链集成的完整技术指南
编程
ECC(Everything Claude Code)深度解析:Claude Code 生产级增强框架——从技能编排到记忆持久化、从上下文压缩到多工具链集成的完整技术指南
2026-07-04 01:12:50 +0800 CST
view 239
深度解析ECC(Everything Claude Code)核心架构、功能特性与实战用法,帮助开发者搭建生产级AI编程工作流
ECC
Everything Claude Code
Claude Code
AI编程
AI Agent
技能编排
记忆持久化
上下文压缩
2026版 ECC(Everything Claude Code)深度解析:Claude Code 生产级增强框架——从技能编排到记忆持久化、从上下文压缩到多工具链集成的完整技术指南
编程
2026版 ECC(Everything Claude Code)深度解析:Claude Code 生产级增强框架——从技能编排到记忆持久化、从上下文压缩到多工具链集成的完整技术指南
2026-07-04 01:13:16 +0800 CST
view 588
2026年最新深度解析ECC核心架构、功能特性与实战用法,帮助开发者搭建生产级AI编程工作流
ECC
Everything Claude Code
Claude Code
AI编程
AI Agent
技能编排
记忆持久化
上下文压缩
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 489
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 182
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
GPT-5-Codex 深度解析:从「代码补全」到「7 小时自主编程」,OpenAI 如何重新定义 AI 编程智能体
编程
GPT-5-Codex 深度解析:从「代码补全」到「7 小时自主编程」,OpenAI 如何重新定义 AI 编程智能体
2026-05-15 07:13:11 +0800 CST
view 1235
GPT-5-Codex是OpenAI专为代理式软件工程优化的编程智能体,搭载动态思考技术可连续自主编程7小时。深度解析版本演进、上下文压缩、沙箱执行、GPT-5.5三大跨越、与Claude Code/Cursor Agent竞品对比。
GPT-5
Codex
AI编程
Agentic Coding
动态思考
Headroom 深度解析:AI Agent 上下文压缩引擎——从 Token 暴降 95% 的原理到生产级部署的完整技术指南(2026)
编程
Headroom 深度解析:AI Agent 上下文压缩引擎——从 Token 暴降 95% 的原理到生产级部署的完整技术指南(2026)
2026-07-04 04:42:34 +0800 CST
view 364
Headroom 深度解析:AI Agent 上下文压缩引擎,节省 60-95% Token 消耗,零侵入透明压缩层,含四种接入模式详解、压缩算法剖析、性能基准测试与生产级部署指南。
Headroom
AI Agent
上下文压缩
Token优化
成本优化
LangChain
Claude Code
Proxy模式
ML路由
DeerFlow 2.0 深度实战:字节跳动开源的超级智能体运行时——从 Super Agent Harness 架构到生产级部署的全链路解析
编程
DeerFlow 2.0 深度实战:字节跳动开源的超级智能体运行时——从 Super Agent Harness 架构到生产级部署的全链路解析
2026-05-08 06:10:07 +0800 CST
view 861
DeerFlow 2.0 深度解析:字节跳动开源的超级智能体运行时框架,49K Star 登顶 GitHub Trending。从四层微服务架构、Lead Agent 编排系统、Markdown 技能系统、Docker 沙箱执行环境、双层记忆系统到 MCP 协议支持,全方位解析这一革命性 AI Agent 框架的技术内涵与工程价值,并提供 Docker Compose 与 Kubernetes 生产级部署指南。
AI Agent
DeerFlow
字节跳动
LangGraph
Docker
开源项目
DeerFlow 2.0 深度解析:字节跳动如何用多智能体架构重新定义AI生产力
编程
DeerFlow 2.0 深度解析:字节跳动如何用多智能体架构重新定义AI生产力
2026-04-27 13:51:37 +0800 CST
view 609
深度解析字节跳动开源的DeerFlow 2.0超级智能体框架,从多智能体编排、沙箱安全执行、分层记忆持久化到可扩展技能系统,全面剖析其架构设计与工程实践。
AI Agent
LangGraph
DeerFlow
多智能体
字节跳动
Superpowers 深度解析:AI编程代理的工程化操作系统——让Claude Code化身专业架构师
编程
Superpowers 深度解析:AI编程代理的工程化操作系统——让Claude Code化身专业架构师
2026-04-17 16:16:42 +0800 CST
view 923
深度解析Superpowers:如何通过Skills框架强制AI遵循TDD、设计验证、代码审查等工程纪律,将Claude Code从「自信满满的初级工程师」进化为「懂得规矩的架构师」。14万Stars的开源项目全解析。
AI编程
Superpowers
Claude Code
TDD
工程化
Coding Agent
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
编程
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
2026-08-03 09:43:58 +0800 CST
view 160
深度拆解vLLM V1引擎四大核心架构:PagedAttention V2融合块表与前缀树缓存、分离式推理Prefill/Decode架构、KV Connector标准化接口、LMCache三层KV Cache管理,附完整部署配置与性能基准测试
vLLM
PagedAttention
LMCache
分离式推理
大模型推理
KV Cache
推理引擎
LLM Serving
GPU优化
开源
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 530
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
编程
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
2026-04-08 15:04:17 +0800 CST
view 847
Oracle Helidon 4.4.0 引入 AI Agent 编排能力,Java 微服务框架进入 AI 原生时代。深度解析 Workflows、Dynamic Agents 两种执行模式,完整代码实战。
Helidon
Java
AI Agent
LangChain4j
微服务
TigerBeetle 深度拆解:一个用 Zig 写的金融级数据库如何让转账吞吐量达到 100 万 TPS——从 VSR 共识到确定性模拟测试的极致工程哲学
编程
TigerBeetle 深度拆解:一个用 Zig 写的金融级数据库如何让转账吞吐量达到 100 万 TPS——从 VSR 共识到确定性模拟测试的极致工程哲学
2026-08-03 13:13:59 +0800 CST
view 111
深度拆解TigerBeetle四大核心架构:Zig语言从零构建的金融级OLTP引擎、Debit/Credit复式记账数据模型、VSR共识+Flexible Quorums多云高可用、VOPR确定性模拟测试1024核24/7模糊测试,附完整Python集成示例与生产部署指南
TigerBeetle
Zig
金融数据库
OLTP
VSR
共识算法
确定性模拟测试
io_uring
复式记账
分布式系统
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
62
63
64
65
66
...
140
下一页