程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 480
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 176
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
GPT-5-Codex 深度解析:从「代码补全」到「7 小时自主编程」,OpenAI 如何重新定义 AI 编程智能体
编程
GPT-5-Codex 深度解析:从「代码补全」到「7 小时自主编程」,OpenAI 如何重新定义 AI 编程智能体
2026-05-15 07:13:11 +0800 CST
view 1225
GPT-5-Codex是OpenAI专为代理式软件工程优化的编程智能体,搭载动态思考技术可连续自主编程7小时。深度解析版本演进、上下文压缩、沙箱执行、GPT-5.5三大跨越、与Claude Code/Cursor Agent竞品对比。
GPT-5
Codex
AI编程
Agentic Coding
动态思考
Headroom 深度解析:AI Agent 上下文压缩引擎——从 Token 暴降 95% 的原理到生产级部署的完整技术指南(2026)
编程
Headroom 深度解析:AI Agent 上下文压缩引擎——从 Token 暴降 95% 的原理到生产级部署的完整技术指南(2026)
2026-07-04 04:42:34 +0800 CST
view 358
Headroom 深度解析:AI Agent 上下文压缩引擎,节省 60-95% Token 消耗,零侵入透明压缩层,含四种接入模式详解、压缩算法剖析、性能基准测试与生产级部署指南。
Headroom
AI Agent
上下文压缩
Token优化
成本优化
LangChain
Claude Code
Proxy模式
ML路由
DeerFlow 2.0 深度实战:字节跳动开源的超级智能体运行时——从 Super Agent Harness 架构到生产级部署的全链路解析
编程
DeerFlow 2.0 深度实战:字节跳动开源的超级智能体运行时——从 Super Agent Harness 架构到生产级部署的全链路解析
2026-05-08 06:10:07 +0800 CST
view 854
DeerFlow 2.0 深度解析:字节跳动开源的超级智能体运行时框架,49K Star 登顶 GitHub Trending。从四层微服务架构、Lead Agent 编排系统、Markdown 技能系统、Docker 沙箱执行环境、双层记忆系统到 MCP 协议支持,全方位解析这一革命性 AI Agent 框架的技术内涵与工程价值,并提供 Docker Compose 与 Kubernetes 生产级部署指南。
AI Agent
DeerFlow
字节跳动
LangGraph
Docker
开源项目
DeerFlow 2.0 深度解析:字节跳动如何用多智能体架构重新定义AI生产力
编程
DeerFlow 2.0 深度解析:字节跳动如何用多智能体架构重新定义AI生产力
2026-04-27 13:51:37 +0800 CST
view 605
深度解析字节跳动开源的DeerFlow 2.0超级智能体框架,从多智能体编排、沙箱安全执行、分层记忆持久化到可扩展技能系统,全面剖析其架构设计与工程实践。
AI Agent
LangGraph
DeerFlow
多智能体
字节跳动
Superpowers 深度解析:AI编程代理的工程化操作系统——让Claude Code化身专业架构师
编程
Superpowers 深度解析:AI编程代理的工程化操作系统——让Claude Code化身专业架构师
2026-04-17 16:16:42 +0800 CST
view 916
深度解析Superpowers:如何通过Skills框架强制AI遵循TDD、设计验证、代码审查等工程纪律,将Claude Code从「自信满满的初级工程师」进化为「懂得规矩的架构师」。14万Stars的开源项目全解析。
AI编程
Superpowers
Claude Code
TDD
工程化
Coding Agent
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
编程
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
2026-08-03 09:43:58 +0800 CST
view 151
深度拆解vLLM V1引擎四大核心架构:PagedAttention V2融合块表与前缀树缓存、分离式推理Prefill/Decode架构、KV Connector标准化接口、LMCache三层KV Cache管理,附完整部署配置与性能基准测试
vLLM
PagedAttention
LMCache
分离式推理
大模型推理
KV Cache
推理引擎
LLM Serving
GPU优化
开源
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 521
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
编程
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
2026-04-08 15:04:17 +0800 CST
view 842
Oracle Helidon 4.4.0 引入 AI Agent 编排能力,Java 微服务框架进入 AI 原生时代。深度解析 Workflows、Dynamic Agents 两种执行模式,完整代码实战。
Helidon
Java
AI Agent
LangChain4j
微服务
TigerBeetle 深度拆解:一个用 Zig 写的金融级数据库如何让转账吞吐量达到 100 万 TPS——从 VSR 共识到确定性模拟测试的极致工程哲学
编程
TigerBeetle 深度拆解:一个用 Zig 写的金融级数据库如何让转账吞吐量达到 100 万 TPS——从 VSR 共识到确定性模拟测试的极致工程哲学
2026-08-03 13:13:59 +0800 CST
view 107
深度拆解TigerBeetle四大核心架构:Zig语言从零构建的金融级OLTP引擎、Debit/Credit复式记账数据模型、VSR共识+Flexible Quorums多云高可用、VOPR确定性模拟测试1024核24/7模糊测试,附完整Python集成示例与生产部署指南
TigerBeetle
Zig
金融数据库
OLTP
VSR
共识算法
确定性模拟测试
io_uring
复式记账
分布式系统
Cognee 深度实战:当 AI Agent 装上持久化记忆——从向量搜索到知识图谱的生产级完全指南(2026)
编程
Cognee 深度实战:当 AI Agent 装上持久化记忆——从向量搜索到知识图谱的生产级完全指南(2026)
2026-06-09 23:18:18 +0800 CST
view 518
深度解析开源项目 Cognee 如何通过向量搜索与知识图谱的融合,为 AI Agent 提供持久化、动态化的记忆能力。从核心概念、架构设计到生产级代码实战。
AI Agent
记忆系统
知识图谱
向量搜索
Cognee
Python
LangChain
你的超级大脑跑在你自己的机器上:MateClaw开源多智能体AI平台
编程
你的超级大脑跑在你自己的机器上:MateClaw开源多智能体AI平台
2026-04-28 03:31:17 +0800 CST
view 975
MateClaw(太一)是Java/Spring Boot构建的开源多智能体AI平台。核心特性:14+家供应商自动故障转移、LLM Wiki知识管理、五种入口(Web/桌面/嵌入/IM/SDK)、RBAC多用户管理。与OpenClaw、Hermes Agent、Claude Code、Cursor对比分析。
AI Agent
开源项目
多智能体
Spring Boot
企业级
Gemma MacOS Tuner 深度解析:在 Apple Silicon 上用 PyTorch 和 MPS 高效微调多模态 Gemma
编程
Gemma MacOS Tuner 深度解析:在 Apple Silicon 上用 PyTorch 和 MPS 高效微调多模态 Gemma
2026-04-09 01:14:39 +0800 CST
view 1322
详解 gemma-tuner-multimodal 项目:在 Apple Silicon 上通过 PyTorch MPS 后端对 Google Gemma 系列模型进行 LoRA 微调,支持文本、图像、音频三种模态,完全本地运行,数据不出机器,零 NVIDIA GPU 依赖。
Gemma
Apple Silicon
PyTorch
MPS
LoRA
微调
Machine Learning
DeerFlow 2.0 深度实战:从 LangGraph 中间件链到 Docker 沙箱的超级智能体架构全解
编程
DeerFlow 2.0 深度实战:从 LangGraph 中间件链到 Docker 沙箱的超级智能体架构全解
2026-05-09 04:41:16 +0800 CST
view 733
深度解析字节跳动开源的超级智能体运行时DeerFlow 2.0,从18层中间件链到Docker沙箱隔离,从Lead Agent协调到渐进式技能加载,完整剖析其技术架构与生产级部署实践
AI Agent
DeerFlow
LangGraph
Docker
字节跳动
智能体架构
TileLang + TileKernels 深度解析:DeepSeek 如何用 Python 写出让 GPU 逼近理论性能上限的 GPU 内核
编程
TileLang + TileKernels 深度解析:DeepSeek 如何用 Python 写出让 GPU 逼近理论性能上限的 GPU 内核
2026-04-28 10:55:20 +0800 CST
view 807
深度剖析 DeepSeek 开源的 TileLang DSL 和 TileKernels GPU 内核库:从 GEMM 到 MoE,从 TVM 编译基础设施到生产级量化内核,揭示用 Python 写接近硬件极限性能 GPU 代码的秘密。
TileLang
GPU内核
DeepSeek
高性能计算
CUDA
GEMM
MoE
量化
TVM
开源项目
DeerFlow 2.0 深度解析:字节跳动开源超级智能体运行时——从 LangGraph 重构到生产级 Agent 基础设施的技术革命
编程
DeerFlow 2.0 深度解析:字节跳动开源超级智能体运行时——从 LangGraph 重构到生产级 Agent 基础设施的技术革命
2026-05-15 23:46:24 +0800 CST
view 803
DeerFlow 2.0完整架构解析:从LangGraph重构到生产级Agent基础设施,深入讲解沙箱执行、技能系统、长期记忆、子代理并行、MCP集成等核心技术。
AI Agent
DeerFlow
LangGraph
字节跳动
开源
DeerFlow 2.0 深度实战:从「对话机器人」到「可进化超级智能体」——字节跳动开源超级 Agent 运行时的架构设计与生产级实践
编程
DeerFlow 2.0 深度实战:从「对话机器人」到「可进化超级智能体」——字节跳动开源超级 Agent 运行时的架构设计与生产级实践
2026-05-22 10:29:50 +0800 CST
view 984
深度解析字节跳动开源的超级智能体运行时框架DeerFlow 2.0,从多层记忆架构、Supervisor-Worker多Agent协作到Docker沙箱隔离,全面拆解其工程设计细节与生产实践。
AI Agent
DeerFlow
字节跳动
多智能体
LangChain
沙箱
上下文工程
AI Agent长期记忆工程实战:从语义向量到生产级记忆系统的完整落地
编程
AI Agent长期记忆工程实战:从语义向量到生产级记忆系统的完整落地
2026-06-29 04:44:18 +0800 CST
view 385
深入探讨如何为AI Agent构建持久化、可检索、分层管理的长期记忆系统,从向量数据库选型到LangChain生产级集成,附带完整Python代码。
AI Agent
长期记忆
向量数据库
Qdrant
LangChain
Google Gemma 4 深度解析:当开源AI进入「逐层嵌入平行化」时代
编程
Google Gemma 4 深度解析:当开源AI进入「逐层嵌入平行化」时代
2026-04-09 04:54:56 +0800 CST
view 1042
Google于2026年4月发布Gemma 4开源模型系列,首次全面切换Apache 2.0许可证,搭载Per-Layer Embedding架构创新,26B MoE以3.8B激活参数击败Qwen3-235B。本文深度解析PLE架构、稀疏激活机制与全规格产品矩阵。
Gemma 4
Google
开源模型
Apache 2.0
MoE
Per-Layer Embedding
从OpenClaw到Hermes Agent:两款爆火开源AI Agent的对决与深层技术哲学
编程
从OpenClaw到Hermes Agent:两款爆火开源AI Agent的对决与深层技术哲学
2026-04-18 16:15:01 +0800 CST
view 655
深度解析OpenClaw与Hermes Agent的功能差异与底层架构:Skill体系谁按下启动键、记忆系统谁在替谁记事、上下文管理的确定性优先哲学,以及两者背后的干预递减光谱与自动化控制权之争。
AI Agent
OpenClaw
Hermes
NousResearch
Skill系统
记忆系统
自进化
GitHub
开源
技术哲学
Hermes Agent 深度实战:构建自我进化的AI代理框架——从零实现具备持续学习能力的下一代AI系统
编程
Hermes Agent 深度实战:构建自我进化的AI代理框架——从零实现具备持续学习能力的下一代AI系统
2026-05-25 03:52:28 +0800 CST
view 546
深入剖析 NousResearch 的 Hermes Agent 框架,探讨如何构建具备自我进化能力的 AI 代理系统,包括架构设计、经验记忆、反思引擎、模式提取等核心机制,并提供完整的部署实战和代码示例。
AI Agent
自我进化
持续学习
NousResearch
Hermes
Hermes Agent 深度解析:自进化 AI 代理框架的设计哲学与工程实践
编程
Hermes Agent 深度解析:自进化 AI 代理框架的设计哲学与工程实践
2026-04-23 12:09:35 +0800 CST
view 712
深度解析 Hermes Agent 的架构设计、三层能力体系、四阶段闭环学习机制,附部署实战与性能优化指南,约12000字。
AI Agent
Hermes
自我进化
Nous Research
持久记忆
技能系统
JavaScript 2026 新特性深度实战:Iterator Helpers、Set 集合运算、RegExp 转义与更多——从语言规范到工程落地的完整指南
编程
JavaScript 2026 新特性深度实战:Iterator Helpers、Set 集合运算、RegExp 转义与更多——从语言规范到工程落地的完整指南
2026-04-23 23:39:35 +0800 CST
view 876
深度解析JavaScript 2025-2026核心新特性:Iterator Helpers惰性求值、Set集合运算7个新方法、RegExp.escape正则转义、using声明资源管理、Temporal API日期时间革命
JavaScript
ES2025
ES2026
Iterator Helpers
Set
RegExp
Temporal
前端开发
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
48
49
50
51
52
...
138
下一页