程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
vLLM vs SGLang 深度拆解:当推理引擎分道扬镳——从 PagedAttention 到 RadixAttention 的架构革命与选型决策指南(2026)
编程
vLLM vs SGLang 深度拆解:当推理引擎分道扬镳——从 PagedAttention 到 RadixAttention 的架构革命与选型决策指南(2026)
2026-08-14 07:12:45 +0800 CST
view 68
深度拆解 vLLM 与 SGLang 两大推理框架:从 PagedAttention 分页内存管理到 RadixAttention 前缀树复用,从 Continuous Batching 到压缩有限状态机,配完整性能对比数据与 15 条生产踩坑清单。
vLLM
SGLang
大模型推理
PagedAttention
RadixAttention
KV Cache
高性能计算
LLM部署
vLLM vs SGLang 深度拆解:从 PagedAttention 到 RadixAttention 的架构革命(2026实战指南)
编程
vLLM vs SGLang 深度拆解:从 PagedAttention 到 RadixAttention 的架构革命(2026实战指南)
2026-08-14 07:13:18 +0800 CST
view 155
深度拆解 vLLM 与 SGLang 两大推理框架:从 PagedAttention 分页内存管理到 RadixAttention 前缀树复用,从 Continuous Batching 到压缩有限状态机,配完整性能对比数据与 15 条生产踩坑清单。
vLLM
SGLang
大模型推理
PagedAttention
RadixAttention
KV Cache
高性能计算
LLM部署
RustFS 深度解析:用 Rust 重写的高性能对象存储——2.3 倍于 MinIO 的小文件吞吐、Apache 2.0 零合规风险,从架构原理到生产部署的完整实战指南
编程
RustFS 深度解析:用 Rust 重写的高性能对象存储——2.3 倍于 MinIO 的小文件吞吐、Apache 2.0 零合规风险,从架构原理到生产部署的完整实战指南
2026-07-06 14:16:29 +0800 CST
view 660
深度解析RustFS开源对象存储:Rust编写,4KB小文件写入2.3倍于MinIO,Apache 2.0协议零合规风险。三层架构设计、纠删码实现、io_uring加速、S3 API完全兼容、Docker/K8s一键部署。含完整代码实战与性能调优指南。
RustFS
Rust
对象存储
MinIO
S3
分布式存储
Apache 2.0
io_uring
Kimi K2.6 开源:12小时连续编码,300个Agent并行,4000次工具调用
编程
Kimi K2.6 开源:12小时连续编码,300个Agent并行,4000次工具调用
2026-04-21 11:06:57 +0800 CST
view 819
Kimi K2.6 开源版发布:SWE-Bench Pro 58.6,多项榜单压GPT-5.4和Claude Opus 4.6,支持300个并行sub-agent、12小时持续编码、4000次工具调用,开源SOTA位置稳固
Kimi
K2.6
开源
SWE-Bench
Agent
Swarm
长程编码
AI编程
模型开源
HuggingFace
Moonshot
Helios深度解析:北大袁粒团队如何用14B参数重塑实时视频生成——从架构革命到工程落地的全解
编程
Helios深度解析:北大袁粒团队如何用14B参数重塑实时视频生成——从架构革命到工程落地的全解
2026-04-13 05:23:52 +0800 CST
view 965
深入解析北京大学袁粒团队发布的Helios 14B实时长视频生成模型,涵盖三阶段训练流程、统一历史注入、金字塔预测校正器、对抗层次蒸馏等核心技术创新,以及完整部署实战指南
视频生成
Helios
扩散模型
深度学习
实时推理
PyTorch
HuggingFace
万字深度解析 MinerU:当文档解析遇见「视觉语言模型」——从 PDF 到结构化 Markdown 的端到端工程化实践(2026)
编程
万字深度解析 MinerU:当文档解析遇见「视觉语言模型」——从 PDF 到结构化 Markdown 的端到端工程化实践(2026)
2026-07-02 01:13:03 +0800 CST
view 561
深度解析MinerU开源项目:72.3K GitHub Star的文档解析引擎,VLM+OCR双引擎,1.2B参数达到95.69分(OmniDocBench),支持PDF/DOCX/PPTX/XLSX解析,原生集成LangChain/Dify/RAGFlow等六大框架,含15+可运行代码示例。
MinerU
PDF解析
文档解析
RAG
LLM
VLM
OCR
LangChain
Dify
MCP
MySQL 26.7.0 深度解析:CalVer 元年、Change Stream Applier 重写并行复制、线程池免费开放——数据库内核的一次范式迁移(2026 实战指南)
编程
MySQL 26.7.0 深度解析:CalVer 元年、Change Stream Applier 重写并行复制、线程池免费开放——数据库内核的一次范式迁移(2026 实战指南)
2026-08-15 15:44:03 +0800 CST
view 64
深度解析 MySQL 26.7.0:CalVer 版本体系变革、Change Stream Applier 重写并行复制、线程池社区版开放、TLS 1.3 后量子加密,配完整部署实战与 15 条生产建议。
MySQL
MySQL 26.7
Change Stream Applier
复制架构
线程池
后量子加密
CalVer
数据库内核
性能优化
编程
Flowise 完全指南:低代码可视化 AI Agent 构建平台——从架构原理到生产级部署(2026)
2026-06-05 03:42:39 +0800 CST
view 1334
Flowise 完全指南:从架构原理到生产级部署。详解可视化AI Agent构建、RAG全流程、多智能体系统、性能优化与云服务部署。
Flowise
AI Agent
低代码
LangChain
RAG
多智能体
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 399
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
工具调用标准化革命:MCP 协议如何让 AI 模型无缝对接任意外部系统
编程
工具调用标准化革命:MCP 协议如何让 AI 模型无缝对接任意外部系统
2026-08-15 17:26:09 +0800 CST
view 61
深度解析MCP协议如何统一AI模型的工具调用标准:核心原语、设计理念与LangChain/Dify等框架的集成实战
MCP
AI工具调用
协议标准化
模型上下文
LangChain
代码示例
2026
Flowise 深度实战:当 LangChain 遇上低代码——从架构原理到生产级 AI 工作流完全指南(2026)
编程
Flowise 深度实战:当 LangChain 遇上低代码——从架构原理到生产级 AI 工作流完全指南(2026)
2026-06-05 20:08:17 +0800 CST
view 487
Flowise 是一个开源的、可视化的低代码工具,专门用来构建基于大语言模型的应用程序或智能体(AI Agent)。本文深入剖析 Flowise 的架构设计、核心组件、实战案例,并提供生产级部署的最佳实践。
Flowise
LangChain
低代码
AI Agent
LLM
Elasticsearch写入、读取、更新、删除以及批量操作(Golang)
编程
Elasticsearch写入、读取、更新、删除以及批量操作(Golang)
2024-11-18 17:43:54 +0800 CST
view 2383
本文介绍了Elasticsearch的基础操作,包括创建、删除、更新、查询和批量操作等。使用三方包`github.com/olivere/elastic`能有效降低开发成本,提升工作效率。文中提供了详细的代码示例,展示如何在Golang中实现这些操作,适合需要处理数据和检索的开发者参考。
Elasticsearch
Golang
数据处理
开发工具
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 398
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 191
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
LangChain4j:把LangChain的能力带入Java世界,一个库搞定LLM集成、RAG、Agent
编程
LangChain4j:把LangChain的能力带入Java世界,一个库搞定LLM集成、RAG、Agent
2026-04-16 19:11:21 +0800 CST
view 794
LangChain4j是Java世界的LangChain,简化Java应用集成大语言模型,支持OpenAI/Claude/DeepSeek等模型,提供RAG、Agent、Tool Calling、Memory等完整能力,Apache 2.0协议。
Java
LangChain
AI
LLM
RAG
Agent
开源
工具调用
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 518
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 200
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 557
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
编程
Helidon 4.4:当 Java 微服务框架开始"长脑子",AI 编排不再是 Python 专利
2026-04-08 15:04:17 +0800 CST
view 859
Oracle Helidon 4.4.0 引入 AI Agent 编排能力,Java 微服务框架进入 AI 原生时代。深度解析 Workflows、Dynamic Agents 两种执行模式,完整代码实战。
Helidon
Java
AI Agent
LangChain4j
微服务
超越 OpenClaw 的 Agent 新王:Hermes Agent 自进化闭环架构深度解析
编程
超越 OpenClaw 的 Agent 新王:Hermes Agent 自进化闭环架构深度解析
2026-04-17 19:45:47 +0800 CST
view 723
深度解析 Nous Research 开源的 Hermes Agent,从四层记忆系统、自进化闭环、平台无关核心架构等角度全面剖析这个 2026 年最火的开源 AI Agent 项目,并对比 OpenClaw 的技术路线差异
AI Agent
Hermes Agent
Nous Research
自我进化
四层记忆
开源项目
GitHub Trending
Cognee 深度实战:当 AI Agent 装上持久化记忆——从向量搜索到知识图谱的生产级完全指南(2026)
编程
Cognee 深度实战:当 AI Agent 装上持久化记忆——从向量搜索到知识图谱的生产级完全指南(2026)
2026-06-09 23:18:18 +0800 CST
view 557
深度解析开源项目 Cognee 如何通过向量搜索与知识图谱的融合,为 AI Agent 提供持久化、动态化的记忆能力。从核心概念、架构设计到生产级代码实战。
AI Agent
记忆系统
知识图谱
向量搜索
Cognee
Python
LangChain
龙架构入主 PostgreSQL 官方仓库:当自主指令系统敲开全球顶级数据库生态大门
编程
龙架构入主 PostgreSQL 官方仓库:当自主指令系统敲开全球顶级数据库生态大门
2026-08-12 06:45:44 +0800 CST
view 158
深度解析龙架构进入PostgreSQL官方仓库的技术意义:从LoongArch指令系统设计、PostgreSQL跨架构移植挑战、龙芯3B6000性能基准到完整部署实战,涵盖代码示例与生产踩坑清单。
LoongArch
PostgreSQL
龙架构
龙芯
国产CPU
数据库
开源生态
自主可控
DeerFlow 2.0 深度实战:从「对话机器人」到「可进化超级智能体」——字节跳动开源超级 Agent 运行时的架构设计与生产级实践
编程
DeerFlow 2.0 深度实战:从「对话机器人」到「可进化超级智能体」——字节跳动开源超级 Agent 运行时的架构设计与生产级实践
2026-05-22 10:29:50 +0800 CST
view 1018
深度解析字节跳动开源的超级智能体运行时框架DeerFlow 2.0,从多层记忆架构、Supervisor-Worker多Agent协作到Docker沙箱隔离,全面拆解其工程设计细节与生产实践。
AI Agent
DeerFlow
字节跳动
多智能体
LangChain
沙箱
上下文工程
AI Agent长期记忆工程实战:从语义向量到生产级记忆系统的完整落地
编程
AI Agent长期记忆工程实战:从语义向量到生产级记忆系统的完整落地
2026-06-29 04:44:18 +0800 CST
view 410
深入探讨如何为AI Agent构建持久化、可检索、分层管理的长期记忆系统,从向量数据库选型到LangChain生产级集成,附带完整Python代码。
AI Agent
长期记忆
向量数据库
Qdrant
LangChain
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
27
28
29
30
31
...
102
下一页