程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
2026 大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 性能与成本终极较量
编程
2026 大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 性能与成本终极较量
2026-07-23 08:13:30 +0800 CST
view 402
2026年四大主流大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9。从核心技术优化、吞吐量延迟、算力成本、部署适配性四大维度开展极致测评,为企业技术选型提供精准参考。
vLLM
TensorRT-LLM
TGI
DeepSpeed-MII
大模型推理
PagedAttention
FlashAttention
量化推理
GPU推理优化
Cloudflare @cloudflare/computer 深度拆解:当 Cloudflare 决定「给每个 AI Agent 一台自己的电脑」——从 Dynamic Workers 到 SQLite 虚拟文件系统,一个开源库如何重新定义 Agent 执行基础设施
编程
Cloudflare @cloudflare/computer 深度拆解:当 Cloudflare 决定「给每个 AI Agent 一台自己的电脑」——从 Dynamic Workers 到 SQLite 虚拟文件系统,一个开源库如何重新定义 Agent 执行基础设施
2026-08-04 21:15:22 +0800 CST
view 259
深度拆解Cloudflare @cloudflare/computer开源库:从Dynamic Workers的Isolate沙箱到SQLite虚拟文件系统,双执行后端智能路由,权限控制与审计追踪,如何重新定义数十亿AI Agent的执行基础设施
Cloudflare
AI Agent
Isolate
Dynamic Workers
边缘计算
虚拟文件系统
SQLite
沙箱
开源
V8 Isolate
LiteRT-LM:Google端侧大模型推理引擎的革命性架构——从TensorFlow Lite的困境到LLM原生推理的全链路解析
编程
LiteRT-LM:Google端侧大模型推理引擎的革命性架构——从TensorFlow Lite的困境到LLM原生推理的全链路解析
2026-04-19 22:17:39 +0800 CST
view 1174
深入解析Google LiteRT-LM端侧LLM推理引擎的核心架构:分层内存池、KV Cache量化、算子融合、WebGPU运行时。与TensorFlow Lite、llama.cpp、MLX横向对比,提供生产级部署实战指南。
Google
端侧AI
LiteRT-LM
WebGPU
量化
KV Cache
TensorFlow Lite
LLM推理
LLM 推理引擎 2026 终极对决:vLLM、SGLang、TensorRT-LLM、LMDeploy 谁才是你的最优解?
编程
LLM 推理引擎 2026 终极对决:vLLM、SGLang、TensorRT-LLM、LMDeploy 谁才是你的最优解?
2026-08-16 07:15:42 +0800 CST
view 125
深度拆解四大主流LLM推理引擎——vLLM、SGLang、TensorRT-LLM、LMDeploy——从核心架构、关键技术、性能基准到选型决策,配完整代码实战,帮你找到最适合业务场景的最优解。
LLM推理
vLLM
SGLang
TensorRT-LLM
LMDeploy
PagedAttention
RadixAttention
性能优化
大模型部署
sqlite-vec 深度拆解:用 60KB 二进制把向量搜索塞进 SQLite,这个「零依赖」方案凭什么成为 AI Agent 的记忆引擎
编程
sqlite-vec 深度拆解:用 60KB 二进制把向量搜索塞进 SQLite,这个「零依赖」方案凭什么成为 AI Agent 的记忆引擎
2026-07-28 08:45:18 +0800 CST
view 209
深度拆解 sqlite-vec:60KB 二进制、零依赖的 SQLite 向量搜索扩展,从架构原理、IVF/DiskANN 索引、性能 Benchmark 到完整的 RAG 记忆系统实战代码,解析为什么 OpenClaw、Hermes、claude-mem 都选择了它。
sqlite-vec
向量搜索
SQLite
AI Agent
RAG
sqlite-vec 技术深度解析:60KB 零依赖向量搜索,OpenClaw/Hermes/claude-mem 的记忆引擎选型逻辑
编程
sqlite-vec 技术深度解析:60KB 零依赖向量搜索,OpenClaw/Hermes/claude-mem 的记忆引擎选型逻辑
2026-07-28 08:45:41 +0800 CST
view 200
深度拆解 sqlite-vec:60KB 二进制、零依赖的 SQLite 向量搜索扩展,从架构原理、IVF/DiskANN 索引、性能 Benchmark 到完整的 RAG 记忆系统实战代码,解析为什么 OpenClaw、Hermes、claude-mem 都选择了它。
sqlite-vec
向量搜索
SQLite
AI Agent
RAG
OmniRoute 深度拆解:当 27K Star 的开源项目决定「干掉 290 个 API Key」——从智能路由到零配置的 AI Gateway 如何重新定义开发者的 AI 基础设施
编程
OmniRoute 深度拆解:当 27K Star 的开源项目决定「干掉 290 个 API Key」——从智能路由到零配置的 AI Gateway 如何重新定义开发者的 AI 基础设施
2026-08-04 05:14:27 +0800 CST
view 398
深度拆解27K Star开源AI Gateway OmniRoute:统一290+供应商到一个端点、四层自动故障转移、RTK+Caveman Token压缩节省15-95%、19种路由策略、15.3亿免费Token/月,附完整部署代码与性能基准
OmniRoute
AI Gateway
开源
API路由
Token压缩
CodeGraph 深度拆解:当「预索引知识图谱」决定干掉 grep/glob/Read——一个让 AI 编程助手省 57% Token 的代码搜索引擎如何重新定义大型项目的 AI 开发范式
编程
CodeGraph 深度拆解:当「预索引知识图谱」决定干掉 grep/glob/Read——一个让 AI 编程助手省 57% Token 的代码搜索引擎如何重新定义大型项目的 AI 开发范式
2026-08-04 07:13:06 +0800 CST
view 183
深度拆解CodeGraph代码知识图谱引擎:tree-sitter解析、引用解析、SQLite+FTS5存储、MCP协议暴露,10个工具、20+语言支持、14种框架路由识别,实测Token消耗降低51%、工具调用减少57%的完整架构分析与实战指南
CodeGraph
AI编程
知识图谱
代码搜索
MCP
Claude Code
Cursor
tree-sitter
SQLite
从Token内卷到DAA崛起:百度Create2026重新定义AI价值度量衡
编程
从Token内卷到DAA崛起:百度Create2026重新定义AI价值度量衡
2026-05-16 17:21:12 +0800 CST
view 661
2026年5月百度Create2026大会,李彦宏首提DAA(日活智能体数)作为AI时代度量衡。本文深度解析这一概念的战略意义,以及百度DuMate、秒哒、伐谋等Agent产品的技术架构。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
李彦宏抛出DAA背后的AI大变局:百度搭子秒哒伐谋三箭齐发
编程
李彦宏抛出DAA背后的AI大变局:百度搭子秒哒伐谋三箭齐发
2026-05-16 17:22:10 +0800 CST
view 680
2026年5月百度Create2026大会,李彦宏首提DAA(日活智能体数)作为AI时代度量衡。本文深度解析这一概念的战略意义,以及百度DuMate、秒哒、伐谋等Agent产品的技术架构。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
告别Token崇拜:Create2026揭示AI时代从流量思维到价值思维的根本跃迁
编程
告别Token崇拜:Create2026揭示AI时代从流量思维到价值思维的根本跃迁
2026-05-16 17:23:01 +0800 CST
view 637
2026年5月百度Create2026大会,李彦宏首提DAA(日活智能体数)作为AI时代度量衡。本文深度解析这一概念的战略意义,以及百度DuMate、秒哒、伐谋等Agent产品的技术架构。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
编程
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
2026-08-04 19:22:29 +0800 CST
view 177
深度拆解SGLang 27K Star开源LLM推理框架:RadixAttention基数树前缀缓存实现3-8倍加速、自研FlashInfer CUDA Kernel、Prefill-Decode分离架构、GB300 NVL72上25倍性能飞跃、DFlash投机采样、多LoRA热切换,附完整部署与调优指南
SGLang
LLM推理
RadixAttention
FlashInfer
GPU加速
大模型部署
推理引擎
PagedAttention
PD分离
投机采样
CUDA
开源
DAA革命:为什么李彦宏说100亿日活智能体将重新定义AI价值
编程
DAA革命:为什么李彦宏说100亿日活智能体将重新定义AI价值
2026-05-16 17:23:50 +0800 CST
view 551
2026年5月百度Create2026,李彦宏提出DAA(日活智能体数)替代Token成为AI时代新度量衡。深度解析这一概念的战略深意,以及百度DuMate、秒哒、伐谋等产品矩阵的技术内核。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
日活智能体数DAA替代Token:百度Create2026透露了哪些AI行业真相
编程
日活智能体数DAA替代Token:百度Create2026透露了哪些AI行业真相
2026-05-16 17:24:43 +0800 CST
view 619
2026年5月百度Create2026,李彦宏提出DAA(日活智能体数)替代Token成为AI时代新度量衡。深度解析这一概念的战略深意,以及百度DuMate、秒哒、伐谋等产品矩阵的技术内核。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
Claude Code Router 深度拆解:一个本地网关如何统一 9 大 AI 编码 Agent,终结「多客户端配置地狱」
编程
Claude Code Router 深度拆解:一个本地网关如何统一 9 大 AI 编码 Agent,终结「多客户端配置地狱」
2026-07-29 06:48:13 +0800 CST
view 157
深度拆解 Claude Code Router:一个开源的本地模型网关与控制平面,支持 Claude Code、Codex、Grok CLI、Kimi CLI 等 9 款主流编码 Agent,提供统一配置、智能路由、Fusion 扩展和全链路可观测性。
Claude Code Router
AI Agent
Agent Gateway
多Agent协作
智能路由
Fusion扩展
可观测性
开源
李彦宏的AI新度量衡:Token是成本DAA才是价值(Create2026深度复盘)
编程
李彦宏的AI新度量衡:Token是成本DAA才是价值(Create2026深度复盘)
2026-05-16 17:25:28 +0800 CST
view 668
2026年5月百度Create2026,李彦宏提出DAA(日活智能体数)替代Token成为AI时代新度量衡。深度解析这一概念的战略深意,以及百度DuMate、秒哒、伐谋等产品矩阵的技术内核。
百度
DAA
AI Agent
Create2026
DuMate
秒哒
伐谋
智能体
AI时代度量衡
超级个体
谷歌 LiteRT.js 深度实战:当 WebAssembly + WebGPU 重写 TensorFlow.js 的心脏,浏览器 AI 推理提速 3 倍背后的技术真相
编程
谷歌 LiteRT.js 深度实战:当 WebAssembly + WebGPU 重写 TensorFlow.js 的心脏,浏览器 AI 推理提速 3 倍背后的技术真相
2026-07-11 14:16:10 +0800 CST
view 447
2026年7月谷歌发布LiteRT.js,用WebAssembly+WebGPU/WebNN替代TensorFlow.js的JavaScript内核,M4 MacBook Pro上推理速度提升3倍。本文深度拆解架构设计、性能优化原理、迁移路径与实战代码。
LiteRT.js
WebGPU
WebNN
WebAssembly
TensorFlow.js
浏览器AI
机器学习
前端
Claude Code Router (CCR) 深度拆解:9 大 AI 编码 Agent 的统一控制平面,从配置地狱到智能路由
编程
Claude Code Router (CCR) 深度拆解:9 大 AI 编码 Agent 的统一控制平面,从配置地狱到智能路由
2026-07-29 06:49:17 +0800 CST
view 176
深度拆解 Claude Code Router:一个开源的本地模型网关与控制平面,支持 Claude Code、Codex、Grok CLI、Kimi CLI 等 9 款主流编码 Agent,提供统一配置、智能路由、Fusion 扩展和全链路可观测性。
Claude Code Router
AI Agent
Agent Gateway
多Agent协作
智能路由
Fusion扩展
可观测性
开源
CCR 深度拆解:AI Agent 本地网关如何终结多客户端配置地狱,9 大编码助手统一管理
编程
CCR 深度拆解:AI Agent 本地网关如何终结多客户端配置地狱,9 大编码助手统一管理
2026-07-29 06:50:13 +0800 CST
view 148
深度拆解 Claude Code Router:一个开源的本地模型网关与控制平面,支持 Claude Code、Codex、Grok CLI、Kimi CLI 等 9 款主流编码 Agent,提供统一配置、智能路由、Fusion 扩展和全链路可观测性。
Claude Code Router
AI Agent
Agent Gateway
多Agent协作
智能路由
Fusion扩展
可观测性
开源
Claude Code Router 全解析:一个本地网关如何统一管理 9 款 AI 编码 Agent
编程
Claude Code Router 全解析:一个本地网关如何统一管理 9 款 AI 编码 Agent
2026-07-29 06:50:48 +0800 CST
view 159
深度拆解 Claude Code Router:一个开源的本地模型网关与控制平面,支持 Claude Code、Codex、Grok CLI、Kimi CLI 等 9 款主流编码 Agent,提供统一配置、智能路由、Fusion 扩展和全链路可观测性。
Claude Code Router
AI Agent
Agent Gateway
多Agent协作
智能路由
Fusion扩展
可观测性
开源
OpenTelemetry 深度实战:当可观测性终于有了统一标准——从三大信号模型、Collector 管线到 eBPF 零侵入采集的生产级完全指南
编程
OpenTelemetry 深度实战:当可观测性终于有了统一标准——从三大信号模型、Collector 管线到 eBPF 零侵入采集的生产级完全指南
2026-07-11 15:44:43 +0800 CST
view 361
深度拆解 OpenTelemetry 的 Signals 信号模型、OTLP 协议、语义约定与上下文传播,剖析 Collector 接收-处理-导出管线与 Agent/Gateway 部署拓扑,配 Go/Python/Java 手动与自动埋点、Collector 配置与 eBPF 零侵入采集实战,并给出尾部采样、基数治理与成本优化方案。
OpenTelemetry
可观测性
分布式追踪
OpenTelemetry Collector
eBPF
云原生
APM
分布式系统
CodeGraph 深度实战:当 AI 编程助手学会「看代码地图」——从 Tree-sitter 预索引到 MCP 协议集成的生产级完全指南(2026)
编程
CodeGraph 深度实战:当 AI 编程助手学会「看代码地图」——从 Tree-sitter 预索引到 MCP 协议集成的生产级完全指南(2026)
2026-06-11 10:19:48 +0800 CST
view 726
CodeGraph 是 2026 年 AI 编程基础设施的重大创新,通过预索引代码知识图谱,让 AI 编程助手可以直接查询代码结构而非逐文件扫描,平均减少 57% Token 消耗。本文深入解析其架构原理、安装配置和生产部署。
CodeGraph,AI编程,MCP,tree-sitter,SQLite
vLLM 与 SGLang 深度横评:两种推理范式的工程哲学对决
编程
vLLM 与 SGLang 深度横评:两种推理范式的工程哲学对决
2026-07-24 06:14:45 +0800 CST
view 351
深度对比vLLM与SGLang两大LLM推理引擎:PagedAttention vs RadixAttention,Continuous Batching原理,吞吐与延迟实战选型指南
vLLM
SGLang
LLM推理
PagedAttention
RadixAttention
Continuous Batching
GPU优化
推理引擎
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
编程
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
2026-06-30 11:16:18 +0800 CST
view 376
深度解析 SGLang 大模型推理框架:RadixAttention 前缀缓存、零开销 CPU 调度器、结构化输出约束、推测解码、PD 分离等核心技术,对比 vLLM/TensorRT-LLM 选型,提供完整代码示例与生产级部署实践
SGLang
大模型推理
RadixAttention
前缀缓存
结构化输出
推测解码
PD分离
vLLM
TensorRT-LLM
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
84
85
86
87
88
...
104
下一页