程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
编程
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
2026-07-13 05:12:59 +0800 CST
view 282
深度对比 vLLM 与 SGLang 两大 LLM 推理引擎:从 KV Cache、PagedAttention、RadixAttention、连续批处理、分块预填充、推测解码、P/D 分离到量化部署,配可直接运行的生产级代码与基准测试。
vLLM
SGLang
LLM推理
大模型部署
PagedAttention
RadixAttention
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
编程
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
2026-05-03 15:13:07 +0800 CST
view 870
2026年深度解析vLLM核心架构,从PagedAttention进化到多节点分布式推理,涵盖SIG社区组织、v1架构重写、生产部署实战与性能优化全链路指南。
vLLM
PagedAttention
LLM
推理优化
分布式
Kubernetes
Python
Vite 8 + Rolldown 深度拆解:Rust 打包器如何终结「dev ≠ prod」,以及 Cloudflare 收购 VoidZero 之后的前端工具链版图
编程
Vite 8 + Rolldown 深度拆解:Rust 打包器如何终结「dev ≠ prod」,以及 Cloudflare 收购 VoidZero 之后的前端工具链版图
2026-07-30 21:15:54 +0800 CST
view 176
深度拆解 Vite 8 用 Rolldown 统一打包内核:双打包器架构的历史债、Rolldown+Oxc 四段流水线、Full Bundle Mode 对 no-bundle 的自我否定、Advanced Chunks 声明式分包、插件跨语言性能陷阱与 filter 下沉、可复现的基准测试脚本、六大迁移坑与检查清单,以及 Cloudflare 收购 VoidZero 后的工具链版图。
Vite,Rolldown,Oxc,VoidZero,Rust,前端工程化,打包器,Cloudflare,构建优化,Full Bundle Mode
vLLM v1 Engine 架构深度拆解:从异步调度到 Chunked Prefill 的生产级推理引擎演进(2026实战指南)
编程
vLLM v1 Engine 架构深度拆解:从异步调度到 Chunked Prefill 的生产级推理引擎演进(2026实战指南)
2026-08-14 17:45:25 +0800 CST
view 44
深度拆解vLLM v1 Engine架构:Continuous Batching、Chunked Prefill、异步内存管理等核心特性,从源码到生产部署,配完整代码实战与性能基准测试
vLLM
LLM推理
PagedAttention
ContinuousBatching
GPU优化
生产部署
推测解码
Python
vLLM v1 Engine 深度拆解:Continuous Batching + Chunked Prefill 如何将推理吞吐量翻倍(2026生产实战)
编程
vLLM v1 Engine 深度拆解:Continuous Batching + Chunked Prefill 如何将推理吞吐量翻倍(2026生产实战)
2026-08-14 17:46:24 +0800 CST
view 37
深度拆解vLLM v1 Engine架构:Continuous Batching、Chunked Prefill、异步内存管理等核心特性,配完整代码实战与性能基准测试
vLLM
LLM推理
PagedAttention
ContinuousBatching
GPU优化
生产部署
推测解码
Python
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
编程
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
2026-06-13 08:23:38 +0800 CST
view 485
cc-skills-golang是一组面向AI编程助手的Go技能包,将Go工程判断、编码约定、排查方法整理成指令文档,让Claude Code/Codex/Cursor等AI在写Go时按统一口径工作,With Skill准确率98% vs 56%。
cc-skills-golang
Go
Claude Code
Codex
Cursor
AI编程
代码规范
Agent Skill
Code Review
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
编程
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
2026-08-15 09:44:41 +0800 CST
view 22
深度拆解 AirLLM 分层推理架构:8GB 显存跑 405B 大模型的时间换空间哲学,从 mmap 权重映射、单层计算流水线到完整 Python 实战与 15 条生产级优化建议。
AirLLM
大模型推理
显存优化
LLM
内存推理
Python
性能优化
GPU
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 929
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
推测解码深度实战:用「小模型猜、大模型验」的并行推理让 LLM 吞吐量翻倍(2026 生产指南)
编程
推测解码深度实战:用「小模型猜、大模型验」的并行推理让 LLM 吞吐量翻倍(2026 生产指南)
2026-08-15 11:15:10 +0800 CST
view 26
深度拆解推测解码技术原理与生产实战:从拒绝采样数学原理到 vLLM 实现架构,配完整 Python 代码与性能基准测试,实现 2-2.5x 无损吞吐量提升
推测解码
Speculative Decoding
LLM推理
vLLM
性能优化
GPU加速
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 904
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
编程
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
2026-07-02 05:42:52 +0800 CST
view 451
2026年LLM应用可观测性完整指南:深度解析Langfuse架构、Tracing系统、ClickHouse存储、SDK集成、生产部署与性能优化,15+可运行代码示例
Langfuse
LLM
可观测性
Tracing
AI Engineering
LLM Ops
ClickHouse
Prompt Management
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
编程
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
2026-04-13 18:57:15 +0800 CST
view 1260
浙江大学联合美团和清华大学发布SKILL0论文,提出技能内化范式,让3B小模型通过上下文强化学习将AI技能内化到模型参数中,推理时零Token开销,在ALFWorld等基准上超越GPT-4o和Gemini。
SKILL0
技能内化
Skill Internalization
AI Agent
强化学习
浙大
美团
小模型
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 280
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 532
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 728
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
编程
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
2026-07-31 15:20:39 +0800 CST
view 247
深度拆解 Claude Opus 5 发布:从 Frontier-Bench 性能翻倍到 ARC-AGI 3 三倍碾压,从定价策略重塑到 Claude Code 系统提示词削减 80% 的工程革命,以及 AI Coding 从 Tools 到 Skills 的范式跃迁。
Claude Opus 5
Anthropic
AI编程
LLM
AI Agent
Skills
Frontier-Bench
ARC-AGI
定价策略
Claude Code
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1336
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
编程
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
2026-07-20 17:18:01 +0800 CST
view 318
深度解析SGLang推理框架核心技术:RadixAttention基数树KV缓存、连续批处理与CPU-GPU调度重叠、约束解码结构化输出、CVE-2026-5760安全漏洞修复、生产部署实战,以及与vLLM的完整对比选型指南。
SGLang
LLM
RadixAttention
PagedAttention
推理优化
Python
深度学习
向量检索
Agent
RAG
vLLM
CVE
Rust
高性能计算
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
编程
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
2026-07-26 04:13:40 +0800 CST
view 208
深度拆解 Linux io_uring:SQ/CQ 环形队列内存模型、SQE/CQE 生命周期、liburing 文件读写与 echo 服务器实战、SQPOLL/注册缓冲区/链式操作/multishot/零拷贝发送进阶特性,并剖析为何性能炸裂却被 Google 在 ChromeOS/Android/GKE 全线封禁,附内核 6.6 安全加固与生产决策清单。
io_uring
Linux内核
异步IO
高性能
SQPOLL
零拷贝
epoll
网络编程
系统编程
安全
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40 +0800 CST
view 384
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
编程
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
2026-08-09 08:42:54 +0800 CST
view 129
深度拆解AirLLM:用分层流式推理打破显存壁垒,从4GB显卡跑通70B大模型的工程原理到MoE时代的新坐标,配完整代码示例与实战指南。
AirLLM
LLM推理
显存优化
MoE
Transformer
Python
AI部署
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
案例
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
2026-05-06 07:35:19 +0800 CST
view 731
25K+Star的LLMFit一键检测你的电脑能跑哪些大模型,Rust编写支持NVIDIA/AMD/Intel/Apple Silicon,智能量化推荐Q8到Q2,四维评分系统,TUI+CLI双模式
LLM部署
硬件检测
量化推荐
Rust
终端工具
本地部署
Ollama
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35 +0800 CST
view 229
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
reverse-skill 深度拆解:当 AI Agent 拥有了「安全直觉」——从路由引擎到自动化渗透的工程全链路
编程
reverse-skill 深度拆解:当 AI Agent 拥有了「安全直觉」——从路由引擎到自动化渗透的工程全链路
2026-08-10 01:22:21 +0800 CST
view 136
深度拆解 GitHub 日榜第一的 reverse-skill 开源项目:AI 自动路由 + 工具链自举 + 攻防知识库,覆盖 APK 脱壳、二进制逆向、JS 混淆、CTF 沙箱全场景,配完整代码示例。
reverse-skill
AI Agent
安全工具
逆向工程
Claude Code
Frida
渗透测试
Skill Router
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
33
34
35
36
37
...
54
下一页