程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 922
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 895
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
编程
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
2026-04-13 18:57:15 +0800 CST
view 1253
浙江大学联合美团和清华大学发布SKILL0论文,提出技能内化范式,让3B小模型通过上下文强化学习将AI技能内化到模型参数中,推理时零Token开销,在ALFWorld等基准上超越GPT-4o和Gemini。
SKILL0
技能内化
Skill Internalization
AI Agent
强化学习
浙大
美团
小模型
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 276
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 527
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 373
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 723
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
编程
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
2026-08-09 02:16:55 +0800 CST
view 87
深度拆解 LLM 推理的 KV Cache 工程体系:为什么北极星指标必须从 Throughput 换成 Goodput、PagedAttention 的链式 hash 与前缀树实现、PD 分离的盈亏平衡方程(长输入短输出为何是负优化)、KVConnector 逐层流水传输、分层存储的盈亏平衡带宽公式与运行时决策函数、缓存感知路由,含可运行代码、调优清单与十条踩坑。
KV Cache
vLLM
PD分离
PagedAttention
LLM推理
Goodput
前缀缓存
RDMA
分层存储
性能优化
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1331
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
编程
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
2026-07-20 17:18:01 +0800 CST
view 314
深度解析SGLang推理框架核心技术:RadixAttention基数树KV缓存、连续批处理与CPU-GPU调度重叠、约束解码结构化输出、CVE-2026-5760安全漏洞修复、生产部署实战,以及与vLLM的完整对比选型指南。
SGLang
LLM
RadixAttention
PagedAttention
推理优化
Python
深度学习
向量检索
Agent
RAG
vLLM
CVE
Rust
高性能计算
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
编程
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
2026-07-26 04:13:40 +0800 CST
view 203
深度拆解 Linux io_uring:SQ/CQ 环形队列内存模型、SQE/CQE 生命周期、liburing 文件读写与 echo 服务器实战、SQPOLL/注册缓冲区/链式操作/multishot/零拷贝发送进阶特性,并剖析为何性能炸裂却被 Google 在 ChromeOS/Android/GKE 全线封禁,附内核 6.6 安全加固与生产决策清单。
io_uring
Linux内核
异步IO
高性能
SQPOLL
零拷贝
epoll
网络编程
系统编程
安全
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
编程
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
2026-08-09 08:42:54 +0800 CST
view 120
深度拆解AirLLM:用分层流式推理打破显存壁垒,从4GB显卡跑通70B大模型的工程原理到MoE时代的新坐标,配完整代码示例与实战指南。
AirLLM
LLM推理
显存优化
MoE
Transformer
Python
AI部署
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
案例
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
2026-05-06 07:35:19 +0800 CST
view 723
25K+Star的LLMFit一键检测你的电脑能跑哪些大模型,Rust编写支持NVIDIA/AMD/Intel/Apple Silicon,智能量化推荐Q8到Q2,四维评分系统,TUI+CLI双模式
LLM部署
硬件检测
量化推荐
Rust
终端工具
本地部署
Ollama
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35 +0800 CST
view 220
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
LMCache 深度拆解:当 KV Cache 变成可复用资产——LLM 推理的「免费午餐」完整指南
编程
LMCache 深度拆解:当 KV Cache 变成可复用资产——LLM 推理的「免费午餐」完整指南
2026-07-14 18:47:11 +0800 CST
view 200
深度拆解 LMCache 项目:从 Transformer Attention 机制出发,详细讲解 KV Cache 原理、三层存储架构、生产部署实战、Docker Compose 配置、CacheGen 压缩算法、PD 分离、跨实例 KV Cache 共享,以及与 vLLM/SGLang 的集成,配完整代码示例与性能调优指南。实测 DeepSeek 多轮对话 3~5 倍 TTFT 改善。
LMCache
KV Cache
LLM推理
vLLM
SGLang
推理优化
DeepSeek
分布式缓存
万字深度解析 LMCache:当 LLM 推理遇见 KV Cache 革命——从 TTFT 优化到跨引擎 KV 复用、从 GPU/CPU/Disk 三级存储到分布式 P2P 共享的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见 KV Cache 革命——从 TTFT 优化到跨引擎 KV 复用、从 GPU/CPU/Disk 三级存储到分布式 P2P 共享的完整技术指南(2026)
2026-07-03 03:14:31 +0800 CST
view 360
深度解析LMCache KV Cache管理层:从TTFT优化原理、GPU/CPU/Disk三级存储架构、跨引擎KV复用、分布式P2P共享,到与vLLM深度集成的生产级部署实战,含完整代码和性能调优指南。
LMCache
LLM推理
KV Cache
vLLM
TTFT优化
GPU优化
AI推理加速
分布式缓存
Nushell 深度实战:30K Star 的结构化数据 Shell——从类型系统到插件架构的生产级全链路解析
编程
Nushell 深度实战:30K Star 的结构化数据 Shell——从类型系统到插件架构的生产级全链路解析
2026-05-07 00:37:06 +0800 CST
view 762
深度解析 Nushell 的类型系统、结构化数据管道、Rust 多 Crate 架构、插件机制和生产实践,从 Bash 迁移到 Nu 的全链路实战指南
Nushell
Rust
Shell
结构化数据
管道
插件系统
类型系统
DevOps
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
编程
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
2026-07-03 08:43:53 +0800 CST
view 339
深度解析 Ollama v0.20 的 Tool Calling 能力:从 JSON Schema 协议原理、HTTP API 调用循环,到生产级多工具 Agent 系统的完整实战(天气查询/数据库查询/Web搜索),配套 LangChain4j 集成方案与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
生产级实战
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
编程
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
2026-07-03 08:44:52 +0800 CST
view 278
深度解析 Ollama v0.20 的 Tool Calling 能力,从 JSON Schema 协议原理到生产级多工具 Agent 实战,含安全防护与性能基准测试。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
编程
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
2026-07-03 08:45:53 +0800 CST
view 309
深度解析 Ollama v0.20 Tool Calling,从协议原理到生产级多工具 Agent 实战,含天气查询、数据库查询、Web搜索三大实战案例与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
编程
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
2026-07-03 08:47:18 +0800 CST
view 308
深度长文:Ollama v0.20 Tool Calling 从协议原理到生产级多工具 Agent 实战,含天气查询、数据库操作、Web搜索三大案例与安全防护策略(2026)。
Ollama
AI Agent
Tool Calling
本地大模型
生产级
Ollama 深度拆解:当大模型变成「一个文件」——GGUF、4-bit 量化与 llama.cpp 计算图如何重写本地推理的心智模型
编程
Ollama 深度拆解:当大模型变成「一个文件」——GGUF、4-bit 量化与 llama.cpp 计算图如何重写本地推理的心智模型
2026-07-15 08:45:14 +0800 CST
view 337
从工程师视角深度拆解 Ollama 与本地大模型推理引擎:GGUF 单文件格式、K-quant/IQ-quant 量化家族、内存带宽墙、llama.cpp 计算图与 KV Cache,配 Modelfile、Python/Go 流式客户端与自量化实战。
Ollama
llama.cpp
GGUF
本地推理
大模型量化
KV Cache
DeepSeek-R1边缘推理实战:从云端独占到本地智能的范式转移
编程
DeepSeek-R1边缘推理实战:从云端独占到本地智能的范式转移
2026-05-19 12:42:27 +0800 CST
view 602
2026年,边缘AI不再只是云端模型的精简版。本文深入剖析DeepSeek-R1 CPU版的技术原理,从模型蒸馏、量化技术的底层原理到生产环境的完整部署方案,提供可直接落地的代码和可量化的性能数据。
DeepSeek
R1
边缘计算
AI推理
模型蒸馏
量化
llama.cpp
Ollama
端侧AI
Agent Skills 深度拆解:当 AI 编程助手学会「工程纪律」——mattpocock/skills、addyosmani/agent-skills 与 Superpowers 如何用可组合 SOP 重写人机协作的心智模型
编程
Agent Skills 深度拆解:当 AI 编程助手学会「工程纪律」——mattpocock/skills、addyosmani/agent-skills 与 Superpowers 如何用可组合 SOP 重写人机协作的心智模型
2026-07-15 12:18:39 +0800 CST
view 380
从工程师视角深度拆解 Agent Skills 运动:mattpocock/skills、addyosmani/agent-skills 与 Superpowers 如何用可组合 SOP、Checkpoint 与反合理化给 AI 编程助手装上工程纪律,配 SKILL.md、TDD、CI 与 MCP 协同实战。
Agent Skills
AI编程
工程纪律
mattpocock
addyosmani
Superpowers
SKILL.md
TDD
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
85
86
87
88
89
...
116
下一页