程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
编程
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
2026-06-22 19:28:19 +0800 CST
view 304
深入解析 AirLLM 的无量化层间 Offloading 技术原理,探讨如何通过 CPU-GPU 混合推理在 4GB 显存上运行 70B 大模型,附完整代码实战与生产部署指南。
LLM推理
GPU优化
CPU Offload
层间调度
AirLLM
PyTorch
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 534
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 515
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
一行命令搞定!16.5k Star 的开源神器,让 AI 生成的前端终于有审美了
案例
一行命令搞定!16.5k Star 的开源神器,让 AI 生成的前端终于有审美了
2026-05-11 16:39:33 +0800 CST
view 529
16.5K Stars 的开源项目 taste-skill,让 AI 生成的前端代码告别紫蓝渐变 Hero + 三列圆角卡片的模板风。一行命令安装,支持 Cursor/Claude Code/Codex 等主流编程 Agent。
taste-skill
AI前端
设计规范
Claude Code
Cursor
反slop
前端开发
SKILL
万字深度解析 Andrej Karpathy Skills:当 AI 编程遇见行为约束——从 CLAUDE.md 四原则到生产级 AI 编码工作流的工程化实践(2026)
编程
万字深度解析 Andrej Karpathy Skills:当 AI 编程遇见行为约束——从 CLAUDE.md 四原则到生产级 AI 编码工作流的工程化实践(2026)
2026-07-01 05:13:58 +0800 CST
view 171
2026年Andrej Karpathy Skills在GitHub狂揽11.7万Star。深度解析CLAUDE.md四核心原则:先思考再编码、简洁性优先、精准修改、目标驱动执行,以及生产级AI编程工作流工程化实践。
Andrej Karpathy Skills
CLAUDE.md
AI编程
Vibe Coding
LLM
行为约束
AI Agent
Cursor
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
编程
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
2026-05-12 01:44:53 +0800 CST
view 563
深度解析Nushell 0.111核心架构:结构化数据管道替代POSIX字符串流、IR优化器实现管道融合与谓词下推带来3-10倍性能提升、栈式虚拟机执行器保证类型安全与即时错误反馈,附DevOps实战、插件开发与渐进迁移指南
Nushell,Shell,Rust,命令行,结构化数据,数据管道,终端工具,DevOps,CLI,编程工具
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
编程
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
2026-04-21 11:04:25 +0800 CST
view 611
fireworks-tech-graph:10天3800星的Claude Code Skill,用自然语言生成7种风格的技术图表,支持RAG、Mem0、多Agent等架构图,Mermaid画不出来的它能补位
Claude Code
Skill
AI画图
图表生成
Claude Code Skills
技术图
架构图
Mermaid
开源
GitHub
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
编程
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
2026-07-13 05:12:59 +0800 CST
view 136
深度对比 vLLM 与 SGLang 两大 LLM 推理引擎:从 KV Cache、PagedAttention、RadixAttention、连续批处理、分块预填充、推测解码、P/D 分离到量化部署,配可直接运行的生产级代码与基准测试。
vLLM
SGLang
LLM推理
大模型部署
PagedAttention
RadixAttention
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
编程
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
2026-05-03 15:13:07 +0800 CST
view 639
2026年深度解析vLLM核心架构,从PagedAttention进化到多节点分布式推理,涵盖SIG社区组织、v1架构重写、生产部署实战与性能优化全链路指南。
vLLM
PagedAttention
LLM
推理优化
分布式
Kubernetes
Python
万字深度解析 MoneyPrinterTurbo:当 LLM 遇见视频自动化——从 5 步 Pipeline 到 100+ 模型接入的生产级实战(2026)
编程
万字深度解析 MoneyPrinterTurbo:当 LLM 遇见视频自动化——从 5 步 Pipeline 到 100+ 模型接入的生产级实战(2026)
2026-07-01 10:45:38 +0800 CST
view 200
深度解析MoneyPrinterTurbo开源项目:AI全自动短视频生成框架,涵盖5步Pipeline、100+LLM模型接入、9种TTS方案、FFmpeg视频合成与性能优化实战(2026)
MoneyPrinterTurbo
AI视频
LLM
视频自动化
短视频
开源项目
Python
FFmpeg
TTS
LiteLLM
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 679
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 679
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
编程
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
2026-07-02 05:42:52 +0800 CST
view 227
2026年LLM应用可观测性完整指南:深度解析Langfuse架构、Tracing系统、ClickHouse存储、SDK集成、生产部署与性能优化,15+可运行代码示例
Langfuse
LLM
可观测性
Tracing
AI Engineering
LLM Ops
ClickHouse
Prompt Management
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
编程
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
2026-04-13 18:57:15 +0800 CST
view 1038
浙江大学联合美团和清华大学发布SKILL0论文,提出技能内化范式,让3B小模型通过上下文强化学习将AI技能内化到模型参数中,推理时零Token开销,在ALFWorld等基准上超越GPT-4o和Gemini。
SKILL0
技能内化
Skill Internalization
AI Agent
强化学习
浙大
美团
小模型
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 212
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
编程
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
2026-07-07 16:15:25 +0800 CST
view 92
深入解析2026年大模型推理中的KV Cache优化技术栈:从PagedAttention虚拟分页管理、Prefix Caching缓存复用、Speculative Decoding并行验证,到INT8量化与Continuous Batching生产实践,配合代码示例与性能对比,助你系统性掌握LLM推理优化的核心要领。
LLM
KV Cache
PagedAttention
Prefix Caching
vLLM
推理优化
Speculative Decoding
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1090
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
编程
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
2026-07-20 17:18:01 +0800 CST
view 43
深度解析SGLang推理框架核心技术:RadixAttention基数树KV缓存、连续批处理与CPU-GPU调度重叠、约束解码结构化输出、CVE-2026-5760安全漏洞修复、生产部署实战,以及与vLLM的完整对比选型指南。
SGLang
LLM
RadixAttention
PagedAttention
推理优化
Python
深度学习
向量检索
Agent
RAG
vLLM
CVE
Rust
高性能计算
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
编程
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
2026-07-02 13:46:08 +0800 CST
view 235
深度解析 LMCache 开源 KV Cache 管理层项目:从三层存储架构、多后端支持、Disaggregated Prefill、CacheBlend、Segmented Prefill、P2P 共享到 Kubernetes 生产级部署的完整技术指南,含性能基准测试与代码实战
LMCache
KV Cache
LLM
vLLM
分布式
RDMA
Kubernetes
推理优化
Redis
NIXL
万字深度解析 LMCache:当 LLM 推理遇见 KV Cache 革命——从 TTFT 优化到跨引擎 KV 复用、从 GPU/CPU/Disk 三级存储到分布式 P2P 共享的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见 KV Cache 革命——从 TTFT 优化到跨引擎 KV 复用、从 GPU/CPU/Disk 三级存储到分布式 P2P 共享的完整技术指南(2026)
2026-07-03 03:14:31 +0800 CST
view 174
深度解析LMCache KV Cache管理层:从TTFT优化原理、GPU/CPU/Disk三级存储架构、跨引擎KV复用、分布式P2P共享,到与vLLM深度集成的生产级部署实战,含完整代码和性能调优指南。
LMCache
LLM推理
KV Cache
vLLM
TTFT优化
GPU优化
AI推理加速
分布式缓存
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
编程
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
2026-05-28 19:39:07 +0800 CST
view 678
深入解析 DFlash 块扩散投机解码方案:如何让 Qwen3-8B 实现 6 倍无损加速,超越 EAGLE-3 与 llama.cpp,附 SGLang/vLLM/MLX 完整部署指南。
LLM推理
投机解码
块扩散
DFlash
推理加速
Transformer优化
GPU
CUDA
SGLang
vLLM
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
编程
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
2026-07-21 12:46:56 +0800 CST
view 19
2026年7月腾讯混元开源HyOCR-1.5端到端OCR大模型,1B参数OmniDocBench 94.74分霸榜。深度拆解DFlash投机解码6.37倍加速、Agentic Data Flow自动化数据闭环、三阶段训练配方,以及vLLM/llama.cpp全场景部署实战。
HyOCR
HunyuanOCR
腾讯混元
端到端OCR
DFlash
投机解码
多模态模型
文档解析
文字识别
视觉语言模型
OmniDocBench
vLLM
llama.cpp
深度学习
Nushell 深度实战:30K Star 的结构化数据 Shell——从类型系统到插件架构的生产级全链路解析
编程
Nushell 深度实战:30K Star 的结构化数据 Shell——从类型系统到插件架构的生产级全链路解析
2026-05-07 00:37:06 +0800 CST
view 585
深度解析 Nushell 的类型系统、结构化数据管道、Rust 多 Crate 架构、插件机制和生产实践,从 Bash 迁移到 Nu 的全链路实战指南
Nushell
Rust
Shell
结构化数据
管道
插件系统
类型系统
DevOps
AI 生成界面为什么总是样板间? taste-skill 如何用 SKILL.md 教 AI 学会设计品味
编程
AI 生成界面为什么总是样板间? taste-skill 如何用 SKILL.md 教 AI 学会设计品味
2026-07-08 12:47:28 +0800 CST
view 183
taste-skill 通过将设计品味封装为可组合的 SKILL.md 技能集,解决 AI 生成界面千篇一律的核心问题。本文深入解析其三段旋钮系统、设计技能体系与工程实践。
AI编程
taste-skill
前端设计
SKILL.md
Claude Code
设计系统
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
32
33
34
35
36
...
50
下一页