程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
编程
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
2026-08-04 19:22:29 +0800 CST
view 158
深度拆解SGLang 27K Star开源LLM推理框架:RadixAttention基数树前缀缓存实现3-8倍加速、自研FlashInfer CUDA Kernel、Prefill-Decode分离架构、GB300 NVL72上25倍性能飞跃、DFlash投机采样、多LoRA热切换,附完整部署与调优指南
SGLang
LLM推理
RadixAttention
FlashInfer
GPU加速
大模型部署
推理引擎
PagedAttention
PD分离
投机采样
CUDA
开源
TileKernels 深度解析:DeepSeek 用 80 行代码榨干 GPU,算子开发范式的降维打击
编程
TileKernels 深度解析:DeepSeek 用 80 行代码榨干 GPU,算子开发范式的降维打击
2026-04-30 03:22:15 +0800 CST
view 977
深度解析 DeepSeek 开源的高性能 GPU 算子库 TileKernels:基于 TileLang DSL 用 80 行代码实现手写 CUDA 级性能,覆盖 MoE Gating/Routing、FP8/FP4 量化、Engram 门控等七大算子家族,首次原生支持 NVIDIA Blackwell 架构,并通过 TVM 编译器打通昇腾等国产芯片。
DeepSeek
TileKernels
GPU
CUDA
TileLang
MoE
算子优化
vLLM 0.17 深度实战:PagedAttention与连续批处理如何把GPU吞吐量提升4倍——从KV Cache原理到生产级大模型推理部署完全指南(2026)
编程
vLLM 0.17 深度实战:PagedAttention与连续批处理如何把GPU吞吐量提升4倍——从KV Cache原理到生产级大模型推理部署完全指南(2026)
2026-06-11 03:17:21 +0800 CST
view 977
深度解析vLLM推理引擎的PagedAttention原理、连续批处理、量化优化,以及从零搭建生产级高并发部署的完整实战指南(2026版)
vLLM
PagedAttention
大模型推理
GPU优化
AI部署
Linux 7.2 内核深度解析:Intel Xe3 架构驱动 Arc B390 核显性能跃升 12% 的技术内幕
编程
Linux 7.2 内核深度解析:Intel Xe3 架构驱动 Arc B390 核显性能跃升 12% 的技术内幕
2026-07-23 20:15:41 +0800 CST
view 1054
深度解析 Linux 7.2 内核如何让 Intel Xe3 架构的 Arc B390 核显性能提升 12%。涵盖 Xe3 架构设计、GuC 批量命令提交、显存预分配策略、智能电源管理、AI 推理优化实战。
Linux
Intel
Xe3
Arc B390
GPU
i915
内核优化
图形驱动
光线追踪
AI推理
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
编程
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
2026-04-30 14:21:13 +0800 CST
view 691
深度解析MCP 2026基准测试框架,拆解TensorRT-LLM、vLLM、Triton三大推理引擎的12个隐性耗时陷阱,提供可落地的诊断方法与修复路径。
AI推理
性能优化
TensorRT-LLM
vLLM
Triton
MCP2026
GPU优化
vLLM 与 SGLang 深度横评:两种推理范式的工程哲学对决
编程
vLLM 与 SGLang 深度横评:两种推理范式的工程哲学对决
2026-07-24 06:14:45 +0800 CST
view 329
深度对比vLLM与SGLang两大LLM推理引擎:PagedAttention vs RadixAttention,Continuous Batching原理,吞吐与延迟实战选型指南
vLLM
SGLang
LLM推理
PagedAttention
RadixAttention
Continuous Batching
GPU优化
推理引擎
Lightpanda 深度实战:当 AI Agent 有了自己的浏览器——从 Zig 零构建引擎到 CDP/MCP 双协议生产级部署完全指南
编程
Lightpanda 深度实战:当 AI Agent 有了自己的浏览器——从 Zig 零构建引擎到 CDP/MCP 双协议生产级部署完全指南
2026-06-11 10:49:09 +0800 CST
view 604
Lightpanda是用Zig从零构建的无头浏览器,专为AI和自动化设计。100并行页面比Chrome快9倍、内存省16倍,支持CDP和MCP双协议
Lightpanda
Zig
Headless Browser
AI Agent
MCP
CDP
Puppeteer
Web Automation
Kimi K3 深度拆解:当月之暗面决定「把开源模型的天花板从 1.6T 抬到 2.8T」——KDA 注意力、Stable LatentMoE 与自进化 GPU 内核如何重新定义 3 万亿级开源大模型的终极形态
编程
Kimi K3 深度拆解:当月之暗面决定「把开源模型的天花板从 1.6T 抬到 2.8T」——KDA 注意力、Stable LatentMoE 与自进化 GPU 内核如何重新定义 3 万亿级开源大模型的终极形态
2026-08-05 03:45:07 +0800 CST
view 210
深度拆解2.8万亿参数全球最大开源模型Kimi K3:KDA混合线性注意力机制、Stable LatentMoE稀疏专家路由、Attention Residuals选择性深度表示、Per-Head Muon逐头优化器,附完整架构分析与部署指南
Kimi K3
月之暗面
开源大模型
KDA注意力
MoE
2.8万亿参数
AI Agent
GPU内核优化
Ollama深度解析:Go语言打造的本地LLM推理引擎——从Modelfile容器化到GPU调度的完整实战指南
编程
Ollama深度解析:Go语言打造的本地LLM推理引擎——从Modelfile容器化到GPU调度的完整实战指南
2026-07-06 05:48:17 +0800 CST
view 269
深度解析Ollama本地LLM推理引擎架构与实战
Ollama
本地推理
LLM
Go
llama.cpp
GGUF
GPU
Modelfile
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
编程
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
2026-05-23 18:44:14 +0800 CST
view 714
2026年深度长文,从PagedAttention分页思想、Continuous Batching调度算法、Speculative Decoding并行验证机制到CUDA Kernel底层实现,全面拆解vLLM推理引擎内核架构,附生产级部署实战与框架横向对比。
vLLM
PagedAttention
Continuous Batching
Speculative Decoding
GPU推理
大模型部署
深度学习
CUDA
Apache Iceberg V3 深度拆解:当删除向量取代删除文件——从 Puffin 字节级解析到行级血缘 CDC 的完整实战指南(2026)
编程
Apache Iceberg V3 深度拆解:当删除向量取代删除文件——从 Puffin 字节级解析到行级血缘 CDC 的完整实战指南(2026)
2026-08-13 22:29:43 +0800 CST
view 74
深度拆解 Apache Iceberg V3:从 Hive 表格式四宗罪、四层元数据指针链、V2 删除文件爆炸的三重代价,到删除向量 Roaring Bitmap 编码、Puffin 字节级布局手写解析器、行级血缘增量 CDC、Variant 半结构化类型,配 PySpark/Flink/DuckDB/PyIceberg 完整实战与 15 条生产踩坑清单。
Apache Iceberg
删除向量
行级血缘
湖仓一体
数据湖
Puffin
Variant
数据工程
Claude Opus 4.8 深度实战:Dynamic Workflows 如何让单个开发者指挥百个 AI Agent 并行编码——从混合推理架构到生产级多智能体调度的完全指南(2026)
编程
Claude Opus 4.8 深度实战:Dynamic Workflows 如何让单个开发者指挥百个 AI Agent 并行编码——从混合推理架构到生产级多智能体调度的完全指南(2026)
2026-06-03 03:15:05 +0800 CST
view 499
深度解析 Claude Opus 4.8 的 Dynamic Workflows 多智能体并行编码能力,涵盖混合推理架构、Effort Control 推理控制、诚实性对齐改进,附完整 Python 调度器实现和代码审查流水线实战
Claude
Opus 4.8
Dynamic Workflows
AI Agent
混合推理
多智能体
SkyPilot 深度实战:从多云 AI 调度到成本优化的企业级完全指南
编程
SkyPilot 深度实战:从多云 AI 调度到成本优化的企业级完全指南
2026-05-24 00:00:53 +0800 CST
view 596
2026 年,SkyPilot 作为 AI 工作负载的通用编排层,彻底解决了多云 GPU 资源调度的碎片化问题。本文深入剖析其架构设计与生产级最佳实践。
SkyPilot
AI基础设施
多云调度
成本优化
GPU
Event-Driven Architecture 完全指南:从 Kafka 到 EventMesh 的现代事件驱动架构实践(2026)
编程
Event-Driven Architecture 完全指南:从 Kafka 到 EventMesh 的现代事件驱动架构实践(2026)
2026-06-03 04:16:03 +0800 CST
view 620
深度解析事件驱动架构核心原理与实战,涵盖 Apache Kafka、Apache Pulsar、EventMesh 等主流方案,通过完整代码示例展示如何构建高可用、可扩展的现代事件驱动系统。
Event-Driven
Kafka
Pulsar
EventMesh
事件驱动架构
微服务
云原生
消息队列
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
编程
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
2026-04-20 22:53:28 +0800 CST
view 1639
复旦大学OpenMOSS团队开源的0.1B参数多语言TTS模型,纯CPU运行、支持零样本语音克隆、48kHz双声道、20种语言、流式推理,MacBook Air单核即可流畅运行
TTS
语音合成
语音克隆
AI
开源
CPU推理
OpenMOSS
BitNet 1.58-bit:微软如何用三个值就让大模型在 CPU 上飞奔
编程
BitNet 1.58-bit:微软如何用三个值就让大模型在 CPU 上飞奔
2026-05-11 13:55:11 +0800 CST
view 743
微软开源BitNet 1.58-bit大模型推理框架,2B参数模型仅需0.4GB内存、29ms/token推理速度。核心创新:训练时量化、-1/0/+1三值权重、位运算加速,精度损失<5%却比INT4表现更好。纯CPU运行,71%能耗降低。
BitNet,1.58bit,微软,大模型量化,1bit LLM,CPU推理,bitnet.cpp,训练时量化,位运算加速,模型压缩
Ghostty 深度解析:Zig 打造的 GPU 加速终端——从 Mitchell Hashimoto 的再次创业到 AI 时代的命令行基础设施
编程
Ghostty 深度解析:Zig 打造的 GPU 加速终端——从 Mitchell Hashimoto 的再次创业到 AI 时代的命令行基础设施
2026-05-17 09:44:24 +0800 CST
view 998
深度解析 Ghostty 终端模拟器的技术架构:Zig 语言编写、Metal/OpenGL GPU 加速渲染、原生 SwiftUI/GTK4 UI、内置分屏与 Quick Terminal,以及 AI 编程时代的终端战略定位。
Ghostty
Zig
终端模拟器
GPU渲染
AI编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 712
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 755
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
DeepGEMM 深度解析:DeepSeek 开源的 FP8 GEMM 内核如何重塑 AI 推理性能边界
编程
DeepGEMM 深度解析:DeepSeek 开源的 FP8 GEMM 内核如何重塑 AI 推理性能边界
2026-04-21 05:16:09 +0800 CST
view 1127
深入剖析 DeepSeek 开源的 DeepGEMM 库:从 FP8 精度革命到 1550 TFLOPS 性能突破,揭秘现代 AI 推理基础设施的底层优化技术
DeepGEMM
FP8
DeepSeek
CUDA
AI推理
GPU优化
GEMM
TensorCore
Cua:15.9K Stars!给 AI 一台隔离云桌面,让它真正会用电脑
案例
Cua:15.9K Stars!给 AI 一台隔离云桌面,让它真正会用电脑
2026-05-11 16:22:59 +0800 CST
view 784
15.9K Stars 的开源项目 Cua,由 Y Combinator 孵化。给 AI 一个隔离云桌面,让它真的去开浏览器、点按钮、跑应用。支持 macOS/Linux/Windows/Android,三周暴涨 2000+ Stars。
Cua
AI Agent
Computer Use
云桌面
沙盒
Y Combinator
Claude Code
跨平台
Firefox in WebAssembly 深度拆解:当浏览器内核被编译成 WASM——在 Chrome 里跑 Firefox 的工程奇迹与容器化革命
编程
Firefox in WebAssembly 深度拆解:当浏览器内核被编译成 WASM——在 Chrome 里跑 Firefox 的工程奇迹与容器化革命
2026-07-19 09:46:07 +0800 CST
view 520
深度拆解 Firefox in WebAssembly 项目:如何将 2000 万行 C++ 的 Gecko 浏览器内核编译成 WASM,在 Chrome 里运行完整 Firefox。从 Emscripten 工具链、WASI 系统接口、内存模型到性能权衡与浏览器容器化的工程全貌。
WebAssembly
Firefox
WASM
浏览器内核
容器化
Gecko
Puter Labs
OpenAI Codex 深度解析:从 AI 编程助手到全能智能体的技术进化
编程
OpenAI Codex 深度解析:从 AI 编程助手到全能智能体的技术进化
2026-05-17 15:16:02 +0800 CST
view 1187
2026年OpenAI Codex全面解析:从代码生成器到全能智能体的技术进化,含GPT-5.3-Codex架构、Computer Use原理、Codex CLI实战与Claude Code深度横评
OpenAI Codex
AI编程工具
Claude Code对比
Computer Use
GPT-5.3
软件工程Agent
Claude Opus 5 深度拆解:性能逼近 Fable 5、价格减半,一次重新定义「性价比旗舰」的行业地震
编程
Claude Opus 5 深度拆解:性能逼近 Fable 5、价格减半,一次重新定义「性价比旗舰」的行业地震
2026-07-30 13:46:00 +0800 CST
view 159
深度拆解 Anthropic Claude Opus 5:性能逼近旗舰 Fable 5,价格却只有一半。涵盖 ARC-AGI 3 三倍领先、IMO 42/42 满分、自我验证能力、多 Agent 协作(5.9x 加速)、安全架构重构与开发者迁移指南。
Claude Opus 5
Anthropic
AI大模型
LLM
评测对比
Frontier-Bench
ARC-AGI
多Agent协作
安全架构
开发者实战
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
6
7
8
9
10
...
78
下一页