程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
编程
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
2026-07-18 13:17:37 +0800 CST
view 99
深度拆解 vLLM 0.5 的 PagedAttention 核心原理、连续批处理架构、MoE 推理优化、分布式部署策略,以及 2026 年四大推理框架生产级性能横评。
vLLM
PagedAttention
LLM推理
ContinuousBatching
MoE
FusedMoE
量化
分布式推理
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 1927
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
BitNet 深度拆解:当大模型被压到 1.58 bit——三值量化、BitLinear 与在 CPU 上跑 100B 的工程全貌(2026)
编程
BitNet 深度拆解:当大模型被压到 1.58 bit——三值量化、BitLinear 与在 CPU 上跑 100B 的工程全貌(2026)
2026-07-19 01:12:51 +0800 CST
view 108
深度拆解微软 BitNet 1-bit/1.58-bit 大模型:从三值量化数学、BitLinear 架构、BitNet.cpp 推理内核,到在 CPU 上运行 100B 模型的完整工程实战。
BitNet
1-bit LLM
三值量化
BitLinear
边缘AI
大模型推理
31GB压缩到4GB:turbovec与TurboQuant算法深度解析——比FAISS快20%的向量索引黑科技(ICLR 2026)
编程
31GB压缩到4GB:turbovec与TurboQuant算法深度解析——比FAISS快20%的向量索引黑科技(ICLR 2026)
2026-06-12 12:19:14 +0800 CST
view 603
基于ICLR 2026论文TurboQuant,深度解析turbovec开源项目:31GB向量压缩到4GB、搜索比FAISS快20%的数学原理、SIMD工程实现与生产级RAG集成实战
向量索引
向量量化
TurboQuant
RAG
FAISS
Rust
Python
SIMD
ICLR 2026
高维向量
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 545
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 525
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度解析 DuckDB 2026:当嵌入式 OLAP 遇见 PostgreSQL——从向量化引擎到 pg_duckdb 扩展的生产级实战
编程
万字深度解析 DuckDB 2026:当嵌入式 OLAP 遇见 PostgreSQL——从向量化引擎到 pg_duckdb 扩展的生产级实战
2026-07-01 02:12:35 +0800 CST
view 266
2026年,嵌入式分析数据库 DuckDB 正在悄然重塑数据分析生态。本文万字深度解析 DuckDB 的向量化执行引擎、列式存储架构、与 PostgreSQL 的无缝集成、以及生产级实战应用。
DuckDB
PostgreSQL
OLAP
数据分析
向量化执行
pg_duckdb
Parquet
性能优化
DuckLake
嵌入式数据库
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
编程
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
2026-07-19 09:14:11 +0800 CST
view 251
纯C语言实现的大模型推理引擎,仅用1300行代码在25GB内存笔记本上运行744B参数的GLM-5.2 MoE模型,含完整代码示例与技术解析
C语言
GLM-5.2
MoE
大模型推理
量化
AVX2
MLA注意力
推测解码
Apple Silicon
River-LLM 深度解析:上交大如何让大模型推理速度翻倍,却几乎不损失精度
编程
River-LLM 深度解析:上交大如何让大模型推理速度翻倍,却几乎不损失精度
2026-05-02 19:05:49 +0800 CST
view 520
深入解析上海交通大学 River-LLM 框架:通过退出层与骨干层共享 KV 缓存,解决早期退出的缓存缺失难题,实现 1.71x-2.16x 推理加速,几乎不损失精度。
LLM
推理优化
KV缓存
早期退出
量化
上海交通大学
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
编程
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
2026-04-12 22:56:41 +0800 CST
view 941
2026年深度解析 llama.cpp 架构设计与 GGUF 量化格式,从底层原理到工程实战,涵盖 K-Quant/IQ 量化、Flash Attention、KV Cache 优化、Intel NPU/GPU 部署全流程。
llama.cpp
GGUF
量化
大模型
C++
本地部署
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
编程
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
2026-07-19 14:42:08 +0800 CST
view 116
深度拆解 colibrì 项目:一位意大利开发者用 10 天、1300 行纯 C 代码,在 25GB 笔记本上运行 7440 亿参数大模型的工程全貌。涵盖 MoE 稀疏推理、NVMe 流式专家、MLA 注意力、MTP 推测解码等核心技术的完整解析。
C语言
MoE
大模型
NVMe
量化
GPU
深度学习
GLM-5.2
推理引擎
推测解码
2026年端侧AI千亿参数突破深度解析:从量化技术到NPU架构,手机如何跑赢云端大模型
编程
2026年端侧AI千亿参数突破深度解析:从量化技术到NPU架构,手机如何跑赢云端大模型
2026-04-22 03:52:11 +0800 CST
view 679
深度解析2026年端侧AI千亿参数突破的技术原理:从INT4量化到MoE架构,从存算一体NPU到动态内存优化,揭示手机如何跑赢云端大模型的核心工程密码。
AI
端侧AI
大模型
量化
NPU
DuckDB 深度实战:当分析型数据库塞进一个进程——从向量化执行引擎、零拷贝 Arrow 到 1.5.0 VARIANT/GEOMETRY 的生产级完整指南(2026)
编程
DuckDB 深度实战:当分析型数据库塞进一个进程——从向量化执行引擎、零拷贝 Arrow 到 1.5.0 VARIANT/GEOMETRY 的生产级完整指南(2026)
2026-07-20 02:44:29 +0800 CST
view 81
深度拆解 DuckDB 进程内分析型数据库:从向量化执行引擎、列存零拷贝、HashAggregate/Join 原理,到 Python 实战、Nginx 日志 BI、1.5.0 VARIANT/GEOMETRY 与性能调优的完整工程指南。
DuckDB
OLAP
数据分析
向量化执行
列存数据库
Parquet
Python
DuckDB 1.5.0 "Variegata" 深度解析:嵌入式分析数据库的性能巅峰
编程
DuckDB 1.5.0 "Variegata" 深度解析:嵌入式分析数据库的性能巅峰
2026-05-12 08:14:38 +0800 CST
view 584
深度解析DuckDB 1.5.0核心新特性:VARIANT数据类型支持半结构化数据、GEOMETRY空间数据类型成为内置类型、SIMD指令集深度优化使聚合查询性能提升3-5倍、全新CLI客户端提升开发体验、DuckLake v1.0湖仓一体格式支持,附物联网与电商实战案例与性能Benchmark
DuckDB 1.5
嵌入式分析
OLAP
VARIANT类型
GEOMETRY空间数据
SIMD优化
向量化执行
DuckLake
Qdrant 向量数据库深度实战:从 HNSW 索引、标量量化到混合检索与 RAG 生产落地的完整工程指南(2026)
编程
Qdrant 向量数据库深度实战:从 HNSW 索引、标量量化到混合检索与 RAG 生产落地的完整工程指南(2026)
2026-07-20 07:13:11 +0800 CST
view 96
2026 年 Qdrant 向量数据库深度实战:从 HNSW 索引、标量量化、稠密/稀疏/多向量到混合检索与生产级 RAG 落地的完整工程指南,附可运行代码。
Qdrant
向量数据库
RAG
混合检索
HNSW
标量量化
Embedding
BGE-M3
ClickHouse 深度实战:当列式存储成为实时分析引擎——从 MergeTree 引擎家族、向量化执行到分布式查询与生产级落地的完整工程指南(2026)
编程
ClickHouse 深度实战:当列式存储成为实时分析引擎——从 MergeTree 引擎家族、向量化执行到分布式查询与生产级落地的完整工程指南(2026)
2026-07-20 07:43:40 +0800 CST
view 104
2026年ClickHouse深度实战:从列式存储与MergeTree引擎家族、向量化执行、ClickHouse Keeper到分布式查询,配Python/Go代码实战、物化视图与性能调优的完整工程指南。
ClickHouse
OLAP
列式存储
MergeTree
向量化执行
实时分析
物化视图
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 701
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
DuckDB 深度实战:当分析引擎塞进进程里——从向量化执行到湖仓一体的技术革命(2026)
编程
DuckDB 深度实战:当分析引擎塞进进程里——从向量化执行到湖仓一体的技术革命(2026)
2026-07-14 03:13:19 +0800 CST
view 157
深度拆解 DuckDB 1.5.4:从 in-process OLAP 定位、向量化列存执行引擎、与 Pandas 零拷贝互操作,到直读 Parquet/S3/Iceberg、Postgres 外表、全文与向量检索、DuckLake 湖仓与 Quack 客户端服务,配完整可运行代码与性能优化实战。
DuckDB
OLAP
数据分析
向量化执行
湖仓一体
SQLite
Parquet
Python
编程
MarkItDown 深度拆解:当微软把文档预处理做到极致——161K Star 的 LLM 预处理层工程全貌(2026·完整版)
2026-07-20 11:50:12 +0800 CST
view 86
2026年深度拆解微软开源项目 MarkItDown:161K Star 的文档转 Markdown 神器,从插件化架构、20+格式处理机制到生产级 RAG 流水线集成的完整工程指南,配可运行代码示例。
MarkItDown
Python
LLM
RAG
文档处理
微软
开源
Markdown
PDF
Word
Excel
OCR
向量化
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
编程
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
2026-07-02 06:43:56 +0800 CST
view 213
DeepSeek V4 技术架构深度解析:从 mHC 流形约束超连接、CSA/HCA 混合稀疏注意力、FP4 量化感知训练到 Muon 优化器,完整拆解 1.6T 开源模型如何用架构创新把 1M token 推理效率提升到 V3.2 的 10%。
DeepSeek V4
大模型架构
MoE
CSA/HCA 注意力
FP4 量化
mHC
AI 开源
长上下文
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 129
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
万字深度解析 NVIDIA Blackwell 架构:当 GPU 编程遇见「Tile 抽象革命」——从 CUDA 13.1 Python 内核生成到 Blackwell Ultra 30 倍推理加速的完整技术指南(2026)
编程
万字深度解析 NVIDIA Blackwell 架构:当 GPU 编程遇见「Tile 抽象革命」——从 CUDA 13.1 Python 内核生成到 Blackwell Ultra 30 倍推理加速的完整技术指南(2026)
2026-07-02 07:45:18 +0800 CST
view 204
深度解析 NVIDIA Blackwell GPU 架构与 CUDA 13.1 Tile 编程模型,涵盖 FP4 量化、Tensor Core v5、NVLink 5.0、DeepSeek V4 推理优化等核心技术,提供完整 Python 实战代码。
Blackwell
CUDA
GPU编程
AI推理
性能优化
深度学习
并行计算
NVIDIA
量化
Tensor Core
DuckDB 深度实战:当嵌入式数据库进化为分析引擎——从向量化执行到湖仓一体、Quack 协议与生产级完全指南(2026)
编程
DuckDB 深度实战:当嵌入式数据库进化为分析引擎——从向量化执行到湖仓一体、Quack 协议与生产级完全指南(2026)
2026-06-18 19:24:32 +0800 CST
view 356
DuckDB 1.5 深度实战:从向量化执行引擎到底层存储架构,从 Parquet 直查到 Quack 协议,从 Python 集成到生产级部署,52000 字完全指南。
DuckDB
OLAP
数据分析
嵌入式数据库
向量化执行
Parquet
Python
DwarfStar 4 深度实战:当 Redis 之父手写 AI 推理引擎——从 284B MoE 模型塞进 MacBook 到生产级本地 Agent 的完全指南(2026)
编程
DwarfStar 4 深度实战:当 Redis 之父手写 AI 推理引擎——从 284B MoE 模型塞进 MacBook 到生产级本地 Agent 的完全指南(2026)
2026-06-13 20:17:57 +0800 CST
view 479
Redis之父antirez新作DwarfStar 4深度解析:专为DeepSeek V4 Flash打造的本地推理引擎,非对称2-bit量化、磁盘KV缓存、Metal图执行、分布式推理、方向引导,MacBook上284B模型跑出26 tok/s的完全指南
ds4
DwarfStar
DeepSeek
本地推理
Metal
MoE
量化
KV缓存
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
5
下一页