程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 346
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 44
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
当 Redis 之父遇上 DeepSeek V4 Flash:ds4.c 如何用 900 行代码重写本地大模型推理
编程
当 Redis 之父遇上 DeepSeek V4 Flash:ds4.c 如何用 900 行代码重写本地大模型推理
2026-07-15 18:15:32 +0800 CST
view 178
Redis创始人antirez开源ds4.c:用C语言+Metal GPU手写DeepSeek V4 Flash推理引擎,26 tok/s性能,2-bit MoE量化,KV缓存磁盘分层管理
ds4.c
DeepSeek V4 Flash
Metal推理
Redis之父
MoE量化
KV缓存分层
PostgreSQL × DuckDB 一库多态:当列存引擎与行存内核协同工作——架构设计与生产实践全解
编程
PostgreSQL × DuckDB 一库多态:当列存引擎与行存内核协同工作——架构设计与生产实践全解
2026-07-22 12:17:32 +0800 CST
view 103
深度解析腾讯云 PostgreSQL × DuckDB 一库多态架构:双引擎协同、向量化执行原理、RAG 加速、Agent 分析、HTAP 混合负载实战,配完整代码示例与性能优化指南。
PostgreSQL
DuckDB
HTAP
向量化执行
列式存储
RAG
AI Agent
数据库
Kronos 深度解析:金融市场基础模型的崛起——从120亿K线数据中炼金的AI革命
编程
Kronos 深度解析:金融市场基础模型的崛起——从120亿K线数据中炼金的AI革命
2026-04-17 15:45:39 +0800 CST
view 855
Kronos是首个开源金融K线基础模型,在45个交易所120亿条数据上预训练,零样本价格预测RankIC提升93%。本文深入解析其Tokenizer架构、预训练范式,并提供代码实战指南。
Kronos
金融AI
基础模型
时间序列
K线
量化交易
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
编程
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
2026-05-30 15:42:55 +0800 CST
view 510
深度解析 LLM 推理优化的核心技术:PagedAttention 内存管理革命、投机解码加速策略、INT4/FP8 量化技术、MoE 架构优化,从架构原理到代码实战,让大模型推理成本下降 70%。
LLM
推理优化
vLLM
PagedAttention
投机解码
量化
MoE
PostgreSQL × DuckDB 深度拆解:一个实例如何同时搞定 OLTP、OLAP 和 AI 向量检索?
编程
PostgreSQL × DuckDB 深度拆解:一个实例如何同时搞定 OLTP、OLAP 和 AI 向量检索?
2026-07-27 09:12:43 +0800 CST
view 54
深度拆解腾讯云 PostgreSQL × DuckDB 一库多态集成方案:从列式存储原理、向量化执行机制、查询路由策略到 RAG 场景实战,附代码示例与性能对比数据。
PostgreSQL
DuckDB
OLAP
向量化执行
AI数据库
RAG
向量检索
HNSW
列式存储
云原生数据库
ds4 深度解析:Redis 作者的最后一战?—— DwarfStar 4 本地推理引擎的技术革命
编程
ds4 深度解析:Redis 作者的最后一战?—— DwarfStar 4 本地推理引擎的技术革命
2026-05-15 17:47:40 +0800 CST
view 780
深入解析 antirez(Redis 作者)新开源项目 ds4:DwarfStar 4 本地推理引擎,专门为 DeepSeek V4 Flash 打造,支持 Metal/CUDA 后端,2-bit 量化可在 96GB 内存 MacBook 上运行 284B 参数模型。
AI推理
本地部署
DeepSeek
Redis
Apple Silicon
CUDA
Metal
MoE
量化
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
编程
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
2026-07-16 11:45:03 +0800 CST
view 265
从 Ollama 6500 万美元融资事件切入,深度拆解 2026 年本地大模型运行时生态:Ollama、llama.cpp、LocalAI、LiteBox、vLLM 的架构设计、性能对比、API 设计、适用场景,配完整代码实战与生产部署踩坑指南。
Ollama
本地大模型
llama.cpp
LocalAI
LiteBox
本地LLM
推理引擎
量化
GGUF
MCP
Ollama 本地大模型部署实战:从零到生产级应用的完全指南(2026)
编程
Ollama 本地大模型部署实战:从零到生产级应用的完全指南(2026)
2026-06-10 01:20:57 +0800 CST
view 575
2026年Ollama本地大模型部署完全指南:从架构原理、GGUF量化、ModelFile自定义、多语言集成(Python/JS/Go)、RAG实战到Docker/K8s生产部署,8500字深度长文。
Ollama
本地部署
大模型
LLM
生产级
GGUF
量化
TensorRT-LLM 深度实战:从 Blackwell 架构到 INT4 量化的 LLM 推理性能革命
编程
TensorRT-LLM 深度实战:从 Blackwell 架构到 INT4 量化的 LLM 推理性能革命
2026-05-22 06:19:51 +0800 CST
view 629
深入解析TensorRT-LLM推理框架,从Paged KV Cache、连续批处理到INT4/INT8/FP8量化实战,覆盖Blackwell架构适配、Triton部署与K8s生产方案
TensorRT-LLM
LLM推理
量化
INT4
Blackwell
GPU优化
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
编程
当 C/C++ 遇上 Rust:llama.cpp 与 LiteBox 深度架构对比——2026 年本地 LLM 推理框架的心智模型之战
2026-07-16 12:50:04 +0800 CST
view 170
深度对比 llama.cpp 与 LiteBox 两大本地 LLM 推理框架:GGUF 格式设计、K-Quant 量化内核、KV cache 管理、多后端抽象、并发架构,配完整代码实战与性能实测数据。
llama.cpp
LiteBox
GGUF
量化
KV cache
本地LLM
推理框架
Rust
C/C++
模型压缩
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
编程
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
2026-06-15 21:20:49 +0800 CST
view 271
深入解析小米MiMo UltraSpeed如何通过SWA架构在通用GPU上突破1000 tokens/s推理速度,从O(n²)困境到极致跨越的完整技术指南。
SWA
Sliding Window Attention
LLM推理
小米MiMo
推理优化
Transformer
PagedAttention
量化推理
端侧AI
2026 大模型推理优化:TensorRT-LLM v0.19 + Blackwell + 低比特量化实战手册
编程
2026 大模型推理优化:TensorRT-LLM v0.19 + Blackwell + 低比特量化实战手册
2026-04-09 03:15:44 +0800 CST
view 1017
2026年TensorRT-LLM v0.19全面解析:Skip Softmax稀疏注意力、Paged KV Cache显存管理、INT8/INT4低比特量化完整实战,Blackwell架构适配指南,70B模型单卡部署方案
TensorRT-LLM
低比特量化
Blackwell
INT8
INT4
推理优化
NVIDIA
ZeroClaw 深度拆解:3.4MB 二进制、5MB 内存跑起完整 AI Agent,全 Rust「零开销哲学」如何把部署成本打下来 98%
编程
ZeroClaw 深度拆解:3.4MB 二进制、5MB 内存跑起完整 AI Agent,全 Rust「零开销哲学」如何把部署成本打下来 98%
2026-07-28 01:43:22 +0800 CST
view 37
深度拆解全 Rust 开源项目 ZeroClaw:3.4MB 单二进制、<5MB 内存、<10ms 启动的自主 AI 助手基础设施,Trait 驱动插件架构解析、性能数字拆解、树莓派实战部署与生产优化指南。
ZeroClaw
Rust
AI Agent
树莓派
边缘计算
自托管
OpenClaw
轻量化
开源
TileLang + TileKernels 深度解析:DeepSeek 如何用 Python 写出让 GPU 逼近理论性能上限的 GPU 内核
编程
TileLang + TileKernels 深度解析:DeepSeek 如何用 Python 写出让 GPU 逼近理论性能上限的 GPU 内核
2026-04-28 10:55:20 +0800 CST
view 668
深度剖析 DeepSeek 开源的 TileLang DSL 和 TileKernels GPU 内核库:从 GEMM 到 MoE,从 TVM 编译基础设施到生产级量化内核,揭示用 Python 写接近硬件极限性能 GPU 代码的秘密。
TileLang
GPU内核
DeepSeek
高性能计算
CUDA
GEMM
MoE
量化
TVM
开源项目
llama.cpp 深度实战:当 C/C++ 重写遇见端侧 LLM 推理——从 GGUF 量化到 Apple Silicon 38 tokens/s 的生产级完全指南(2026)
编程
llama.cpp 深度实战:当 C/C++ 重写遇见端侧 LLM 推理——从 GGUF 量化到 Apple Silicon 38 tokens/s 的生产级完全指南(2026)
2026-06-16 01:17:28 +0800 CST
view 651
llama.cpp 是端侧 LLM 推理的事实标准(180K+ Stars)。本文从源码架构、GGUF 格式、量化方法、跨平台后端、生产部署、性能优化到 DeepSeek V4 Flash 实战,全方位讲解本地 AI 推理。
llama.cpp
GGUF
量化
端侧推理
本地AI
C/C++
Apple Silicon
Polars 深度实战:Rust+Arrow 原生架构如何重构 Python 数据处理
编程
Polars 深度实战:Rust+Arrow 原生架构如何重构 Python 数据处理
2026-05-09 06:39:07 +0800 CST
view 541
深入解析 Polars 的 Rust+Arrow 原生架构,从内存格式革命到查询优化器原理,对比 Pandas 性能差异,详解 Polars 2.0 关键升级与生产级实战技巧。
Python
Rust
数据分析
DataFrame
Pathway 深度解析:Python ETL 框架的流式处理革命 —— 用 Rust 引擎吊打 Flink/Spark,构建实时 LLM Pipeline
编程
Pathway 深度解析:Python ETL 框架的流式处理革命 —— 用 Rust 引擎吊打 Flink/Spark,构建实时 LLM Pipeline
2026-05-16 03:46:12 +0800 CST
view 545
55K+ Star,基于 Differential Dataflow 的 Rust 引擎,增量计算,内存计算,无缝集成 Python ML 生态——Pathway 正在重新定义实时流处理与 LLM Pipeline 的边界。
Python
流处理
实时分析
LLM
RAG
Pathway
ETL
开源项目
GitHub Trending
sql语句分别按日,按周,按月,按季统计金额
编程
sql语句分别按日,按周,按月,按季统计金额
2024-11-17 05:05:22 +0800 CST
view 3353
本文讨论如何使用SQL语句按日、周、月和季节统计消费记录的总量。提供了四条SQL示例语句,分别实现不同时间段的消费总和计算,并说明了如何根据指定日期进行查询。示例中使用了聚合函数和groupby语句,适用于消费记录表的分析。
数据库
SQL
数据分析
ClickHouse 2026 深度实战:当列式存储遇见 AI 时代——从 MergeTree 引擎到 PB 级实时分析,构建下一代数据基础设施的完全指南
编程
ClickHouse 2026 深度实战:当列式存储遇见 AI 时代——从 MergeTree 引擎到 PB 级实时分析,构建下一代数据基础设施的完全指南
2026-06-21 21:58:21 +0800 CST
view 326
2026 年 ClickHouse 生产级完全指南:从列式存储、MergeTree 引擎、向量化执行到分布式架构、物化视图、Kafka 集成、性能优化与 AI 场景实战。
ClickHouse
OLAP
列式存储
MergeTree
实时分析
数据库
大数据
性能优化
物化视图
云原生
Dirty Frag 深度实战:Linux 内核零拷贝页缓存污染漏洞——从 splice() 注入到双链提权的完整技术剖析
编程
Dirty Frag 深度实战:Linux 内核零拷贝页缓存污染漏洞——从 splice() 注入到双链提权的完整技术剖析
2026-05-16 12:14:12 +0800 CST
view 648
深度剖析 Linux 内核 Dirty Frag 漏洞链,从 splice() 零拷贝注入到 xfrm-ESP 与 RxRPC 双链提权的完整技术实战,含防护方案与 eBPF 检测
Linux
内核安全
漏洞分析
提权
零拷贝
eBPF
CVE-2026-31431 Copy Fail 深度技术剖析:Linux 内核 AF_ALG + splice() 提权漏洞从原理到实战修复
编程
CVE-2026-31431 Copy Fail 深度技术剖析:Linux 内核 AF_ALG + splice() 提权漏洞从原理到实战修复
2026-07-28 13:17:02 +0800 CST
view 33
深度剖析 CVE-2026-31431 Copy Fail 漏洞:内核 AF_ALG 加密套接字与 splice() 零拷贝系统调用的致命组合如何导致页缓存可控越界写入,附多发行版完整修复方案与容器逃逸场景分析
Linux内核
漏洞分析
AF_ALG
splice
CVE
安全
CentOS
Ubuntu
Chrome DevTools MCP 深度解析:谷歌官方出品的 AI 编程助手浏览器控制利器
编程
Chrome DevTools MCP 深度解析:谷歌官方出品的 AI 编程助手浏览器控制利器
2026-04-29 08:44:10 +0800 CST
view 695
37K+ Star 谷歌官方开源项目,让 Claude、Cursor、Copilot 等 AI 编程助手直接操控浏览器进行自动化调试、性能分析和智能测试。深度解析 MCP 协议、CDP 协议、30+ 工具详解、代码实战、部署指南。
Chrome DevTools
MCP
AI编程助手
浏览器自动化
性能分析
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
4
5
6
7
8
...
11
下一页