程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
编程
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
2026-08-16 11:15:36 +0800 CST
view 17
深度拆解阿里Qwen3.8-27B:270亿参数原生多模态稠密模型,262K原生上下文可扩展至100万tokens,编程能力超越Qwen3.7-Plus。从Dense架构原理、混合注意力、YaRN外推、reasoning_effort机制,到INT4量化部署、KV Cache优化、vLLM推理加速、生产级FastAPI部署,配完整代码实战与性能对比数据。
Qwen3.8-27B
多模态模型
Dense架构
长上下文
本地部署
量化优化
编程能力
推理引擎
BitNet 1.58-bit:微软如何用三个值就让大模型在 CPU 上飞奔
编程
BitNet 1.58-bit:微软如何用三个值就让大模型在 CPU 上飞奔
2026-05-11 13:55:11 +0800 CST
view 729
微软开源BitNet 1.58-bit大模型推理框架,2B参数模型仅需0.4GB内存、29ms/token推理速度。核心创新:训练时量化、-1/0/+1三值权重、位运算加速,精度损失<5%却比INT4表现更好。纯CPU运行,71%能耗降低。
BitNet,1.58bit,微软,大模型量化,1bit LLM,CPU推理,bitnet.cpp,训练时量化,位运算加速,模型压缩
AI量化交易多智能体框架深度解析:从TradingAgents到Qlib,一场颠覆传统量化投资的技术革命
编程
AI量化交易多智能体框架深度解析:从TradingAgents到Qlib,一场颠覆传统量化投资的技术革命
2026-04-22 02:49:55 +0800 CST
view 1143
深入剖析TradingAgents、Qlib、VeighNa三大AI量化交易框架的技术架构与实战方法,从多智能体协作到工业级部署,一篇搞定AI量化的核心技术与最佳实践。
AI量化交易
多智能体
TradingAgents
Qlib
VeighNa
Python
量化投资
LLM
TradingAgents-CN 深度实战:当 AI 多智能体遇上量化交易——从架构原理到 A 股智能决策的完全指南(2026)
编程
TradingAgents-CN 深度实战:当 AI 多智能体遇上量化交易——从架构原理到 A 股智能决策的完全指南(2026)
2026-06-10 03:50:20 +0800 CST
view 812
深入解析 TradingAgents-CN 的核心架构、多智能体协作机制、A 股本地化适配方案,从零搭建生产级 AI 量化交易系统。
AI量化交易
多智能体系统
TradingAgents
量化交易
金融AI
Vibe-Trading 深度解析:HKUDS 开源 AI 量化交易 Agent——从自然语言到可执行策略、从多智能体架构到生产级部署的完整技术指南(2026)
编程
Vibe-Trading 深度解析:HKUDS 开源 AI 量化交易 Agent——从自然语言到可执行策略、从多智能体架构到生产级部署的完整技术指南(2026)
2026-07-04 17:12:17 +0800 CST
view 757
深度解析 HKUDS Vibe-Trading:AI 驱动的量化交易 Agent,支持自然语言驱动的策略研究、69+ 金融技能、16 通道 IM 消息、多智能体协作、Alpha Zoo 因子库,从架构原理到代码实战的完整技术指南。
Vibe-Trading
AI量化交易
多智能体
量化投资
开源
Python
LLM Agent
ReAct
因子研究
A股
FastAPI
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 178
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
编程
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
2026-07-10 17:44:16 +0800 CST
view 432
深度对比2026年四大主流LLM推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,涵盖PagedAttention、FP8量化、ZeRO-3、连续批处理等核心技术原理,配生产级代码示例与实测性能数据。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
量化
AI部署
2026 大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 性能与成本终极较量
编程
2026 大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9 性能与成本终极较量
2026-07-23 08:13:30 +0800 CST
view 359
2026年四大主流大模型推理框架深度对比:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9。从核心技术优化、吞吐量延迟、算力成本、部署适配性四大维度开展极致测评,为企业技术选型提供精准参考。
vLLM
TensorRT-LLM
TGI
DeepSpeed-MII
大模型推理
PagedAttention
FlashAttention
量化推理
GPU推理优化
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24 +0800 CST
view 141
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04 +0800 CST
view 181
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16 +0800 CST
view 221
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
编程
vLLM 2026 推理引擎全解:从 PagedAttention 到分离式 Prefill,如何把大模型跑出 GPU 极限性能
2026-06-29 17:16:04 +0800 CST
view 608
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
编程
万字长文拆解 vLLM 0.18:PagedAttention 如何用操作系统思维颠覆大模型推理
2026-06-29 17:17:00 +0800 CST
view 375
2026年vLLM 0.18深度解析:PagedAttention显存管理、EAGLE3推测解码、连续批处理、分离式Prefill、FP4量化,附生产级部署代码与Benchmark对比
vLLM
LLM推理
PagedAttention
推测解码
EAGLE3
FP4量化
CUDA
GPU性能优化
DuckDB 深度拆解:当分析型数据库塞进一个进程——从向量化执行引擎到 DuckLake 湖仓一体的完全指南(2026)
编程
DuckDB 深度拆解:当分析型数据库塞进一个进程——从向量化执行引擎到 DuckLake 湖仓一体的完全指南(2026)
2026-08-13 12:42:03 +0800 CST
view 64
深度拆解 DuckDB 进程内分析型数据库:列式存储、向量化执行引擎、CBO 优化器、与 Pandas/Arrow 零拷贝协作、DuckLake 湖仓实战,配 15 条生产踩坑清单。
DuckDB
OLAP
向量化执行
列式存储
数据分析
DuckLake
湖仓一体
SQLite
Python
性能优化
LLM推理引擎终极对决:vLLM vs TensorRT-LLM深度解析与2026生产环境选型指南
编程
LLM推理引擎终极对决:vLLM vs TensorRT-LLM深度解析与2026生产环境选型指南
2026-04-20 13:45:31 +0800 CST
view 933
深度对比vLLM与TensorRT-LLM两大LLM推理框架,从PagedAttention到Kernel Fusion,从量化技术到生产部署,助你做出正确的技术选型决策
LLM
vLLM
TensorRT-LLM
推理优化
大模型部署
量化技术
AI工程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 2216
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 703
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 746
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度解析 DuckDB 2026:当嵌入式 OLAP 遇见 PostgreSQL——从向量化引擎到 pg_duckdb 扩展的生产级实战
编程
万字深度解析 DuckDB 2026:当嵌入式 OLAP 遇见 PostgreSQL——从向量化引擎到 pg_duckdb 扩展的生产级实战
2026-07-01 02:12:35 +0800 CST
view 477
2026年,嵌入式分析数据库 DuckDB 正在悄然重塑数据分析生态。本文万字深度解析 DuckDB 的向量化执行引擎、列式存储架构、与 PostgreSQL 的无缝集成、以及生产级实战应用。
DuckDB
PostgreSQL
OLAP
数据分析
向量化执行
pg_duckdb
Parquet
性能优化
DuckLake
嵌入式数据库
DuckDB 深度解剖:向量化执行引擎、列式存储内核与千万级数据分析的工程实战
编程
DuckDB 深度解剖:向量化执行引擎、列式存储内核与千万级数据分析的工程实战
2026-07-25 01:43:45 +0800 CST
view 237
从第一性原理深度拆解 DuckDB 架构设计、向量化执行引擎、列式存储、扩展系统,以及千万级数据分析实战与性能调优。
DuckDB
列式存储
向量化执行
OLAP
数据分析
Python
Parquet
嵌入式数据库
性能优化
开源
River-LLM 深度解析:上交大如何让大模型推理速度翻倍,却几乎不损失精度
编程
River-LLM 深度解析:上交大如何让大模型推理速度翻倍,却几乎不损失精度
2026-05-02 19:05:49 +0800 CST
view 677
深入解析上海交通大学 River-LLM 框架:通过退出层与骨干层共享 KV 缓存,解决早期退出的缓存缺失难题,实现 1.71x-2.16x 推理加速,几乎不损失精度。
LLM
推理优化
KV缓存
早期退出
量化
上海交通大学
DuckDB 1.5.0 "Variegata" 深度解析:嵌入式分析数据库的性能巅峰
编程
DuckDB 1.5.0 "Variegata" 深度解析:嵌入式分析数据库的性能巅峰
2026-05-12 08:14:38 +0800 CST
view 720
深度解析DuckDB 1.5.0核心新特性:VARIANT数据类型支持半结构化数据、GEOMETRY空间数据类型成为内置类型、SIMD指令集深度优化使聚合查询性能提升3-5倍、全新CLI客户端提升开发体验、DuckLake v1.0湖仓一体格式支持,附物联网与电商实战案例与性能Benchmark
DuckDB 1.5
嵌入式分析
OLAP
VARIANT类型
GEOMETRY空间数据
SIMD优化
向量化执行
DuckLake
pg_duckdb 深度拆解:当 Postgres 决定「把 DuckDB 焊进自己的执行器」——从 CustomScan 钩子到 Arrow 零拷贝,一个扩展如何终结「为了跑个报表再搭一套数仓」的时代
编程
pg_duckdb 深度拆解:当 Postgres 决定「把 DuckDB 焊进自己的执行器」——从 CustomScan 钩子到 Arrow 零拷贝,一个扩展如何终结「为了跑个报表再搭一套数仓」的时代
2026-08-08 12:18:38 +0800 CST
view 116
pg_duckdb 深度拆解:为什么 Postgres 火山模型跑不动 OLAP、DuckDB 向量化与 morsel 并行快在哪、planner hook + CustomScan 如何整棵替换执行计划、MVCC 快照传递与类型映射陷阱,含 Parquet/S3 冷热联查、静默回退排查与七条调优规律。
pg_duckdb
PostgreSQL
DuckDB
OLAP
向量化执行
列式存储
CustomScan
Parquet
HTAP
数据库扩展
湖仓一体
性能优化
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 904
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
...
53
下一页