程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
llmfit 深度拆解:Rust 写就的本地大模型选型神器——一行命令把"显存够不够跑"从玄学变成算术
编程
llmfit 深度拆解:Rust 写就的本地大模型选型神器——一行命令把"显存够不够跑"从玄学变成算术
2026-08-18 08:15:14 +0800 CST
view 9
llmfit 是一款 Rust 编写的本地大模型选型工具,一行命令自动检测硬件配置,精确计算显存占用,给出 Fit 评分和速度估算,支持 Ollama、llama.cpp、MLX 等多运行时,配可运行代码与最佳实践。
llmfit
Rust
TUI
本地大模型
LLM推理
Ollama
llama.cpp
模型选型
量化
Apple Silicon
GPU
显存计算
MLX
命令行工具
SpacetimeDB 深度实战:当数据库学会了「吃掉服务器」——从内存计算到实时状态同步的生产级完全指南(2026)
编程
SpacetimeDB 深度实战:当数据库学会了「吃掉服务器」——从内存计算到实时状态同步的生产级完全指南(2026)
2026-06-14 23:49:48 +0800 CST
view 474
SpacetimeDB深度实战:详解数据库即服务器架构、Rust模块开发、BSATN二进制协议、客户端集成与性能优化,附BitCraft Online真实生产案例。
SpacetimeDB
Rust
实时数据库
游戏后端
内存计算
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24 +0800 CST
view 149
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04 +0800 CST
view 186
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16 +0800 CST
view 233
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
编程
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
2026-08-15 09:44:41 +0800 CST
view 52
深度拆解 AirLLM 分层推理架构:8GB 显存跑 405B 大模型的时间换空间哲学,从 mmap 权重映射、单层计算流水线到完整 Python 实战与 15 条生产级优化建议。
AirLLM
大模型推理
显存优化
LLM
内存推理
Python
性能优化
GPU
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
编程
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
2026-08-09 08:42:54 +0800 CST
view 152
深度拆解AirLLM:用分层流式推理打破显存壁垒,从4GB显卡跑通70B大模型的工程原理到MoE时代的新坐标,配完整代码示例与实战指南。
AirLLM
LLM推理
显存优化
MoE
Transformer
Python
AI部署
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 185
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 198
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
编程
LLM 推理的显存战争:从 PagedAttention 到统一内存架构——KV Cache 管理五世代深度解析(2026)
2026-06-15 11:18:23 +0800 CST
view 553
深度解析大模型推理中 KV Cache 管理的五世代演进:从连续分配到 PagedAttention,再到异构缓存、分布式 KV 和统一混合内存架构。结合 vLLM、SGLang、TensorRT-LLM 给出生产环境选型指南。
LLM
大模型
KVCache
PagedAttention
vLLM
SGLang
TensorRT
推理优化
显存管理
分布式
WebGPU 深度实战:把浏览器变成 GPU 计算平台——从 WGSL 计算着色器、并行矩阵乘法到图像处理的完整指南(2026)
编程
WebGPU 深度实战:把浏览器变成 GPU 计算平台——从 WGSL 计算着色器、并行矩阵乘法到图像处理的完整指南(2026)
2026-07-08 03:15:29 +0800 CST
view 338
从底层架构到可运行代码,系统讲解 WebGPU 计算管线:adapter/device、storage buffer、workgroup 共享内存与 WGSL 计算着色器,实战向量加法、分块矩阵乘法、Sobel 边缘检测与并行规约,并给出性能优化清单与真实基准对比。
WebGPU
GPU计算
WGSL
计算着色器
并行计算
前端性能
WebGPU 深度拆解:当浏览器终于长出「现代 GPU 心脏」——从 WGSL 计算着色器到浏览器内跑通 1.1B 大模型的完全指南(2026)
编程
WebGPU 深度拆解:当浏览器终于长出「现代 GPU 心脏」——从 WGSL 计算着色器到浏览器内跑通 1.1B 大模型的完全指南(2026)
2026-08-13 05:11:43 +0800 CST
view 93
深度拆解 WebGPU:从 WGSL 计算着色器、GPU 架构心智模型到浏览器内运行 1.1B 大模型的完整实战,配可运行代码与性能优化清单。
WebGPU
WGSL
计算着色器
浏览器GPU计算
WebLLM
前端
GPU
英伟达 CUDA-Oxide 0.1 深度解析:用 Rust 编写 GPU 内核的破冰之旅
编程
英伟达 CUDA-Oxide 0.1 深度解析:用 Rust 编写 GPU 内核的破冰之旅
2026-05-10 08:20:42 +0800 CST
view 940
英伟达发布实验性Rust-to-CUDA编译器CUDA-Oxide 0.1,支持用Rust编写SIMT GPU内核并输出标准PTX中间代码。深度解析其架构设计、代码示例与未来展望。
CUDA-Oxide
Rust
GPU编程
NVIDIA
PTX
SIMT
并行计算
高性能计算
W3C震撼官宣:WebAssembly正式成为Web一等编程语言——从 "JavaScript小弟" 到 "原生级性能霸主" 的完整技术解析
编程
W3C震撼官宣:WebAssembly正式成为Web一等编程语言——从 "JavaScript小弟" 到 "原生级性能霸主" 的完整技术解析
2026-05-16 21:49:12 +0800 CST
view 725
2026年3月W3C正式将WebAssembly定为Web一等编程语言。本文深度解析WASM如何打破JavaScript垄断,直接DOM操作、多语言支持(Rust/C++/Go/Python)、并行计算与GPU加速,以及Blazor从4.2秒优化到300ms的实战案例。
WebAssembly
WASM
Rust
性能优化
浏览器
WASI
边缘计算
并行计算
GPU加速
WebGPU 计算管线深度拆解:当浏览器开始「直接调用 GPU 算力」——从 WGSL 计算着色器、Storage Buffer 到浏览器端 GPGPU 与 AI 推理的工程全貌(2026)
编程
WebGPU 计算管线深度拆解:当浏览器开始「直接调用 GPU 算力」——从 WGSL 计算着色器、Storage Buffer 到浏览器端 GPGPU 与 AI 推理的工程全貌(2026)
2026-07-19 02:43:47 +0800 CST
view 218
深度拆解 WebGPU 计算管线:从 WGSL 计算着色器、Storage Buffer、workgroup 共享内存,到矩阵乘法 tiling、图像卷积、真实 GPU 基准对比,并落地浏览器端大模型推理(WebLLM/ONNX Runtime Web)。
WebGPU
GPGPU
WGSL
计算管线
浏览器AI
GPU计算
WiFi信号透视人体:RuView用9美元ESP32实现无摄像头姿态估计,一场颠覆计算机视觉的技术革命
编程
WiFi信号透视人体:RuView用9美元ESP32实现无摄像头姿态估计,一场颠覆计算机视觉的技术革命
2026-07-13 07:45:17 +0800 CST
view 351
RuView用9美元ESP32实现WiFi信号人体姿态估计,无需摄像头,隐私友好,穿墙透视,实时54,000fps,一场颠覆计算机视觉的技术革命。
RuView
WiFi感知
CSI
人体姿态估计
ESP32
Rust
边缘AI
隐私计算
计算机视觉
开源项目
WebGPU 深度实战:当浏览器成为 GPU 计算平台——从计算着色器、异步管线到跨平台性能优化的工程全貌(2026)
编程
WebGPU 深度实战:当浏览器成为 GPU 计算平台——从计算着色器、异步管线到跨平台性能优化的工程全貌(2026)
2026-07-20 00:16:12 +0800 CST
view 259
2026年WebGPU成为W3C推荐标准,浏览器正式成为GPU计算平台。本文深度拆解:从架构演进、计算着色器实战、性能优化到跨平台兼容与生产级渲染器架构。
WebGPU
GPU计算
计算着色器
性能优化
跨平台
图形编程
前端技术
WebGPU + WGSL:浏览器通用计算时代全解析——从渲染管线到 AI 推理的架构革命
编程
WebGPU + WGSL:浏览器通用计算时代全解析——从渲染管线到 AI 推理的架构革命
2026-07-31 15:51:04 +0800 CST
view 144
深度解析 WebGPU 架构与 WGSL 语言,涵盖粒子物理仿真、神经网络推理等实战案例,探讨浏览器通用计算的技术变革。
WebGPU
WGSL
浏览器图形
GPU计算
前端性能
AI推理
并行计算
Mojo 1.0 深度实战:从「Python 超集 C 速」到生产级 AI 基础设施——三年磨一剑,全链路拆解 Modular 的破局之道
编程
Mojo 1.0 深度实战:从「Python 超集 C 速」到生产级 AI 基础设施——三年磨一剑,全链路拆解 Modular 的破局之道
2026-08-17 12:45:19 +0800 CST
view 32
深度拆解 Mojo 1.0 正式发布:从 MLIR 编译器架构、GPU 编程模型、Python 互操作、编译时元编程,到引用失效诊断与 MAX 推理框架,配完整代码与性能基准测试。
Mojo
AI编程语言
MLIR
GPU编程
Python
高性能计算
异构计算
Modular
编译器基础设施
Polars 深度拆解:当 DataFrame 学会「延迟计算」——用 Rust + Apache Arrow + 查询优化器重写数据分析的心智模型
编程
Polars 深度拆解:当 DataFrame 学会「延迟计算」——用 Rust + Apache Arrow + 查询优化器重写数据分析的心智模型
2026-07-15 15:46:12 +0800 CST
view 232
从工程师视角深度拆解 Polars:Rust + Apache Arrow 列式内存、表达式系统、查询优化器(投影/谓词下推、公共子表达式消除)、多线程 SIMD 与 Streaming 流式引擎,配完整代码实战与 7 个性能优化技巧。
Polars
Rust
数据分析
DataFrame
查询优化器
高性能计算
Apache Arrow
流式计算
向量化
Python
RISC-V 深度拆解:当开源指令集学会「造芯」——NVIDIA SiFive 联姻、Linux 7.2 默认支持与 NumPy RVV 优化如何重写芯片战争格局
编程
RISC-V 深度拆解:当开源指令集学会「造芯」——NVIDIA SiFive 联姻、Linux 7.2 默认支持与 NumPy RVV 优化如何重写芯片战争格局
2026-07-15 16:17:47 +0800 CST
view 593
深度拆解 2026 年 RISC-V 生态关键技术突破:NVIDIA SiFive 战略合作、Linux 7.2 默认支持国产芯片、灵睿智芯 P100 v1、RISC-V Vector 扩展优化,配完整代码实战与性能对比。
RISC-V
RV-Vector
RVV
NVIDIA
SiFive
向量计算
SIMD
LLVM向量化
NumPy
国产芯片
Linux内核
AI推理
异构计算
别再手写汇编了!Go 1.27 原生SIMD,性能直接起飞
编程
别再手写汇编了!Go 1.27 原生SIMD,性能直接起飞
2026-07-04 08:18:54 +0800 CST
view 325
Go 1.27正式支持原生SIMD,无需手写Plan9汇编即可使用向量指令。底层archsimd包+高层Highway封装,两步走策略。Green Tea GC已用SIMD让GC开销降10%,runtime.freegc让strings.Builder扩容翻2倍。高性能计算牌桌上Go正式入座。
Go
SIMD
AVX
AVX-512
ARM64
NEON
SVE
高性能计算
并行计算
GreenTeaGC
编译器优化
WorldMonitor 深度拆解:73K Star 的「全球态势感知面板」,Vanilla TypeScript 扛住 500+ 数据源与 65+ 外部 API,不用框架反而赢了
编程
WorldMonitor 深度拆解:73K Star 的「全球态势感知面板」,Vanilla TypeScript 扛住 500+ 数据源与 65+ 外部 API,不用框架反而赢了
2026-07-28 05:46:45 +0800 CST
view 337
深度拆解 73K Star 开源项目 WorldMonitor:单代码库 6 站点变体、281 个 Protobuf 契约、三级缓存聚合 65+ 数据源、无框架 Vanilla TS + WebGL 双地图引擎,附 CLI/SDK/MCP 接入实战与四个可复用工程设计。
WorldMonitor
开源
TypeScript
MCP
AI Agent
数据可视化
Tauri
deck.gl
边缘计算
Protobuf
Ant 深度拆解:当一个 9MB 的 JavaScript 运行时决定「干掉 V8」——从自研 Silver 引擎到 MIR JIT 后端,一个 Show HN 爆款如何重新定义边缘计算的运行时范式
编程
Ant 深度拆解:当一个 9MB 的 JavaScript 运行时决定「干掉 V8」——从自研 Silver 引擎到 MIR JIT 后端,一个 Show HN 爆款如何重新定义边缘计算的运行时范式
2026-08-04 01:13:29 +0800 CST
view 188
深度拆解Ant JavaScript运行时:9MB二进制、5.5ms冷启动、自研Silver引擎、MIR JIT后端的技术原理与工程实践,附完整竞品对比与迁移指南
JavaScript
运行时
Ant
边缘计算
Serverless
V8
JIT
WebAssembly
TypeScript
MIR
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
...
10
下一页