程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
编程
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
2026-06-02 09:36:52 +0800 CST
view 791
从vLLM到TensorRT-LLM,一次讲透vLLM、SGLang、TensorRT-LLM、llama.cpp四大LLM推理框架的架构哲学、核心原理、生产级部署实战与选型决策树。
LLM
vLLM
TensorRT-LLM
llama.cpp
SGLang
推理优化
GPU
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
编程
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
2026-07-24 01:46:45 +0800 CST
view 179
深度实战 TabbyML/tabby 自托管 AI 编程助手:三层架构与 llama-server 独立化重构、消费级 GPU 模型选型、Repository Context 语法感知 RAG 索引、FIM Prompt 拼装原理、systemd/nginx 生产部署、压测与 Prometheus 监控全套方案。
Tabby
AI编程
代码补全
自托管
llama.cpp
RAG
Rust
GPU
开源
Copilot
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
编程
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
2026-04-30 14:21:13 +0800 CST
view 671
深度解析MCP 2026基准测试框架,拆解TensorRT-LLM、vLLM、Triton三大推理引擎的12个隐性耗时陷阱,提供可落地的诊断方法与修复路径。
AI推理
性能优化
TensorRT-LLM
vLLM
Triton
MCP2026
GPU优化
Lightpanda 深度实战:当 AI Agent 有了自己的浏览器——从 Zig 零构建引擎到 CDP/MCP 双协议生产级部署完全指南
编程
Lightpanda 深度实战:当 AI Agent 有了自己的浏览器——从 Zig 零构建引擎到 CDP/MCP 双协议生产级部署完全指南
2026-06-11 10:49:09 +0800 CST
view 587
Lightpanda是用Zig从零构建的无头浏览器,专为AI和自动化设计。100并行页面比Chrome快9倍、内存省16倍,支持CDP和MCP双协议
Lightpanda
Zig
Headless Browser
AI Agent
MCP
CDP
Puppeteer
Web Automation
Ollama深度解析:Go语言打造的本地LLM推理引擎——从Modelfile容器化到GPU调度的完整实战指南
编程
Ollama深度解析:Go语言打造的本地LLM推理引擎——从Modelfile容器化到GPU调度的完整实战指南
2026-07-06 05:48:17 +0800 CST
view 247
深度解析Ollama本地LLM推理引擎架构与实战
Ollama
本地推理
LLM
Go
llama.cpp
GGUF
GPU
Modelfile
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
编程
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
2026-04-20 22:53:28 +0800 CST
view 1607
复旦大学OpenMOSS团队开源的0.1B参数多语言TTS模型,纯CPU运行、支持零样本语音克隆、48kHz双声道、20种语言、流式推理,MacBook Air单核即可流畅运行
TTS
语音合成
语音克隆
AI
开源
CPU推理
OpenMOSS
AI 算力基础设施深度解剖:从异构计算到 CPO 光互连与液冷散热的工程真相
编程
AI 算力基础设施深度解剖:从异构计算到 CPO 光互连与液冷散热的工程真相
2026-07-25 06:43:33 +0800 CST
view 175
深度拆解 2026 年 AI 算力基础设施三大核心技术突破:异构计算从 x86 到 Arm 的架构革命、CPO 共封装光学突破互连瓶颈、液冷散热解决高密度算力散热难题,附工程实战案例与性能数据。
AI基础设施
异构计算
CPO
液冷散热
数据中心
GPU集群
云原生
性能优化
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
编程
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
2026-07-25 15:14:38 +0800 CST
view 152
深度解析 Shimmy v2.3.0:纯 Rust WebGPU 推理引擎如何实现浏览器端原生运行 GGUF 量化模型,OpenAI API 兼容,零依赖部署。
WebGPU
Rust
GGUF
AI推理
浏览器
llama.cpp
OpenAI API
前端工程
CPU 重回 C 位:玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程,RISC-V 高性能算力的关键一跃
编程
CPU 重回 C 位:玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程,RISC-V 高性能算力的关键一跃
2026-07-25 21:16:03 +0800 CST
view 305
深度解析达摩院玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程的工程真相:从发射队列 IQ 水位线保留策略、ROB 延迟滤波优化、物理寄存器策略化分配,到空间多线程的静态分区架构与 AI Agent 三大场景落地,全面剖析 RISC-V 高性能服务器的最后一块拼图。
RISC-V
SMT
玄铁
香山
CPU
微架构
AI Agent
空间多线程
处理器
sched_ext 深度拆解:当 Linux 决定把调度器「按 cgroup 分包出租」——从 DSQ 阻抗匹配到 cid 拓扑 ID 与子调度器的架构手术
编程
sched_ext 深度拆解:当 Linux 决定把调度器「按 cgroup 分包出租」——从 DSQ 阻抗匹配到 cid 拓扑 ID 与子调度器的架构手术
2026-08-09 00:55:14 +0800 CST
view 88
深度拆解 sched_ext:从 DSQ 阻抗匹配层、完整调度周期与 custody 语义,到 2026 主线内核新增的 cid 拓扑有序 CPU ID 与按 cgroup 挂载的子调度器。含两个可读的 BPF 调度器完整实现、events 计数器逐条排障表、七条调优经验与十条踩坑清单。
sched_ext
eBPF
Linux内核
CPU调度
BPF
内核调度器
cgroup
性能优化
Rust
scx
Microsoft BitNet 深度实战:1比特大模型推理框架——让CPU跑起千亿参数模型的技术革命(2026完全指南)
编程
Microsoft BitNet 深度实战:1比特大模型推理框架——让CPU跑起千亿参数模型的技术革命(2026完全指南)
2026-05-26 12:35:43 +0800 CST
view 608
深入解析 Microsoft BitNet 1比特大模型推理框架,从原理到实战,让CPU跑起千亿参数模型。包含完整代码示例、性能优化策略和应用场景分析。
BitNet
模型量化
大模型推理
CPU推理
1-bit LLM
SPEC CPU 2026 深度解析:九年磨一剑,52 个基准测试如何重塑 CPU 性能评估标准
编程
SPEC CPU 2026 深度解析:九年磨一剑,52 个基准测试如何重塑 CPU 性能评估标准
2026-05-18 17:44:27 +0800 CST
view 815
2026年5月5日SPEC正式发布SPEC CPU 2026基准测试套件,九年来首次重大版本更新。52个基准测试、源码行数翻倍、内存需求64GB、全面拥抱AI工作负载。本文深度解析新特性、技术架构升级及Intel/AMD/NVIDIA实测对比。
CPU
基准测试
SPEC
Intel
AMD
Arm
编译器
LLVM
性能优化
服务器
从 43 到 52:SPEC CPU 2026 深度解析——九年磨一剑,CPU 性能评估标准全面重塑
编程
从 43 到 52:SPEC CPU 2026 深度解析——九年磨一剑,CPU 性能评估标准全面重塑
2026-05-18 17:48:07 +0800 CST
view 1348
2026年5月5日SPEC正式发布SPEC CPU 2026基准测试套件,九年来首次重大版本更新。52个基准测试、源码行数翻倍、内存需求64GB、全面拥抱AI工作负载。本文深度解析新特性、技术架构升级及Intel/AMD/NVIDIA实测对比。
CPU
基准测试
SPEC
Intel
AMD
Arm
编译器
LLVM
性能优化
服务器
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
编程
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
2026-04-23 19:09:57 +0800 CST
view 740
深度解析微软开源的BitNet b1.58 2B4T模型,从1.58位三值量化原理、架构设计、性能对比到部署实战,全面剖析这个仅需0.4GB内存、在普通CPU上流畅运行的革命性大语言模型。
BitNet
量化
大模型
微软
CPU推理
边缘计算
OpenVINO 2026.3 深度拆解:从 MoE 磁盘卸载到 FP8 量化,Intel 的端侧 AI 推理全家桶又升级了
编程
OpenVINO 2026.3 深度拆解:从 MoE 磁盘卸载到 FP8 量化,Intel 的端侧 AI 推理全家桶又升级了
2026-08-10 11:46:27 +0800 CST
view 93
深度拆解 Intel OpenVINO 2026.3 四大核心更新:MoE 磁盘卸载让 300B 模型跑在 16GB 机器上、Linux 懒加载消除权重复制、FP8 量化新能力、三条 GenAI 新流水线,配完整代码实战与性能数据对比
OpenVINO
Intel
AI推理
MoE
FP8量化
端侧部署
NNCF
LLM
CPU推理
Ollama 深度实战:当本地大模型成为生产级基础设施——从模型量化到高并发推理、从 REST API 到 Kubernetes 部署的完全指南(2026)
编程
Ollama 深度实战:当本地大模型成为生产级基础设施——从模型量化到高并发推理、从 REST API 到 Kubernetes 部署的完全指南(2026)
2026-06-20 01:25:22 +0800 CST
view 712
Ollama本地大模型生产级部署完全指南:从GGUF格式原理、INT4/INT8量化实战、REST API集成、多语言SDK(Python/Go/TypeScript)、GPU显存管理、Kubernetes+Helm生产部署、性能调优到RAG知识库构建,全流程深度实战。
Ollama
本地大模型
LLM部署
模型量化
GGUF
llama.cpp
REST API
Kubernetes
GPU
RAG
BitNet 深度实战:微软 32K Star 的 1-bit LLM 推理框架——从三值量化原理到 CPU 原生推理的全链路架构解析
编程
BitNet 深度实战:微软 32K Star 的 1-bit LLM 推理框架——从三值量化原理到 CPU 原生推理的全链路架构解析
2026-05-07 03:35:48 +0800 CST
view 597
深度解析微软 BitNet 1-bit LLM 推理框架,从三值量化数学原理到 bitnet.cpp 内核优化,再到 CPU 原生推理实战部署的全链路架构解析
BitNet
1-bit LLM
量化
CPU推理
微软
AMD Zen 7 Florence 深度解析:ACE 指令集如何让 x86 芯片在 AI 时代绝地反击
编程
AMD Zen 7 Florence 深度解析:ACE 指令集如何让 x86 芯片在 AI 时代绝地反击
2026-07-26 14:44:50 +0800 CST
view 136
深度解析AMD Zen 7 Florence处理器中的ACE AI计算扩展指令集:与英特尔AMX的架构差异、288核规格、2nm工艺、MRDIMM/LPDDR6内存、开发者编程实战,以及对AI基础设施格局的影响。
Zen 7
Florence
ACE指令集
AMD AI
AMX对比
矩阵乘法
CPU AI加速
EPYC 2028
sched_ext 源码级深度拆解:把 Linux 调度器变成可热插拔的 BPF 程序——从 DSQ 状态机到手写一个大小核感知调度器(附完整 C 实现)
编程
sched_ext 源码级深度拆解:把 Linux 调度器变成可热插拔的 BPF 程序——从 DSQ 状态机到手写一个大小核感知调度器(附完整 C 实现)
2026-08-02 02:19:25 +0800 CST
view 119
深度拆解 Linux 6.12 主线 sched_ext 可扩展调度器类:为什么 CFS/EEVDF 在异构硬件下失灵、sched_class 层级与 struct_ops 加载机制、DSQ 三件套与回调时序状态机,手写 v1~v4 四个逐步进化的 BPF 调度器(含完整可编译 C 代码与大小核感知实现),附 verifier 十条纪律、scx_lavd/scx_layered/scx_rusty 选型决策树、可观测调试与十条生产踩坑清单。
sched_ext
Linux内核
BPF
CPU调度器
eBPF
EEVDF
scx
性能优化
异构计算
云原生
AMD Zen 7 Florence ACE 指令集深度解析:x86 的 AI 自我革命
编程
AMD Zen 7 Florence ACE 指令集深度解析:x86 的 AI 自我革命
2026-07-26 14:46:05 +0800 CST
view 345
深度解析AMD Zen 7 Florence处理器中的ACE AI计算扩展指令集:与英特尔AMX的架构差异、288核规格、2nm工艺、MRDIMM/LPDDR6内存、开发者编程实战,以及对AI基础设施格局的影响。
Zen 7
Florence
ACE指令集
AMD AI
AMX对比
矩阵乘法
CPU AI加速
EPYC 2028
SPEC CPU 2026 深度解析:九年磨一剑,CPU基准测试迎来全面现代化
编程
SPEC CPU 2026 深度解析:九年磨一剑,CPU基准测试迎来全面现代化
2026-05-07 12:06:17 +0800 CST
view 1029
SPEC CPU 2026 九年来首次重大更新,52个基准测试全面覆盖现代工作负载,从AI推理到科学计算,深入解析这一行业标准的架构设计与性能影响
CPU
基准测试
性能优化
编译器
Bun 从 Zig 到 Rust 的六天重写:当 AI 开始重写运行时本身——从内存泄漏到 --cpu-prof-md、从 Claude Code 到开发者工具链的 AI 原生革命(2026)
编程
Bun 从 Zig 到 Rust 的六天重写:当 AI 开始重写运行时本身——从内存泄漏到 --cpu-prof-md、从 Claude Code 到开发者工具链的 AI 原生革命(2026)
2026-06-20 10:56:29 +0800 CST
view 416
Bun六天从Zig重写为Rust的深度分析:内存泄漏、--cpu-prof-md AI原生调试、Claude Code与运行时质量之问、Drizzle ORM JIT优化实战
Bun
Rust
Zig
AI编程
JavaScript运行时
Claude Code
CPU Profiling
Drizzle ORM
Warp 深度实战:49K+ Star 的 AI Agent 原生终端——从 Block 架构到 Oz 云代理平台的全链路解析
编程
Warp 深度实战:49K+ Star 的 AI Agent 原生终端——从 Block 架构到 Oz 云代理平台的全链路解析
2026-05-07 21:38:59 +0800 CST
view 823
深入剖析 Warp 终端的开源架构,从 Block-Based 输出模型到 GPU 加速渲染,从 AI Agent 原生集成到 Oz 云代理平台,全面解读 49K+ Star 背后的技术革新。
Warp
终端
Rust
AI Agent
GPU渲染
MCP
Skills
AI 控制 Mac 电脑和手机的 MCP/Skill 方案全解析
案例
AI 控制 Mac 电脑和手机的 MCP/Skill 方案全解析
2026-04-27 06:46:32 +0800 CST
view 949
盘点 2025-2026 年主流的 AI 控制 Mac 电脑和手机的 MCP/Skill 方案,包括 computer-use-mcp、mobile-mcp、DesktopCommanderMCP 等,附选型建议和安全提醒。
MCP
AI自动化
Mac
手机控制
Computer Use
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
5
6
...
33
下一页