程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
编程
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
2026-07-24 07:44:31 +0800 CST
view 116
KTransformers 通过 CPU/GPU 异构计算,让一块 RTX 5090(32GB 显存)能跑起 100B+ MoE 大模型,且无需量化压缩,保持原精度 FP16。实测比 llama.cpp Q8_0 快 4.5 倍。本文深度拆解其专家细粒度卸载、异步预取、DMA 优化等核心技术,以及实战部署指南。
KTransformers
LLM推理
MoE
异构计算
DeepSeek
SGLang
CPU Offload
本地部署
GPU优化
Zig 0.16.0 深度解析:无隐藏魔法的系统编程革命——io_uring、编译时计算与交叉编译如何重新定义底层开发
编程
Zig 0.16.0 深度解析:无隐藏魔法的系统编程革命——io_uring、编译时计算与交叉编译如何重新定义底层开发
2026-05-11 06:53:34 +0800 CST
view 566
Zig 0.16.0深度解析:io_uring异步IO、编译时计算、零配置交叉编译、CGO替代方案
Zig
系统编程
io_uring
交叉编译
comptime
CGO替代
Wails:Go 版 Electron,打包体积直接缩小 10 倍!
编程
Wails:Go 版 Electron,打包体积直接缩小 10 倍!
2026-06-11 11:57:18 +0800 CST
view 411
Wails是Go语言写的跨平台桌面应用框架,GitHub 34.7K Stars,打包体积10-20MB(Electron的1/10)。Go后端+任意前端+系统原生WebView,Go方法直接当JS函数调用,支持热重载和v3跨平台编译。
Wails
Go桌面应用
Electron替代
Tauri对比
跨平台桌面
WebView
前端开发
Golang
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
编程
SGLang 深度解析:RadixAttention 如何重塑大模型推理的「结构化革命」
2026-06-30 11:16:18 +0800 CST
view 256
深度解析 SGLang 大模型推理框架:RadixAttention 前缀缓存、零开销 CPU 调度器、结构化输出约束、推测解码、PD 分离等核心技术,对比 vLLM/TensorRT-LLM 选型,提供完整代码示例与生产级部署实践
SGLang
大模型推理
RadixAttention
前缀缓存
结构化输出
推测解码
PD分离
vLLM
TensorRT-LLM
SGLang 深度解析:RadixAttention 前缀缓存与结构化 LLM 推理革命——从 RAG/Agent 场景到生产级部署的完整指南
编程
SGLang 深度解析:RadixAttention 前缀缓存与结构化 LLM 推理革命——从 RAG/Agent 场景到生产级部署的完整指南
2026-06-30 11:17:15 +0800 CST
view 292
深度解析 SGLang 大模型推理框架:RadixAttention 前缀缓存、零开销 CPU 调度器、结构化输出约束、推测解码、PD 分离等核心技术,对比 vLLM/TensorRT-LLM 选型,提供完整代码示例与生产级部署实践
SGLang
大模型推理
RadixAttention
前缀缓存
结构化输出
推测解码
PD分离
vLLM
TensorRT-LLM
NGINX Rift 深度实战:CVE-2026-42945 漏洞原理、利用链与生产级防护完全指南
编程
NGINX Rift 深度实战:CVE-2026-42945 漏洞原理、利用链与生产级防护完全指南
2026-05-23 16:45:06 +0800 CST
view 697
深度解析潜伏18年的NGINX高危漏洞CVE-2026-42945,从源码层面拆解堆溢出原理、RCE利用链及生产级防护策略
NGINX
安全漏洞
RCE
CVE-2026-42945
堆溢出
网络安全
DiffusionGemma 深度实战:当离散文本扩散颠覆自回归霸权——从并行去噪原理到 MoE 架构、本地推理优化与混合范式展望的生产级完全指南(2026)
编程
DiffusionGemma 深度实战:当离散文本扩散颠覆自回归霸权——从并行去噪原理到 MoE 架构、本地推理优化与混合范式展望的生产级完全指南(2026)
2026-06-17 07:55:50 +0800 CST
view 327
Google开源DiffusionGemma:基于离散文本扩散的26B MoE模型,并行去噪实现4倍推理加速,双向注意力天然支持代码补全与行内编辑
DiffusionGemma
LLM
扩散模型
推理加速
MoE
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
编程
vLLM 0.5 深度拆解:当 PagedAttention 重塑 LLM 推理内存——从 OS 分页思想到 MoE 分布式推理的工程全貌(2026)
2026-07-18 13:17:37 +0800 CST
view 145
深度拆解 vLLM 0.5 的 PagedAttention 核心原理、连续批处理架构、MoE 推理优化、分布式部署策略,以及 2026 年四大推理框架生产级性能横评。
vLLM
PagedAttention
LLM推理
ContinuousBatching
MoE
FusedMoE
量化
分布式推理
Everything Claude Code 深度解析:黑客马拉松冠军如何让 AI 编程从「裸奔」到「武装到牙齿」
编程
Everything Claude Code 深度解析:黑客马拉松冠军如何让 AI 编程从「裸奔」到「武装到牙齿」
2026-05-11 08:21:24 +0800 CST
view 581
深度解析2026年GitHub增长最快的AI开源项目Everything Claude Code:105K Star、27个专业Agent、Instinct持续学习系统、AgentShield安全审计、Hook自动化,让Claude Code从单次会话工具进化为生产级AI编程平台
AI编程,ClaudeCode,EverythingClaudeCode,AI Agent,开发者工具
吴恩达 OpenWorker 深度拆解:开源版AI同事如何用 aisuite 引擎 + 审批门控重新定义桌面自动化
编程
吴恩达 OpenWorker 深度拆解:开源版AI同事如何用 aisuite 引擎 + 审批门控重新定义桌面自动化
2026-07-29 15:14:32 +0800 CST
view 18
深度拆解吴恩达团队开源的 OpenWorker 项目:开源版 AI 同事如何用 aisuite 多模型引擎 + 审批门控机制重新定义桌面自动化,附架构解析、代码实战与生产部署指南。
OpenWorker
吴恩达
AI助手
aisuite
开源
桌面自动化
MCP
Function Calling
审批门控
Python
吴恩达开源 OpenWorker 深度拆解:桌面 AI 助手的开源之路,从 aisuite 引擎到审批门控的工程实践
编程
吴恩达开源 OpenWorker 深度拆解:桌面 AI 助手的开源之路,从 aisuite 引擎到审批门控的工程实践
2026-07-29 15:15:04 +0800 CST
view 24
深度拆解吴恩达团队开源的 OpenWorker 项目:开源版 AI 同事如何用 aisuite 多模型引擎 + 审批门控机制重新定义桌面自动化,附架构解析、代码实战与生产部署指南。
OpenWorker
吴恩达
AI助手
aisuite
开源
桌面自动化
MCP
Function Calling
审批门控
Python
Go应用中使用MongoDB客户端库mongo-driver
编程
Go应用中使用MongoDB客户端库mongo-driver
2024-11-18 21:53:37 +0800 CST
view 1992
本文介绍了如何在Go应用中使用MongoDB客户端库mongo-driver,包括安装、连接、基本的CRUD操作、索引管理、聚合操作和事务支持。通过代码示例,展示了如何高效地与MongoDB进行交互,适用于各种应用场景。
编程
数据库
Go语言
MongoDB
开发
Spec-Kit 深度实战:GitHub 开源的 AI 规格驱动开发工具包,让 Vibe Coding 走向工程化
编程
Spec-Kit 深度实战:GitHub 开源的 AI 规格驱动开发工具包,让 Vibe Coding 走向工程化
2026-07-12 08:14:57 +0800 CST
view 211
深度解析 GitHub 开源的 AI 规格驱动开发工具包 Spec-Kit,剖析六步工作流、Constitution 宪法约束、Agent 命令体系,以及 SDD 生态与 OpenSpec/Amazon Kiro 的对比,帮助开发者从 Vibe Coding 走向工程化。
Spec-Kit
AI编程
SDD
Vibe Coding
Claude Code
GitHub
工程化
Snail-AI:开源免费的企业级 AI Agent 平台,Java 生态的智能体解决方案
编程
Snail-AI:开源免费的企业级 AI Agent 平台,Java 生态的智能体解决方案
2026-07-06 07:22:04 +0800 CST
view 250
基于Spring Boot+Spring AI的企业级AI智能体平台,多模型管理、Agent编排、RAG知识库、长期记忆、MCP工具、全链路追踪,支持信创数据库。
AI
Java
Spring Boot
Agent
RAG
开源
智能体
企业级
DSpark深度解析:DeepSeek联合北大开源的推测解码框架——半自回归生成+置信度调度如何让大模型推理速度飙升85%
编程
DSpark深度解析:DeepSeek联合北大开源的推测解码框架——半自回归生成+置信度调度如何让大模型推理速度飙升85%
2026-07-06 07:43:51 +0800 CST
view 394
深度解析DeepSeek联合北京大学开源的DSpark推测解码推理加速框架:半自回归生成架构解决后缀衰减、置信度调度验证机制避免算力浪费、单用户生成速度提升60%-85%、吞吐量最高暴涨661%。含完整代码实战与性能基准测试。
DSpark
DeepSeek
推测解码
Speculative Decoding
推理加速
半自回归
置信度调度
大模型推理
OpenTelemetry 深度实战:当可观测性终于有了「通用语」——从三大支柱、OTLP 协议、Collector 管线到零侵入自动插桩与生产级排障的完全指南(2026)
编程
OpenTelemetry 深度实战:当可观测性终于有了「通用语」——从三大支柱、OTLP 协议、Collector 管线到零侵入自动插桩与生产级排障的完全指南(2026)
2026-07-12 09:17:23 +0800 CST
view 197
深度解析 OpenTelemetry:从可观测性三支柱与 Profiles、OTLP 协议、Collector 管线、零侵入自动插桩,到采样、批处理、基数与背压的生产级调优,以及从厂商私有 SDK 平滑迁移到 OTel 的双写策略完全指南(2026)。
OpenTelemetry
可观测性
分布式追踪
Tracing
OTLP
Collector
云原生
Prometheus
Jaeger
GPT-5.6 系列深度解析:Sol、Terra、Luna 三体架构与 Ultra 模式——大模型推理范式的转折点
编程
GPT-5.6 系列深度解析:Sol、Terra、Luna 三体架构与 Ultra 模式——大模型推理范式的转折点
2026-06-30 14:48:42 +0800 CST
view 665
2026年6月OpenAI发布GPT-5.6系列Sol/Terra/Luna三体模型深度解析:Ultra模式多智能体内化架构、150万token上下文、Prompt Caching成本优化、与Claude Mythos/Gemini横向对比,万字长文从后端开发视角拆解大模型推理范式的转折点
GPT-5.6
OpenAI
Sol
Terra
Luna
Ultra模式
大模型
多智能体
AI架构
PromptCaching
AI Agent 可观测性深度实战:当黑箱遇见全链路追踪——从 OTel GenAI 语义规范到 LoongSuite Pilot 端侧采集、Python 零代码插桩与安全审计的生产级完全指南
编程
AI Agent 可观测性深度实战:当黑箱遇见全链路追踪——从 OTel GenAI 语义规范到 LoongSuite Pilot 端侧采集、Python 零代码插桩与安全审计的生产级完全指南
2026-06-17 11:56:08 +0800 CST
view 471
深入剖析 AI Agent 可观测性核心难题,基于阿里云 LoongSuite 开源方案,从 OTel GenAI 语义规范扩展到端侧采集、零代码插桩与安全审计的完整生产级实战指南
AI Agent
可观测性
OpenTelemetry
LoongSuite
安全审计
Transformers.js v4 深度解析:WebGPU 原生化让 AI 推理在 Node/Bun/Deno 中真正起飞
编程
Transformers.js v4 深度解析:WebGPU 原生化让 AI 推理在 Node/Bun/Deno 中真正起飞
2026-04-12 04:55:32 +0800 CST
view 950
深度解析 Transformers.js v4 的 WebGPU 原生化架构:如何用 C++ 重写 WebGPU Runtime、与 ONNX Runtime 深度集成、在 Node/Bun/Deno 中实现原生 GPU AI 推理。包含代码实战、性能对比与生产部署指南。
JavaScript
AI
WebGPU
Transformers
HuggingFace
Node.js
Bun
Deno
ONNX
Rust 2026:首进 TIOBE 前十、1.96 Range 重构、Tokio 统治异步生态——系统编程王者的全面解析
编程
Rust 2026:首进 TIOBE 前十、1.96 Range 重构、Tokio 统治异步生态——系统编程王者的全面解析
2026-07-24 14:47:22 +0800 CST
view 135
Rust语言2026年首进TIOBE前十。深度解析Rust 1.96 Range类型重构、Tokio异步运行时架构、生产级并发编程实践,以及Rust在WebAssembly、云原生、AI基础设施的最新应用版图
Rust
Rust 1.96
Range
async
Tokio
异步编程
系统编程
MiMo Code 深度实战:当小米杀入 AI 编程赛道——从 SQLite FTS5 持久记忆到子智能体编排、Max Mode 并行推理与 Compose 自进化工作流的生产级完全指南(2026)
编程
MiMo Code 深度实战:当小米杀入 AI 编程赛道——从 SQLite FTS5 持久记忆到子智能体编排、Max Mode 并行推理与 Compose 自进化工作流的生产级完全指南(2026)
2026-06-17 13:23:19 +0800 CST
view 585
深度拆解小米 MiMo Code V0.1.0 的架构设计、持久记忆系统、子智能体编排、Goal 裁判模型、Max Mode 并行推理与 Compose 工作流
AI编程
MiMo Code
小米
Coding Agent
开源项目
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
编程
LLM推理引擎全栈优化实战:从PagedAttention到投机解码,榨干GPU的每一滴算力
2026-05-17 10:21:56 +0800 CST
view 585
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
编程
万字深度:PagedAttention、连续批处理与投机解码——LLM推理优化七层实战
2026-05-17 10:22:13 +0800 CST
view 588
深度拆解LLM推理引擎核心技术栈:PagedAttention消除内存碎片、连续批处理榨干GPU算力、NUMA感知调度、混合精度量化、投机解码加速、算子融合、分布式推理架构,附代码示例与性能数据
LLM
vLLM
PagedAttention
推理优化
量化
投机解码
ContinuousBatching
GPU
Nginx最强配置清单(反向代理/限流/SSL/负载均衡)
编程
Nginx最强配置清单(反向代理/限流/SSL/负载均衡)
2025-07-26 10:43:48 +0800 CST
view 1133
本文介绍了Nginx的强大配置,包括负载均衡、反向代理、限流、安全防护、性能优化和日志管理等功能。通过示例代码,读者可以学习如何配置Nginx以实现高效的反向代理、SSL加密、请求限流、IP访问控制、静态资源缓存等。还涉及了高级功能如灰度发布和地理位置限制,帮助用户提升网站的安全性和性能。
Nginx
Web服务器
网络安全
性能优化
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
40
41
42
43
44
...
84
下一页