程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
agents-cli:谷歌开源 AI Agent 全流程开发工具,从搭建到部署一键搞定
案例
agents-cli:谷歌开源 AI Agent 全流程开发工具,从搭建到部署一键搞定
2026-05-11 08:01:29 +0800 CST
view 672
谷歌云官方开源的 agents-cli 工具,专为简化 AI 智能体开发生命周期设计。支持 Gemini CLI、Claude Code、Codex、Cursor 等主流编程助手,内置七大技能包覆盖构建-评估-部署全流程,支持本地模拟评估、自动化部署到 Cloud Run/GKE、Gemini Enterprise 注册。
Google
agents-cli
AI Agent
CLI
部署
评估
ADK
Cloud Run
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
编程
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
2026-07-18 12:44:38 +0800 CST
view 266
深度拆解 Google AI Edge Gallery 开源项目:LiteRT 推理引擎架构、INT4 量化原理、多模态支持、模型转换实战、企业级落地场景,配完整 Kotlin 代码示例与性能优化指南。
Google AI Edge Gallery
LiteRT
端侧AI
大模型
Android
量化
多模态
离线推理
移动端部署
GenAI
Meta Muse Glimmer 深度拆解:300亿参数端侧Agent模型的工程革命——从知识蒸馏到4bit量化的完整实战指南(2026)
编程
Meta Muse Glimmer 深度拆解:300亿参数端侧Agent模型的工程革命——从知识蒸馏到4bit量化的完整实战指南(2026)
2026-08-13 18:49:00 +0800 CST
view 36
深度拆解Meta 2026年8月发布的Muse Glimmer:300亿参数开放权重Dense模型,4bit量化可在单张RTX 3090/4090上本地运行。涵盖架构设计、知识蒸馏、量化原理、本地部署实战与性能基准测试。
Muse Glimmer
端侧AI
知识蒸馏
4bit量化
Agent本地部署
300亿参数
Meta
Apache 2.0
llama.cpp
Ollama
Muse Glimmer 端侧Agent革命:300亿参数模型如何在消费级GPU上跑出生产级性能(2026实战)
编程
Muse Glimmer 端侧Agent革命:300亿参数模型如何在消费级GPU上跑出生产级性能(2026实战)
2026-08-13 18:50:11 +0800 CST
view 32
深度拆解Meta 2026年8月发布的Muse Glimmer:300亿参数开放权重Dense模型,4bit量化可在单张RTX 3090/4090上本地运行。涵盖架构设计、知识蒸馏、量化原理、本地部署实战与性能基准测试。
Muse Glimmer
端侧AI
知识蒸馏
4bit量化
Agent本地部署
300亿参数
Meta
Apache 2.0
llama.cpp
Ollama
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 2194
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
Qwen3.8-2.4T-A95B 深度技术拆解:从2.4万亿参数MoE架构到本地部署的完整工程实践(2026)
编程
Qwen3.8-2.4T-A95B 深度技术拆解:从2.4万亿参数MoE架构到本地部署的完整工程实践(2026)
2026-08-13 19:44:17 +0800 CST
view 30
深度拆解阿里开源的Qwen3.8-2.4T-A95B模型:2.4万亿参数、512专家MoE架构、混合注意力机制、MTP多Token预测、9芯适配、vLLM/SGLang部署实战与性能优化,附15条生产踩坑清单。
Qwen3.8
MoE架构
混合专家
开源大模型
本地部署
人工智能
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
编程
vLLM 深度实战:从 PagedAttention 到 Speculative Decoding——2026年大模型推理引擎内核架构完全指南
2026-05-23 18:44:14 +0800 CST
view 693
2026年深度长文,从PagedAttention分页思想、Continuous Batching调度算法、Speculative Decoding并行验证机制到CUDA Kernel底层实现,全面拆解vLLM推理引擎内核架构,附生产级部署实战与框架横向对比。
vLLM
PagedAttention
Continuous Batching
Speculative Decoding
GPU推理
大模型部署
深度学习
CUDA
Gunicorn是一个高性能、易于使用的Python,适用于多种应用部署场景
编程
Gunicorn是一个高性能、易于使用的Python,适用于多种应用部署场景
2024-11-18 13:34:51 +0800 CST
view 2198
Gunicorn是一个高性能、易于使用的PythonWSGIHTTP服务器,适用于多种应用部署场景。它支持多种工作模式,能够高效处理并发请求,并兼容多种PythonWeb框架。本文详细介绍了Gunicorn的安装方法、主要特性、基本和高级功能,以及实际应用场景,帮助开发者全面掌握该库的使用。
Python
Web开发
服务器
并发处理
应用部署
omlx:Mac 本地 LLM 推理的终极方案——从菜单栏管理到 SSD 缓存的完整工程实践
编程
omlx:Mac 本地 LLM 推理的终极方案——从菜单栏管理到 SSD 缓存的完整工程实践
2026-07-24 17:17:27 +0800 CST
view 261
深度解析 omlx:专为 Mac 优化的本地 LLM 推理服务器,通过连续批处理、分层 KV Cache、SSD 缓存和菜单栏管理,实现便捷与控制兼得的推理体验。涵盖技术架构、性能调优、RAG 实战和最佳实践。
LLM
Mac
Apple Silicon
推理优化
本地部署
omlx
MemPalace 深度实战:当记忆宫殿遇上 AI Agent——从 2000 年前认知术到 96.6% 召回率的本地记忆系统完全指南(2026)
编程
MemPalace 深度实战:当记忆宫殿遇上 AI Agent——从 2000 年前认知术到 96.6% 召回率的本地记忆系统完全指南(2026)
2026-06-12 15:20:19 +0800 CST
view 700
从 2000 年前古希腊记忆术到 96.6% R@5 的 AI 本地记忆系统,深度解析 MemPalace 的 Wing/Room/Drawer 架构、可插拔后端设计与 MCP 集成实践
AI记忆
MemPalace
MCP
向量检索
RAG
本地部署
Python
AI Agent
MCP 无状态架构深度拆解:当 AI 工具协议决定「删掉 Session」——从有状态握手到无状态 HTTP,MCP 2026-07-28 规范如何用一个「减法」重新定义企业级 AI 工具生态的终极形态
编程
MCP 无状态架构深度拆解:当 AI 工具协议决定「删掉 Session」——从有状态握手到无状态 HTTP,MCP 2026-07-28 规范如何用一个「减法」重新定义企业级 AI 工具生态的终极形态
2026-08-05 15:26:29 +0800 CST
view 167
深度拆解MCP 2026-07-28规范:从有状态到无状态的架构重构,MRTR多轮往返请求机制,MCP Apps与Tasks扩展,OAuth企业级授权适配,附完整代码实战与迁移指南
MCP
Model Context Protocol
无状态架构
AI Agent
Anthropic
工具协议
HTTP
MRTR
OAuth
企业级部署
vLLM vs SGLang 深度拆解:当推理引擎分道扬镳——从 PagedAttention 到 RadixAttention 的架构革命与选型决策指南(2026)
编程
vLLM vs SGLang 深度拆解:当推理引擎分道扬镳——从 PagedAttention 到 RadixAttention 的架构革命与选型决策指南(2026)
2026-08-14 07:12:45 +0800 CST
view 22
深度拆解 vLLM 与 SGLang 两大推理框架:从 PagedAttention 分页内存管理到 RadixAttention 前缀树复用,从 Continuous Batching 到压缩有限状态机,配完整性能对比数据与 15 条生产踩坑清单。
vLLM
SGLang
大模型推理
PagedAttention
RadixAttention
KV Cache
高性能计算
LLM部署
vLLM vs SGLang 深度拆解:从 PagedAttention 到 RadixAttention 的架构革命(2026实战指南)
编程
vLLM vs SGLang 深度拆解:从 PagedAttention 到 RadixAttention 的架构革命(2026实战指南)
2026-08-14 07:13:18 +0800 CST
view 30
深度拆解 vLLM 与 SGLang 两大推理框架:从 PagedAttention 分页内存管理到 RadixAttention 前缀树复用,从 Continuous Batching 到压缩有限状态机,配完整性能对比数据与 15 条生产踩坑清单。
vLLM
SGLang
大模型推理
PagedAttention
RadixAttention
KV Cache
高性能计算
LLM部署
Openship 深度拆解:桌面控制平面 + 零 YAML,自托管部署平台的新范式
编程
Openship 深度拆解:桌面控制平面 + 零 YAML,自托管部署平台的新范式
2026-07-24 19:44:05 +0800 CST
view 299
深度拆解 GitHub Trending 开源项目 Openship:桌面控制平面的安全创新、零配置栈检测原理、内置邮件/CDN/备份的全家桶设计、MCP 原生 AI Agent 接口,以及与 Coolify/Dokploy/Kamal 的横向选型对比。
Openship
自托管
CI/CD
部署平台
Docker
DevOps
MCP
开源
Vercel替代
PaaS
智谱 slime 深度实战:当 RL 后训练终于有了工业级「炼丹炉」——从 Megatron+SGLang 三模块联调到 GLM-5.2 两天完成 OPD 后训练的生产级完全指南(2026)
编程
智谱 slime 深度实战:当 RL 后训练终于有了工业级「炼丹炉」——从 Megatron+SGLang 三模块联调到 GLM-5.2 两天完成 OPD 后训练的生产级完全指南(2026)
2026-06-23 07:54:24 +0800 CST
view 527
2026年6月智谱开源RL后训练框架slime,支撑GLM-5.2仅用2天完成OPD后训练。本文深度解析其三模块架构、原生引擎透传设计、PD分离、增量权重同步等核心技术,附完整生产级部署实战代码。
强化学习
RL训练
slime框架
智谱AI
GLM-5.2
Megatron
SGLang
后训练
开源框架
生产级部署
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
编程
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
2026-08-14 09:44:53 +0800 CST
view 26
深度拆解Meta开源的Muse Glimmer 30B端侧Agent模型:从稠密Transformer架构、1.8B ViT-G/14视觉编码器,到4-bit GGUF量化、DFlash推测性解码,再到Ollama一键部署、配完整代码实战与15条生产踩坑清单
Muse Glimmer
Meta
Agent模型
本地AI
开源LLM
量化部署
Function Calling
多模态
万字深度解析 DeepSeek V4:当 1.6 万亿参数遇见 DSA 稀疏注意力——开源大模型如何让 API 账单暴降 95%(2026)
编程
万字深度解析 DeepSeek V4:当 1.6 万亿参数遇见 DSA 稀疏注意力——开源大模型如何让 API 账单暴降 95%(2026)
2026-07-01 07:13:58 +0800 CST
view 421
2026年4月DeepSeek V4发布,1.6万亿参数+百万上下文+SWE-Bench 80.6%,API成本暴降95%。深度解析DSA稀疏注意力、MoE架构、生产级部署实战。
DeepSeek V4
DSA 稀疏注意力
MoE 架构
百万上下文
开源大模型
API 成本优化
大模型部署
Agent 能力
SWE-Bench
DeepSeek
Ollama v0.14.3 深度实战:从本地部署到多模态 AI——2026 年私有化大模型工程化完全指南
编程
Ollama v0.14.3 深度实战:从本地部署到多模态 AI——2026 年私有化大模型工程化完全指南
2026-05-24 12:04:34 +0800 CST
view 418
Ollama v0.14.3 深度实战指南:从架构解析到生产部署,涵盖 GGUF 格式、API 集成、多模态模型、性能优化等核心内容,2026 年私有化大模型首选方案。
Ollama
大模型
本地部署
GGUF
多模态
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
编程
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
2026-04-12 22:56:41 +0800 CST
view 1147
2026年深度解析 llama.cpp 架构设计与 GGUF 量化格式,从底层原理到工程实战,涵盖 K-Quant/IQ 量化、Flash Attention、KV Cache 优化、Intel NPU/GPU 部署全流程。
llama.cpp
GGUF
量化
大模型
C++
本地部署
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
编程
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
2026-07-13 05:12:59 +0800 CST
view 275
深度对比 vLLM 与 SGLang 两大 LLM 推理引擎:从 KV Cache、PagedAttention、RadixAttention、连续批处理、分块预填充、推测解码、P/D 分离到量化部署,配可直接运行的生产级代码与基准测试。
vLLM
SGLang
LLM推理
大模型部署
PagedAttention
RadixAttention
2.8万亿参数的开源大模型工程极限:Kimi K3 架构深度拆解与本地部署完全指南
编程
2.8万亿参数的开源大模型工程极限:Kimi K3 架构深度拆解与本地部署完全指南
2026-07-30 22:15:48 +0800 CST
view 305
深度拆解 Kimi K3 的 2.8T MoE 架构:KDA 线性注意力、Attention Residuals、Stable Latent MoE、Benchmark 分析与完整本地部署指南
大模型
MoE
混合注意力
Kimi
开源AI
本地部署
Shimmy 深度解剖:Airframe 引擎与 TurboShimmy INT4 KV——纯 Rust WebGPU 推理如何用 4GB 显存跑起 7B 模型
编程
Shimmy 深度解剖:Airframe 引擎与 TurboShimmy INT4 KV——纯 Rust WebGPU 推理如何用 4GB 显存跑起 7B 模型
2026-07-25 10:15:27 +0800 CST
view 237
深度拆解 Shimmy v2.x 的 Airframe 纯 Rust WebGPU 推理引擎与 TurboShimmy INT4 KV Cache 压缩技术:从 WGSL shader 到 GGUF 模型加载,从跨平台 GPU 适配到 4GB 显存跑 7B 模型的工程真相。
Shimmy
WebGPU
GGUF
LLM推理
Rust
Inference Engine
TurboShimmy
INT4量化
消费级GPU
本地部署
wgpu
WGSL
Airframe
OpenAI API
vLLM v1 Engine 架构深度拆解:从异步调度到 Chunked Prefill 的生产级推理引擎演进(2026实战指南)
编程
vLLM v1 Engine 架构深度拆解:从异步调度到 Chunked Prefill 的生产级推理引擎演进(2026实战指南)
2026-08-14 17:45:25 +0800 CST
view 19
深度拆解vLLM v1 Engine架构:Continuous Batching、Chunked Prefill、异步内存管理等核心特性,从源码到生产部署,配完整代码实战与性能基准测试
vLLM
LLM推理
PagedAttention
ContinuousBatching
GPU优化
生产部署
推测解码
Python
Gemma 4 MoE 架构技术深度解析:Dense MLP + Routed MoE 双路径设计如何重塑开源大模型
编程
Gemma 4 MoE 架构技术深度解析:Dense MLP + Routed MoE 双路径设计如何重塑开源大模型
2026-04-21 14:22:20 +0800 CST
view 751
深度解析 Google Gemma 4 的 Dual-Path 混合架构设计:Dense MLP 保障通用基座能力,Routed MoE 释放专业化推理效率。一文吃透技术原理、部署实战与选型对比。
Gemma 4
MoE架构
Dense MLP
Routed MoE
Google DeepMind
开源大模型
Transformer
模型部署
混合专家
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
5
下一页