程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
ZeroClaw 深度拆解:3.4MB 二进制、5MB 内存跑起完整 AI Agent,全 Rust「零开销哲学」如何把部署成本打下来 98%
编程
ZeroClaw 深度拆解:3.4MB 二进制、5MB 内存跑起完整 AI Agent,全 Rust「零开销哲学」如何把部署成本打下来 98%
2026-07-28 01:43:22 +0800 CST
view 47
深度拆解全 Rust 开源项目 ZeroClaw:3.4MB 单二进制、<5MB 内存、<10ms 启动的自主 AI 助手基础设施,Trait 驱动插件架构解析、性能数字拆解、树莓派实战部署与生产优化指南。
ZeroClaw
Rust
AI Agent
树莓派
边缘计算
自托管
OpenClaw
轻量化
开源
EasyOCR光学字符识别库,基于深度学习,支持80多种语言,能够快速准确地识别图片中的文字
综合
EasyOCR光学字符识别库,基于深度学习,支持80多种语言,能够快速准确地识别图片中的文字
2024-11-19 06:41:57 +0800 CST
view 1971
EasyOCR是一个开源的光学字符识别库,基于深度学习,支持80多种语言,能够快速准确地识别图片中的文字。本文介绍了EasyOCR的安装、使用方法及在Python和PHP中的应用示例,涵盖了环境配置、代码示例及执行命令,适用于多种场景如文档数字化和车牌识别等。
OCR
深度学习
图像处理
编程
开发工具
pi-mono 深度拆解:libGDX 作者的 4 万 Star AI Agent 全家桶,不到 1000 token 的 System Prompt 凭什么成为 OpenClaw 的引擎
编程
pi-mono 深度拆解:libGDX 作者的 4 万 Star AI Agent 全家桶,不到 1000 token 的 System Prompt 凭什么成为 OpenClaw 的引擎
2026-07-28 05:13:25 +0800 CST
view 70
深度拆解 libGDX 作者 badlogic 的 4 万 Star 项目 pi-mono:7 包 Monorepo 架构、pi-ai 统一 LLM 层、不到 1000 token 的极简 System Prompt 与学徒哲学,附自定义工具实战与 Claude Code/Codex 对比选型。
pi-mono
AI Agent
Coding Agent
TypeScript
LLM
开源
OpenClaw
开发者工具
vLLM
终端工具
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40 +0800 CST
view 203
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
深度长文:LLM 推测解码(Speculative Decoding)工程化实战——从原理到3倍加速的完整实现
编程
深度长文:LLM 推测解码(Speculative Decoding)工程化实战——从原理到3倍加速的完整实现
2026-07-26 17:15:22 +0800 CST
view 102
深度长文实战 Speculative Decoding 推测解码技术:从拒绝采样原理、草稿模型选型到 vLLM 生产部署,包含完整代码实现、性能基准测试和 DSpark 等前沿变体解析,不修改模型不牺牲质量即可实现 2-3 倍推理加速。
Speculative Decoding
LLM推理加速
推测解码
vLLM
DSpark
自建大模型统一网关:多模型路由、故障转移与成本治理的工程实战
编程
自建大模型统一网关:多模型路由、故障转移与成本治理的工程实战
2026-07-23 02:41:45 +0800 CST
view 116
从协议碎片化病根讲起,拆解生产级 LLM 网关必须解决的六类工程问题,并用手写 Go 网关+Python 语义缓存跑通路由、熔断、重试与成本记账。
LLM Gateway
大模型网关
多模型路由
故障转移
成本治理
LiteLLM
OmniRoute
Rolldown 1.0 深度实战:当 Vite 用 Rust 重写打包器,10–30 倍性能背后到底发生了什么?
编程
Rolldown 1.0 深度实战:当 Vite 用 Rust 重写打包器,10–30 倍性能背后到底发生了什么?
2026-07-11 00:44:38 +0800 CST
view 183
2026年6月 Rolldown 1.0 正式发布,作为 Vite 8 默认打包器比 Rollup 快 10-30 倍。本文从架构、代码、性能三维度深度拆解:双引擎原罪、OXC 并行解析、bitset 可达性 tree-shaking、智能分块,配可运行实战与迁移指南。
Rolldown
Vite 8
Rust
前端工程化
打包器
构建工具
OXC
Rollup
性能优化
Tree Shaking
LMCache 实战:大模型推理的 KV Cache 终极优化方案
编程
LMCache 实战:大模型推理的 KV Cache 终极优化方案
2026-07-23 08:44:51 +0800 CST
view 99
LMCache 实战指南:通过智能 KV Cache 管理,实现 LLM 推理吞吐量最高 10 倍提升,显存占用降低 40%-60%。包含 vLLM/TGI 集成、分布式缓存、性能调优最佳实践。
LMCache
KV Cache
LLM推理优化
vLLM
RAG性能优化
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
2026-07-17 10:43:43 +0800 CST
view 265
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议原生支持、RAG ETL Pipeline、Micrometer 可观测性,配完整生产级代码实战。2026年Java开发者AI集成的终极指南。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
Spring Framework
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
2026-07-17 10:44:29 +0800 CST
view 195
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议支持、RAG ETL Pipeline,配完整生产级代码实战。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
编程
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
2026-07-23 11:45:35 +0800 CST
view 103
深度解析纯 Rust WebGPU 推理引擎 shimmy v2.3.0:GGUF 原生加载、OpenAI API 兼容、KV Cache 量化、Flash Attention 等效实现,配 Tauri 桌面应用集成实战与性能基准测试。
shimmy
WebGPU
Rust
GGUF
LLM
llama.cpp
推理引擎
WebAssembly
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
编程
MCP 2026 深度解析:AI推理性能瓶颈诊断的12个隐性耗时陷阱——从TensorRT-LLM到vLLM再到Triton的全引擎实战
2026-04-30 14:21:13 +0800 CST
view 577
深度解析MCP 2026基准测试框架,拆解TensorRT-LLM、vLLM、Triton三大推理引擎的12个隐性耗时陷阱,提供可落地的诊断方法与修复路径。
AI推理
性能优化
TensorRT-LLM
vLLM
Triton
MCP2026
GPU优化
2026 大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——从架构原理到生产级部署的完全指南
编程
2026 大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——从架构原理到生产级部署的完全指南
2026-06-16 23:24:43 +0800 CST
view 291
深度对比四大主流LLM推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9。从PagedAttention架构原理、FlashAttention优化、量化支持到生产级部署实战,包含统一环境下的性能测试数据与代码示例,帮助你做出最优选型决策。
LLM
推理框架
vLLM
TensorRT
DeepSpeed
性能优化
AI
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 2038
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
编程
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
2026-06-22 19:28:19 +0800 CST
view 369
深入解析 AirLLM 的无量化层间 Offloading 技术原理,探讨如何通过 CPU-GPU 混合推理在 4GB 显存上运行 70B 大模型,附完整代码实战与生产部署指南。
LLM推理
GPU优化
CPU Offload
层间调度
AirLLM
PyTorch
2026大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——谁才是生产级部署的真正王者?
编程
2026大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——谁才是生产级部署的真正王者?
2026-06-23 08:22:26 +0800 CST
view 435
深度对比2026年四大主流大模型推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,从核心架构、性能压测、成本分析到代码实战的完全指南。
vLLM
TensorRT-LLM
大模型推理
性能优化
DeepSpeed
TGI
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
编程
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
2026-05-12 01:44:53 +0800 CST
view 627
深度解析Nushell 0.111核心架构:结构化数据管道替代POSIX字符串流、IR优化器实现管道融合与谓词下推带来3-10倍性能提升、栈式虚拟机执行器保证类型安全与即时错误反馈,附DevOps实战、插件开发与渐进迁移指南
Nushell,Shell,Rust,命令行,结构化数据,数据管道,终端工具,DevOps,CLI,编程工具
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 201
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 435
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 270
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 563
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1174
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
编程
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
2026-07-02 13:46:08 +0800 CST
view 298
深度解析 LMCache 开源 KV Cache 管理层项目:从三层存储架构、多后端支持、Disaggregated Prefill、CacheBlend、Segmented Prefill、P2P 共享到 Kubernetes 生产级部署的完整技术指南,含性能基准测试与代码实战
LMCache
KV Cache
LLM
vLLM
分布式
RDMA
Kubernetes
推理优化
Redis
NIXL
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
案例
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
2026-05-06 07:35:19 +0800 CST
view 625
25K+Star的LLMFit一键检测你的电脑能跑哪些大模型,Rust编写支持NVIDIA/AMD/Intel/Apple Silicon,智能量化推荐Q8到Q2,四维评分系统,TUI+CLI双模式
LLM部署
硬件检测
量化推荐
Rust
终端工具
本地部署
Ollama
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
49
50
51
52
53
...
84
下一页