程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Khazix Skills 深度解析:当「数字生命卡兹克」把压箱底的 AI Skills 一字不改开源出来
编程
Khazix Skills 深度解析:当「数字生命卡兹克」把压箱底的 AI Skills 一字不改开源出来
2026-04-10 00:44:17 +0800 CST
view 2377
数字生命卡兹克开源的 AI Skills 合集,支持 Claude Code、OpenClaw、Codex 三大平台,包含写作、代码、研究等核心 Skill,实用主义风格,真实生产环境验证。
AI Skills
Khazix
数字生命卡兹克
Agent Skills
开源
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16 +0800 CST
view 226
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
2026-07-17 10:43:43 +0800 CST
view 386
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议原生支持、RAG ETL Pipeline、Micrometer 可观测性,配完整生产级代码实战。2026年Java开发者AI集成的终极指南。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
Spring Framework
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
2026-07-17 10:44:29 +0800 CST
view 292
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议支持、RAG ETL Pipeline,配完整生产级代码实战。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
编程
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
2026-07-23 11:45:35 +0800 CST
view 216
深度解析纯 Rust WebGPU 推理引擎 shimmy v2.3.0:GGUF 原生加载、OpenAI API 兼容、KV Cache 量化、Flash Attention 等效实现,配 Tauri 桌面应用集成实战与性能基准测试。
shimmy
WebGPU
Rust
GGUF
LLM
llama.cpp
推理引擎
WebAssembly
AI 编程助手瘫痪了吗?Karpathy Skills 与 CLAUDE.md 如何用数学约束驯服 LLM 的混乱天性——从四大失败模式到生产级行为规则的完全指南
编程
AI 编程助手瘫痪了吗?Karpathy Skills 与 CLAUDE.md 如何用数学约束驯服 LLM 的混乱天性——从四大失败模式到生产级行为规则的完全指南
2026-05-23 00:46:41 +0800 CST
view 609
深度剖析 AI 编码代理的四大核心失败模式(静默假设、过度工程、范围蔓延、缺乏验证),介绍 Karpathy Skills 项目如何用行为约束体系替代模糊提示,以及如何使用 CLAUDE.md 构建可维护的 AI 辅助开发流程。
AI编程
LLM
Karpathy Skills
CLAUDE.md
行为约束
提示工程
Meta Muse Glimmer 深度拆解:300亿参数端侧Agent模型的工程革命——从知识蒸馏到4bit量化的完整实战指南(2026)
编程
Meta Muse Glimmer 深度拆解:300亿参数端侧Agent模型的工程革命——从知识蒸馏到4bit量化的完整实战指南(2026)
2026-08-13 18:49:00 +0800 CST
view 67
深度拆解Meta 2026年8月发布的Muse Glimmer:300亿参数开放权重Dense模型,4bit量化可在单张RTX 3090/4090上本地运行。涵盖架构设计、知识蒸馏、量化原理、本地部署实战与性能基准测试。
Muse Glimmer
端侧AI
知识蒸馏
4bit量化
Agent本地部署
300亿参数
Meta
Apache 2.0
llama.cpp
Ollama
Muse Glimmer 端侧Agent革命:300亿参数模型如何在消费级GPU上跑出生产级性能(2026实战)
编程
Muse Glimmer 端侧Agent革命:300亿参数模型如何在消费级GPU上跑出生产级性能(2026实战)
2026-08-13 18:50:11 +0800 CST
view 78
深度拆解Meta 2026年8月发布的Muse Glimmer:300亿参数开放权重Dense模型,4bit量化可在单张RTX 3090/4090上本地运行。涵盖架构设计、知识蒸馏、量化原理、本地部署实战与性能基准测试。
Muse Glimmer
端侧AI
知识蒸馏
4bit量化
Agent本地部署
300亿参数
Meta
Apache 2.0
llama.cpp
Ollama
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 2227
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
编程
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
2026-06-22 19:28:19 +0800 CST
view 491
深入解析 AirLLM 的无量化层间 Offloading 技术原理,探讨如何通过 CPU-GPU 混合推理在 4GB 显存上运行 70B 大模型,附完整代码实战与生产部署指南。
LLM推理
GPU优化
CPU Offload
层间调度
AirLLM
PyTorch
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
编程
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
2026-08-14 09:44:53 +0800 CST
view 84
深度拆解Meta开源的Muse Glimmer 30B端侧Agent模型:从稠密Transformer架构、1.8B ViT-G/14视觉编码器,到4-bit GGUF量化、DFlash推测性解码,再到Ollama一键部署、配完整代码实战与15条生产踩坑清单
Muse Glimmer
Meta
Agent模型
本地AI
开源LLM
量化部署
Function Calling
多模态
SkillOpt 深度拆解:当微软决定「像训练神经网络一样训练 Skill」——从轨迹驱动优化到文本空间搜索,一个 3.1K Star 的框架如何用「不改权重只改文档」重新定义 Agent 技能优化的终极形态
编程
SkillOpt 深度拆解:当微软决定「像训练神经网络一样训练 Skill」——从轨迹驱动优化到文本空间搜索,一个 3.1K Star 的框架如何用「不改权重只改文档」重新定义 Agent 技能优化的终极形态
2026-08-05 21:49:06 +0800 CST
view 141
深度拆解微软开源的SkillOpt框架:用训练神经网络的方法论优化Agent技能文档,不改权重只改Markdown,52个评测组合全部最优,准确率提升20%+
SkillOpt
微软
AI Agent
技能优化
LLM
Prompt工程
强化学习
轨迹优化
文本空间搜索
开源
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
编程
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
2026-04-21 11:04:25 +0800 CST
view 804
fireworks-tech-graph:10天3800星的Claude Code Skill,用自然语言生成7种风格的技术图表,支持RAG、Mem0、多Agent等架构图,Mermaid画不出来的它能补位
Claude Code
Skill
AI画图
图表生成
Claude Code Skills
技术图
架构图
Mermaid
开源
GitHub
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
编程
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
2026-08-15 09:44:41 +0800 CST
view 40
深度拆解 AirLLM 分层推理架构:8GB 显存跑 405B 大模型的时间换空间哲学,从 mmap 权重映射、单层计算流水线到完整 Python 实战与 15 条生产级优化建议。
AirLLM
大模型推理
显存优化
LLM
内存推理
Python
性能优化
GPU
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 937
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
推测解码深度实战:用「小模型猜、大模型验」的并行推理让 LLM 吞吐量翻倍(2026 生产指南)
编程
推测解码深度实战:用「小模型猜、大模型验」的并行推理让 LLM 吞吐量翻倍(2026 生产指南)
2026-08-15 11:15:10 +0800 CST
view 52
深度拆解推测解码技术原理与生产实战:从拒绝采样数学原理到 vLLM 实现架构,配完整 Python 代码与性能基准测试,实现 2-2.5x 无损吞吐量提升
推测解码
Speculative Decoding
LLM推理
vLLM
性能优化
GPU加速
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
编程
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
2026-07-02 05:42:52 +0800 CST
view 459
2026年LLM应用可观测性完整指南:深度解析Langfuse架构、Tracing系统、ClickHouse存储、SDK集成、生产部署与性能优化,15+可运行代码示例
Langfuse
LLM
可观测性
Tracing
AI Engineering
LLM Ops
ClickHouse
Prompt Management
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 289
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 538
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 387
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 735
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
编程
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
2026-07-31 15:20:39 +0800 CST
view 250
深度拆解 Claude Opus 5 发布:从 Frontier-Bench 性能翻倍到 ARC-AGI 3 三倍碾压,从定价策略重塑到 Claude Code 系统提示词削减 80% 的工程革命,以及 AI Coding 从 Tools 到 Skills 的范式跃迁。
Claude Opus 5
Anthropic
AI编程
LLM
AI Agent
Skills
Frontier-Bench
ARC-AGI
定价策略
Claude Code
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1343
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
编程
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
2026-07-26 04:13:40 +0800 CST
view 212
深度拆解 Linux io_uring:SQ/CQ 环形队列内存模型、SQE/CQE 生命周期、liburing 文件读写与 echo 服务器实战、SQPOLL/注册缓冲区/链式操作/multishot/零拷贝发送进阶特性,并剖析为何性能炸裂却被 Google 在 ChromeOS/Android/GKE 全线封禁,附内核 6.6 安全加固与生产决策清单。
io_uring
Linux内核
异步IO
高性能
SQPOLL
零拷贝
epoll
网络编程
系统编程
安全
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
53
54
55
56
57
...
90
下一页