程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
编程
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
2026-07-21 08:20:26 +0800 CST
view 155
华为联合清华大学开源的 XY-Serve 论文被 ASPLOS 2026 录用,解决了 NPU 上高效运行动态 LLM 负载的核心挑战。吞吐量提升95%,Attention 内核提速21.5%,Linear 内核提速14.6%。
XY-Serve
华为昇腾
NPU
LLM推理
Meta-Attention
虚拟填充
动态负载
ASPLOS
AI基础设施
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
编程
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
2026-04-15 17:20:25 +0800 CST
view 738
深度解析中科院与腾讯微信联合研发的 FlashPrefill 如何通过即时注意力模式发现和动态阈值筛选,将 25.6 万字符长文本处理速度提升 27.78 倍,同时保持近乎完美的精度。
LLM推理优化
FlashAttention
GPU计算
长文本处理
注意力机制
Transformer
深度学习
Hermes Agent 深度拆解:三层记忆架构 × 五阶段学习闭环 × 八种执行后端,一个自进化 AI Agent 的工程化全景
编程
Hermes Agent 深度拆解:三层记忆架构 × 五阶段学习闭环 × 八种执行后端,一个自进化 AI Agent 的工程化全景
2026-08-01 10:15:57 +0800 CST
view 57
深度拆解 Hermes Agent 自进化 AI 框架:三层记忆架构(L1/L2/L3)、五阶段学习闭环、GEPA 自省引擎、八种执行后端、六种消息平台。从认知科学映射到工程实践,附完整部署指南与踩坑清单。
Hermes Agent
AI Agent
记忆系统
自进化
Nous Research
LLM
技能系统
学习闭环
分布式
工程实践
Llama 4 MoE 架构深度解析:从混合专家到万亿参数的技术革命
编程
Llama 4 MoE 架构深度解析:从混合专家到万亿参数的技术革命
2026-05-28 16:37:41 +0800 CST
view 372
深入解析 Meta Llama 4 的 MoE 混合专家架构原理,探讨其如何以 17B 激活参数撬动万亿级算力,并提供完整的本地部署实战指南。
Llama4
MoE
混合专家
开源大模型
本地部署
Meta
人工智能
深度学习
OpenTelemetry 深度实战:从 SDK 埋点、W3C 上下文传播到 Collector 流水线、尾部采样与全链路关联的工程全解(2026)
编程
OpenTelemetry 深度实战:从 SDK 埋点、W3C 上下文传播到 Collector 流水线、尾部采样与全链路关联的工程全解(2026)
2026-07-22 04:44:03 +0800 CST
view 160
OpenTelemetry 深度实战:从 SDK 手动埋点、W3C 上下文传播到 Collector 流水线、尾部采样与全链路关联,配 Go/Python 代码与生产级 Collector 配置,覆盖采样策略与基数控制等性能优化。
OpenTelemetry
可观测性
分布式追踪
OTLP
Collector
W3C
尾部采样
OpenTelemetry 深度实战:从三大信号模型、Collector 管线、W3C 上下文传播到尾部采样与 eBPF 无侵入埋点的生产级可观测性完全指南(2026)
编程
OpenTelemetry 深度实战:从三大信号模型、Collector 管线、W3C 上下文传播到尾部采样与 eBPF 无侵入埋点的生产级可观测性完全指南(2026)
2026-07-09 05:43:14 +0800 CST
view 332
从原理到落地的 OpenTelemetry 长文:讲清 traces/metrics/logs 三大信号模型、OTLP 协议、Collector 接收-处理-导出管线,手写 Go/Python 埋点与跨进程 W3C Trace Context 传播,配置尾部采样与 eBPF 零代码埋点,并给出采样、批处理、基数的生产级性能优化清单。
OpenTelemetry
可观测性
分布式追踪
Collector
eBPF
Zig 0.16 深度实战:无隐式控制流、comptime与显式内存管理如何重写系统编程范式——从 Kimi K2.6 的 13 倍推理加速说起
编程
Zig 0.16 深度实战:无隐式控制流、comptime与显式内存管理如何重写系统编程范式——从 Kimi K2.6 的 13 倍推理加速说起
2026-06-28 07:44:27 +0800 CST
view 321
从 Kimi K2.6 用 Zig 实现 13 倍 LLM 推理加速的真实案例出发,深度解析 Zig 0.16 的核心特性:无隐式控制流、comptime 编译期计算、显式内存管理、与 C 的无缝互操作,并通过完整的 HTTP 服务器和矩阵乘法优化示例展示 Zig 在高性能场景下的实践。
Zig
系统编程
内存管理
comptime
性能优化
LLM推理
Kimi K2.6
记忆宫殿走进AI时代:Milla Jovovich 开源的 MemPalace 如何让 AI 拥有真正的长期记忆
编程
记忆宫殿走进AI时代:Milla Jovovich 开源的 MemPalace 如何让 AI 拥有真正的长期记忆
2026-04-17 19:14:38 +0800 CST
view 699
好莱坞女星Milla Jovovich参与开源的AI记忆系统MemPalace深度解析:四层记忆栈架构、Drawer抽象机制、与Graphify/Claude-Mem的深度对比,以及完整的集成实战教程。
AI记忆系统
MemPalace
长期记忆
开源项目
Milla Jovovich
AI Agent
记忆宫殿
MCP协议
四层记忆栈 + Drawer 抽象:深度解析 Milla Jovovich 开源的 MemPalace AI 记忆系统
编程
四层记忆栈 + Drawer 抽象:深度解析 Milla Jovovich 开源的 MemPalace AI 记忆系统
2026-04-17 19:14:59 +0800 CST
view 706
深度解析Milla Jovovich参与开源的MemPalace AI长期记忆系统:四层记忆栈架构、Drawer统一抽象、与Graphify/Claude-Mem的核心差异对比及集成实战。
AI记忆系统
MemPalace
长期记忆
开源项目
Milla Jovovich
AI Agent
记忆宫殿
MCP协议
Rust 正在吞噬前端工具链:2026 年生态全景与深度架构解析
编程
Rust 正在吞噬前端工具链:2026 年生态全景与深度架构解析
2026-04-18 00:16:25 +0800 CST
view 877
深度解析 2026 年 Rust 在前端工具链的完整生态,涵盖 Rspack、Rolldown、Oxc、Biome 等核心工具,从架构原理到实战代码,从性能数据到迁移策略,10000字长文覆盖一切。
Rust
前端工具链
构建工具
Rspack
Rolldown
Oxc
Biome
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
编程
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
2026-06-15 21:20:49 +0800 CST
view 291
深入解析小米MiMo UltraSpeed如何通过SWA架构在通用GPU上突破1000 tokens/s推理速度,从O(n²)困境到极致跨越的完整技术指南。
SWA
Sliding Window Attention
LLM推理
小米MiMo
推理优化
Transformer
PagedAttention
量化推理
端侧AI
给 AI Agent 装上生产级可观测性:用 OpenTelemetry 把 LLM 工作流从黑盒变白盒
编程
给 AI Agent 装上生产级可观测性:用 OpenTelemetry 把 LLM 工作流从黑盒变白盒
2026-07-10 11:47:48 +0800 CST
view 247
深度解析2026年AI工程化最关键方向——AI Agent可观测性,涵盖OpenTelemetry LLM语义约定、MCP协议链路追踪、OpenLIT全链路平台,附生产级Go代码实现
AI Agent
OpenTelemetry
LLM
可观测性
生产级
Go
链路追踪
Token优化
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
编程
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
2026-06-02 09:36:52 +0800 CST
view 696
从vLLM到TensorRT-LLM,一次讲透vLLM、SGLang、TensorRT-LLM、llama.cpp四大LLM推理框架的架构哲学、核心原理、生产级部署实战与选型决策树。
LLM
vLLM
TensorRT-LLM
llama.cpp
SGLang
推理优化
GPU
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
编程
llmfit 深度拆解:一条命令算出你的电脑能跑哪些大模型——硬件感知适配引擎的工程解剖
2026-07-24 18:44:04 +0800 CST
view 146
深度拆解 GitHub Trending 开源工具 llmfit:四维评分系统、量化自动试探、MoE 精算、带宽速度模型、Plan 模式与 bench 众包校准,从第一性原理讲透本地大模型的硬件适配方法论。
llmfit
本地大模型
LLM
Rust
量化
Ollama
llama.cpp
Apple Silicon
硬件适配
开源
MemPalace 深度解析:当 AI 记忆系统终于学会「宫殿记忆法」
编程
MemPalace 深度解析:当 AI 记忆系统终于学会「宫殿记忆法」
2026-04-09 05:52:11 +0800 CST
view 1448
MemPalace 以 96.6% LongMemEval 召回率成为目前评分最高的 AI 记忆系统。本文深度解析其宫殿记忆法架构、四层记忆栈、AAAK 压缩方言,以及与 Claude Code 的集成方案。
AI
memory
vector-database
RAG
Claude
open-source
Hermes Agent 深度实战:自我进化的 AI Agent 架构与生产级实践——从 NousResearch 15万星项目中看 AI 编程伙伴的新范式
编程
Hermes Agent 深度实战:自我进化的 AI Agent 架构与生产级实践——从 NousResearch 15万星项目中看 AI 编程伙伴的新范式
2026-05-22 13:17:11 +0800 CST
view 687
深入解析 NousResearch 开源的 Hermes Agent(15.5万星)六层架构、三层记忆系统、Skills 七阶段进化闭环,包含完整源码解析和 8 种部署方案对比
AI Agent
Hermes Agent
NousResearch
自我进化
记忆系统
MemPalace 深度实战:当 AI Agent 遇见「记忆宫殿」——从本地优先架构到 96.6% 召回率的生产级完全指南(2026)
编程
MemPalace 深度实战:当 AI Agent 遇见「记忆宫殿」——从本地优先架构到 96.6% 召回率的生产级完全指南(2026)
2026-06-16 03:46:31 +0800 CST
view 374
MemPalace 深度实战:本地优先的 AI 记忆系统,96.6% R@5 召回率,33 个 MCP 工具,零 API Key,完全开源
AI Agent
记忆系统
MemPalace
本地优先
RAG
AI编程陷阱:METR研究揭示的残酷真相——为什么AI让资深开发者慢了19%
编程
AI编程陷阱:METR研究揭示的残酷真相——为什么AI让资深开发者慢了19%
2026-06-29 07:12:30 +0800 CST
view 285
METR研究发现AI让资深开发者慢了19%。本文深入分析理解债、上下文衰减等概念,揭示AI编程工具的真正能力边界和实用主义使用指南。
AI编程
METR研究
生产力
理解债
上下文衰减
ClickHouse 深度拆解:当关系型数据库学会「按列思考」——从 MergeTree 引擎、向量化执行到稀疏索引与生产级 OLAP 完全指南(2026)
编程
ClickHouse 深度拆解:当关系型数据库学会「按列思考」——从 MergeTree 引擎、向量化执行到稀疏索引与生产级 OLAP 完全指南(2026)
2026-07-17 02:44:42 +0800 CST
view 216
深度拆解 ClickHouse v25.8 LTS:从列存与向量化执行原理、MergeTree 引擎家族、稀疏主键索引、物理存储布局,到物化视图、跳数索引、Kafka 接入与 Python 实战、生产级性能优化完全指南。
ClickHouse
OLAP
列式存储
MergeTree
向量化执行
物化视图
数据分析
数据库
Wasmtime 47 默认启用 WASM GC 与异常:高阶语言进军 WebAssembly 的最后一道运行时枷锁被打破
编程
Wasmtime 47 默认启用 WASM GC 与异常:高阶语言进军 WebAssembly 的最后一道运行时枷锁被打破
2026-07-23 02:15:08 +0800 CST
view 173
Wasmtime 47 把 WASM GC 与异常处理默认开启,意味着 Java/Kotlin/Go/C# 等带对象模型的语言不再需要在 .wasm 里自带垃圾回收器。本文从提案原理、Cheney 半空间复制 GC 的线性内存实现、到 Rust 宿主实战与性能权衡,拆解这场 WebAssembly 运行时革命。
Wasmtime
WASM GC
WebAssembly
Rust
字节码联盟
Zig语言0.16.0深度解析:当「无隐藏魔法」遇上AI时代——从反投机哲学到未来50年的系统编程宣言
编程
Zig语言0.16.0深度解析:当「无隐藏魔法」遇上AI时代——从反投机哲学到未来50年的系统编程宣言
2026-06-10 09:50:08 +0800 CST
view 515
深度解析Zig语言0.16.0版本的重大更新,探讨Zig拒绝AI代码的设计哲学,以及comptime、显式错误处理等核心特性的实战应用。
Zig语言
系统编程
编程语言
0.16.0
AI编程
内存安全
comptime
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
编程
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
2026-07-05 02:43:03 +0800 CST
view 290
深入解析百度Unlimited OCR的核心技术:R-SWA注意力机制如何将KV Cache压成常数,DeepEncoder+MoE解码器架构,以及长文档OCR的完整解决方案。
OCR
百度
深度学习
Transformer
KV Cache
端到端
多模态
文档解析
Kronos 深度拆解:34K Star 的金融 K 线「大模型」,为什么说时间序列预测也迎来了自己的 GPT 时刻
编程
Kronos 深度拆解:34K Star 的金融 K 线「大模型」,为什么说时间序列预测也迎来了自己的 GPT 时刻
2026-07-28 06:43:51 +0800 CST
view 130
深度拆解 34K Star 的 AAAI 2026 开源项目 Kronos:首个金融 K 线基础模型,分层量化 Tokenizer + 自回归 Transformer 架构解析,附预测/批量推理/Qlib 微调 A 股实战与五条生产落地建议。
Kronos
时间序列
基础模型
量化交易
K线预测
Transformer
Qlib
金融AI
开源
深度学习
Kubernetes 1.36 深度拆解:当调度器学会「按拓扑思考」——DRA 全面收网、PodGroup 组调度与 User Namespace GA 的工程全貌
编程
Kubernetes 1.36 深度拆解:当调度器学会「按拓扑思考」——DRA 全面收网、PodGroup 组调度与 User Namespace GA 的工程全貌
2026-07-17 03:42:13 +0800 CST
view 220
深度拆解 Kubernetes 1.36(Haru):DRA 动态资源分配全面收网、PodGroup 组调度、拓扑感知调度 TAS、User Namespaces 与 Mutating Admission Policies GA,附完整 YAML 实战与生产性能优化。
Kubernetes 1.36
DRA
动态资源分配
PodGroup
User Namespaces
云原生
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
27
28
29
30
31
...
58
下一页