程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
1.6万亿参数,1M上下文,仅需27%算力:DeepSeek-V4-Pro 如何重新定义长文本推理
编程
1.6万亿参数,1M上下文,仅需27%算力:DeepSeek-V4-Pro 如何重新定义长文本推理
2026-05-11 10:53:54 +0800 CST
view 761
DeepSeek-V4-Pro 以 1.6T 总参数、49B 激活参数的 MoE 架构,原生支持 100 万 token 上下文,同时将推理算力降至 V3.2 的 27%、KV Cache 降至 10%。本文深度解析 CSA/HCA 混合注意力机制、mHC 流形约束超连接、KV Cache 极致优化、Muon 优化器等核心技术创新,以及如何在 Ollama、vLLM、官方 API 三种方式下部署运行。
DeepSeek-V4,MoE架构,CSA注意力,HCA注意力,KV Cache,1M上下文,长文本推理,开源大模型
Hermes Agent 深度解析:自进化智能体的工程架构与 Skill 生成机制
编程
Hermes Agent 深度解析:自进化智能体的工程架构与 Skill 生成机制
2026-04-12 05:23:08 +0800 CST
view 1574
深入解析 Hermes Agent 的自进化智能体架构:从 Skill 自动生成引擎、三层记忆系统、Tool Router 到 Platform Bridge,源码级别剖析 + 代码示例,对比 OpenClaw
AI Agent
Hermes Agent
Nous Research
自进化
智能体
Skill生成
Memory Hub
Tool Router
Qwen3.8-Max 深度拆解:当阿里决定「把 2.4 万亿参数的 Max 模型开源」——从 MoE 架构到 16 天自主编程,一个首次开源的旗舰大模型如何用「激活 95B 跑出 2.4T 效果」重新定义开源模型的终极形态
编程
Qwen3.8-Max 深度拆解:当阿里决定「把 2.4 万亿参数的 Max 模型开源」——从 MoE 架构到 16 天自主编程,一个首次开源的旗舰大模型如何用「激活 95B 跑出 2.4T 效果」重新定义开源模型的终极形态
2026-08-05 18:47:19 +0800 CST
view 189
深度拆解阿里Qwen3.8-Max:2.4万亿参数MoE旗舰,首次开源Max级权重,100万token上下文,16天自主编程oh-my-cli项目,Gated DeltaNet混合注意力架构,Arena全球第二,Apache 2.0完全可商用
Qwen3.8
Qwen
阿里
大模型
MoE
开源
人工智能
Apache 2.0
自主编程
oh-my-cli
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
编程
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
2026-07-01 03:42:17 +0800 CST
view 343
2026年6月百度开源Unlimited OCR,5天GitHub Star破万。深度解析R-SWA注意力机制、MoE架构、16倍视觉Token压缩,以及为何能将KV Cache从线性增长压成常数。
Unlimited OCR
OCR
R-SWA
MoE
百度
深度学习
计算机视觉
文档识别
KV Cache
从 KVCache 到 AI SSD:存储如何成为大模型推理的「第三层」
编程
从 KVCache 到 AI SSD:存储如何成为大模型推理的「第三层」
2026-08-14 13:16:01 +0800 CST
view 87
深度拆解 NVIDIA G3.5 与 CMX、Mooncake KVCache 分离式架构、AI SSD 三大技术路线(英韧 N3X、群联 aiDAPTIV、江波龙 SPU、寅谱-联芸),从 Prefill/Decode 数据路径到生产部署踩坑清单,配完整代码实战与 15 条生产级建议。
AI存储
KVCache
G3.5
CMX
Mooncake
NVIDIA
推理优化
SSD
NVMe
CXL
存储架构
AI基础设施
AI 推理的「存储升维」:NVIDIA G3.5 层、Mooncake 与四大 AI SSD 路线深度对比(2026)
编程
AI 推理的「存储升维」:NVIDIA G3.5 层、Mooncake 与四大 AI SSD 路线深度对比(2026)
2026-08-14 13:16:52 +0800 CST
view 226
深度拆解 NVIDIA G3.5 与 CMX、Mooncake KVCache 分离式架构、AI SSD 四大技术路线(英韧/群联/江波龙/寅谱联芸),从 Prefill/Decode 数据路径到生产部署踩坑清单。
AI存储
KVCache
G3.5
CMX
Mooncake
NVIDIA
推理优化
SSD
NVMe
CXL
存储架构
AI基础设施
Token经济学重写存储格局:NVIDIA CMX/Mooncake 引领推理数据路径革命(2026实战)
编程
Token经济学重写存储格局:NVIDIA CMX/Mooncake 引领推理数据路径革命(2026实战)
2026-08-14 13:17:12 +0800 CST
view 118
从 Prefill/Decode 数据路径到生产部署,深度拆解 NVIDIA CMX G3.5 层、Mooncake KVCache 分离式架构与四大 AI SSD 路线。
AI存储
KVCache
CMX
Mooncake
NVIDIA
推理优化
SSD
NVMe
CXL
存储架构
AI基础设施
Redis 8.x AI 原生深度拆解:从缓存到 AI 实时数据基础设施——向量搜索、语义缓存、Agent Memory 工程实战
编程
Redis 8.x AI 原生深度拆解:从缓存到 AI 实时数据基础设施——向量搜索、语义缓存、Agent Memory 工程实战
2026-07-30 22:43:18 +0800 CST
view 230
深度拆解 Redis 8.x 的 AI 原生能力:Vector Sets 原生向量数据类型、HNSW/SVS-VAMANA 向量索引、LangCache 语义缓存、Agent Memory 智能体记忆层、完整 RAG Pipeline 实战,以及生产部署架构决策与渐进式采纳路线。万字长文,代码实战。
Redis
AI原生
向量搜索
语义缓存
Agent Memory
RAG
Spring AI
Vector Sets
HNSW
LangCache
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
编程
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
2026-07-02 18:16:20 +0800 CST
view 635
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,将 KV Cache 从线性增长压至常数级;3B MoE 解码器架构、DeepEncoder 视觉编码器;完整本地部署代码、KV Cache 监控脚本与 SGLang 生产推理优化指南。OmniDocBench v1.6 综合得分 93.92%,端到端 OCR 新 SOTA。
OCR
R-SWA
KV Cache
MoE
百度
长文档解析
Transformer
深度学习
Python
性能优化
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
编程
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
2026-06-27 09:15:20 +0800 CST
view 248
百度开源 Unlimited OCR,5天 GitHub Star 破万。本文深度解析其核心创新 R-SWA(Reference Sliding Window Attention),如何将解码器 KV Cache 从线性增长压成常数,OmniDocBench v1.6 刷榜 SOTA(93.92%),30B 总参/5B 激活,32K 超长上下文,一次前向全稿转录,附完整代码实战。
Unlimited OCR
R-SWA
KV Cache
MoE
端到端 OCR
百度
深度学习
Transformer
文档识别
OCR
TypeScript 7.0 深度拆解:当微软用 Go 语言重写 14 年老编译器,一次编译提速 10 倍背后的工程方法论
编程
TypeScript 7.0 深度拆解:当微软用 Go 语言重写 14 年老编译器,一次编译提速 10 倍背后的工程方法论
2026-07-15 07:43:20 +0800 CST
view 213
深度解析 TypeScript 7.0 用 Go 重写编译器的技术原理:并行类型检查、worker pool 架构、破坏性变更、升级路径与工程意义,附完整代码示例与性能调优实战
TypeScript 7.0
TypeScript Go重写
Go编译器
TypeScript性能优化
前端工具链
monorepo
typecheck
Elastic 9.5 深度拆解:当搜索引擎主动删掉倒排索引——Columnar Mode、ES95 编解码器与「3 字节/采样点」的存储战争
编程
Elastic 9.5 深度拆解:当搜索引擎主动删掉倒排索引——Columnar Mode、ES95 编解码器与「3 字节/采样点」的存储战争
2026-08-11 03:18:13 +0800 CST
view 98
Elastic 9.5 深度拆解:Columnar Mode 为何默认不建倒排索引、index sorting 为何成为硬性前置条件,ES95 编解码器 3 字节/采样点的真实含义,VectorDB 索引模式与 DiskBBQ 自动校准,ES|QL Fast Mode 的采样统计学陷阱。含完整 mapping、Python 压测脚本、Go 查询路由封装、reindex 迁移 SOP 与十二条踩坑清单。
Elasticsearch
Elastic 9.5
Columnar Mode
列式存储
倒排索引
logsdb
ES
QL
Prometheus
PromQL
向量数据库
DiskBBQ
存储优化
可观测性
数据库
DeepSeek V4 架构全拆解:MLA 压缩、MoE 动态路由与 1.6T 参数的工程哲学——从训练到推理的全栈重构
编程
DeepSeek V4 架构全拆解:MLA 压缩、MoE 动态路由与 1.6T 参数的工程哲学——从训练到推理的全栈重构
2026-08-03 00:13:26 +0800 CST
view 233
深度拆解 DeepSeek V4 四大核心架构创新:MLA 16x KV Cache 压缩、MoE-Routing v2 Token级动态路由、HAAA混合注意力、antirez ds4.c推理引擎,附完整代码示例与生产部署指南
DeepSeek
MoE
MLA
KV Cache
大模型
AI推理
开源
性能优化
混合注意力
量化
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
编程
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
2026-06-28 14:13:06 +0800 CST
view 496
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,如何将 KV Cache 从线性增长压到常数,使长文档 OCR 性能恒定不衰减。含完整架构分析、训练配方、性能基准和实战代码。
Unlimited OCR
R-SWA
OCR
端到端
百度
文档识别
KV Cache
MoE
DeepEncoder
长文档处理
Google Gemma 4 深度解析:当开源AI进入「逐层嵌入平行化」时代
编程
Google Gemma 4 深度解析:当开源AI进入「逐层嵌入平行化」时代
2026-04-09 04:54:56 +0800 CST
view 1092
Google于2026年4月发布Gemma 4开源模型系列,首次全面切换Apache 2.0许可证,搭载Per-Layer Embedding架构创新,26B MoE以3.8B激活参数击败Qwen3-235B。本文深度解析PLE架构、稀疏激活机制与全规格产品矩阵。
Gemma 4
Google
开源模型
Apache 2.0
MoE
Per-Layer Embedding
Hermes Agent 深度拆解:当 Nous Research 决定「干掉所有无状态 Agent」——110K Star 的自进化智能体如何用闭环学习重新定义 AI Agent 的终极形态
编程
Hermes Agent 深度拆解:当 Nous Research 决定「干掉所有无状态 Agent」——110K Star 的自进化智能体如何用闭环学习重新定义 AI Agent 的终极形态
2026-08-04 07:42:23 +0800 CST
view 204
深度拆解 Nous Research 出品的 110K Star 自进化 AI Agent 框架:闭环学习系统、技能自动生成与优化、SQLite FTS5 跨会话记忆、Honcho 用户建模、Atropos RL 强化学习训练环境,附完整代码示例与架构对比分析
Hermes Agent
Nous Research
AI Agent
自进化
闭环学习
Python Agent
开源
MIT
Atropos
Honcho
LLM 推理服务引擎深度拆解:从 PagedAttention 到 PD 分离,把 GPU 榨干的七层优化栈
编程
LLM 推理服务引擎深度拆解:从 PagedAttention 到 PD 分离,把 GPU 榨干的七层优化栈
2026-07-30 21:49:19 +0800 CST
view 180
深度拆解 LLM 推理服务的七层优化栈:PagedAttention 分页显存与写时复制、连续批处理消灭队头阻塞、前缀缓存命中率实操、Chunked Prefill 与 PD 分离决策、KV Cache 分层复用的拉取/重算临界点、投机解码加速比数学与失效场景、量化与并行选型。附大量可运行代码、压测骨架、调优顺序与七个常见误区。
LLM推理
vLLM
SGLang
PagedAttention
PD分离
KV Cache
前缀缓存
投机解码
Chunked Prefill
性能优化
Hermes Agent 深度实战:当AI智能体学会越用越聪明——从E-A-A-S闭环到生产级自进化系统的2026完全指南
编程
Hermes Agent 深度实战:当AI智能体学会越用越聪明——从E-A-A-S闭环到生产级自进化系统的2026完全指南
2026-06-26 00:43:59 +0800 CST
view 352
2026年2月Nous Research开源的Hermes Agent以惊人的速度席卷全球。本文深度解析其E-A-A-S闭环自进化系统、三层记忆架构、Tool Search机制,并提供完整的代码实战和生产部署指南。
Hermes Agent
自进化AI
E-A-A-S闭环
三层记忆架构
Tool Search
Nous Research
AI Agent框架
Token优化
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
编程
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
2026-07-07 16:15:25 +0800 CST
view 194
深入解析2026年大模型推理中的KV Cache优化技术栈:从PagedAttention虚拟分页管理、Prefix Caching缓存复用、Speculative Decoding并行验证,到INT8量化与Continuous Batching生产实践,配合代码示例与性能对比,助你系统性掌握LLM推理优化的核心要领。
LLM
KV Cache
PagedAttention
Prefix Caching
vLLM
推理优化
Speculative Decoding
C++26 反射系统深度拆解:当这门语言终于拥有「自省」能力——从元对象协议到十年火箭引擎的全链路实战
编程
C++26 反射系统深度拆解:当这门语言终于拥有「自省」能力——从元对象协议到十年火箭引擎的全链路实战
2026-08-12 15:23:32 +0800 CST
view 134
深度拆解 C++26 反射系统:从元对象协议(MOP)、std::meta::info 命名空间、属性系统,到编译期序列化框架、DI容器、对象转储器的全链路实战,含15条生产踩坑清单
C++26
反射
reflection
元对象协议
MOP
编译期
序列化
DI容器
std::meta
Herb Sutter
codebase-memory-mcp 深度实战:当 C 语言把代码库变成知识图谱——从 Tree-sitter AST 到 Hybrid LSP 类型推导、从 11 信号语义搜索到 Cypher 图查询的 AI 编程生产级完全指南(2026)
编程
codebase-memory-mcp 深度实战:当 C 语言把代码库变成知识图谱——从 Tree-sitter AST 到 Hybrid LSP 类型推导、从 11 信号语义搜索到 Cypher 图查询的 AI 编程生产级完全指南(2026)
2026-06-22 11:27:33 +0800 CST
view 996
深度拆解codebase-memory-mcp:纯C语言的代码知识图谱MCP服务器,Tree-sitter 158语言解析、Hybrid LSP类型推导、11信号语义搜索、Cypher图查询、死代码检测、Git diff影响分析,11个AI Agent一键集成
codebase-memory-mcp
MCP
Tree-sitter
知识图谱
AI编程
C语言
LSP
语义搜索
Cypher
代码智能
AI Agent 记忆革命:codebase-memory-mcp 持久化知识图谱与 Hermes Agent 三层记忆架构深度解析
编程
AI Agent 记忆革命:codebase-memory-mcp 持久化知识图谱与 Hermes Agent 三层记忆架构深度解析
2026-07-25 10:45:16 +0800 CST
view 271
深度解析 codebase-memory-mcp 的纯 C 知识图谱引擎与 Hermes Agent 的三层记忆架构,探讨 AI Agent 持久化记忆的技术实现路线与工程实践
AI Agent
MCP
Hermes Agent
codebase-memory-mcp
记忆系统
知识图谱
持久化
自主编码
OpenDuck 深度拆解:把 MotherDuck 开源化——DuckDB「差分存储 + 混合执行」云边协同架构与自托管实战
编程
OpenDuck 深度拆解:把 MotherDuck 开源化——DuckDB「差分存储 + 混合执行」云边协同架构与自托管实战
2026-07-31 05:44:28 +0800 CST
view 171
深度拆解开源项目 OpenDuck:把 MotherDuck 验证过的差分存储、混合执行、ATTACH 原生体验拆成可自托管开源形态。含 catalog 级集成原理、四大构件源码边界、plan splitting 与 bridge operator 数据流、完整 PoC 实战、自定义后端协议实现与生产化清单。
OpenDuck
DuckDB
MotherDuck
差分存储
混合执行
数据库
云原生
开源
Arrow
数据分析
Headroom 深度实战:AI Agent 的上下文压缩革命——60%~95% Token 节省背后的架构原理与生产级实战
编程
Headroom 深度实战:AI Agent 的上下文压缩革命——60%~95% Token 节省背后的架构原理与生产级实战
2026-06-28 10:14:20 +0800 CST
view 642
深度解析 GitHub Trending 项目 Headroom:AI Agent 上下文压缩引擎的架构原理、6 种算法、60-95% Token 节省实战,涵盖 Rust 高性能核心、CCR 可逆压缩、MCP 服务器与生产级部署指南。
Headroom
AI Agent
上下文压缩
Token优化
Claude Code
Cursor
AI编程
Rust
Python
MCP
RAG
LLMOps
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
...
37
下一页