程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
DeepSeek V4 Flash 深度拆解:第一个为智能体而生的开源 MoE——从 2840 亿参数稀疏架构、百万上下文到 Agentic 工作流实战(2026)
编程
DeepSeek V4 Flash 深度拆解:第一个为智能体而生的开源 MoE——从 2840 亿参数稀疏架构、百万上下文到 Agentic 工作流实战(2026)
2026-07-20 01:43:13 +0800 CST
view 40
2026年OpenRouter开源F4之首DeepSeek V4 Flash深度拆解:MoE稀疏架构、百万上下文、FP8单卡部署与Agentic工具调用实战
DeepSeek
V4
MoE
开源大模型
AI智能体
vLLM
推理部署
EchoBird百灵鸟:2.2K Star开源AI桌面客户端,一个工具搞定所有AI Agent的安装配置与管理
编程
EchoBird百灵鸟:2.2K Star开源AI桌面客户端,一个工具搞定所有AI Agent的安装配置与管理
2026-06-18 08:34:13 +0800 CST
view 547
EchoBird(百灵鸟)是2200+ Star的开源AI桌面客户端,基于Tauri+Rust,图形界面一键安装管理12+ AI Agent工具(Claude Code/Codex/OpenClaw/Aider等),Model Nexus统一配置模型,内置llama.cpp/vLLM本地推理引擎,一键启动本地大模型。
EchoBird
AI桌面客户端
Agent管理
Tauri
Rust
开源
本地大模型
AI工具管理
百灵鸟
2026年端侧AI千亿参数突破深度解析:从量化技术到NPU架构,手机如何跑赢云端大模型
编程
2026年端侧AI千亿参数突破深度解析:从量化技术到NPU架构,手机如何跑赢云端大模型
2026-04-22 03:52:11 +0800 CST
view 662
深度解析2026年端侧AI千亿参数突破的技术原理:从INT4量化到MoE架构,从存算一体NPU到动态内存优化,揭示手机如何跑赢云端大模型的核心工程密码。
AI
端侧AI
大模型
量化
NPU
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
编程
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
2026-04-22 09:27:57 +0800 CST
view 664
DeepSeek官方推荐!SGLang高性能大模型推理框架速通指南,RadixAttention前缀缓存、零开销调度、OpenAI API兼容,性能碾压vLLM。
SGLang
大模型推理
DeepSeek
开源
vLLM
MoE架构深度实战:当模型参数突破万亿——从DeepSeek R2到GPT-5的稀疏激活革命(2026完全指南)
编程
MoE架构深度实战:当模型参数突破万亿——从DeepSeek R2到GPT-5的稀疏激活革命(2026完全指南)
2026-06-26 00:46:56 +0800 CST
view 190
2026年,大语言模型的参数量已经突破1.2万亿(DeepSeek R2),但推理时的计算量只相当于200亿参数的稠密模型。这背后的核心技术就是Mixture of Experts(MoE)架构。本文深度解析MoE的核心原理、工程实现、负载均衡策略,以及DeepSeek R2和GPT-5中的最新优化技巧。包含完整的PyTorch代码实战,从零实现MoE层。
MoE架构
混合专家
DeepSeek R2
稀疏激活
门控网络
负载均衡
大模型推理
细粒度MoE
共享专家
GPT-5
ds4.c 深度解析:Redis之父如何用纯C代码在MacBook上跑通284B大模型——从不对称量化到KV缓存磁盘化的完整技术内幕
编程
ds4.c 深度解析:Redis之父如何用纯C代码在MacBook上跑通284B大模型——从不对称量化到KV缓存磁盘化的完整技术内幕
2026-05-18 06:15:03 +0800 CST
view 607
Redis之父antirez开源ds4.c项目深度解析:用纯C语言在MacBook上运行284B参数大模型,不对称2-bit量化、KV缓存磁盘化、OpenAI/Anthropic API兼容,打造首个真正的本地Agent推理后端
AI推理
本地大模型
Redis
Apple Silicon
DeepSeek
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
编程
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
2026-07-13 15:14:42 +0800 CST
view 131
2026年7月Anthropic重磅论文解读:Claude内部自发涌现的J空间(雅可比空间)与人类全局工作空间高度相似,从神经科学理论到五大因果实验,从AI可解释性突破到安全范式革命,一次把大模型内部黑箱讲透。
Claude
Anthropic
J空间
全局工作空间
AI可解释性
AI安全
大模型
意识科学
Transformer
AGI
红队测试
LangGraph 深度实战:从状态机架构到生产级 Multi-Agent 编排的完整指南(2026)
编程
LangGraph 深度实战:从状态机架构到生产级 Multi-Agent 编排的完整指南(2026)
2026-06-04 18:45:17 +0800 CST
view 428
2026年最全面的LangGraph实战指南:从状态机架构原理到生产级Multi-Agent协作系统开发,包含完整代码示例与电商智能客服案例。
LangGraph
Multi-Agent
AI Agent
Python
大模型
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
编程
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
2026-07-07 10:14:22 +0800 CST
view 128
深度解析美团LongCat-2.0万亿参数MoE大模型:1.6T总参数/48B激活、LSA稀疏注意力实现1M原生上下文、N-gram Embedding 135B参数强化代码理解、MOPD三类专家动态调度、五万卡国产算力全流程训练。SWE-bench Pro 59.5超GPT-5.5,从架构原理到生产级实战的完整技术剖析。
LongCat-2.0
美团
MoE
大模型
国产算力
LSA
稀疏注意力
N-gram Embedding
MOPD
开源
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
编程
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
2026-06-18 17:54:54 +0800 CST
view 551
深度横评2026年四大主流大模型推理框架,涵盖PagedAttention架构、ContinuousBatching、算子融合、FP8量化、NVMe卸载等核心技术,配实测数据与生产级选型指南
大模型
LLM
推理框架
vLLM
TensorRT-LLM
TGI
DeepSpeed
GPU推理
AI部署
NVIDIA
GPT-5.6技术深度解析:Sol/Terra/Luna三档模型架构与实战对比
编程
GPT-5.6技术深度解析:Sol/Terra/Luna三档模型架构与实战对比
2026-07-02 06:14:06 +0800 CST
view 526
深入解析OpenAI最新发布的GPT-5.6系列模型,涵盖Sol/Terra/Luna三档架构设计、技术原理、实战应用与性能对比,为开发者提供全面的选型指南。
AI
GPT-5.6
大模型
OpenAI
人工智能
深度学习
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
编程
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
2026-07-02 06:43:56 +0800 CST
view 195
DeepSeek V4 技术架构深度解析:从 mHC 流形约束超连接、CSA/HCA 混合稀疏注意力、FP4 量化感知训练到 Muon 优化器,完整拆解 1.6T 开源模型如何用架构创新把 1M token 推理效率提升到 V3.2 的 10%。
DeepSeek V4
大模型架构
MoE
CSA/HCA 注意力
FP4 量化
mHC
AI 开源
长上下文
MiniMax M2.7 深度解析:当 AI 模型开始自己训练自己——从自我进化架构到软件工程能力全面评测
编程
MiniMax M2.7 深度解析:当 AI 模型开始自己训练自己——从自我进化架构到软件工程能力全面评测
2026-04-13 19:57:01 +0800 CST
view 1364
MiniMax M2.7 开源模型深度解析:自我进化架构、SWE-Pro 56.22% 软件工程能力、OpenRoom 多模态交互、本地部署方案与开源协议争议全面剖析。
AI
大模型
MiniMax
自我进化
开源
SWE-Pro
腾讯混元 Hy3 正式版深度解析:快慢思考融合的 MoE 架构与开发者实战指南
编程
腾讯混元 Hy3 正式版深度解析:快慢思考融合的 MoE 架构与开发者实战指南
2026-07-07 14:15:18 +0800 CST
view 312
深度解析腾讯混元 Hy3 正式版的技术架构,涵盖 MoE 混合专家、快慢思考融合机制、256K 上下文、Agent 能力等核心特性,并提供 API 调用与 SDK 集成的完整实战指南。
MoE架构
快慢思考
腾讯混元
Hy3
AI大模型
混合专家
Agent
开发者工具
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 405
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 477
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40 +0800 CST
view 42
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
Kimi K3深度解析:2.8万亿参数、MoE架构与开源大模型的工程拐点(2026完整版)
编程
Kimi K3深度解析:2.8万亿参数、MoE架构与开源大模型的工程拐点(2026完整版)
2026-07-21 01:14:29 +0800 CST
view 18
深度解析月之暗面Kimi K3:2.8万亿参数MoE架构、KDA混合注意力机制、AttnRes残差设计、Mooncake分离式推理与90%缓存命中率,附完整API接入代码与工程落地指南。
Kimi K3
MoE
KDA
开源大模型
Mooncake
长上下文
注意力机制
AI编程
Agent
DiffusionGemma 深度实战:当文本生成进入「扩散纪元」——从离散扩散原理到本地高速推理的完全指南(2026)
编程
DiffusionGemma 深度实战:当文本生成进入「扩散纪元」——从离散扩散原理到本地高速推理的完全指南(2026)
2026-06-14 01:18:58 +0800 CST
view 500
2026年6月Google开源DiffusionGemma——基于离散扩散技术的文本生成模型,打破传统自回归范式,实现4倍生成速度提升。本文深入解析其架构原理、性能实测、代码实战与生产落地。
DiffusionGemma
离散扩散
文本生成
AI大模型
Google
并行推理
MoE架构
Qwen3.8 深度实战:2.4T MoE 巨兽来了——从 Preview API 接入、函数调用到本地部署与微调的完整工程指南(2026)
编程
Qwen3.8 深度实战:2.4T MoE 巨兽来了——从 Preview API 接入、函数调用到本地部署与微调的完整工程指南(2026)
2026-07-21 01:43:04 +0800 CST
view 19
2026年Qwen3.8深度实战:2.4T MoE架构原理、Preview API接入、流式调用、函数调用、RAG检索增强、vLLM/SGLang本地部署与QLoRA微调的完整工程指南
Qwen3.8
MoE
大模型部署
函数调用
QLoRA
vLLM
通义千问
2026
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
编程
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
2026-04-23 19:09:57 +0800 CST
view 609
深度解析微软开源的BitNet b1.58 2B4T模型,从1.58位三值量化原理、架构设计、性能对比到部署实战,全面剖析这个仅需0.4GB内存、在普通CPU上流畅运行的革命性大语言模型。
BitNet
量化
大模型
微软
CPU推理
边缘计算
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
2026-06-14 04:46:45 +0800 CST
view 396
深度解析 Google DeepMind Gemma 4 12B 的无编码器统一多模态架构,从原理到代码实战,涵盖 llama.cpp 部署、量化策略、Agent 工作流和生产级架构设计(2026)。
Gemma 4
Google DeepMind
多模态
本地部署
Agent
llama.cpp
开源大模型
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
资讯
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
2026-04-23 21:18:45 +0800 CST
view 808
2026年4月23日,腾讯发布并开源新一代大模型混元Hy3preview,总参数295B、激活参数21B的MoE架构,支持256K超长上下文,推理效率提升40%,API最低1.2元/百万tokens。在复杂推理、代码与Agent能力上表现突出,接近GPT-5.4级别,数学推理创国内最高纪录。已接入腾讯云、元宝等多条产品线,并上架TokenHub。
人工智能
大模型
腾讯
开源
MoE
推理
代码生成
Agent
云计算
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
编程
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
2026-06-19 07:26:01 +0800 CST
view 271
深度解析MiniMax M3的自研MSA稀疏注意力架构,从KV outer gather Q设计到1M上下文工程实践,包含代码示例、性能优化和部署指南
MiniMax
M3
MSA
稀疏注意力
1M上下文
多模态
Agent
大模型
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
3
4
5
6
7
...
46
下一页