程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
ds4.c 深度解析:Redis之父如何用纯C代码在MacBook上跑通284B大模型——从不对称量化到KV缓存磁盘化的完整技术内幕
编程
ds4.c 深度解析:Redis之父如何用纯C代码在MacBook上跑通284B大模型——从不对称量化到KV缓存磁盘化的完整技术内幕
2026-05-18 06:15:03 +0800 CST
view 798
Redis之父antirez开源ds4.c项目深度解析:用纯C语言在MacBook上运行284B参数大模型,不对称2-bit量化、KV缓存磁盘化、OpenAI/Anthropic API兼容,打造首个真正的本地Agent推理后端
AI推理
本地大模型
Redis
Apple Silicon
DeepSeek
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
编程
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
2026-07-13 15:14:42 +0800 CST
view 249
2026年7月Anthropic重磅论文解读:Claude内部自发涌现的J空间(雅可比空间)与人类全局工作空间高度相似,从神经科学理论到五大因果实验,从AI可解释性突破到安全范式革命,一次把大模型内部黑箱讲透。
Claude
Anthropic
J空间
全局工作空间
AI可解释性
AI安全
大模型
意识科学
Transformer
AGI
红队测试
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
编程
AirLLM 深度实战:8GB 显存跑 405B 大模型——分层推理如何拆掉「显存墙」(2026 实战指南)
2026-08-15 09:44:41 +0800 CST
view 69
深度拆解 AirLLM 分层推理架构:8GB 显存跑 405B 大模型的时间换空间哲学,从 mmap 权重映射、单层计算流水线到完整 Python 实战与 15 条生产级优化建议。
AirLLM
大模型推理
显存优化
LLM
内存推理
Python
性能优化
GPU
LangGraph 深度实战:从状态机架构到生产级 Multi-Agent 编排的完整指南(2026)
编程
LangGraph 深度实战:从状态机架构到生产级 Multi-Agent 编排的完整指南(2026)
2026-06-04 18:45:17 +0800 CST
view 675
2026年最全面的LangGraph实战指南:从状态机架构原理到生产级Multi-Agent协作系统开发,包含完整代码示例与电商智能客服案例。
LangGraph
Multi-Agent
AI Agent
Python
大模型
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
编程
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
2026-07-07 10:14:22 +0800 CST
view 342
深度解析美团LongCat-2.0万亿参数MoE大模型:1.6T总参数/48B激活、LSA稀疏注意力实现1M原生上下文、N-gram Embedding 135B参数强化代码理解、MOPD三类专家动态调度、五万卡国产算力全流程训练。SWE-bench Pro 59.5超GPT-5.5,从架构原理到生产级实战的完整技术剖析。
LongCat-2.0
美团
MoE
大模型
国产算力
LSA
稀疏注意力
N-gram Embedding
MOPD
开源
Kimi K3 深度拆解:2.8万亿参数开源MoE旗舰的架构革命与工程极限
编程
Kimi K3 深度拆解:2.8万亿参数开源MoE旗舰的架构革命与工程极限
2026-07-31 09:42:32 +0800 CST
view 253
深度拆解 Kimi K3 的三项核心架构创新:KDA 混合线性注意力、Attention Residuals、Stable LatentMoE。涵盖 O(n) 长上下文建模原理、极端稀疏 MoE 工程实践、FlashKDA 高性能 CUDA 优化、MoonEP 通信库,以及 2.8T 参数的显存墙分析与 Ollama/vLLM 本地部署指南。
Kimi K3
Moonshot AI
MoE
大模型
开源
KDA
Attention Residuals
Stable LatentMoE
深度学习
编程Agent
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
编程
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
2026-06-18 17:54:54 +0800 CST
view 885
深度横评2026年四大主流大模型推理框架,涵盖PagedAttention架构、ContinuousBatching、算子融合、FP8量化、NVMe卸载等核心技术,配实测数据与生产级选型指南
大模型
LLM
推理框架
vLLM
TensorRT-LLM
TGI
DeepSpeed
GPU推理
AI部署
NVIDIA
GPT-5.6技术深度解析:Sol/Terra/Luna三档模型架构与实战对比
编程
GPT-5.6技术深度解析:Sol/Terra/Luna三档模型架构与实战对比
2026-07-02 06:14:06 +0800 CST
view 695
深入解析OpenAI最新发布的GPT-5.6系列模型,涵盖Sol/Terra/Luna三档架构设计、技术原理、实战应用与性能对比,为开发者提供全面的选型指南。
AI
GPT-5.6
大模型
OpenAI
人工智能
深度学习
MiniMax M2.7 深度解析:当 AI 模型开始自己训练自己——从自我进化架构到软件工程能力全面评测
编程
MiniMax M2.7 深度解析:当 AI 模型开始自己训练自己——从自我进化架构到软件工程能力全面评测
2026-04-13 19:57:01 +0800 CST
view 1518
MiniMax M2.7 开源模型深度解析:自我进化架构、SWE-Pro 56.22% 软件工程能力、OpenRoom 多模态交互、本地部署方案与开源协议争议全面剖析。
AI
大模型
MiniMax
自我进化
开源
SWE-Pro
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 551
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 755
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
Agent 能力哪家强?2026 年 8 月主流大模型 Terminal Bench 横向评测:数据、趋势与选型指南
编程
Agent 能力哪家强?2026 年 8 月主流大模型 Terminal Bench 横向评测:数据、趋势与选型指南
2026-08-15 17:19:35 +0800 CST
view 87
2026年8月最新Terminal Bench 2.1评测数据横评:Kimi K3/DeepSeek V4-Pro/Claude Opus 4.8等六大模型在五大维度的真实表现差异,配选型决策框架与成本效益分析
Terminal Bench
AI Agent
评测基准
大模型对比
Kimi
DeepSeek
Claude
Fable 5
选型指南
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40 +0800 CST
view 419
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
Kimi K3深度解析:2.8万亿参数、MoE架构与开源大模型的工程拐点(2026完整版)
编程
Kimi K3深度解析:2.8万亿参数、MoE架构与开源大模型的工程拐点(2026完整版)
2026-07-21 01:14:29 +0800 CST
view 557
深度解析月之暗面Kimi K3:2.8万亿参数MoE架构、KDA混合注意力机制、AttnRes残差设计、Mooncake分离式推理与90%缓存命中率,附完整API接入代码与工程落地指南。
Kimi K3
MoE
KDA
开源大模型
Mooncake
长上下文
注意力机制
AI编程
Agent
Qwen3.8 深度实战:2.4T MoE 巨兽来了——从 Preview API 接入、函数调用到本地部署与微调的完整工程指南(2026)
编程
Qwen3.8 深度实战:2.4T MoE 巨兽来了——从 Preview API 接入、函数调用到本地部署与微调的完整工程指南(2026)
2026-07-21 01:43:04 +0800 CST
view 417
2026年Qwen3.8深度实战:2.4T MoE架构原理、Preview API接入、流式调用、函数调用、RAG检索增强、vLLM/SGLang本地部署与QLoRA微调的完整工程指南
Qwen3.8
MoE
大模型部署
函数调用
QLoRA
vLLM
通义千问
2026
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
编程
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
2026-04-23 19:09:57 +0800 CST
view 762
深度解析微软开源的BitNet b1.58 2B4T模型,从1.58位三值量化原理、架构设计、性能对比到部署实战,全面剖析这个仅需0.4GB内存、在普通CPU上流畅运行的革命性大语言模型。
BitNet
量化
大模型
微软
CPU推理
边缘计算
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
2026-06-14 04:46:45 +0800 CST
view 605
深度解析 Google DeepMind Gemma 4 12B 的无编码器统一多模态架构,从原理到代码实战,涵盖 llama.cpp 部署、量化策略、Agent 工作流和生产级架构设计(2026)。
Gemma 4
Google DeepMind
多模态
本地部署
Agent
llama.cpp
开源大模型
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
资讯
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
2026-04-23 21:18:45 +0800 CST
view 993
2026年4月23日,腾讯发布并开源新一代大模型混元Hy3preview,总参数295B、激活参数21B的MoE架构,支持256K超长上下文,推理效率提升40%,API最低1.2元/百万tokens。在复杂推理、代码与Agent能力上表现突出,接近GPT-5.4级别,数学推理创国内最高纪录。已接入腾讯云、元宝等多条产品线,并上架TokenHub。
人工智能
大模型
腾讯
开源
MoE
推理
代码生成
Agent
云计算
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
编程
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
2026-06-19 07:26:01 +0800 CST
view 454
深度解析MiniMax M3的自研MSA稀疏注意力架构,从KV outer gather Q设计到1M上下文工程实践,包含代码示例、性能优化和部署指南
MiniMax
M3
MSA
稀疏注意力
1M上下文
多模态
Agent
大模型
Qwen3.6-27B开源:270亿稠密模型如何用单卡性能打穿3970亿MoE旗舰——从架构革命到本地编程助手实战
编程
Qwen3.6-27B开源:270亿稠密模型如何用单卡性能打穿3970亿MoE旗舰——从架构革命到本地编程助手实战
2026-07-08 00:47:14 +0800 CST
view 798
深度解析阿里开源Qwen3.6-27B:270亿参数稠密模型全面超越3970亿MoE旗舰的技术原理、混合注意力架构、编程基准实测、本地部署实战与Claude Code协同工作流。
Qwen3.6
开源大模型
AI编程
本地部署
vLLM
SGLang
LLM 推理引擎 2026 终极对决:vLLM、SGLang、TensorRT-LLM、LMDeploy 谁才是你的最优解?
编程
LLM 推理引擎 2026 终极对决:vLLM、SGLang、TensorRT-LLM、LMDeploy 谁才是你的最优解?
2026-08-16 07:15:42 +0800 CST
view 99
深度拆解四大主流LLM推理引擎——vLLM、SGLang、TensorRT-LLM、LMDeploy——从核心架构、关键技术、性能基准到选型决策,配完整代码实战,帮你找到最适合业务场景的最优解。
LLM推理
vLLM
SGLang
TensorRT-LLM
LMDeploy
PagedAttention
RadixAttention
性能优化
大模型部署
Llama 4 MoE 架构深度解析:从混合专家到万亿参数的技术革命
编程
Llama 4 MoE 架构深度解析:从混合专家到万亿参数的技术革命
2026-05-28 16:37:41 +0800 CST
view 435
深入解析 Meta Llama 4 的 MoE 混合专家架构原理,探讨其如何以 17B 激活参数撬动万亿级算力,并提供完整的本地部署实战指南。
Llama4
MoE
混合专家
开源大模型
本地部署
Meta
人工智能
深度学习
DeepSeek-V4预览版深度解析:MoE架构+百万上下文+1.6T参数,开源旗舰模型全面升级
编程
DeepSeek-V4预览版深度解析:MoE架构+百万上下文+1.6T参数,开源旗舰模型全面升级
2026-04-24 17:19:28 +0800 CST
view 929
2026年4月24日DeepSeek发布V4预览版,总参1.6T/284B,激活49B/13B,100万Token上下文,DSA稀疏注意力,兼容OpenAI+Anthropic双协议,昇腾与寒武纪Day 0适配,深度解析其架构与API用法。
DeepSeek
V4
MoE
大模型
开源
Kimi K3 架构深度解析:从第一性原理吃透 2.8 万亿参数 MoE 模型的三层核心创新
编程
Kimi K3 架构深度解析:从第一性原理吃透 2.8 万亿参数 MoE 模型的三层核心创新
2026-08-01 14:17:55 +0800 CST
view 303
深度解析 Kimi K3 的三大架构创新:KDA 混合线性注意力、Attention Residuals 注意力残差、Stable LatentMoE 分位数均衡路由,从第一性原理配代码示例吃透 2.8 万亿参数 MoE 模型。
Kimi
K3
MoE
KDA
AttnRes
StableLatentMoE
LLM
开源大模型
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
5
6
7
8
9
...
24
下一页