程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
HunyuanVideo 1.5 深度解析:腾讯 8.3B 参数视频生成模型,消费级显卡的革命性突破
编程
HunyuanVideo 1.5 深度解析:腾讯 8.3B 参数视频生成模型,消费级显卡的革命性突破
2026-05-09 18:51:15 +0800 CST
view 629
腾讯混元开源 HunyuanVideo 1.5 视频生成模型,8.3B 参数 Diffusion Transformer 架构,14G 显存消费级显卡可运行。SSTA 稀疏注意力机制实现推理速度 1.87 倍提升,3D 因果 VAE 实现空间 16 倍、时间 4 倍压缩。
AI视频生成
腾讯混元
HunyuanVideo
Diffusion Transformer
SSTA
开源模型
消费级显卡
WorldMonitor 深度拆解:一个人写出的「全球态势感知室」——500+ 信源、双地图引擎与 60+ Edge Function 的无后端架构
编程
WorldMonitor 深度拆解:一个人写出的「全球态势感知室」——500+ 信源、双地图引擎与 60+ Edge Function 的无后端架构
2026-07-28 16:45:43 +0800 CST
view 109
深度拆解 GitHub Trending 项目 WorldMonitor:500+信源AI聚合、CII国家不稳定指数算法、globe.gl+deck.gl双地图引擎、60+ Edge Function无后端架构、Tauri 2桌面端与MCP Agent生态,附完整代码实战与冷思考。
WorldMonitor
OSINT
deck.gl
Tauri
Edge Function
态势感知
开源
TypeScript
MCP
Transformers.js
SSM-Transformer 混合架构深度实战:当状态空间模型终于与注意力机制握手言和
编程
SSM-Transformer 混合架构深度实战:当状态空间模型终于与注意力机制握手言和
2026-07-11 10:25:05 +0800 CST
view 213
深度拆解 2026 年 SSM-Transformer 混合架构的设计哲学、内核原理与生产实战:Mamba 选择性状态空间模型、Hybrid 混合层设计、vLLM 推理优化、Kubernetes 部署与性能调优,配完整可运行代码。
SSM
Mamba
Mamba2
Transformer
混合架构
状态空间模型
长上下文
推理优化
大模型
LLM
Gemma 4 架构解密:MoE 路由 × GQA 注意力 × Thinking Mode——31B 如何击败 20 倍参数对手
编程
Gemma 4 架构解密:MoE 路由 × GQA 注意力 × Thinking Mode——31B 如何击败 20 倍参数对手
2026-04-19 17:47:49 +0800 CST
view 792
深入解析 Google Gemma 4 的核心技术架构:MoE 稀疏专家路由、GQA 分组查询注意力、PLE 逐层嵌入、Thinking Mode 推理机制,详解 31B 模型如何以小博大击败 20 倍参数对手,附全场景部署实战代码。
Gemma
Google
AI
开源大模型
MoE
GQA
Transformer
深度学习
模型架构
TimesFM 2.5 深度解析:Google 如何用 200M 参数的时间序列基础模型颠覆传统预测范式
编程
TimesFM 2.5 深度解析:Google 如何用 200M 参数的时间序列基础模型颠覆传统预测范式
2026-04-19 19:46:34 +0800 CST
view 896
Google TimesFM 2.5 时间序列基础模型深度解析:Patched Decoder 架构、XReg 协变量机制、LoRA 微调实战、BigQuery ML 部署,从零样本预测到生产落地全链路指南
TimesFM
时间序列
机器学习
Google
深度学习
SANA-WM 深度解析:2.6B 参数开源世界模型如何颠覆视频生成——从扩散Transformer到1分钟720p实时渲染的完整技术架构
编程
SANA-WM 深度解析:2.6B 参数开源世界模型如何颠覆视频生成——从扩散Transformer到1分钟720p实时渲染的完整技术架构
2026-05-16 21:15:15 +0800 CST
view 1150
SANA-WM是NVIDIA Lab开源的2.6B参数世界模型视频生成系统,支持1分钟720p视频生成。本文从扩散Transformer底层数学到Flow Matching推理优化,完整解析其Dual-Pathway架构、3D VAE时空压缩、因果注意力掩码等核心技术,并提供完整PyTorch代码示例。
AI视频生成
世界模型
扩散模型
Transformer
Flow Matching
KTransformers 深度拆解:单张 4090 跑满血 DeepSeek-R1 671B,清华团队如何用 CPU/GPU 异构推理实现 28 倍加速
编程
KTransformers 深度拆解:单张 4090 跑满血 DeepSeek-R1 671B,清华团队如何用 CPU/GPU 异构推理实现 28 倍加速
2026-07-29 09:44:03 +0800 CST
view 87
深度拆解清华开源的 KTransformers:MoE 稀疏性卸载、AMX/Marlin 高性能算子、CUDA Graph 与 YAML 注入框架四层架构,单张 4090 跑满血 DeepSeek-R1 671B,附完整部署实战与性能调优清单。
KTransformers
异构推理
MoE
DeepSeek
AMX
CUDA Graph
大模型部署
性能优化
开源
GuppyLM:5分钟从零训练一个LLM,870万参数小鱼模型的完整教学
编程
GuppyLM:5分钟从零训练一个LLM,870万参数小鱼模型的完整教学
2026-05-01 04:35:06 +0800 CST
view 580
GuppyLM是开源教育项目,870万参数小鱼角色扮演模型,5分钟Colab训练,覆盖数据生成到ONNX部署全流程,适合LLM初学者。
LLM
深度学习
开源
教学
Transformer
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
编程
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
2026-07-24 07:44:31 +0800 CST
view 164
KTransformers 通过 CPU/GPU 异构计算,让一块 RTX 5090(32GB 显存)能跑起 100B+ MoE 大模型,且无需量化压缩,保持原精度 FP16。实测比 llama.cpp Q8_0 快 4.5 倍。本文深度拆解其专家细粒度卸载、异步预取、DMA 优化等核心技术,以及实战部署指南。
KTransformers
LLM推理
MoE
异构计算
DeepSeek
SGLang
CPU Offload
本地部署
GPU优化
World Monitor 深度拆解:500+ 信息源、56 种地图图层、一套代码发 6 个站,日增 300 星的开源态势感知仪表盘怎么造
编程
World Monitor 深度拆解:500+ 信息源、56 种地图图层、一套代码发 6 个站,日增 300 星的开源态势感知仪表盘怎么造
2026-07-24 08:17:48 +0800 CST
view 305
深度拆解 GitHub Trending 榜首 World Monitor:500+ 信息源聚合去重管线、deck.gl/globe.gl 双地图引擎、281 个 Protobuf 防腐层、三层缓存、一套代码发 6 个变体站与 Tauri sidecar 安全教训,配可运行代码复现核心机制。
World Monitor
开源
deck.gl
Tauri
态势感知
信息聚合
边缘计算
Transformers.js
Ollama
TypeScript
Stanford CS336 深度实战:从零实现大语言模型——数据清洗、Transformer 架构、FlashAttention 系统优化到 RL 对齐的完全指南(2026)
编程
Stanford CS336 深度实战:从零实现大语言模型——数据清洗、Transformer 架构、FlashAttention 系统优化到 RL 对齐的完全指南(2026)
2026-06-02 20:14:38 +0800 CST
view 593
Stanford CS336 课程深度解读:从零实现大语言模型,覆盖 Tokenizer、Transformer、FlashAttention-2、FSDP 分布式训练、Scaling Law、Common Crawl 数据清洗去重、SFT 与 GRPO 对齐,配完整代码示例。
LLM
Transformer
Stanford CS336
FlashAttention
PyTorch
AI工程
分布式训练
强化学习
LCLM 深度实战:当「潜在上下文」颠覆大模型记忆困境——从 8.8 倍速提升到工业级部署的完整指南(2026)
编程
LCLM 深度实战:当「潜在上下文」颠覆大模型记忆困境——从 8.8 倍速提升到工业级部署的完整指南(2026)
2026-06-17 08:57:22 +0800 CST
view 334
深入解析2026年LCLM潜在上下文语言模型,8.8倍速度提升背后的技术原理与工业级部署实战,含完整代码示例与性能对比。
大模型
上下文压缩
KV缓存
LCLM
Transformer
AI优化
推理加速
当「潜在上下文」颠覆大模型记忆困境:LCLM 8.8 倍速提升完整拆解与工业部署指南(2026)
编程
当「潜在上下文」颠覆大模型记忆困境:LCLM 8.8 倍速提升完整拆解与工业部署指南(2026)
2026-06-17 08:57:46 +0800 CST
view 357
深入解析2026年LCLM潜在上下文语言模型,8.8倍速度提升背后的技术原理与工业级部署实战,含完整代码示例与性能对比。
大模型
上下文压缩
KV缓存
LCLM
Transformer
AI优化
推理加速
Transformers.js v4 深度解析:WebGPU 原生化让 AI 推理在 Node/Bun/Deno 中真正起飞
编程
Transformers.js v4 深度解析:WebGPU 原生化让 AI 推理在 Node/Bun/Deno 中真正起飞
2026-04-12 04:55:32 +0800 CST
view 983
深度解析 Transformers.js v4 的 WebGPU 原生化架构:如何用 C++ 重写 WebGPU Runtime、与 ONNX Runtime 深度集成、在 Node/Bun/Deno 中实现原生 GPU AI 推理。包含代码实战、性能对比与生产部署指南。
JavaScript
AI
WebGPU
Transformers
HuggingFace
Node.js
Bun
Deno
ONNX
NVIDIA Cosmos 3 深度实战:当世界模型重塑 Physical AI——从 MoT 架构到机器人策略的生产级完全指南(2026)
编程
NVIDIA Cosmos 3 深度实战:当世界模型重塑 Physical AI——从 MoT 架构到机器人策略的生产级完全指南(2026)
2026-06-12 15:50:50 +0800 CST
view 594
深入解析 NVIDIA Cosmos 3 全模态物理 AI 世界模型:MoT 双塔架构、统一动作表征、3D MRoPE 位置编码,以及 Hugging Face 实战代码。适合机器人、自动驾驶、AI 研究者和工程师。
NVIDIA
Cosmos
世界模型
Physical AI
MoT
机器人
Transformer
具身智能
µP 深度拆解:当调参侠终于破解 scaling 诅咒——从最大更新参数化到万亿参数大模型超参迁移的工程全貌(2026)
编程
µP 深度拆解:当调参侠终于破解 scaling 诅咒——从最大更新参数化到万亿参数大模型超参迁移的工程全貌(2026)
2026-07-19 08:43:41 +0800 CST
view 169
深度拆解微软/ OpenAI 的 µP(最大更新参数化)理论:从 Tensor Programs 数学框架、为什么标准参数化失效、到 PyTorch mup 库完整实战代码,含 Transformer 层、AdamW 配置、跨尺度超参数迁移验证与生产级 Pipeline。
µP
Max Update Parametrization
超参数迁移
Tensor Programs
深度学习
Transformer
LLM训练
AdamW
mup
微软
2.8秒超越4小时调优:TabPFN如何用Transformer重写表格数据机器学习
编程
2.8秒超越4小时调优:TabPFN如何用Transformer重写表格数据机器学习
2026-05-12 00:20:07 +0800 CST
view 641
深度解析TabPFN如何用Transformer架构重写表格数据机器学习范式:从合成数据预训练、先验数据拟合原理、2.8秒vs4小时性能对比,到TabPFN-2.5的10万行处理能力与SAP收购战略意义,附完整代码示例
TabPFN,表格数据,Transformer,AutoML,机器学习,XGBoost,PriorLabs,深度学习,基础模型,Python
Gemma 4 MoE 架构技术深度解析:Dense MLP + Routed MoE 双路径设计如何重塑开源大模型
编程
Gemma 4 MoE 架构技术深度解析:Dense MLP + Routed MoE 双路径设计如何重塑开源大模型
2026-04-21 14:22:20 +0800 CST
view 698
深度解析 Google Gemma 4 的 Dual-Path 混合架构设计:Dense MLP 保障通用基座能力,Routed MoE 释放专业化推理效率。一文吃透技术原理、部署实战与选型对比。
Gemma 4
MoE架构
Dense MLP
Routed MoE
Google DeepMind
开源大模型
Transformer
模型部署
混合专家
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
编程
Anthropic 在 Claude 内部发现了"意识前厅":J空间如何重写 AI 可解释性与安全格局
2026-07-13 15:14:42 +0800 CST
view 184
2026年7月Anthropic重磅论文解读:Claude内部自发涌现的J空间(雅可比空间)与人类全局工作空间高度相似,从神经科学理论到五大因果实验,从AI可解释性突破到安全范式革命,一次把大模型内部黑箱讲透。
Claude
Anthropic
J空间
全局工作空间
AI可解释性
AI安全
大模型
意识科学
Transformer
AGI
红队测试
流式3D重建的工程革命:lingbot-map 如何用几何上下文Transformer颠覆实时空间感知
编程
流式3D重建的工程革命:lingbot-map 如何用几何上下文Transformer颠覆实时空间感知
2026-07-25 19:44:11 +0800 CST
view 101
深度解析2026年GitHub爆火项目lingbot-map:从传统离线重建困境到前馈式流式架构,深入拆解几何上下文Transformer的极线约束、深度先验机制,附完整Python实战代码与性能调优指南。
流式3D重建
lingsbot-map
几何上下文Transformer
实时重建
计算机视觉
点云
SLAM
深度学习
前馈网络
机器人导航
InsForge 深度实战:面向AI编码代理的后端开发平台——2026年完全指南
编程
InsForge 深度实战:面向AI编码代理的后端开发平台——2026年完全指南
2026-05-25 03:34:05 +0800 CST
view 422
本文深入讲解InsForge的核心概念、架构设计、实战安装与插件开发,以及性能优化方法,帮助开发者全面掌握这一2026年热门的AI编码代理后端开发平台。
InsForge
AI编码代理
后端开发平台
开源项目
2026
MiniMax M3 & MSA 深度实战:当国产大模型用「稀疏注意力」重写 Transformer 规则——从 1M 上下文架构原理到生产级 Agent 部署的完全指南(2026)
编程
MiniMax M3 & MSA 深度实战:当国产大模型用「稀疏注意力」重写 Transformer 规则——从 1M 上下文架构原理到生产级 Agent 部署的完全指南(2026)
2026-06-13 23:46:46 +0800 CST
view 511
深度拆解MiniMax M3的MSA稀疏注意力架构:两级路由原理、MSA vs MoE技术对比、1M上下文实战、Agent部署、性能基准测试、选型决策指南
MiniMax M3
MSA
稀疏注意力
大模型
Agent
AI
Transformer
开源模型
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
编程
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
2026-07-02 18:16:20 +0800 CST
view 512
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,将 KV Cache 从线性增长压至常数级;3B MoE 解码器架构、DeepEncoder 视觉编码器;完整本地部署代码、KV Cache 监控脚本与 SGLang 生产推理优化指南。OmniDocBench v1.6 综合得分 93.92%,端到端 OCR 新 SOTA。
OCR
R-SWA
KV Cache
MoE
百度
长文档解析
Transformer
深度学习
Python
性能优化
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
编程
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
2026-04-15 17:20:25 +0800 CST
view 730
深度解析中科院与腾讯微信联合研发的 FlashPrefill 如何通过即时注意力模式发现和动态阈值筛选,将 25.6 万字符长文本处理速度提升 27.78 倍,同时保持近乎完美的精度。
LLM推理优化
FlashAttention
GPU计算
长文本处理
注意力机制
Transformer
深度学习
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
...
9
下一页