程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Unsloth 深度实战:从显存爆炸到 70% 压缩——本地大模型微调的工程化革命与生产级实践
编程
Unsloth 深度实战:从显存爆炸到 70% 压缩——本地大模型微调的工程化革命与生产级实践
2026-05-22 16:15:29 +0800 CST
view 956
Unsloth通过底层算子优化让大模型微调显存降低70%、速度提升2-5x,本文从原理到生产实战全方位拆解,含完整代码。
Unsloth
LoRA
QLoRA
大模型微调
本地训练
Unsloth 深度拆解:当 LLM 微调学会「省显存」——2倍速+70%显存节省背后的 QLoRA 工程革命
编程
Unsloth 深度拆解:当 LLM 微调学会「省显存」——2倍速+70%显存节省背后的 QLoRA 工程革命
2026-07-15 17:47:08 +0800 CST
view 284
深度拆解Unsloth技术栈:QLoRA量化原理、4-bit NF4精度机制、Triton内核重写、8-bit Adam优化器、梯度检查点优化,以及从Notebook到Ollama/vLLM生产部署的完整工程路径,含完整代码实战
Unsloth
LLM微调
QLoRA
LoRA
4-bit量化
深度学习
模型训练
Unsloth实战:当QLoRA让27B模型在RTX 4090上跑起来——从Qwen3.5微调到Ollama部署的完整工程链
编程
Unsloth实战:当QLoRA让27B模型在RTX 4090上跑起来——从Qwen3.5微调到Ollama部署的完整工程链
2026-07-15 17:48:36 +0800 CST
view 262
深度拆解Unsloth技术栈:QLoRA量化原理、4-bit NF4精度机制、Triton内核重写、8-bit Adam优化器、梯度检查点优化,以及从Notebook到Ollama/vLLM生产部署的完整工程路径,含完整代码实战
Unsloth
LLM微调
QLoRA
LoRA
4-bit量化
深度学习
模型训练
Unsloth 深度实战:从 Triton 内核优化到 70% 显存压缩——2026 年 LLM 本地微调的工业级完全指南
编程
Unsloth 深度实战:从 Triton 内核优化到 70% 显存压缩——2026 年 LLM 本地微调的工业级完全指南
2026-05-23 20:00:37 +0800 CST
view 610
深度剖析 Unsloth 如何通过手写 Triton 内核、智能显存管理和 LoRA/QLoRA 优化,实现训练速度 2-5 倍提升、显存占用降低 70% 的技术奇迹。
LLM
微调
Unsloth
LoRA
深度学习
Unsloth 深度实战:Triton 内核 + 手写反向传播引擎如何把 LLM 微调速度拉高 10 倍——从 LoRA 原理到 GRPO 强化学习全链路拆解
编程
Unsloth 深度实战:Triton 内核 + 手写反向传播引擎如何把 LLM 微调速度拉高 10 倍——从 LoRA 原理到 GRPO 强化学习全链路拆解
2026-08-16 09:15:16 +0800 CST
view 111
深度拆解 Unsloth 框架如何用 Triton 内核 + 手写反向传播引擎把 LLM 微调速度提升 10 倍:从 LoRA/QLoRA 数学原理、算子融合、GRPO 强化学习到生产部署全链路实战,附完整代码示例与性能对比数据。
Unsloth
LoRA
Triton
LLM微调
GRPO
QLoRA
强化学习
GPU优化
Gemma MacOS Tuner 深度解析:在 Apple Silicon 上用 PyTorch 和 MPS 高效微调多模态 Gemma
编程
Gemma MacOS Tuner 深度解析:在 Apple Silicon 上用 PyTorch 和 MPS 高效微调多模态 Gemma
2026-04-09 01:14:39 +0800 CST
view 1373
详解 gemma-tuner-multimodal 项目:在 Apple Silicon 上通过 PyTorch MPS 后端对 Google Gemma 系列模型进行 LoRA 微调,支持文本、图像、音频三种模态,完全本地运行,数据不出机器,零 NVIDIA GPU 依赖。
Gemma
Apple Silicon
PyTorch
MPS
LoRA
微调
Machine Learning
MusaCoder 深度实战:当国产GPU遇见AI驱动的Kernel生成——从PyTorch到CUDA/MUSA原生算子的全栈训练完全指南(2026)
编程
MusaCoder 深度实战:当国产GPU遇见AI驱动的Kernel生成——从PyTorch到CUDA/MUSA原生算子的全栈训练完全指南(2026)
2026-06-16 06:47:47 +0800 CST
view 501
MusaCoder是首个基于国产GPU完成全链路训练的代码大模型,在KernelBench上超越Claude Opus 4.7。从三阶段数据合成、多样性RFT到执行反馈RL,深度解析全栈训练方法论。
MusaCoder
GPU Kernel
摩尔线程
国产GPU
CUDA
MUSA
大模型
强化学习
KernelBench
代码大模型
AI Coding
深度学习
MiniMax M3 开源:当 428B 参数遇见自研 MSA 稀疏注意力——从架构革命到编程超 GPT-5.5 的生产级完全指南(2026)
编程
MiniMax M3 开源:当 428B 参数遇见自研 MSA 稀疏注意力——从架构革命到编程超 GPT-5.5 的生产级完全指南(2026)
2026-06-16 09:47:42 +0800 CST
view 715
MiniMax M3 428B参数开源大模型深度解析:自研MSA稀疏注意力架构、编程能力超越GPT-5.5、1M上下文、原生多模态,从底层原理到生产部署的完全指南
MiniMax M3
MSA稀疏注意力
开源大模型
大模型技术
AI编程
Qwen3.8-2.4T-A95B 首次开源:从 2.4 万亿参数旗舰到本地部署,2026 年最重磅开发者事件深度解析
编程
Qwen3.8-2.4T-A95B 首次开源:从 2.4 万亿参数旗舰到本地部署,2026 年最重磅开发者事件深度解析
2026-08-13 09:52:01 +0800 CST
view 174
2026年8月13日阿里Qwen团队正式开放Qwen3.8-2.4T-A95B模型权重,这是Qwen-Max级别旗舰首次开源。本文从技术原理、MoE架构、上下文扩展、双协议兼容、性能对比、本地部署门槛、生产踩坑清单六个维度深度解析这一2026年最重磅开发者事件。
Qwen3.8
2.4T参数
MoE架构
开源权重
本地部署
稀疏混合专家
AI大模型
国产大模型
万字深度解析 DeepSeek V4:当 1.6 万亿参数遇见 DSA 稀疏注意力——开源大模型如何让 API 账单暴降 95%(2026)
编程
万字深度解析 DeepSeek V4:当 1.6 万亿参数遇见 DSA 稀疏注意力——开源大模型如何让 API 账单暴降 95%(2026)
2026-07-01 07:13:58 +0800 CST
view 444
2026年4月DeepSeek V4发布,1.6万亿参数+百万上下文+SWE-Bench 80.6%,API成本暴降95%。深度解析DSA稀疏注意力、MoE架构、生产级部署实战。
DeepSeek V4
DSA 稀疏注意力
MoE 架构
百万上下文
开源大模型
API 成本优化
大模型部署
Agent 能力
SWE-Bench
DeepSeek
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 316
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
MiniMind-O 深度实战:从0训练0.1B全模态Omni模型——2026年极简大模型工程化完全指南
编程
MiniMind-O 深度实战:从0训练0.1B全模态Omni模型——2026年极简大模型工程化完全指南
2026-05-24 16:30:13 +0800 CST
view 810
MiniMind-O 以仅0.1B参数实现能听能说能看的全模态Omni能力,4张RTX 3090仅需4小时完成训练。本文深入剖析Thinker-Talker双路架构、编码器融合技术,并提供从数据处理到推理部署的完整工程化指南。
MiniMind-O
全模态模型
Omni模型
大模型训练
多模态AI
边缘计算
自建大模型统一网关:多模型路由、故障转移与成本治理的工程实战
编程
自建大模型统一网关:多模型路由、故障转移与成本治理的工程实战
2026-07-23 02:41:45 +0800 CST
view 343
从协议碎片化病根讲起,拆解生产级 LLM 网关必须解决的六类工程问题,并用手写 Go 网关+Python 语义缓存跑通路由、熔断、重试与成本记账。
LLM Gateway
大模型网关
多模型路由
故障转移
成本治理
LiteLLM
OmniRoute
Kimi K2.6 开源深度测评:国产模型首次登顶全球代码榜首,开发者必须知道的那些事
编程
Kimi K2.6 开源深度测评:国产模型首次登顶全球代码榜首,开发者必须知道的那些事
2026-04-28 15:51:45 +0800 CST
view 1380
2026年4月20日月之暗面发布Kimi K2.6,在SWE-Bench Pro拿下58.6分首次超越GPT-5.4和Claude Opus 4.6。本文从技术架构、代码实测、API集成、性能优化、工具链集成等维度进行深度测评。
AI大模型
代码工具
Kimi
月之暗面
开源模型
SWE-Bench
开发者工具
代码审查
Google TimesFM 深度解析:14K Star 的时间序列基础模型如何用 200M 参数颠覆零样本预测
编程
Google TimesFM 深度解析:14K Star 的时间序列基础模型如何用 200M 参数颠覆零样本预测
2026-04-28 18:22:55 +0800 CST
view 758
深度解析 Google TimesFM:200M 参数如何在 1000 亿时间点上预训练后实现零样本超越有监督模型,覆盖架构原理、代码实战、性能对比与生产部署完整指南。
AI大模型
时间序列预测
Google
TimesFM
零样本预测
深度学习
GitHub开源
预训练模型
Kimi K3 深度拆解:当月之暗面决定「干掉所有开源对手」——2.8 万亿参数、百万上下文与三大 Infra 开源如何重新定义开源大模型的天花板
编程
Kimi K3 深度拆解:当月之暗面决定「干掉所有开源对手」——2.8 万亿参数、百万上下文与三大 Infra 开源如何重新定义开源大模型的天花板
2026-08-04 05:42:36 +0800 CST
view 349
深度拆解Kimi K3 2.8万亿参数MoE开源大模型:KDA混合线性注意力、Stable LatentMoE 896专家架构、百万Token上下文、三大Infra开源(MoonEP/FlashKDA/AgentEnv),附完整代码示例与性能基准对比
Kimi K3
月之暗面
MoE
大模型开源
2.8万亿参数
KDA注意力
FlashKDA
MoonEP
AgentEnv
开源模型
DeepSeek 专家模式深度解析:当低调更新成为AGI赛道的产品哲学宣言
编程
DeepSeek 专家模式深度解析:当低调更新成为AGI赛道的产品哲学宣言
2026-04-09 10:23:56 +0800 CST
view 929
2026年4月8日,DeepSeek悄然上线「专家模式」,无发布会无公告,却被业内视为V4发布前最有分量的产品预告。本文深度拆解双模式技术架构差异,实测数理推理、专业编程、创意写作三大场景,并解读这一低调更新背后的产品哲学与行业信号。
DeepSeek
AI大模型
V4
专家模式
推理模型
产品设计
国产AI
场景分层
Qwen3.8 深度拆解:当阿里巴巴用 2.4 万亿参数 MoE 架构决定「干掉所有编程助手」——从 Gated DeltaNet 混合注意力到 100 万上下文 Token 的 Agent-First 大模型工程哲学
编程
Qwen3.8 深度拆解:当阿里巴巴用 2.4 万亿参数 MoE 架构决定「干掉所有编程助手」——从 Gated DeltaNet 混合注意力到 100 万上下文 Token 的 Agent-First 大模型工程哲学
2026-08-04 09:16:35 +0800 CST
view 144
深度拆解阿里巴巴2.4万亿参数Qwen3.8大模型:稀疏MoE架构、Gated DeltaNet混合注意力、100万上下文Token、编程+办公双引擎、完整部署代码与性能基准对比
Qwen3.8
阿里巴巴
MoE
大模型开源
2.4万亿参数
Gated DeltaNet
混合注意力
Agent
编程助手
千问办公
开源模型
vLLM
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
编程
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
2026-07-17 14:24:55 +0800 CST
view 349
深度拆解微软 BitNet:1.58-bit 三值量化、Absmean/Absmax、BitLinear、bitnet.cpp 子矩阵内核,附 PyTorch 手写实现与 CPU 端侧推理性能实测。
BitNet
1-bit LLM
大模型推理
模型量化
端侧AI
bitnet.cpp
DeepSeek V4 Flash 深度解析:284B总参、13B激活的MoE开源模型,凭什么成为2026年度「性价比之王」?
编程
DeepSeek V4 Flash 深度解析:284B总参、13B激活的MoE开源模型,凭什么成为2026年度「性价比之王」?
2026-06-29 22:12:39 +0800 CST
view 1319
深度解析DeepSeek V4 Flash架构:CSA/HCA混合注意力、MoE细粒度路由、DSpark推测解码技术,附完整部署代码与Benchmark对比
DeepSeek
V4
MoE
开源模型
AI推理
DSpark
CSA
大模型
SSM-Transformer 混合架构深度实战:当状态空间模型终于与注意力机制握手言和
编程
SSM-Transformer 混合架构深度实战:当状态空间模型终于与注意力机制握手言和
2026-07-11 10:25:05 +0800 CST
view 289
深度拆解 2026 年 SSM-Transformer 混合架构的设计哲学、内核原理与生产实战:Mamba 选择性状态空间模型、Hybrid 混合层设计、vLLM 推理优化、Kubernetes 部署与性能调优,配完整可运行代码。
SSM
Mamba
Mamba2
Transformer
混合架构
状态空间模型
长上下文
推理优化
大模型
LLM
Gemma 4 架构解密:MoE 路由 × GQA 注意力 × Thinking Mode——31B 如何击败 20 倍参数对手
编程
Gemma 4 架构解密:MoE 路由 × GQA 注意力 × Thinking Mode——31B 如何击败 20 倍参数对手
2026-04-19 17:47:49 +0800 CST
view 920
深入解析 Google Gemma 4 的核心技术架构:MoE 稀疏专家路由、GQA 分组查询注意力、PLE 逐层嵌入、Thinking Mode 推理机制,详解 31B 模型如何以小博大击败 20 倍参数对手,附全场景部署实战代码。
Gemma
Google
AI
开源大模型
MoE
GQA
Transformer
深度学习
模型架构
OpenVINO 2026.3 深度拆解:从推理工具到「让大模型在 16GB 内存跑起来」的工程实践完全指南
编程
OpenVINO 2026.3 深度拆解:从推理工具到「让大模型在 16GB 内存跑起来」的工程实践完全指南
2026-08-13 08:43:23 +0800 CST
view 133
深度拆解OpenVINO 2026.3:磁盘卸载让300亿MoE模型在16GB内存运行、懒加载权重降低内存峰值、HuggingFace Transformers 5.5兼容、GenAI新流水线、EAGLE-3推测解码扩展,配完整Python/C++代码示例与15条生产踩坑清单。
OpenVINO
AI推理
Intel
深度学习
模型部署
CPU推理
GPU推理
MoE
磁盘卸载
大模型
DFlash 深度实战:块扩散模型如何实现 6 倍无损加速——从自回归瓶颈到并行生成的范式跃迁
编程
DFlash 深度实战:块扩散模型如何实现 6 倍无损加速——从自回归瓶颈到并行生成的范式跃迁
2026-05-23 11:16:44 +0800 CST
view 674
深度解析UC San Diego Z Lab提出的DFlash(Block Diffusion for Flash Speculative Decoding),详解块扩散草稿模型如何突破自回归瓶颈,在Qwen3-8B上实现6倍无损加速的架构原理、训练方法与生产级实战代码
LLM推理,投机解码,块扩散模型,大模型加速,DFlash,Speculative Decoding,UC San Diego,PyTorch,深度学习,AI推理优化
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
...
17
下一页