Kimi K3 深度拆解:当月之暗面决定「干掉所有开源对手」——2.8 万亿参数、百万上下文与三大 Infra 开源如何重新定义开源大模型的天花板
一、引言:开源大模型的「3 万亿时代」正式到来
2026 年 7 月 27 日深夜,月之暗面(Moonshot AI)低调但有力地发布了 Kimi K3——一个拥有 2.8 万亿参数的混合专家(MoE)大语言模型。这不是一次简单的规模堆砌,而是一次系统性的架构革新:自研的 Kimi Delta Attention(KDA)混合线性注意力机制、Attention Residuals(注意力残差)技术、Stable LatentMoE 框架,再加上三项关键 Infra 技术(MoonEP、FlashKDA、AgentEnv)的同步开源,构成了一个从底层算子到上层训练环境的完整技术栈。
作为首个突破 3 万亿参数门槛的开源模型,Kimi K3 的意义远不止于参数量的数字游戏。它用 896 个专家中仅激活 16 个 的极端稀疏设计,在保持超大模型容量的同时,将推理效率控制在可接受范围内。100 万 Token 的原生上下文窗口,让它在长程编码、知识工作、多模态推理等前沿场景中展现出超越闭源竞品的潜力。
本文将从架构设计、核心技术创新、三大 Infra 开源、性能基准对比、实战应用案例以及定价策略六个维度,对 Kimi K3 进行深度拆解。对于关注大模型技术演进的开发者和研究者来说,这篇文章或许能帮你理解——为什么说 Kimi K3 的发布,标志着开源大模型正式进入了「万亿级」竞争时代。
二、模型架构全景:2.8 万亿参数的「大而快」设计哲学
2.1 核心参数一览
Kimi K3 的架构参数如下:
| 参数 | 值 |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数量 | 2.8T (2.8 万亿) |
| 激活参数量 | 104B (1040 亿) |
| 层数 | 93 层 (含 1 层 Dense 层) |
| 注意力层组成 | 69 KDA + 24 Gated MLA |
| 注意力隐藏维度 | 7168 |
| 注意力头数 | 96 |
| Latent MoE 维度 | 3584 |
| 每个专家的隐藏维度 | 3072 |
| 专家总数 | 896 |
| 每 Token 激活专家数 | 16 |
| 共享专家数 | 2 |
| 词表大小 | 160K |
| 上下文长度 | 1,048,576 (100 万 Token) |
| 注意力机制 | KDA & Gated MLA |
| 激活函数 | SiTU-GLU |
| 视觉编码器 | MoonViT-V2 (401M 参数) |
| 量化 | MXFP4 权重 / MXFP8 激活 (量化感知训练) |
2.2 MoE 架构:896 专家中只激活 16 个的极端稀疏
Kimi K3 延续并大幅扩展了 MoE(Mixture of Experts)架构路线,但将其推向了前所未有的稀疏度。传统的 MoE 模型可能只有 8-64 个专家,而 K3 将专家数量推到了 896 个,每次推理仅激活 16 个——这意味着稀疏度达到了惊人的 98.2%。
这种极端稀疏设计的核心逻辑是:
- 大容量 + 高效率:总参数量 2.8 万亿提供了海量的知识存储能力,但每次推理只使用约 3.7% 的参数(104B / 2.8T),算力消耗远低于同规模的稠密模型。
- 任务专业化:896 个专家可以学习到极其细粒度的知识分布,不同任务激活不同的专家组合,实现「专病专治」。
- 训练稳定性:结合 Stable LatentMoE 框架,通过 SiTU-GLU 激活函数和 Quantile Balancing 策略,确保在极高稀疏度下训练不崩溃。
# 简化的 MoE 路由示意(概念性代码,非实际实现)
import torch
import torch.nn as nn
class MoERouter(nn.Module):
def __init__(self, num_experts=896, top_k=16, hidden_dim=7168):
super().__init__()
self.num_experts = num_experts
self.top_k = top_k
# 路由网络:将输入映射到每个专家的分数
self.gate = nn.Linear(hidden_dim, num_experts, bias=False)
def forward(self, x):
# x: [batch, seq_len, hidden_dim]
logits = self.gate(x) # [batch, seq_len, 896]
# Top-K 选择:每个 token 选择得分最高的 16 个专家
topk_scores, topk_indices = torch.topk(logits, self.top_k, dim=-1)
# Softmax 归一化路由权重
topk_weights = torch.softmax(topk_scores, dim=-1)
# 返回选中的专家索引和对应权重
return topk_indices, topk_weights
# 在 2.8T 参数的 K3 中:
# - 896 个专家,每个专家有 3072 维隐藏层
# - 每个 token 仅激活 16 个专家
# - 另外还有 2 个共享专家始终参与计算
# 总参数量 ≈ 93 层 × (896 × 3072 × 3072 × 2 + 7168 × 7168 × 96 × 3) ≈ 2.8T
2.3 注意力机制的双重架构:KDA + Gated MLA
Kimi K3 的注意力层采用了混合设计:69 层使用 Kimi Delta Attention(KDA),24 层使用 Gated MLA(Multi-Head Latent Attention)。这种混合架构是 K3 能够高效处理百万级上下文的关键。
Kimi Delta Attention (KDA) 是月之暗面自研的混合线性注意力机制。它的核心思想是将线性注意力的 O(1) 状态压缩与传统注意力的精确检索能力相结合:
- 恒态记忆(Constant State):线性注意力将历史信息压缩为固定大小的状态矩阵,无论序列多长,KV Cache 的大小都是常数。这使得百万 Token 的上下文不会带来显存的线性增长。
- 选择性遗忘:KDA 不是简单地记住所有历史,而是通过门控机制选择性地保留重要信息、遗忘冗余信息。这种「有损压缩」在实际测试中被证明比精确注意力更高效。
- 混合精度:在 KDA 的基础上,通过块级注意力残差(AttnRes)增强跨层信息流动,确保深层网络中的信息不丢失。
Gated MLA 则是标准的多头潜注意力机制的改进版本,通过门控机制控制信息流动,在 24 层注意力层中提供精确的 Token 级检索能力。
这种混合设计的工程意义在于:
# 概念性展示 KDA 的状态压缩机制(非实际实现)
class KimiDeltaAttention:
"""
KDA 的核心思想:
- 传统注意力:每层都需要存储完整的 KV Cache → O(N) 显存
- KDA:将历史信息压缩为固定大小的状态 → O(1) 显存
"""
def __init__(self, state_dim=7168):
self.state_dim = state_dim
# 恒态记忆:固定大小的状态矩阵
self.state = torch.zeros(state_dim, state_dim)
def forward(self, query, key, value):
# 1. 状态更新:用当前的 KV 对更新状态(类似 DeltaNet)
delta = key.T @ value # 外积更新
self.state = self.state + delta
# 2. 注意力计算:用 query 从状态中检索信息
output = query @ self.state # O(d²) 计算,与序列长度无关
# 3. 与标准注意力的混合(通过 AttnRes 残差连接)
# output = alpha * output_kda + (1 - alpha) * output_attn
return output
# 关键优势:
# - 无论序列长度是 1K 还是 1M,显存占用恒定
# - 推理速度与序列长度近似线性关系
# - 代价是牺牲一定的精确检索能力(通过混合设计弥补)
2.4 MoonViT-V2:从零训练的视觉编码器
Kimi K3 原生支持视觉理解,其视觉编码器 MoonViT-V2 是一个拥有 401M 参数的视觉 Transformer。与大多数视觉语言模型使用 SigLIP 等预训练视觉编码器不同,MoonViT-V2 从零开始使用 next-token prediction 训练,无需对比预训练。
这种训练策略的优势在于:
- 更稳定的优化过程(避免了对比学习中的负样本采样问题)
- 与语言模型的训练目标天然对齐
- 在达到 SigLIP 初始化基线效果的同时,获得更好的多模态一致性
三、三大 Infra 开源:从通信库到沙箱的完整技术栈
Kimi K3 的开源不仅限于模型权重,月之暗面还同步开源了支撑训练的三大核心技术基础设施。这在开源大模型领域是前所未有的——大多数开源模型只发布权重,而训练基础设施往往被视为核心竞争力而严格保密。
3.1 MoonEP:超大细粒度 MoE 的高性能通信库
MoonEP 是为超大细粒度 MoE 架构打造的高性能专家并行(Expert Parallelism)通信库。在训练 2.8 万亿参数的 MoE 模型时,最大的工程挑战之一就是专家路由导致的数据通信不均衡——不同的 token 会被路由到不同的专家,而专家分布在不同的 GPU 上,这会导致严重的通信瓶颈。
MoonEP 的核心创新:
- 负载均衡感知的通信调度:即使专家路由导致负载不均,MoonEP 也能通过智能调度确保通信效率
- 细粒度专家并行:支持 896 个专家的超大规模并行,而传统通信库通常只支持几十个专家
- 与训练框架深度集成:无缝对接 PyTorch 分布式训练框架
# MoonEP 通信优化的概念性展示
# 实际 API 可能有所不同
# 传统 MoE 通信的问题:
# Expert 0 on GPU 0, Expert 1 on GPU 1, ...
# Token A → Expert 3 (GPU 3)
# Token B → Expert 5 (GPU 5)
# Token C → Expert 3 (GPU 3) # 负载不均衡!
# MoonEP 的解决方案:
from moonep import ExpertParallelComm
# 初始化 896 专家的通信组
comm = ExpertParallelComm(
num_experts=896,
expert_parallel_size=8, # 8 GPU 并行
load_balance_strategy="adaptive" # 自适应负载均衡
)
# 在前向传播中高效交换专家数据
def expert_parallel_forward(hidden_states, expert_indices):
# 1. 收集每个 GPU 需要的数据
# 2. 使用 All-to-All 通信交换数据
# 3. 本地计算专家前向
# 4. 使用 All-to-All 通信返回结果
# MoonEP 在步骤 1-2 和 3-4 中实现负载均衡
return comm.expert_forward(hidden_states, expert_indices)
3.2 FlashKDA:Kimi Delta Attention 的高性能算子
FlashKDA 是 Kimi Delta Attention 的高性能 CUDA 算子(kernel),专门针对 KDA 的计算特点进行优化。在英伟达 H20 芯片上,FlashKDA 相比基线方案将 prefill 速度提升了 1.72 至 2.22 倍。
KDA 的计算瓶颈在于:
- 状态矩阵的更新需要大量的矩阵乘法
- 长序列场景下,状态矩阵的维度成为性能瓶颈
- 需要与标准注意力机制高效混合
FlashKDA 的优化策略:
- 融合内核(Fused Kernel):将多个 CUDA 操作融合为一个内核,减少显存读写
- 分块计算(Tiling):将大矩阵运算分解为小块,充分利用 GPU 的共享内存
- 混合精度优化:在保持数值稳定性的同时,使用低精度计算加速
// FlashKDA 核心计算的伪代码(概念性展示)
// 实际 CUDA 代码远比这复杂
// KDA 状态更新的融合内核
__global__ void flash_kda_update(
float* state, // [d, d] 状态矩阵
float* key, // [seq_len, d] 键
float* value, // [seq_len, d] 值
int seq_len,
int d
) {
// 1. 每个线程块处理 state 的一块
int block_row = blockIdx.y * blockDim.y + threadIdx.y;
int block_col = blockIdx.x * blockDim.x + threadIdx.x;
// 2. 分块累加 key^T @ value
float acc = 0.0f;
for (int i = 0; i < seq_len; i++) {
acc += key[i * d + block_row] * value[i * d + block_col];
}
// 3. 原子更新状态矩阵
atomicAdd(&state[block_row * d + block_col], acc);
}
// 优化点:
// - 使用共享内存缓存 key 和 value 的分块
// - 使用 warp 级别的归约操作
// - 支持 FP16/BF16 混合精度
3.3 AgentEnv:智能体强化学习沙箱系统
AgentEnv 是月之暗面与 KVCache.ai 联合开发的智能体沙箱系统,为大规模 Agent 运行提供高保真、强隔离的环境。它支持:
- 快速快照(Snapshot):在毫秒级时间内保存 Agent 的完整运行状态
- 状态恢复(Restore):从任意快照点恢复 Agent 运行
- 状态分叉(Fork):从同一个起点分叉出多个并行实验
- 分布式 RL 环境:支持数千个 Agent 并行运行强化学习训练
AgentEnv 的工程价值在于解决了 Agent 训练中的一个核心难题:如何在安全可控的环境中进行大规模的试错学习。传统的 Agent 训练要么在真实环境中进行(风险高、成本高),要么在简化的模拟环境中进行(保真度低)。AgentEnv 通过高保真沙箱 + 快速快照/恢复的组合,在安全性和保真度之间找到了平衡点。
# AgentEnv 沙箱系统的概念性使用方式
from agentenv import Sandbox
# 创建沙箱环境
sandbox = Sandbox(
image="kimi-k3-env:latest",
resources={"gpu": 1, "memory": "16GB"},
isolation_level="full" # 完全隔离
)
# 在沙箱中运行 Agent
agent = sandbox.create_agent(model="kimi-k3")
# 保存快照
snapshot_id = sandbox.snapshot(agent)
# 运行 Agent 任务
result = agent.run_task(
task="在 GitHub 上修复 issue #1234",
tools=["github", "terminal", "browser"],
max_steps=100
)
# 如果结果不满意,可以恢复快照重新尝试
sandbox.restore(agent, snapshot_id)
# 分叉出多个并行实验
fork_results = sandbox.fork_and_run(
agent=agent,
snapshot=snapshot_id,
strategies=["aggressive", "conservative", "balanced"],
num_trials=10
)
四、性能基准:全面超越开源竞品,逼近闭源前沿
Kimi K3 在多个权威基准测试中展现出强大的性能。以下是其在推理与知识、编码、Agent、视觉四大维度的表现:
4.1 推理与知识
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 |
| CritPt | 23.4 | 28.6 | 32.3 | 20.9 | 27.1 |
| AA-LCR | 74.7 | 70.0 | 73.7 | 67.7 | 74.3 |
在 GPQA Diamond 上,Kimi K3 达到 93.5 分,超过 Claude Fable 5(92.6)和 Claude Opus 4.8(91.0),与 GPT-5.5 持平。这证明了 2.8 万亿参数带来的知识密度优势。
4.2 编码能力
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 |
| ProgramBench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 |
| SWE-Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 |
| Kimi Code Bench 2.0 | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 |
K3 在 ProgramBench(77.8)上超越了所有竞品,包括 Claude Fable 5(76.8)和 GPT-5.6 Sol(77.6)。在 SWE-Marathon 上,K3 达到 42.0 分,显著领先于 Claude Fable 5(35.0)和 GPT-5.6 Sol(39.0)。这证明了 K3 在长时间编码任务上的持续执行能力。
4.3 Agent 能力
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 |
| DeepSearchQA (F1) | 95.0 | 94.2 | — | 93.1 | — |
| MCPMark-Verified | 94.5 | 87.4 | 92.9 | 76.4 | 92.9 |
| AutomationBench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 |
| OSWorld-Verified | 84.8 | 85.0 | 83.0 | 83.4 | 79.0 |
K3 在 Agent 相关基准上全面领先开源竞品。BrowseComp(91.2)超过 Claude Fable 5(88.0)和 GPT-5.6 Sol(90.4),MCPMark-Verified(94.5)大幅领先 Claude Fable 5(87.4)。这表明 K3 的百万 Token 上下文 + 强大的工具调用能力,使其在 Agent 场景中具有显著优势。
4.4 视觉能力
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| WorldVQA ForceAnswer | 51.0 | 56.7 | 41.8 | 39.1 | 38.5 |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 |
| Video-MME (w. sub) | 90.0 | — | 89.5 | 86.0 | 89.3 |
| MathVision | 94.3 / 97.8 | 94.8 / 98.6 | 95.8 / 97.8 | 86.7 / 97.1 | 92.2 / 96.8 |
K3 在视觉理解上与闭源前沿模型基本持平。OmniDocBench(91.1)超过 Claude Fable 5(89.8),Video-MME(90.0)超过 GPT-5.6 Sol(89.5)。这证明了 MoonViT-V2 从零训练的策略是成功的。
五、实战案例:K3 能做什么?
Kimi K3 的技术报告展示了多个令人印象深刻的实战案例,证明了其在长程编码、科学研究、芯片设计等场景中的能力。
5.1 芯片设计:48 小时自主完成 45nm 推理芯片
K3 在一次 48 小时的自主运行中,利用开源 EDA 工具在 Nangate 45nm 库上设计了一款基于自身架构的纳米模型芯片。芯片的关键指标:
- 面积:4 平方毫米
- 闭合时序:100 MHz
- 译码吞吐量:8700+ 令码/秒
- 标准单元数:146M
- SRAM:0.277MB
- INT4 MAC 阵列
这个案例的工程意义在于:K3 不仅能写出正确的代码,还能理解复杂的硬件约束(时序、面积、功耗),并在 48 小时内完成从架构设计到物理验证的全流程。
5.2 GPU 编译器开发:MiniTriton
K3 开发了 MiniTriton,一款紧凑型的 Triton 类编译器,拥有自己的磁片级 IR 层,覆盖 MLIR、优化通道和 PTX 代码生成流水线。在支持的车顶线基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 不相上下甚至更好。
# MiniTriton 的使用示例(概念性展示)
# K3 开发的 GPU 编译器能够从 DSL 到 PTX 的完整流水线
import minitriton as mt
@mt.jit
def flash_attention_forward(Q, K, V, scale):
"""
K3 生成的 FlashAttention 内核
- 支持自动分块计算
- 支持 FP16/BF16 混合精度
- 自动管理共享内存
"""
seq_len = Q.shape[0]
head_dim = Q.shape[1]
# 分块计算(K3 自动优化块大小)
for block_start in range(0, seq_len, mt.BLOCK_SIZE):
# 计算当前块的注意力分数
scores = mt.dot(Q, K[block_start:block_start+mt.BLOCK_SIZE].T) * scale
# Softmax + 加权求和
probs = mt.softmax(scores, dim=-1)
output = mt.dot(probs, V[block_start:block_start+mt.BLOCK_SIZE])
return output
# K3 在生成此代码时:
# 1. 理解了 FlashAttention 的算法原理
# 2. 选择了合适的分块策略
# 3. 自动生成了高效的 CUDA 内核
# 4. 性能与手写优化的 Triton 相当
5.3 科学研究:2 小时完成一周的工作量
K3 在计算天体物理学中重现了 I-Love-Q 普遍关系:
- 审阅并交叉验证了 20+ 篇论文
- 实现了完整的数值流程
- 评估了 300+ 个状态方程
- 发现已发表公式中的不一致之处
- 生成了 3000+ 行 Python 代码
- 制作了交互式 HTML 仪表盘
这个案例展示了 K3 的「长程 Agent」能力——在极少人工监督下,持续执行复杂的多步骤任务,最终交付完整的、可验证的研究成果。
六、定价策略:「输入友好、输出偏贵」的精准定位
Kimi K3 的 API 定价策略非常有意思:
| 场景 | 价格(¥/百万 Token) |
|---|---|
| 输入(缓存命中) | ¥2.0 |
| 输入(缓存未命中) | ¥20.0 |
| 输出 | ¥100.0 |
| 上下文窗口 | 1,048,576 |
这种「输入友好、输出偏贵」的定价策略背后的逻辑:
- 读多写少的场景:K3 的百万 Token 上下文窗口意味着它可以一次性读取大量信息(代码库、文档、论文),然后输出精炼的摘要或分析。在这种场景下,输入成本低、输出量少,总成本可控。
- Agent 场景:Agent 的特点是频繁的工具调用和状态读取,输入量远大于输出量。K3 的定价精准匹配了这一场景。
- 自部署降本:作为开源模型,拥有 GPU 集群的团队可以自部署 K3,边际成本趋近于零。
# 成本估算示例:K3 vs GPT-5.5 在长文档摘要场景
# 假设:输入 50,000 tokens(一篇长论文),输出 500 tokens(摘要)
# K3 成本(缓存未命中):
k3_input_cost = 50000 * 20 / 1_000_000 # ¥1.0
k3_output_cost = 500 * 100 / 1_000_000 # ¥0.05
k3_total = k3_input_cost + k3_output_cost # ¥1.05
# K3 成本(缓存命中):
k3_input_cost_cached = 50000 * 2 / 1_000_000 # ¥0.1
k3_total_cached = k3_input_cost_cached + k3_output_cost # ¥0.15
# GPT-5.5 成本:
gpt_input_cost = 50000 * 14 / 1_000_000 # ¥0.7
gpt_output_cost = 500 * 56 / 1_000_000 # ¥0.028
gpt_total = gpt_input_cost + gpt_output_cost # ¥0.728
# 对比:
# - 缓存未命中:K3 (¥1.05) vs GPT-5.5 (¥0.728) → K3 贵 44%
# - 缓存命中:K3 (¥0.15) vs GPT-5.5 (¥0.728) → K3 便宜 79%
# - 自部署:K3 ≈ ¥0(仅电力成本)
# 结论:对于重复调用相同上下文的场景(如 Agent),K3 的缓存命中率高,成本优势明显
七、技术挑战与未来展望
7.1 当前挑战
- 输出价格偏高:¥100/百万 Token 的输出价格,对于「写多读少」的生成式场景(如长文创作、大量代码生成)是一道门槛。
- 部署门槛:2.8 万亿参数的模型需要 H100/A100 级别的 GPU 集群才能高效运行,中小团队难以负担。
- 生态成熟度:开源社区围绕 K3 构建的微调工具链、推理优化方案还需要时间积累。
- 与闭源前沿的差距:虽然 K3 全面超越了大部分开源模型和部分闭源模型,但在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol。
7.2 技术趋势
Kimi K3 的发布揭示了大模型技术的几个重要趋势:
- MoE 架构成为主流:从 K3 的 896 专家架构可以看出,MoE 是实现超大参数量 + 高推理效率的最佳路径。未来我们可能会看到更多超过 1 万亿参数的开源 MoE 模型。
- 注意力机制的进化:KDA 的成功证明,传统 Transformer 的注意力机制已经不是唯一选择。混合线性注意力 + 残差连接的组合,可能是处理百万级上下文的最优解。
- Infra 开源成为趋势:K3 同步开源 MoonEP、FlashKDA、AgentEnv 的做法,为开源大模型树立了新标杆。未来,只发布模型权重而不发布训练基础设施的做法可能会被视为「不完整」的开源。
- Agent 能力成为核心竞争力:K3 在 Agent 基准上的全面领先,证明了大模型的竞争已经从「谁更会说话」转向「谁更会干活」。
八、总结
Kimi K3 是一个里程碑式的产品。它证明了:
- 开源可以做到 3 万亿参数:K3 的发布打破了「开源模型规模有限」的刻板印象。
- 极端稀疏 MoE 是可行的:896 专家中激活 16 个的极端稀疏设计,在工程上是可实现的。
- 混合注意力机制是处理超长上下文的关键:KDA + AttnRes 的组合,为百万 Token 上下文提供了高效的解决方案。
- Infra 开源可以加速生态发展:MoonEP、FlashKDA、AgentEnv 的开源,为社区提供了训练和部署超大 MoE 模型的完整工具链。
对于开发者来说,K3 提供了一个明确的选择信号:
- 如果你经常处理超长文档分析、全仓库级代码审查:K3 的百万 Token 上下文 + 低输入成本是最佳选择。
- 如果你需要强大的 Agent 能力:K3 在 Agent 基准上的全面领先,使其成为 Agent 开发的首选模型。
- 如果你有 GPU 集群:自部署 K3 的综合成本优势是任何闭源 API 都无法比拟的。
开源大模型的万亿级竞争时代,正式开始了。而月之暗面用 Kimi K3 交出了一份令人信服的答卷。
参考资源