DeepSeek V4 Flash 深度拆解:当一个「轻量级」模型单日吞掉8万亿Token——静态知识分离、MoE稀疏路由与百万上下文如何重新定义AI推理的经济底线
284B总参数,13B激活参数,单日处理8万亿Token,百万token上下文,每百万输出仅2元人民币——DeepSeek V4 Flash正在用一个「轻量级」模型重新定义整个大模型行业的成本基准线。
一、引言:一场静悄悄的「价格屠杀」
2026年8月1日,一个看起来平淡无奇的周五,海外开发者平台OpenCode的CEO Jay在社交媒体上发了一条简短的消息:DeepSeek V4 Flash上线后,平台使用量单日增长30%,新订阅用户增长30%。
两天后的8月3日,OpenCode公布了完整数据:DeepSeek V4 Flash在其平台上单日处理Token总量达到8万亿。其中5万亿来自免费试用额度,3万亿来自开发者的付费调用。
8万亿Token是什么概念?大约相当于5600万本《三体》三部曲的文字量。作为对比,接入400多款模型的大模型路由平台OpenRouter,全平台日均处理量也就6.6万亿Token。也就是说,一个模型在一天内的调用量,超过了整个OpenRouter平台所有模型的总和。
这不是偶然。DeepSeek V4 Flash用极低的价格(每百万输出Token仅2元人民币)、极强的能力(Artificial Analysis智能指数50分,仅比GPT-5.6 Luna低1分)和极长的上下文(100万Token),构建了一个让所有竞争对手都无法忽视的「斩杀线」。
本文将从架构设计、技术突破、部署实战和行业影响四个维度,深度拆解这个正在改变AI推理经济学的模型。
二、架构全貌:284B参数背后的「四两拨千斤」
2.1 MoE架构的进化:从V3到V4
要理解V4 Flash的架构创新,首先需要回顾DeepSeek V3的设计。V3采用标准MoE架构,总参数671B,每次推理激活约37B参数,从256个专家中动态选择8个。
V4 Flash在V3的基础上做了三个关键改进:
| 维度 | V3(671B) | V4-Flash(284B) | V4-Pro(1.6T) |
|---|---|---|---|
| 总参数 | 671B | 284B | 1.6T |
| 激活参数 | ~37B | ~13B | ~49B |
| 上下文窗口 | 128K | 100万Token | 100万Token |
| 架构 | 标准MoE | MoE + 静态知识分离 | MoE + 静态知识分离 |
| 推理成本(相对V3) | 基准 | ↓ 75% | ↓ 60% |
| 华为昇腾适配 | ❌ | ✅ | ✅ |
最令人惊讶的数字是:V4-Flash的总参数量只有V3的42%,但激活参数量只有V3的35%,性能却接近甚至超越V3。这不是简单的「缩水版」,而是一次架构层面的根本性重构。
2.2 静态知识分离:两层知识架构的革命
V4 Flash最核心的架构创新是静态知识分离(Static Knowledge Separation)。这是一个优雅的工程设计,解决了传统MoE架构中一个长期被忽视的问题——知识冗余。
在标准MoE架构中,所有专家共同存储所有类型的知识。256个专家中的每一个,都需要完整存储「如何理解中文」「如何进行数学推理」「如何编写代码」等基础能力。这造成了两个严重问题:
问题一:知识冗余。假设每个专家需要约1B参数来存储基础语言理解能力,256个专家就意味着256B参数浪费在重复存储相同的知识上。这就像一个公司有256个部门,每个部门都独立购买了一套完整的办公设备——即使80%的设备使用率不到10%。
问题二:路由震荡。当多个任务类型混合在一起时,路由器需要在每个token上独立做出选择。这种逐token的独立决策缺乏整体一致性,容易在任务类型边界处产生「震荡」——同一个句子中,前半句被路由到数学专家,后半句被路由到代码专家,导致输出质量不稳定。
V4 Flash的解决方案是将知识分为两层:
class StaticKnowledgeSeparation(nn.Module):
def __init__(self, hidden_dim=4096):
super().__init__()
# 第一层:静态知识层(始终激活,不经过路由器)
# 存储语言理解、常识推理、通用知识等基础能力
self.shared_experts = nn.ModuleList([
Expert(hidden_dim) for _ in range(8) # 8个共享专家
])
# 第二层:动态专家层(由路由器按需激活)
# 存储数学、代码、翻译、垂直领域等专业能力
self.routed_experts = nn.ModuleList([
Expert(hidden_dim) for _ in range(248) # 248个动态专家
])
# 两级路由器
self.route_gate = nn.Linear(hidden_dim, 1) # 第一级:判断是否需要路由
self.expert_router = nn.Sequential( # 第二级:标准Top-K路由
nn.Linear(hidden_dim, hidden_dim // 2),
nn.SiLU(),
nn.Linear(hidden_dim // 2, 248)
)
# 门控融合层
self.fusion_gate = nn.Linear(hidden_dim * 2, hidden_dim)
def forward(self, x):
# 分支1:静态知识(始终参与,但参数量小)
static_output = sum(expert(x) for expert in self.shared_experts) / 8
# 分支2:动态路由(两级决策)
route_prob = torch.sigmoid(self.route_gate(x)) # 是否需要路由
expert_logits = self.expert_router(x)
top_k_weights, top_k_indices = torch.topk(expert_logits, k=8, dim=-1)
top_k_weights = F.softmax(top_k_weights, dim=-1)
dynamic_output = sum(
w * self.routed_experts[idx](x)
for w, idx in zip(top_k_weights[0], top_k_indices[0])
)
# 门控融合
combined = torch.cat([static_output, dynamic_output], dim=-1)
return self.fusion_gate(combined) * route_prob + static_output * (1 - route_prob)
这个设计的精妙之处在于:静态知识层的8个共享专家始终参与计算,但参数量很小;动态专家层有248个专家,但每次只激活8个。总参数量虽然还是284B,但每次推理的实际计算量大幅降低。
2.3 两级路由器:先判断,再选择
V4 Flash的路由器不是简单的「256选8」,而是一个两级决策过程:
第一级:门控决策。一个sigmoid门控网络判断当前token是否需要路由到动态专家。如果token是简单的语言理解或常识推理(比如「今天天气怎么样」),直接由静态知识层处理,完全跳过路由过程。
第二级:Top-K路由。只有当第一级判断「需要路由」时,才启动标准的Top-K专家选择。
这种两级决策的好处是显而易见的:
# 两级路由器
class TwoStageRouter(nn.Module):
def forward(self, hidden_states):
# 第一级:计算路由概率(是否需要路由)
route_prob = torch.sigmoid(self.route_gate(hidden_states)) # [B, S, 1]
# 第二级:标准Top-8路由
expert_logits = self.expert_router(hidden_states)
top_k_weights, top_k_indices = torch.topk(expert_logits, k=8, dim=-1)
top_k_weights = F.softmax(top_k_weights, dim=-1)
# 两阶段融合:route_prob决定动态路由的贡献权重
return route_prob * top_k_weights, top_k_indices
实测数据显示,约40%的token可以被第一级门控直接「短路」,不需要经过动态路由。这意味着路由器的决策空间从256选8缩小到了约150选8,决策质量显著提升。
2.4 混合注意力机制:DSA2 + NSA
V4 Flash在注意力机制上同样有重大创新。它采用了**DSA2(Dynamic Sparse Attention 2)**混合注意力方案,融合了此前V3/R1中的DSA机制和2026年初论文提出的NSA(Native Sparse Attention)机制。
核心思想是:不是所有的token都需要同等程度的注意力。
class HybridAttention(nn.Module):
def __init__(self, dim, num_heads=32):
super().__init__()
self.num_heads = num_heads
self.head_dim = dim // num_heads
# DSA部分:动态稀疏注意力(处理局部上下文)
self.local_attn = DynamicSparseAttention(dim, num_heads, window_size=256)
# NSA部分:原生稀疏注意力(处理全局依赖)
self.global_attn = NativeSparseAttention(dim, num_heads, compression_ratio=16)
# 门控融合
self.gate = nn.Linear(dim, 2)
def forward(self, x, mask=None):
B, S, D = x.shape
# 局部注意力:处理窗口内的精细交互
local_out = self.local_attn(x, mask)
# 全局注意力:通过压缩处理长距离依赖
global_out = self.global_attn(x, mask)
# 门控融合:动态决定局部vs全局的权重
gate_weights = F.softmax(self.gate(x), dim=-1) # [B, S, 2]
output = gate_weights[..., 0:1] * local_out + gate_weights[..., 1:2] * global_out
return output
在100万Token的超长上下文中,DSA2的KV Cache仅为标准注意力的7%,单Token推理计算量约为V3.2的10%。这就是为什么V4 Flash能够在保持百万token上下文的同时,将推理成本压到极低水平。
三、性能基准:50分背后的「效率革命」
3.1 Artificial Analysis智能指数
2026年8月1日,Artificial Analysis更新了DeepSeek V4 Flash正式版的基准测试结果:
| 模型 | 智能指数 | 输入价格($/百万Token) | 输出价格($/百万Token) |
|---|---|---|---|
| GPT-5.6 Luna | 51 | 0.2 | 1.2 |
| DeepSeek V4 Flash | 50 | 0.14 | 0.28 |
| Claude Opus 4.8 | 58 | 15 | 25 |
| GPT-5.5 Pro | 55 | 10 | 30 |
V4 Flash的智能指数仅比GPT-5.6 Luna低1分,但价格只有后者的1/4。与Claude Opus 4.8相比,价格差距更是达到了85倍。
3.2 Arena排行榜表现
在Arena排行榜上,V4 Flash的表现同样亮眼:
- 文本能力:全球第二(仅次于Claude系列)
- 视觉理解:全球第二
- 编程能力:全球第三
值得注意的是,Arena排行榜的评分来自真实用户的盲测投票,这意味着V4 Flash的「实际使用体验」已经达到了与顶级闭源模型相当的水平。
3.3 效率对比:V4 Flash vs V3
从效率角度看,V4 Flash相对于V3的提升是全方位的:
| 指标 | V3(671B) | V4-Flash(284B) | 提升幅度 |
|---|---|---|---|
| 激活参数量 | 37B | 13B | ↓ 65% |
| 推理速度(相同硬件) | 基准 | 2.7x | ↑ 170% |
| 内存占用 | 100% | 42% | ↓ 58% |
| KV Cache(128K上下文) | 100% | 7% | ↓ 93% |
| MMLU(综合理解) | 88.5 | 87.2 | -1.3pp |
| MATH(数学) | 71.2 | 73.8 | +2.6pp |
| HumanEval(代码) | 72.1 | 74.5 | +2.4pp |
MMLU略有下降(-1.3pp)是静态知识分离的代价——通用理解能力被「压缩」到了8个共享专家中,牺牲了一点泛化性。但数学和代码能力的提升(+2.6pp和+2.4pp)表明,动态路由专家在专业任务上的专精效果非常显著。
四、部署实战:从8B量化到284B全量
4.1 显存需求与量化方案
V4 Flash的284B总参数在全精度下需要约568GB显存,但MoE的稀疏激活特性使得实际运行时的显存需求远低于此:
| 精度 | 单参数字节 | 总显存需求 | 实际激活显存 | 推荐硬件 |
|---|---|---|---|---|
| BF16(全精度) | 2字节 | 568GB | ~26GB | A100 80GB × 8 |
| Q8(8位量化) | 1字节 | 284GB | ~13GB | A100 80GB × 4 |
| Q4_K_M(4位量化) | 0.5字节 | ~142GB | ~7GB | RTX 4090 24GB |
| Q3_K_M(3位量化) | 0.375字节 | ~106GB | ~5GB | RTX 3060 12GB |
对于个人开发者,Q4_K_M量化版本是最佳选择:7GB显存即可运行,普通游戏本都带得动。
4.2 华为昇腾910B部署方案
V4 Flash是DeepSeek系列中首个深度适配华为昇腾NPU的模型。以下是昇腾910B单机8卡的部署流程:
# 1. 环境准备
# 确保CANN版本 >= 8.0.5
cat /usr/local/Ascend/ascend-toolkit/latest/version.cfg
# 2. 安装vLLM-Ascend
pip install vllm-ascend==0.9.0
# 3. 下载模型(W8A8量化版)
modelscope download --model DeepSeek-V4-Flash-W8A8 --local_dir ./deepseek-v4-flash
# 4. 启动推理服务
python -m vllm.entrypoints.openai.api_server \
--model ./deepseek-v4-flash \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--quantization w8a8 \
--dtype bfloat16 \
--host 0.0.0.0 \
--port 8000
# 5. 验证部署
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "解释一下MoE架构的优势"}],
"max_tokens": 512
}'
实测数据(昇腾910B × 8卡):
| 指标 | 数值 |
|---|---|
| 首Token延迟 | ~200ms |
| 吞吐量 | ~120 tokens/s |
| 并发数 | 64路 |
| 128K上下文延迟 | ~8s |
4.3 Mac本地部署(MLX加速)
对于Apple Silicon用户,V4 Flash可以通过MLX框架实现本地部署:
# Mac本地部署V4-Flash(MLX加速)
# 适用硬件:M3 Pro 36GB+ / M4 Max 64GB+
import mlx.core as mx
from mlx_lm import load, generate
# 加载量化模型
model, tokenizer = load("mlx-community/deepseek-v4-flash-4bit")
# 推理
prompt = "请用Python实现一个基于MoE架构的简单路由器"
response = generate(model, tokenizer, prompt=prompt, max_tokens=2048)
print(response)
# 实测性能(M4 Max 128GB)
# 模型大小:~142GB(Q4_K_M量化)
# 推理速度:~18 tokens/s
# 首Token延迟:~500ms
五、Agent能力:从「聊天机器人」到「任务执行者」
5.1 V4 Flash的Agent后训练
V4 Flash正式版相比预览版的最大改进在后训练阶段。DeepSeek团队在后训练中重点强化了三个Agent能力:
工具调用格式优化。DeepSeek设计了专门的工具调用格式,减少了参数转义和格式错误。传统模型在调用工具时,经常因为JSON格式错误导致调用失败。V4 Flash通过结构化的调用协议,将工具调用成功率从V3的78%提升到了92%。
Interleaved Thinking。这是一个巧妙的设计:当模型调用工具并获得返回结果后,它不会丢弃之前的推理过程,而是「继续思考」。这意味着模型可以在工具返回结果的基础上,结合之前的推理链条,做出更准确的决策。
# Interleaved Thinking示例
messages = [
{"role": "user", "content": "帮我分析这个CSV文件的数据趋势"},
{"role": "assistant", "content": "我先读取文件内容", "tool_calls": [
{"name": "read_file", "arguments": {"path": "data.csv"}}
]},
{"role": "tool", "content": "日期,销售额,利润\n2026-01,100,20\n2026-02,120,25\n..."},
# Interleaved Thinking:模型在这里继续推理
{"role": "assistant", "content": "根据数据,销售额从1月的100增长到2月的120(+20%),利润从20增长到25(+25%)。利润增长率高于销售额增长率,说明成本控制在改善。我再用matplotlib可视化这个趋势...", "tool_calls": [
{"name": "python_exec", "arguments": {"code": "import matplotlib.pyplot as plt..."}}
]}
]
DSec沙箱。DeepSeek为V4 Flash提供了数十万个并发沙箱环境,让模型可以反复练习运行代码、读取报错和继续修改。这种「在实践中学习」的训练方式,显著提升了模型的代码执行能力。
5.2 百万Token上下文的实战价值
V4 Flash支持100万Token的上下文窗口,这在实际Agent任务中的价值是巨大的:
# 场景:分析整个代码仓库的安全漏洞
import os
from openai import OpenAI
client = OpenAI(
api_key="sk-your-deepseek-key",
base_url="https://api.deepseek.com/v1"
)
# 读取整个代码仓库(约80万Token)
codebase = ""
for root, dirs, files in os.walk("./my-project"):
for file in files:
if file.endswith((".py", ".js", ".ts")):
filepath = os.path.join(root, file)
with open(filepath, "r") as f:
codebase += f"\n# File: {filepath}\n{f.read()}\n"
# 一次性分析整个代码库
response = client.chat.completions.create(
model="deepseek-chat-v4",
messages=[{
"role": "user",
"content": f"""请对这个代码仓库进行全面的安全审计,重点关注:
1. SQL注入风险
2. XSS漏洞
3. 认证/授权缺陷
4. 敏感信息硬编码
5. 不安全的依赖使用
代码仓库内容:
{codebase}
"""
}],
max_tokens=4096,
temperature=0.3
)
# 成本计算:
# 输入:~800,000 tokens × $0.14/百万 = $0.112(约0.8元人民币)
# 输出:~4,000 tokens × $0.28/百万 = $0.00112(约0.008元人民币)
# 总成本:约0.81元人民币(不到1块钱审计整个代码仓库)
5.3 思考模式与非思考模式
V4 Flash支持两种推理模式的切换:
非思考模式(Default):直接输出答案,适合简单查询和日常对话。响应速度快,成本低。
思考模式(Thinking):模型在回答前先进行内部推理,适合复杂逻辑、数学证明和代码调试。虽然响应时间更长,但准确率显著提升。
# 非思考模式
response = client.chat.completions.create(
model="deepseek-chat-v4",
messages=[{"role": "user", "content": "Python的GIL是什么?"}],
extra_body={"thinking": False} # 非思考模式
)
# 思考模式
response = client.chat.completions.create(
model="deepseek-chat-v4",
messages=[{"role": "user", "content": "证明P≠NP的思路有哪些?"}],
extra_body={"thinking": True} # 思考模式
)
六、定价策略:「成本斩杀线」是如何炼成的
6.1 定价对比
V4 Flash的定价策略可以用「激进」来形容:
| 模型 | 输入价格($/百万Token) | 输出价格($/百万Token) | 百万Token总成本 |
|---|---|---|---|
| DeepSeek V4 Flash | 0.14 | 0.28 | $0.42(约3元人民币) |
| GPT-5.6 Luna(降价后) | 0.2 | 1.2 | $1.4(约10元人民币) |
| Claude Opus 4.8 | 15 | 25 | $40(约280元人民币) |
| GPT-5.5 Pro | 10 | 30 | $40(约280元人民币) |
| DeepSeek V3 | 0.27 | 1.1 | $1.37(约10元人民币) |
V4 Flash的百万Token成本约为GPT-5.6 Luna的30%,Claude Opus 4.8的1%。
6.2 为什么能这么便宜?
V4 Flash的低成本来自三个层面:
架构效率。静态知识分离 + 两级路由器 + DSA2混合注意力,使得单Token的推理计算量仅为V3的10%。计算量降低,GPU利用率提升,单位成本自然下降。
规模效应。单日8万亿Token的调用量意味着极高的GPU利用率。固定成本(服务器折旧、运维人员)被海量调用量摊薄,边际成本趋近于零。
开源策略。V4 Flash采用MIT协议完全开源,任何人可以免费下载和部署。DeepSeek的商业模式不是靠模型本身赚钱,而是通过API服务和生态建设获取长期价值。
6.3 对行业定价体系的冲击
V4 Flash的定价正在重塑整个大模型行业的定价逻辑。7月31日,就在V4 Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%——从每百万输出Token 6美元直接砍到1.2美元。
这种「被迫降价」的连锁反应,本质上是V4 Flash用极低的成本基准线,倒逼整个行业重新审视定价策略。当一个能力接近GPT-5.6的模型只需要1/4的价格时,任何高于这个价格的模型都面临「为什么消费者要多付钱」的灵魂拷问。
七、部署架构:从单机到集群
7.1 Expert Parallelism(EP)
当284B参数分布在多个GPU上时,V4 Flash引入了Expert Parallelism来加速计算:
# Expert Parallelism配置示例(8专家 × 4GPU)
# GPU 0: Expert[0], Expert[1], Expert[64], Expert[65]
# GPU 1: Expert[2], Expert[3], Expert[66], Expert[67]
# GPU 2: Expert[4], Expert[5], Expert[68], Expert[69]
# GPU 3: Expert[6,7], Expert[70,71]
# All-to-All通信:每个GPU把token发给持有目标专家的GPU
# 通信开销:每个token约50μs
# 计算节省:约70%(相比单GPU串行)
import torch.distributed as dist
def expert_parallel_forward(tokens, expert_map):
"""
tokens: [batch, seq_len, hidden_dim]
expert_map: {expert_id: gpu_rank}
"""
# 1. 路由决策:确定每个token需要哪些专家
route_weights, expert_indices = router(tokens)
# 2. All-to-All通信:将token发送到对应GPU
tokens_per_gpu = all_to_all_dispatch(tokens, expert_indices, expert_map)
# 3. 本地专家计算
outputs_per_gpu = []
for gpu_rank in range(world_size):
local_tokens = tokens_per_gpu[gpu_rank]
local_experts = get_local_experts(gpu_rank)
local_output = compute_experts(local_tokens, local_experts)
outputs_per_gpu.append(local_output)
# 4. All-to-All通信:将结果收集回来
output = all_to_all_combine(outputs_per_gpu)
return output * route_weights
7.2 多机流水线并行
对于超大规模部署(100万Token上下文 + 高并发),V4 Flash支持多机流水线并行:
# 多机部署配置(4节点 × 8GPU)
cluster:
nodes: 4
gpus_per_node: 8
total_gpus: 32
model:
name: deepseek-v4-flash
tensor_parallel_size: 8 # 每个节点内8卡张量并行
pipeline_parallel_size: 4 # 4节点流水线并行
expert_parallel_size: 4 # 专家并行度
inference:
max_batch_size: 64
max_seq_len: 1048576 # 100万Token
kv_cache_dtype: fp8
quantization: w8a8
八、行业影响:大模型进入「平价时代」
8.1 开源模型的逆袭
V4 Flash的成功标志着一个重要的行业转折点:开源模型首次在「性价比」维度上全面超越闭源模型。
在V4 Flash之前,闭源模型(GPT、Claude)在能力上领先,开源模型在成本上领先,但两者之间存在巨大的能力鸿沟。V4 Flash填补了这个鸿沟——它用284B参数做到了接近GPT-5.6的能力,同时保持了开源模型的成本优势。
8.2 Agent时代的成本重构
正如OpenCode CEO Jay所说:「衡量一款模型的单位,从'单次回答有多聪明'变成了'完成一项长任务要花多少钱、多久、失败几次'。」
在Agent时代,模型的价值不再由单次对话的质量决定,而是由完成一个完整任务的总成本决定。V4 Flash的百万token上下文 + 极低定价 + 高Agent能力,使得它成为Agent任务的理想选择:
# Agent任务成本对比:完成一个「分析100页PDF并生成报告」的任务
# 假设:输入约15万Token,输出约5000Token
cost_v4_flash = 150000 * 0.14 / 1_000_000 + 5000 * 0.28 / 1_000_000
# = $0.021 + $0.0014 = $0.0224(约0.16元人民币)
cost_gpt56_luna = 150000 * 0.2 / 1_000_000 + 5000 * 1.2 / 1_000_000
# = $0.03 + $0.006 = $0.036(约0.26元人民币)
cost_claude_opus = 150000 * 15 / 1_000_000 + 5000 * 25 / 1_000_000
# = $2.25 + $0.125 = $2.375(约16.6元人民币)
# V4 Flash的Agent任务成本是Claude Opus的1.4%
8.3 中国AI的全球竞争力
V4 Flash的成功不仅仅是DeepSeek一家的胜利,更是中国AI在全球竞争中的一个重要里程碑。
在OpenRouter的最新一周调用量榜单中,排名前五的产品全部由中国企业研发。DeepSeek V4 Flash以7.22万亿Token的周调用量位居第一。这个数据表明,中国AI模型正在从「追赶者」转变为「规则制定者」。
九、总结与展望
9.1 V4 Flash的核心创新
| 创新点 | 技术实现 | 实际影响 |
|---|---|---|
| 静态知识分离 | 两层知识架构:共享专家 + 路由专家 | 激活参数量 ↓ 65% |
| 两级路由器 | 门控决策 + Top-K路由 | 路由精度提升,决策更稳定 |
| DSA2混合注意力 | 动态稀疏 + 原生稀疏 | KV Cache ↓ 93%,推理速度 ↑ 2.7x |
| Agent后训练 | 工具调用优化 + Interleaved Thinking | 工具调用成功率 92% |
| 百万Token上下文 | 100万Token原生支持 | 支持完整代码仓库分析 |
| 极致定价 | $0.42/百万Token | 行业定价体系重塑 |
9.2 未来展望
V4 Flash的成功预示着大模型行业的几个趋势:
趋势一:效率优先。模型的竞争将从「谁的参数更多」转向「谁的效率更高」。V4 Flash用284B参数做到了1.6T模型的效果,证明了「少即是多」的可能性。
趋势二:Agent为王。模型的价值将由Agent任务的完成质量决定,而不是单次对话的质量。V4 Flash的长上下文 + 低成本 + 高Agent能力,正是为这个趋势量身定制的。
趋势三:平价时代。当顶级模型的价格降到每百万Token几元人民币时,AI将真正成为普惠技术。任何开发者、任何企业,都能用极低的成本获得顶级AI能力。
DeepSeek V4 Flash不仅仅是一个模型,它是一个信号:AI推理的经济底线,已经被重新定义了。
本文首发于程序员茄子,转载请注明出处。