Spark-X2.5 本地实测:把 4B 端侧模型接到 Codex 与翻译工具
过去要让 Agent 稳定调用工具,基本是百亿参数以上大模型的活。词元星火(科大讯飞全资子公司)开源了两款端侧模型:Spark-X2.5-1.7B 和 Spark-X2.5-4B。官方评测里,这两款模型在同类尺寸开源模型中多项能力靠前,Agent 类任务更加明显;模型原生支持 100 万 Token 上下文,长任务的上下文不容易断。

相关资源:
- Hugging Face:
- ModelScope:
- AtomGit:
- GitHub 项目(含部署文档):
- 讯飞星辰 MaaS 平台:
按这个尺寸判断,我原本只预期它能做点对话。实际在本地部署后,它能读 GitHub 项目、调用技能工具,把 4B 模型接进 Codex 也能跑完 Agent 流程。
一句话让 AI 把模型部署到本地
模型兼容 SGLang、vLLM、llama.cpp 等主流推理框架,权重在 Hugging Face 和 ModelScope 都有。我选了自己常用的 Claude Code,直接发一句话:
帮我在本地部署这个开源模型 https://huggingface.co/XHToken/Spark-X2.5-1.7B,按 README 用 llama.cpp 方式,跑通后起一个本地服务

Claude Code 会先检查电脑配置和环境,判断这台机器适不适合部署,再下载权重、按 README 编译并启动服务,全程不需要手动介入。部署完成后,模型暴露的服务可以接入任何兼容 OpenAI 或 Anthropic 协议的工具。

llama.cpp 自带 WebUI,浏览器打开本地服务地址就能直接对话。我先部署的是 Spark-X2.5-1.7B,实测大约 28 token/s,比预想流畅。随后用同样方式把 4B 也部署了一遍。

挂到翻译工具上当本地引擎
模型支持 200 多种语言。部署完第一件事,就是把它接进电脑里的翻译工具。配置不复杂:服务商选 OpenAI,请求地址填本地服务地址,模型名填部署的模型 ID,API Key 随便填一个即可。

我从 Spark-X2.5 的 README 里拿了一段英文介绍测试,翻译几乎是瞬时返回,质量也可读。关键是全程离线,不需要 API 费用。

把 Codex 默认模型切成本地 4B
接着把 4B 模型接进 Codex。这里用 CC Switch 做配置切换,要接入 Claude Code 的步骤也类似。
打开 CC Switch 切到 Codex,点右侧加号「新添加供应商」:
- 供应商名称、API Key:随便填
- API 请求地址:本地部署的服务地址
- 默认模型:本机部署的模型 ID
- 上游格式:Responses(原生)
- 模型映射里的上下文窗口:按部署时设置的上下文长度填


回到 CC Switch 主页后启用新供应商,顺手测一下连接。终端启动 Codex,模型列表里出现 Spark-X2.5-4B 就算接通了。

简单任务:读懂一个 GitHub 项目
先给它一个简单任务:我只发了一个 GitHub 项目地址,让它了解整个项目。它会自己调用工具把项目拉到本地,读取代码和 README,最后输出项目用途、特性和安装方法。

上难度:用 Archify 技能生成架构图
第二个任务测的是工具调用和代码能力。之前介绍过的画图技能 Archify 输出的是 HTML 架构图,正好拿来测:让模型用 Archify 给项目生成一张架构图,然后观察过程。
模型先读取技能的使用说明,再看项目核心文件确认细节,最后调用技能写代码生成架构图。整个过程拆成很多步,4B 参数能做到这个完整度,确实超出我对小模型的预期。

最终 HTML 架构图信息量很足,看完基本能了解项目结构。小问题也有:字体偏小、部分组件位置不对、动效缺失。但 Spark-X2.5-4B 跑在端侧能做到这个程度,已经算可用。

写在最后
小模型只配当对话玩具的印象,这次确实被修正了:一个 4B 模型在本地,能读完整个项目代码,能调用外部工具和技能,也能走完 Agent 式的多步任务。
对医疗、法务、金融这类数据敏感行业来说,需求一直在,真正的卡点不是模型效果,而是数据不能出本地。Agent 能力跑在端侧、离线可部署,这类场景才有落地空间。接下来一两年,端侧模型在这些行业的落地案例,很可能比云端 Agent 来得更快。