编程 Spark-X2.5 本地实测:把 4B 端侧模型接到 Codex 与翻译工具

2026-09-04 18:05:38

Spark-X2.5 本地实测:把 4B 端侧模型接到 Codex 与翻译工具

过去要让 Agent 稳定调用工具,基本是百亿参数以上大模型的活。词元星火(科大讯飞全资子公司)开源了两款端侧模型:Spark-X2.5-1.7BSpark-X2.5-4B。官方评测里,这两款模型在同类尺寸开源模型中多项能力靠前,Agent 类任务更加明显;模型原生支持 100 万 Token 上下文,长任务的上下文不容易断。

官方评测结果

相关资源:

  • Hugging Face:
  • ModelScope:
  • AtomGit:
  • GitHub 项目(含部署文档):
  • 讯飞星辰 MaaS 平台:

按这个尺寸判断,我原本只预期它能做点对话。实际在本地部署后,它能读 GitHub 项目、调用技能工具,把 4B 模型接进 Codex 也能跑完 Agent 流程。

一句话让 AI 把模型部署到本地

模型兼容 SGLang、vLLM、llama.cpp 等主流推理框架,权重在 Hugging Face 和 ModelScope 都有。我选了自己常用的 Claude Code,直接发一句话:

帮我在本地部署这个开源模型 https://huggingface.co/XHToken/Spark-X2.5-1.7B,按 README 用 llama.cpp 方式,跑通后起一个本地服务

按提示词执行部署

Claude Code 会先检查电脑配置和环境,判断这台机器适不适合部署,再下载权重、按 README 编译并启动服务,全程不需要手动介入。部署完成后,模型暴露的服务可以接入任何兼容 OpenAI 或 Anthropic 协议的工具。

接入到 OpenAI/Anthropic 兼容工具

llama.cpp 自带 WebUI,浏览器打开本地服务地址就能直接对话。我先部署的是 Spark-X2.5-1.7B,实测大约 28 token/s,比预想流畅。随后用同样方式把 4B 也部署了一遍。

本地模型服务

挂到翻译工具上当本地引擎

模型支持 200 多种语言。部署完第一件事,就是把它接进电脑里的翻译工具。配置不复杂:服务商选 OpenAI,请求地址填本地服务地址,模型名填部署的模型 ID,API Key 随便填一个即可。

翻译工具 OpenAI 接入配置

我从 Spark-X2.5 的 README 里拿了一段英文介绍测试,翻译几乎是瞬时返回,质量也可读。关键是全程离线,不需要 API 费用。

翻译输出效果

把 Codex 默认模型切成本地 4B

接着把 4B 模型接进 Codex。这里用 CC Switch 做配置切换,要接入 Claude Code 的步骤也类似。

打开 CC Switch 切到 Codex,点右侧加号「新添加供应商」:

  • 供应商名称、API Key:随便填
  • API 请求地址:本地部署的服务地址
  • 默认模型:本机部署的模型 ID
  • 上游格式:Responses(原生)
  • 模型映射里的上下文窗口:按部署时设置的上下文长度填

CC Switch 供应商配置

CC Switch 模型映射配置

回到 CC Switch 主页后启用新供应商,顺手测一下连接。终端启动 Codex,模型列表里出现 Spark-X2.5-4B 就算接通了。

Codex 中显示本地模型

简单任务:读懂一个 GitHub 项目

先给它一个简单任务:我只发了一个 GitHub 项目地址,让它了解整个项目。它会自己调用工具把项目拉到本地,读取代码和 README,最后输出项目用途、特性和安装方法。

模型总结 GitHub 项目

上难度:用 Archify 技能生成架构图

第二个任务测的是工具调用和代码能力。之前介绍过的画图技能 Archify 输出的是 HTML 架构图,正好拿来测:让模型用 Archify 给项目生成一张架构图,然后观察过程。

模型先读取技能的使用说明,再看项目核心文件确认细节,最后调用技能写代码生成架构图。整个过程拆成很多步,4B 参数能做到这个完整度,确实超出我对小模型的预期。

模型调用技能生成架构图过程

最终 HTML 架构图信息量很足,看完基本能了解项目结构。小问题也有:字体偏小、部分组件位置不对、动效缺失。但 Spark-X2.5-4B 跑在端侧能做到这个程度,已经算可用。

生成的 HTML 架构图

写在最后

小模型只配当对话玩具的印象,这次确实被修正了:一个 4B 模型在本地,能读完整个项目代码,能调用外部工具和技能,也能走完 Agent 式的多步任务。

对医疗、法务、金融这类数据敏感行业来说,需求一直在,真正的卡点不是模型效果,而是数据不能出本地。Agent 能力跑在端侧、离线可部署,这类场景才有落地空间。接下来一两年,端侧模型在这些行业的落地案例,很可能比云端 Agent 来得更快。

推荐文章

程序员茄子在线接单