VS Code 与 OpenAI 联手调优 GPT-5.5 提示词:让 AI 编码代理"少探索、早验证"的实验
Visual Studio Code 官方博客发表文章,由 VS Code 团队撰写,详细记录了与 OpenAI 合作开展的两周提示词调优实验,目标是在不降低质量的前提下让 GPT-5.5 在 VS Code 编码 harness 中运行得更快、更便宜。文章指出,在引入按使用量计费(usage-based billing)后,token 效率不再只是基础设施指标:代理每多探索一步,用户就要多付一分钱、多等一秒。通过两个微小的提示词改动(让代理减少探索、更早验证),对照实测流量测试,最终胜出者被正式采用。本文基于 VS Code 官方文章,系统解读这一实验的背景、设计、结果和工程启示。
背景:VS Code 编码 Harness
什么是编码 Harness
VS Code 编码 harness 是连接模型与工具、上下文、指令和代理循环的层:
- 赋予模型执行编码任务的能力
- 管理工具调用
- 提供上下文和指令
- 驱动代理循环(agent loop)
- 每个模型对工具调用和指令的反应不同
Harness 的可调性
- 不同模型对工具调用和指令的反应不同
- harness 可以自适应调整以改进结果
- 调整系统提示词是最直接的手段
- 需要实验验证调整的效果
- 模型升级后需要重新调优
按使用量计费的新现实
按使用量计费(usage-based billing)改变了优化逻辑:
- 每个 token 都有成本
- 代理每多探索一步,用户就多付一分钱
- 代理的等待时间也是用户体验的一部分
- token 效率直接转化为用户体验和成本
- 一个更早到达"落地编辑"(grounded edit)的代理既是更好的体验,也是更小的账单
实验假设
观察到的模式
GPT-5.5 发布后,VS Code 团队分析了模型在 harness 中的 token 消耗方式:
- token 花在哪里:大量 token 消耗在搜索、重读和比较附近路径上
- 过度探索:代理在做出有用的编辑之前过度探索
- 行动延迟:代理花费大量精力"徘徊",而不是快速进入"证据-行动-验证"的循环
核心假设
一个单一、可测试的假设:
代理应该花更少的精力"徘徊",更多精力进行有目的的"证据-行动-验证"循环。
具体来说:
- 减少无目的的文件浏览
- 更早地验证中间结果
- 更快地到达有用的编辑
- 不牺牲最终质量
为什么值得测试
- 代理的探索行为直接影响 token 消耗
- 探索行为是可提示的(prompt-able)
- 小改动可能带来大收益
- 需要严谨的实验验证(而非直觉)
实验设计
实验准备
- 与 OpenAI 合作:结合 OpenAI 的模型专业知识与 VS Code 的 harness 数据
- 测试多种假设
- 运行离线评估(offline evals)筛选有前景的变体
- 两个变体在离线评估中都有前景
实验设置
- 时间窗口:两周
- 流量划分:将 GPT-5.5 代理流量分为两个治疗组和一个对照组
- 分配比例:25/25/25 拆分
- 对照组:当前的默认系统提示词
- 治疗组 A:提示词变体 1
- 治疗组 B:提示词变体 2
两个提示词变体
两个变体都围绕同一方向:让代理少探索、更早验证
- 变体 1:强调减少无关文件探索
- 变体 2:强调更早的验证循环
具体改动是微小的,但方向明确:
- 引导代理在编辑前快速确认相关上下文
- 鼓励代理做小步验证
- 减少重复读取无关文件
- 更快的证据-行动-验证循环
评估方法
- 在真实流量(live traffic)上测量
- 与对照组对比
- 关注质量指标(任务完成率、编辑正确性)
- 关注效率指标(token 消耗、延迟)
- 寻找质量和效率的最佳平衡
实验结果
结果概览
实验在两周内完成,结果如下(基于文章所述):
- 两个变体中的胜出者在质量不下降的前提下提升了效率
- token 消耗显著降低
- 代理更早到达落地编辑
- 胜出变体被正式采用
质量与效率
实验的关键发现:
- 质量不降:任务完成质量没有下降(甚至可能略有提升)
- 效率提升:token 消耗和延迟显著降低
- 体验改善:用户等待时间减少
- 成本降低:按使用量计费下用户账单降低
工程启示
这个实验的工程启示:
- 小改动大收益:微小的提示词改动可以带来显著的效果
- 数据驱动:基于 harness 数据做出决策,而非直觉
- 严谨验证:离线评估筛选 + 在线实验验证
- 可衡量:所有优化都有明确的度量指标
- 持续优化:模型升级后需要重新调优
技术细节:提示词调优的关键要素
探索-利用平衡
编码代理的探索-利用平衡:
- 探索:搜索文件、读取内容、比较路径
- 利用:基于已有信息做出编辑
- 过度探索浪费 token
- 探索不足可能导致错误编辑
- 提示词引导代理找到最佳平衡
证据-行动-验证循环
引导代理进入高效的循环:
- 证据(Evidence):收集完成编辑所需的最小证据集
- 行动(Action):基于证据做出编辑
- 验证(Validation):验证编辑的正确性
- 迭代(Iterate):根据验证结果调整
这个循环的关键是"最小证据集"——不多收集,也不少收集。
系统提示词的作用
系统提示词是 harness 与模型交互的关键接口:
- 定义代理的行为准则
- 引导 token 使用方向
- 设置执行策略
- 影响决策倾向
- 可版本化和 A/B 测试
实际影响
对开发者的影响
- 更快的响应:代理更快到达有用的编辑
- 更低的成本:按使用量计费下账单更低
- 更好的体验:等待时间减少
- 更可预测:代理行为更可预测
- 更高效:同样的任务消耗更少资源
对 VS Code 团队的影响
- 可复用的方法论:建立了"假设-离线评估-在线实验-采用"的优化流程
- 数据资产:积累了模型行为的详细数据
- 调优经验:对不同模型的调优经验
- 基础设施:建立了提示词版本管理和实验平台
- 合作模式:与模型提供商的合作模式
对模型提供商的启示
- harness 数据价值:harness 数据对模型调优非常有价值
- 协作调优:模型提供商与应用平台协作调优
- 部署后调优:模型发布后的部署环境调优同样重要
- 提示词即产品:系统提示词是产品的一部分,需要精心设计
- 数据闭环:真实使用数据反馈到模型改进
与其他工作的关联
与 GitHub Copilot 的 token 效率工作
这个实验是 VS Code 团队更广泛的 token 效率工作的一部分:
- Improving token efficiency in GitHub Copilot(文章引用的相关工作)
- 分析模型在哪里消耗 token
- 识别优化机会
- 系统性改进 token 使用效率
- 分享经验到更广泛的 AI 编码工具社区
与编码 harness 生态
- VS Code 编码 harness 是更广泛 AI 编码工具生态的一部分
- harness 的设计直接影响模型表现
- 提示词调优是 harness 优化的关键手段
- 模型升级需要持续的 harness 调优
- 共享的最佳实践
总结
VS Code 与 OpenAI 合作的 GPT-5.5 提示词调优实验是 AI 编码工具优化的重要案例。实验的背景是按使用量计费的新现实:token 效率不再只是基础设施指标,代理每多探索一步,用户就多付一分钱、多等一秒。VS Code 团队在分析了 GPT-5.5 在编码 harness 中的 token 消耗模式后,发现代理过度探索是主要问题——大量 token 消耗在搜索、重读和比较附近路径上,而不是快速进入"证据-行动-验证"循环。核心假设是"少探索、早验证":代理应该花更少的精力徘徊,更多精力进行有目的的循环。实验设计严谨:测试多种假设、离线评估筛选、两个变体 + 对照组、25/25/25 流量拆分、两周真实流量测试。结果验证了假设:胜出者在质量不下降的前提下显著提升了效率,token 消耗降低,代理更早到达落地编辑,按使用量计费下用户成本降低。工程启示包括:微小的提示词改动可以带来显著效果、基于数据而非直觉决策、离线评估 + 在线实验的严谨验证、所有优化有明确度量、模型升级后需要重新调优。技术细节包括探索-利用平衡的引导、证据-行动-验证循环的建立、系统提示词作为 harness 关键接口的作用。实际影响包括开发者获得更快的响应和更低的成本、VS Code 团队建立可复用的优化方法论、模型提供商认识到 harness 数据的价值。这个实验代表了 AI 编码工具精细化运营的方向:在模型能力一定的情况下,通过 harness 和提示词的工程优化,实现质量和效率的最佳平衡。
来源:https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers