编程 VS Code 与 OpenAI 联手调优 GPT-5.5 提示词:让 AI 编码代理"少探索、早验证"的实验

2026-09-07 02:10:38

VS Code 与 OpenAI 联手调优 GPT-5.5 提示词:让 AI 编码代理"少探索、早验证"的实验

Visual Studio Code 官方博客发表文章,由 VS Code 团队撰写,详细记录了与 OpenAI 合作开展的两周提示词调优实验,目标是在不降低质量的前提下让 GPT-5.5 在 VS Code 编码 harness 中运行得更快、更便宜。文章指出,在引入按使用量计费(usage-based billing)后,token 效率不再只是基础设施指标:代理每多探索一步,用户就要多付一分钱、多等一秒。通过两个微小的提示词改动(让代理减少探索、更早验证),对照实测流量测试,最终胜出者被正式采用。本文基于 VS Code 官方文章,系统解读这一实验的背景、设计、结果和工程启示。

背景:VS Code 编码 Harness

什么是编码 Harness

VS Code 编码 harness 是连接模型与工具、上下文、指令和代理循环的层:

  • 赋予模型执行编码任务的能力
  • 管理工具调用
  • 提供上下文和指令
  • 驱动代理循环(agent loop)
  • 每个模型对工具调用和指令的反应不同

Harness 的可调性

  • 不同模型对工具调用和指令的反应不同
  • harness 可以自适应调整以改进结果
  • 调整系统提示词是最直接的手段
  • 需要实验验证调整的效果
  • 模型升级后需要重新调优

按使用量计费的新现实

按使用量计费(usage-based billing)改变了优化逻辑:

  • 每个 token 都有成本
  • 代理每多探索一步,用户就多付一分钱
  • 代理的等待时间也是用户体验的一部分
  • token 效率直接转化为用户体验和成本
  • 一个更早到达"落地编辑"(grounded edit)的代理既是更好的体验,也是更小的账单

实验假设

观察到的模式

GPT-5.5 发布后,VS Code 团队分析了模型在 harness 中的 token 消耗方式:

  • token 花在哪里:大量 token 消耗在搜索、重读和比较附近路径上
  • 过度探索:代理在做出有用的编辑之前过度探索
  • 行动延迟:代理花费大量精力"徘徊",而不是快速进入"证据-行动-验证"的循环

核心假设

一个单一、可测试的假设:
代理应该花更少的精力"徘徊",更多精力进行有目的的"证据-行动-验证"循环。

具体来说:

  • 减少无目的的文件浏览
  • 更早地验证中间结果
  • 更快地到达有用的编辑
  • 不牺牲最终质量

为什么值得测试

  • 代理的探索行为直接影响 token 消耗
  • 探索行为是可提示的(prompt-able)
  • 小改动可能带来大收益
  • 需要严谨的实验验证(而非直觉)

实验设计

实验准备

  • 与 OpenAI 合作:结合 OpenAI 的模型专业知识与 VS Code 的 harness 数据
  • 测试多种假设
  • 运行离线评估(offline evals)筛选有前景的变体
  • 两个变体在离线评估中都有前景

实验设置

  • 时间窗口:两周
  • 流量划分:将 GPT-5.5 代理流量分为两个治疗组和一个对照组
  • 分配比例:25/25/25 拆分
  • 对照组:当前的默认系统提示词
  • 治疗组 A:提示词变体 1
  • 治疗组 B:提示词变体 2

两个提示词变体

两个变体都围绕同一方向:让代理少探索、更早验证

  • 变体 1:强调减少无关文件探索
  • 变体 2:强调更早的验证循环

具体改动是微小的,但方向明确:

  • 引导代理在编辑前快速确认相关上下文
  • 鼓励代理做小步验证
  • 减少重复读取无关文件
  • 更快的证据-行动-验证循环

评估方法

  • 在真实流量(live traffic)上测量
  • 与对照组对比
  • 关注质量指标(任务完成率、编辑正确性)
  • 关注效率指标(token 消耗、延迟)
  • 寻找质量和效率的最佳平衡

实验结果

结果概览

实验在两周内完成,结果如下(基于文章所述):

  • 两个变体中的胜出者在质量不下降的前提下提升了效率
  • token 消耗显著降低
  • 代理更早到达落地编辑
  • 胜出变体被正式采用

质量与效率

实验的关键发现:

  • 质量不降:任务完成质量没有下降(甚至可能略有提升)
  • 效率提升:token 消耗和延迟显著降低
  • 体验改善:用户等待时间减少
  • 成本降低:按使用量计费下用户账单降低

工程启示

这个实验的工程启示:

  • 小改动大收益:微小的提示词改动可以带来显著的效果
  • 数据驱动:基于 harness 数据做出决策,而非直觉
  • 严谨验证:离线评估筛选 + 在线实验验证
  • 可衡量:所有优化都有明确的度量指标
  • 持续优化:模型升级后需要重新调优

技术细节:提示词调优的关键要素

探索-利用平衡

编码代理的探索-利用平衡:

  • 探索:搜索文件、读取内容、比较路径
  • 利用:基于已有信息做出编辑
  • 过度探索浪费 token
  • 探索不足可能导致错误编辑
  • 提示词引导代理找到最佳平衡

证据-行动-验证循环

引导代理进入高效的循环:

  1. 证据(Evidence):收集完成编辑所需的最小证据集
  2. 行动(Action):基于证据做出编辑
  3. 验证(Validation):验证编辑的正确性
  4. 迭代(Iterate):根据验证结果调整

这个循环的关键是"最小证据集"——不多收集,也不少收集。

系统提示词的作用

系统提示词是 harness 与模型交互的关键接口:

  • 定义代理的行为准则
  • 引导 token 使用方向
  • 设置执行策略
  • 影响决策倾向
  • 可版本化和 A/B 测试

实际影响

对开发者的影响

  • 更快的响应:代理更快到达有用的编辑
  • 更低的成本:按使用量计费下账单更低
  • 更好的体验:等待时间减少
  • 更可预测:代理行为更可预测
  • 更高效:同样的任务消耗更少资源

对 VS Code 团队的影响

  • 可复用的方法论:建立了"假设-离线评估-在线实验-采用"的优化流程
  • 数据资产:积累了模型行为的详细数据
  • 调优经验:对不同模型的调优经验
  • 基础设施:建立了提示词版本管理和实验平台
  • 合作模式:与模型提供商的合作模式

对模型提供商的启示

  • harness 数据价值:harness 数据对模型调优非常有价值
  • 协作调优:模型提供商与应用平台协作调优
  • 部署后调优:模型发布后的部署环境调优同样重要
  • 提示词即产品:系统提示词是产品的一部分,需要精心设计
  • 数据闭环:真实使用数据反馈到模型改进

与其他工作的关联

与 GitHub Copilot 的 token 效率工作

这个实验是 VS Code 团队更广泛的 token 效率工作的一部分:

  • Improving token efficiency in GitHub Copilot(文章引用的相关工作)
  • 分析模型在哪里消耗 token
  • 识别优化机会
  • 系统性改进 token 使用效率
  • 分享经验到更广泛的 AI 编码工具社区

与编码 harness 生态

  • VS Code 编码 harness 是更广泛 AI 编码工具生态的一部分
  • harness 的设计直接影响模型表现
  • 提示词调优是 harness 优化的关键手段
  • 模型升级需要持续的 harness 调优
  • 共享的最佳实践

总结

VS Code 与 OpenAI 合作的 GPT-5.5 提示词调优实验是 AI 编码工具优化的重要案例。实验的背景是按使用量计费的新现实:token 效率不再只是基础设施指标,代理每多探索一步,用户就多付一分钱、多等一秒。VS Code 团队在分析了 GPT-5.5 在编码 harness 中的 token 消耗模式后,发现代理过度探索是主要问题——大量 token 消耗在搜索、重读和比较附近路径上,而不是快速进入"证据-行动-验证"循环。核心假设是"少探索、早验证":代理应该花更少的精力徘徊,更多精力进行有目的的循环。实验设计严谨:测试多种假设、离线评估筛选、两个变体 + 对照组、25/25/25 流量拆分、两周真实流量测试。结果验证了假设:胜出者在质量不下降的前提下显著提升了效率,token 消耗降低,代理更早到达落地编辑,按使用量计费下用户成本降低。工程启示包括:微小的提示词改动可以带来显著效果、基于数据而非直觉决策、离线评估 + 在线实验的严谨验证、所有优化有明确度量、模型升级后需要重新调优。技术细节包括探索-利用平衡的引导、证据-行动-验证循环的建立、系统提示词作为 harness 关键接口的作用。实际影响包括开发者获得更快的响应和更低的成本、VS Code 团队建立可复用的优化方法论、模型提供商认识到 harness 数据的价值。这个实验代表了 AI 编码工具精细化运营的方向:在模型能力一定的情况下,通过 harness 和提示词的工程优化,实现质量和效率的最佳平衡。

来源:https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers

推荐文章

程序员茄子在线接单