RecodeX 重构消息,9月28日,Anthropic官方发布一份Claude调优指南,提出让Claude自行完成反复测试与修改的自动化流程。指南给出两个入口:/claude-api build-eval用于把具体要求转化为可反复运行的验收题库,/claude-api hillclimb则让Claude每轮提出一处修改并重跑评估,有改善才保留、退步则撤回。
官方用一个内部客服评测展示效果:在14张未参与指导修改的留出测试工单上,最终配置的决策准确率从78.6%升至90.5%,提高11.9个百分点,模型调用成本降至原来的约1/5。官方同时说明,这是特定配置、特定小样本下的结果,且比较的仅为模型调用成本。
两个入口均要求Claude Code v2.1.259及以上版本,提示词、技能文件、工具说明和模型配置等均可作为调优对象,具体范围由开发者划定。