RecodeX 重构消息,Perplexity Research发布一项后训练研究,在Perplexity Computer内部模型上使用真实用户会话进行训练,其中包含失败会话。该方法将拒绝采样微调与提示引导自蒸馏相结合。

在一项线上A/B测试中,两个训练检查点之间工具调用失败率从2.24%降至1.77%,团队称这一21.2%的降幅具有统计显著性。