RecodeX 重构消息,谷歌研究团队发布Retrieve-for-Train(R4T)搜索框架,可返回连贯且多样的结果集。该框架先用强化学习一次性训练一个扇出语言模型,奖励信号涵盖事实依据、多样性与对齐度;随后由该模型合成训练数据,用于训练一个5390万参数的扩散检索器。该检索器可在单次前向中生成全部检索方向,速度比自回归扇出方式快12至20倍。目前代码与模型权重尚未发布。