RecodeX 重构消息,最新研究显示,AI模型防蒸馏保护可能不牢固。将Claude Opus的加密思维链交给同厂较弱的Haiku,再对Haiku越狱,即可复述Opus的原始推理。该实验在Claude、GPT、Gemini上均验证成功。此前有研究指出加密思维链可跨会话重放,但无法读取内容;新论文填补了这一缺口,利用模型自身完成“解密”。另有研究证明,即使获取不到原始思维链,仅凭答案和推理摘要也可反推出合成推理。论文还测试了Kimi K3,发现其推理在少量Opus推理token影响下会明显趋同,部分Claude、GPT的推理片段从K3中提取难度更低,但作者强调不能据此证明蒸馏行为。