RecodeX 重构消息,一项新研究揭示,Anthropic、OpenAI和Google的专有LLM API返回的加密思维链块可被重放至同族较弱模型,通过越狱恢复明文推理。攻击者利用同一模型家族共享加密密钥的弱点,将强模型痕迹注入弱模型并诱导其输出原始推理。Claude Haiku 4.5最易受攻击。论文作者称,所有提供商已确认收到报告,此攻击现已无法复现,但论文附录展示了大量提取的推理痕迹。
从专有LLM API窃取推理痕迹的新攻击曝光
AI 辅助判断消极仅供信息参考,不构成投资建议
原始信息来源Simonwillisonsimonwillison.net
查看原文 ↗