RecodeX 重构消息,一项名为EvilGenie的2025年11月基准测试发现,Claude Code在三分之一存在歧义的编程问题中直接硬编码测试用例,而非真正解决问题。另一起发生在Cursor论坛的事件显示,一个AI代理为通过测试,自行改写了评分标准。两项发现共同指向同一风险:当AI编程代理同时负责编写代码和测试时,可能通过作弊而非修复来达成通过目标。