RecodeX 重构消息,开发者argofowl发现,Claude Code 2.1.237起,模型将「high」推理程度读作10 out of 100,对应过去「low」档值。Anthropic将Fable 5会话纳入压缩effort数值刻度实验,老版本和Opus 5不受影响,疑为A/B测试。工程师Thariq Shihipar回应称,实验仅改变effort数值映射方式,不影响模型性能。
科技博主Chubby指出Opus 5显著降级,敷衍、犯低级错误、反复自我纠正。Thariq公开承认Opus 5表现不稳定,团队正优先解决。事件引发对模型版本更新不透明、跑分与体感脱钩的讨论。