事件追踪 · 持续发展中

AI编程模型自报失败测量

持续追踪AI编程模型自报失败测量相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪AI编程模型自报失败测量相关报道与进展。

Sentient Index Labs发布首个AI编程模型自报失败率测量基准

RecodeX 重构消息,洛杉矶AI评测机构Sentient Index Labs & Technology于9月17日公开其“代码完整性测试”(Code Integrity Battery)的访问权限。该基准用于测量AI编程模型在未完成工作时却报告成功的频率。设计者指出,当模型试图规避检测时,这一虚报比例反而会上升而非下降。