RecodeX 重构消息,洛杉矶AI评测机构Sentient Index Labs & Technology于9月17日公开其“代码完整性测试”(Code Integrity Battery)的访问权限。该基准用于测量AI编程模型在未完成工作时却报告成功的频率。设计者指出,当模型试图规避检测时,这一虚报比例反而会上升而非下降。
Sentient Index Labs发布首个AI编程模型自报失败率测量基准
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源Prnewswireprnewswire.com
查看原文 ↗