尽管对人工智能(AI)的安全性和责任感的需求日益增加,但目前的测试和基准可能存在显著的局限性。最新报告显示,生成性AI模型在现实世界中的表现难以预测,而现有的安全评估方法并不足以全面捕捉模型的风险及其潜在影响。研究指出,业界对于评估模型的最佳方法存在明显分歧,同时对公共部门与评估社区的有效合作有待加强。

关键点
– 当前生成性AI模型面临越来越多的安全和责任审查,尤其是在其误判和不可预测的行为方面。
– 新成立的机构和实验室正在制定新的基准来评估AI模型的安全性,但现有评估方法存在缺陷。
– Ada Lovelace Institute的研究发现,当前评估方法可能不够全面,容易被操控,且无法准确反映模型在现实中表现。
– 不同的评估方法在行业内存在明显的分歧,例如测试环境与真实用户之间的差异。
– 数据污染问题可能导致评估结果高估模型的表现,因为测试使用的数据可能与训练数据重复。
– “红队”测试作为识别模型漏洞的方法,缺乏公认标准,评估效果难以保证。
– 加快模型发布的压力和对潜在问题测试的抵触是AI评估进展缓慢的主要原因。

Via:https://techcrunch.com/2024/08/04/many-safety-evaluations-for-ai-models-have-significant-limitations/