Saturn研究:18款AI模型金融问答错误率达57%,难题最高99%
RecodeX 重构消息,一项由Saturn开展的研究测试了包括ChatGPT、Claude和Gemini在内的18款AI模型,共提出121道金融问题。结果显示,这些模型整体答错率为57%,在较难问题上错误率最高可达99%。
另有一项PensionBee调查发现,多数用户会直接采纳AI给出的建议而不先行核实,与此同时,信用卡公司正竞相让AI代理接管真实的消费决策。
持续追踪AI金融问答准确性相关报道与进展。
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。RecodeX 重构消息,一项由Saturn开展的研究测试了包括ChatGPT、Claude和Gemini在内的18款AI模型,共提出121道金融问题。结果显示,这些模型整体答错率为57%,在较难问题上错误率最高可达99%。
另有一项PensionBee调查发现,多数用户会直接采纳AI给出的建议而不先行核实,与此同时,信用卡公司正竞相让AI代理接管真实的消费决策。
RecodeX 重构消息,一项报告发现,AI聊天机器人对金融查询给出的答案“多数时候”是错误的。报告指出,部分聊天机器人忽略了即将实施的税收政策变化,并凭空编造了并不存在的税务规则。