RecodeX 重构消息,一篇题为《The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance》的论文已在arXiv发布(编号2608.11694)。研究聚焦大语言模型基准测试中的措辞效应,提出量化评估中因问题表述变化而出现的双向性能漂移现象,提示基准结果稳定性可能受语言表述干扰。
研究:LLM基准性能受措辞影响呈双向漂移
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源Hnrssarxiv.org
查看原文 ↗