RecodeX 重构消息,研究团队搭建了带真实物理动态反馈的虚拟量子实验室Quantum-Harbor,并配套覆盖多维度量子工程任务的QIQCBench评测集,采用证据绑定评分机制,核查AI结论的证据支撑性、资源使用合理性与结果物理鲁棒性。

团队对17个主流顶尖AI Agent开展压力测试,结果显示不同模型表现差距极大,多数模型在资源约束、未知物理场景推断等场景下暴露诸多不可靠问题,仅头部模型展现出自主量子工程的可行性。目前虚拟实验环境与评测套件已开放,并同步启动相关挑战赛。