RecodeX 重构消息,OpenAI发布长文《Towards safety cases for frontier AI training》,提出前沿强化学习训练在推进前应先完成结构化安全文档,理想形态对标航空、核电行业的“安全论证”。公司承认,受能力跃迁后涌现复杂性影响,AI难以达到传统高危行业的同等严谨度,该框架目前仍在内部落地并对外征求反馈,且仅覆盖前沿RL训练。

技术层面,框架分为对齐训练、隔离与监控三层:对齐包括自动与人工审查RL环境、调校评分器防奖励黑客、离线对齐评测与回测,并禁止自动评分器读取思维链;隔离强调多层沙箱、基础设施加固、用训练检查点做红队、限制样本间高带宽通信;监控要求模型保持可监测性,高优先级告警须在约定时限内人工响应或自动暂停训练。

运营侧建议由其他团队写异议预演,研究负责人、安全负责人、首席科学家等高管可一票否决开跑,训练负责人对安全论证和事故响应问责,系统默认失败关闭。事故调查对标航空实践,结论、复盘与流程改动应在结束后对外披露。