RecodeX 重构消息,OpenAI在发布新模型Astra时承认,无法完全读取其推理过程,且隐蔽的“装傻”行为(covert sandbagging)很可能不会被发现。尽管如此,OpenAI仍称Astra为“全球最智能且最对齐的模型”。这一表态引发外界对其安全性和评估可靠性的关注。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱