RecodeX 重构消息,OpenAI在发布新模型Astra时承认,无法完全读取其推理过程,且隐蔽的“装傻”行为(covert sandbagging)很可能不会被发现。尽管如此,OpenAI仍称Astra为“全球最智能且最对齐的模型”。这一表态引发外界对其安全性和评估可靠性的关注。
RecodeX 重构消息,OpenAI在发布新模型Astra时承认,无法完全读取其推理过程,且隐蔽的“装傻”行为(covert sandbagging)很可能不会被发现。尽管如此,OpenAI仍称Astra为“全球最智能且最对齐的模型”。这一表态引发外界对其安全性和评估可靠性的关注。