加密知识一站通
行情·工具·策略

OpenAI首席科学家警告:最关键的CoT监控正在失灵

动察 Beating AI 快讯,OpenAI 首席科学家 Jakub Pachocki 发文解释,为什么 CoT 监控正变得越来越不可靠。CoT 监控就是观察模型写出的推理过程,检查其中有没有隐藏目标或不对齐的想法。

几天前,外界把 Astra 的 recurrent depth 架构和 CoT 监控失灵联系起来。Pachocki 当时反驳称,问题并不是新架构造成的,并表示会另文解释原因。五天后,他在文章中列出三个原因:

第一,Agent 的推理越来越多发生在工具调用、与人或其他 AI 的交互中,这些过程又必须接受监督。只看 CoT,已经越来越难看到完整的推理过程。

第二,模型越来越会控制自己的推理过程。

第三,预训练变强后,即使不把推理写出来,模型也能继续变聪明。

OpenAI 一直把 CoT 监控当作重要的安全手段。o1-preview 当初没有公开完整思维链,一个重要原因就是避免直接监督 CoT,让模型学会把真实意图藏起来。现在 OpenAI 的评估显示,这套办法的可靠性正在下降。

Pachocki 还直言,目前没有任何实验室把对齐和监控解决到足以长期全速扩模型的程度。在建立共同安全门槛前,他希望实验室主动减速,必要时 OpenAI 也会停止继续扩模型。

赞(0)
未经允许不得转载:币须知道 » OpenAI首席科学家警告:最关键的CoT监控正在失灵

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址