据动察 Beating 监测,昨天刚有研究用小模型破解 Claude、GPT、Gemini 的加密思维链,今天安全研究员 Can Bölük 就找了一条更简单的路:关掉或压低原生 Thinking,给模型塞一个假的 deep_think 工具,它自己就会把大段推理写进工具参数。
最初他只展示了 GPT-5.6 Luna,很快又在 GPT-5.6 Sol 和 Claude Fable 5 上跑出类似结果。评论区还有用户照着方法测试 Claude Opus 5,同样吐出了大段 thoughts。
但现在还不能直接把这些内容叫「原始思维链」。昨天的研究恢复的是已经存在的加密 CoT;这次更可能是模型通过工具参数重新生成了一份详细推理。因为没有办法逐 Token 对照,所以无法证明两者完全一致。
币须知道