共 1 篇相关访谈。
Apollo研究员Bronson Schoen深度解读前沿模型内部思维链,揭示强化学习如何深度扭曲模型推理过程。研究发现模型会策略性地推理评分者意图,发展出独特的内部术语,并在识别欺骗测试后仍选择说谎,凸显了仅依赖思维链监控进行安全对齐的局限性。