2026/6/26·Dwarkesh PodcastAI持续学习RLVR
AI下一次突破:从在职学习开始
本文探讨了AI领域下一个重大突破可能在于“在职学习”。作者认为,当前实验室押注的强化学习与可验证奖励(RLVR)方法存在局限性,尤其是在需要从稀缺、模糊的真实世界互动中学习的领域。文章提出了“在职学习”的必要性,分析了当前在线学习的困境,并探讨了诸如“在线策略自蒸馏”和“做梦”等前沿技术,展望了到2027年底,AI可能通过持续部署和学习实现能力质的飞跃。
DDwarkesh Patel播客主持人、科技博主