AI情报2026年8月19日AI情报
文章
LEGO-RL:面向编程智能体的Harness原生强化学习
公告类型:新 摘要:面向编程智能体的强化学习越来越依赖长时间运行的智能体harness来管理工具集成、仓库上下文和执行反馈。然而,这些harness的原生执行环境与策略梯度训练天然不一致:环境崩溃和奖励黑客(reward hacking)会破坏结果信号,而
Frontier 编辑部来源: arXiv
公告类型:新 摘要:面向编程智能体的强化学习越来越依赖长时间运行的智能体harness来管理工具集成、仓库上下文和执行反馈。然而,这些harness的原生执行环境与策略梯度训练天然不一致:环境崩溃和奖励黑客(reward hacking)会破坏结果信号,而