← 返回信息流

DAIR.AI推文

终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进

论文AI评分:70/100

这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

译文

终于有一篇靠谱的论文,检验基于记忆的自我改进智能体是否真的在进步。这项复现评估补充了先前研究忽略的两点:多次运行以测量方差,以及随机打乱任务顺序。这两点都削弱了原有结论。智能体评估在多步骤任务上本就噪声很大,叠加自我改进循环后,噪声被进一步放大。默认的任务顺序隐含了一种课程式安排,而报告中的大部分提升正是依赖于此。在记忆构建中加入详细评分细则和环境反馈,能挽回部分性能下降,但仍有显著差距。论文:https://arxiv.org/abs/2608.18066 在学院中追踪更多热门AI论文:https://academy.dair.ai/

D
DAIR.AI

@dair_ai

Finally a good paper testing whether memory-based self-improving agents actually improve. The re-evaluation adds two things prior work skipped, multiple runs to measure variance and randomly shuffled task orders. Both hurt. Agent evaluation is already noisy on multi-step tasks, and stacking a self-improvement loop amplifies that noise. Default task orderings impose an implicit curriculum that much of the reported gain was riding on. Adding detailed rubrics and environment feedback to memory construction recovers part of the drop, and a significant gap remains. Paper: https://arxiv.org/abs/2608.18066 Track more trending AI papers in our academy: https://academy.dair.ai/

阅读原文