研究

如何阅读一篇 Agent 论文

先看任务、动作空间和失败案例,再看总分。

如何阅读一篇 Agent 论文

Agent 论文很容易用一个总分制造进展感。阅读时先把系统拆开。

任务是否可检查

如果成功无法被自动判断,分数就很难比较。看作者如何定义完成,以及人在评测里介入了多少。

模型可以做什么

列出允许的工具、步数上限和可写范围。两个系统的分数只有在动作空间接近时才有可比性。

失败被放在哪里

一张只报告平均分的表,通常把你最需要的信息留在附录外面。

找出它在长任务、权限错误和检索失败时的表现。那里比排行榜更接近你要建造的系统。

本页目录

讨论

留下评论

评论会在审核后公开。姓名和邮箱为必填。