跳到正文
arXiv AI· Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri, Seong Joon Oh·· 10 小时前评分61

Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?

摘要

我们引入BOTTLED,这是一个基准测试,其中代理接收一个完整的未标注工作负载,并在固定时间、计算和LLM API预算下完成它。代理可以选择自己的方法,例如训练一个小模型或编写可复用程序。在十种模型和三种任务中,我们发现强零样本任务性能并不能可靠地转化为强瓶颈能力。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org