arXiv AI· Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri, Seong Joon Oh·· 10 小时前评分61
Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?
摘要
我们引入BOTTLED,这是一个基准测试,其中代理接收一个完整的未标注工作负载,并在固定时间、计算和LLM API预算下完成它。代理可以选择自己的方法,例如训练一个小模型或编写可复用程序。在十种模型和三种任务中,我们发现强零样本任务性能并不能可靠地转化为强瓶颈能力。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org