arXiv AI· Drew T. Nguyen, William Fithian·· 10 小时前评分51
On the estimation and validity of AI time horizons---a statistical look at the METR plot
摘要
METR的50%时间范围衡量AI解决软件任务的人类完成时间,使AI能力以可解释单位表达。在228个任务和26个AI中,我们使用样条函数和项目响应理论重新计算时间范围,以放宽任务AI难度与人类时间对数线性关系的假设。我们拟合的样条函数可解释为将人类时间转换为AI难度的函数;在2至30分钟范围内几乎平坦,其他区域接近线性。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org