跳到正文
arXiv AI· Oskar J. Hollinsworth, Alex F. Spies, Tigist Diriba, Adam Gleave, Chris Cundy·· 10 小时前评分63

Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception

摘要

最近事件凸显了监控大语言模型代理的挑战,以及模型欺骗人类的危险性。我们通过收集迄今为止最大的欺骗数据集进行训练,引入了一种新型探针架构,可跨多层和token聚合信息。我们的探针在SHADE-Arena中实现98.8% AUC,超越了Opus 5.5文本监控基线,并随着底层模型的扩展而效果提升。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org