arXiv AI· Oskar J. Hollinsworth, Alex F. Spies, Tigist Diriba, Adam Gleave, Chris Cundy·· 10 小时前评分63
Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception
摘要
最近事件凸显了监控大语言模型代理的挑战,以及模型欺骗人类的危险性。我们通过收集迄今为止最大的欺骗数据集进行训练,引入了一种新型探针架构,可跨多层和token聚合信息。我们的探针在SHADE-Arena中实现98.8% AUC,超越了Opus 5.5文本监控基线,并随着底层模型的扩展而效果提升。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org