arXiv AI· Jesson Wang, Shawn Li, Wei Yang, Franck Dernoncourt, Ryan A. Rossi, Charith Peris, Yue Zhao·· 7 天前评分52
Controlled Decoding Attacks on Black-Box LLMs
摘要
我们引入 extbf{方法}{},一种通过文本仅延续接口实现脱壳的框架,允许重复采样和助手前缀延续。样本基于分布重建结合了采样输出与对未观察动作的先验分布,以获得可用的控制信号。风险门残差控制利用不断演变的响应前缀决定何时重建和修改分布,将采样成本集中在选定位置。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org