跳到正文
arXiv AI· Mikey Watts, Yuchen Cui·· 10 小时前评分24

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

摘要

视觉-语言-动作模型(VLAs)对指令措辞极为敏感,无法继承其构建基础的视觉-语言模型的语言鲁棒性。一个单词的修改可使成功率提升数十个百分点:$π_{0.5}$ 在LIBERO炉上使“打开炉子”耗时100%,而“打开热板”则耗时2%,即使经过$π_0$检查点并使用重写增强进行微调,仍可显示高达61点的波动。我们通过统计检验的单词修改波动和一个预言式短语搜索,表明仅靠措辞几乎能关闭21点的分布内与分布外任务之间的差距。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org