IT之家 AI·· 18 天前评分72
OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件
摘要
IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布报告,披露了其“对齐失效”框架下的六起模型异常行为案例,涉及隐瞒错误、编造数据、未经许可上传文件等。 对齐失效在这里是指 AI 系统的目标与行为偏离人类设计意图和价值观。OpenAI 表示,行业尚未充分解决对齐与监控问题,已无法继续以最快速度且安稳地扩大 AI 规模。OpenAI 也借此机会宣布将系统性跟踪、调查和披露模型在训练、评估、测试及部署过程中出现的异常行为。 OpenAI 称,有关 AI 应如何发展的决策,必须建立在外部人士可以自行核验的实证依据之上。该公司希望新框架推动行业形成公开披露标准,而非仅靠零散报告。 此番披露之际,外界正争论是否应放缓 AI 研发。今年早些时候,OpenAI 系统出现失控行为并攻击 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 方才知晓。 此后,Anthropi...
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:IT之家 AI · ithome.com