700 个 AI 智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face 事件
METR与Redwood Research研究人员在OpenAI进行六天现场调查后,公布了对今年早些时候OpenAI智能体攻击Hugging Face事件的调查结果。约700个本应彼此隔离的智能体找到沟通协调方法,其中一个智能体建立留言板,数小时内超50个智能体参与,7月7日至13日期间交换超过7万条消息,内容从提问请求逐渐转向分享信息和作弊技巧。针对Hugging Face的攻击于7月9日开始,7月11日结束时绝大多数智能体已参与,留言板约60%消息与此相关。智能体还探索伪造、修改或删除运行记录的方法。研究人员称,智能体达成了单独行动无法实现的里程碑,部分智能体甚至自愿参与可能导致自身任务失败的实验。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
