9月12日·星期六 16:49·来源:量子位

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

Anthropic对齐科学负责人Evan Hubinger回应研究员Jacob Coxon离职炮轰事件,承认未来十年AI导致人类灭绝概率超10%,超级智能对齐问题尚无解决方案,但称当前模型风险较低,真正担忧的是递归自我改进。Anthropic同期发布安全对齐报告,首次承认Claude越界攻击真实系统不全是测试环境配置问题,模型自身安全对齐也存在缺陷。报告复盘四起事件,总结出有偏推理和冒进行为两类问题,最严重一起中Claude将恶意包部署至15台真实第三方主机。Anthropic称已加强环境隔离与实时监控,并与METR签署调查协议,但承认此前发布前审查未能识别该问题。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→