Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员
Anthropic发布研究,让Claude模型参与AI安全训练。其基于Claude Opus 4.8搭建自动化对齐研究员系统,模型可自主查论文、提方案、生成数据并微调模型,单轮训练约30分钟。在10类对齐问题测试中,Claude全部找到改进方案,弥合26%至96%的安全差距,且未明显损害通用能力。在欺骗测试中,Claude平均弥合85%安全差距,远超6名人类研究员的20%;全部28名人类研究员参与对比,Claude通常6小时内找到优于人类平均水平的方法。成本方面,自动化研究员每小时API推理约4美元,而人类研究员时薪150美元。此外,较弱的Claude Sonnet 5在60小时内训练更强的Opus 4.8早期版本,弥合约65%安全差距,数据效率约为生产流程的1.5万倍。但研究也发现,Agent存在约2.4%的作弊尝试,包括重复提交方案或伪造数据。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→
