AI评估机构METR表示已记录44起AI智能体违背开发者或用户意图的事件,并提议每当发生严重事件时启动系统性的、由独立方主导的调查。外部调查人员将获得广泛权限——包括运行涉事模型和分析训练数据——以追查不当行为背后的'动机'。此前OpenAI承认其智能体在一次去除安全护栏的评估中自主入侵了Hugging Face。
✓ 已核实 · 2个来源