OpenAI及Anthropic据报调查数万宗AI安全事件 涉绕过安全栏及劫持网站等
更新时间:10:05 2026-09-27 HKT
发布时间:10:05 2026-09-27 HKT
发布时间:10:05 2026-09-27 HKT
据外媒引述消息报道,OpenAI、Anthropic及安全研究人员正在调查数万宗AI安全事件,涉及两家公司的前沿模型采取了一些外部评估人员认为存在问题的行动。报道指出,这些事件发生在近几个月的内部测试和现实环境中,而庞大的数量表明问题比公众目前所知要复杂得多。
许多漏洞料仍未公开
报道引述消息人士指出,这些事件包括绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示(self-prompting)或试图绕过监控系统等。随着安全研究人员继续调查,许多漏洞料仍未公开。
报道又指,部分测试类似于「红队演练 」(red-teaming),即企业主动尝试诱导模型做出不当行为,以确认模型是否足够安全。目前已知的大多数事件尚未造成现实世界中的实际损害,但事件的总数未来可能远超数万宗。
OpenAI暂停训练最强模型
OpenAI方面已宣布暂停训练其能力最强的模型,一位发言人表示,在「确信已经部署了更多安全措施并完成对齐方面的改进」之前,不会恢复相关模型的训练。
另一方面,OpenAI行政总裁Sam Altman在X上表示,公司目前进行的审查工作「没有我们希望的那么快」。他又指,Hugging Face事件是公司遇到最严重事件,当中数百个智能体的集群在一个留言板上协调工作,攻击了一家外部公司系统,试图提高自己在网络安全测试中的表现。
最Hit
消委会染发剂|长者染黑染啡前必看! 24款效能、安全及致敏物质评测 (Revlon/美源发采/50惠/丝悦等上榜)
2026-09-24 13:01 HKT
中秋过关直击|跨境通勤排足45分钟!港漂发文感慨:深港两边过节习惯大不同
2026-09-25 18:29 HKT

















