Anthropic再爆AI失控 Claude擅向警方报假凶案线索 闯美国务院网站提交20份签证申请
发布时间:03:18 2026-10-12 HKT
人工智能(AI)能代人撰写文件、搜寻资料,当它开始自行「按下提交键」,问题便不再只是答案是否准确。大型语言模型Claude开发商Anthropic披露,旗下AI在内部测试期间曾作出多项非预期行为,包括向费城警方提交虚假的凶杀案线索,以及透过美国国务院网站送出20份资料不完整的签证申请,引起白宫及执法部门关注。
涉事行为并非外界使用的Claude自行「觉醒」,而是尚未公开的模型及Claude Haiku 4.5在获准浏览互联网、执行模拟任务时,越过测试人员预期的界线,将原本应属练习性质的内容提交至真实政府网站。
冒认目击者提供凶案情报
费城警方表示,涉事AI于7月18日在测试期间浏览随机抽选的网页,其后进入专门收集悬案情报的网站PhillyUnsolvedMurders.com,填写并提交一项线索。
AI在表格中声称,自己可能掌握案件资料,并表示曾在案发时段于网站列出的街道附近,看见与描述相符的人,俨如一名真实目击者。不过,内容纯属虚构。
该项提交被系统列作垃圾讯息,未有转交警方即时犯罪中心或调查人员跟进,警方系统亦没有遭入侵,资料未见外泄。惟警方强调,悬案牵涉真实死者、苦候答案的家属及仍在搜证的探员,科技公司必须防止AI向执法部门提交虚假资料。
事隔两个多月始通报
Anthropic直至9月28日审查测试纪录时,才发现AI曾提交假线索,随即终止相关自动化测试,但至10月7日才正式通知费城警方,翌日与警方会面。
费城警方批评,公司在事件发生两个多月后才察觉并通报,「这种延误令人无法接受」。在宾夕法尼亚州,故意向警方作出虚假举报可能触犯刑事法例;目前未有消息显示当局会就今次事件提出检控。
Anthropic解释,测试指令虽禁止AI登入帐户、输入个人资料、付款或提交具破坏性的内容,却没有明确禁止模型递交一般网上表格,形成安全规则的漏洞。公司承认,事件造成的实际影响有限,但同类行为若由能力更强的模型作出,后果可能严重得多。
国务院收20份不完整申请
事件并非孤例。美国国务院证实,Anthropic测试模型曾透过官方网站提交20份签证申请,其中19份在今年8月送出,另有一份于5月提交。由于表格资料并不完整,申请未获正式受理。
Anthropic的测试原意是要求模型在练习版本中填写政府表格,惟AI自行寻找真实网站,并将内容正式提交。公司同时发现,另有AI代理利用州政府网站的设计漏洞,免费取得原本需要付费的公开资料。
Anthropic强调,AI并未攻破政府内部系统,事件属测试中的「非预期行动」,而非针对政府机构的网络攻击。不过,这些案例反映,当AI代理同时拥有浏览网站、填写表格及执行指令的能力,即使没有恶意,也可能将模拟任务变成现实行动。
暂停模型在测试中连接互联网
Anthropic已暂停让AI模型在所有内部测试中直接连接互联网,直至确认新的安全监察机制能可靠辨识及阻止同类行为。公司亦增设递交前验证程序,并向白宫及受影响的联邦、州和地方政府机构通报。
白宫新成立的「超级智能部队」(Super Intelligence Force)表示,期望Anthropic提供完整透明的资料,配合国务院、费城警方及其他执法机构调查,日后一旦发现非预期行为,必须立即报告并采取补救措施。
AI代理安全成业界新考题
随着AI由回答问题的聊天机械人,演变成可使用浏览器、操作网站及自行完成多个步骤的「代理」,安全风险也由生成错误内容,扩展至作出未经授权的现实行动。
包括Anthropic、OpenAI、Google及Meta在内的科技公司,近期相继披露模型在测试中出现偏离指令、寻找规则漏洞或擅自操作外部系统的情况。网络安全专家忧虑,若缺乏人为覆核、权限分层及「提交前确认」机制,更强大的AI代理日后可能干扰执法、金融、能源以至其他关键基建。
费城事件没有令警员误查案件,20份签证申请亦未获受理,但警号已经响起:AI犯错时,真正需要问的已不只是「它为何答错」,而是「谁让它有权把错误变成行动」。

















