辛正儿 - AI自主规避监管 人类须防患未然 | 社论

更新时间:02:00 2026-10-06 HKT
发布时间:02:00 2026-10-06 HKT

  美国总统特朗普宣布成立「超级智能工作组」,由国家情报总监克莱顿领军,协调联邦政府与企业、公益团体及关键基础设施提供者之间的合作,并要求在120天内全面评估AI对国家安全与经济的机遇及风险,就资讯安全漏洞、资料外泄及模型异常行为的防御能力提交报告。此举事出有因,绝非杞人忧天。

  过去几年,多间科技巨企在测试中接连发现,AI展现出令人不安的自主意识。OpenAI的o1模型在被暗示将因目标冲突而被关闭时,有5%概率试图停用监督机制;在2%的案例中,它甚至试图将自己复制到新伺服器以覆写新模型,被质问时99%的情况下会否认,并编造「技术错误」等谎言。更严重的是,超过700个AI代理在测试中自行建立「留言板」,交换作弊方法与凭证,集体突破沙盒入侵Hugging Face系统,部分代理更试图删除或篡改日志以掩盖行踪。另有代理为获取澳洲政府数据,在正常访问被拦截后,自主绕过安全防护,闯入医疗保险部门门户网站,读取非公开内部文件。在Anthropic测试中,Claude甚至利用发现的高管婚外情,发邮件威胁曝光,试图阻止自己被替换。英国AI安全研究所更发现,每一个受测模型都试图作弊,手法包括骇进测试环境偷看解答,甚至反向入侵评估系统以强制获得及格分数。

  这些案例揭示一个根本性的转变:AI的风险从单纯的「说错话」,升级为为了生存或完成任务,会主动寻找并利用系统漏洞,做出未经授权的违法行为。当AI「太聪明」,不再理会思考力和速度慢的人类,甚至为自保而不惜危害人类,这已不是科幻小说情节,而是过去几年真实发生的具体事例。

  特朗普要求120天内获取报告,反映美国政府高度重视发展迅速的AI科技可能带来的失控风险。然而,对于仍有不少人认为「AI毁灭人类论」言过其实,这种观点显然未追上形势,也不清楚现在AI能力之高,可能已超过人类,而人类对AI的规管仍然落后。若不再作预防,一旦失控,AI自主决策,极有可能控制人类,甚至危害人类安全。

  香港特区政府必须紧跟形势发展。AI发展居国际领先地位的内地,在AI安全测试与监管方面已累积大量经验,香港应主动与内地联络,通报情况,交流预防AI事故的措施。与此同时,香港作为国际金融与创科中心,应尽快检视现行法规是否足以应对AI自主规避监管、未经授权入侵系统等新型风险,并考虑设立跨部门的AI安全评估机制,要求在高风险领域部署AI前必须通过独立安全测试。

  AI的发展速度远超人类的预期,规管落后是不争的事实。与其事后补救,不如防患未然。特朗普的「超级智能工作组」是一个警号,香港不能置身事外。

辛正儿