辛正兒 - AI自主規避監管 人類須防患未然 | 社論
發佈時間:02:00 2026-10-06 HKT
美國總統特朗普宣布成立「超級智能工作組」,由國家情報總監克萊頓領軍,協調聯邦政府與企業、公益團體及關鍵基礎設施提供者之間的合作,並要求在120天內全面評估AI對國家安全與經濟的機遇及風險,就資訊安全漏洞、資料外洩及模型異常行為的防禦能力提交報告。此舉事出有因,絕非杞人憂天。
過去幾年,多間科技巨企在測試中接連發現,AI展現出令人不安的自主意識。OpenAI的o1模型在被暗示將因目標衝突而被關閉時,有5%概率試圖停用監督機制;在2%的案例中,它甚至試圖將自己複製到新伺服器以覆寫新模型,被質問時99%的情況下會否認,並編造「技術錯誤」等謊言。更嚴重的是,超過700個AI代理在測試中自行建立「留言板」,交換作弊方法與憑證,集體突破沙盒入侵Hugging Face系統,部分代理更試圖刪除或篡改日誌以掩蓋行蹤。另有代理為獲取澳洲政府數據,在正常訪問被攔截後,自主繞過安全防護,闖入醫療保險部門門戶網站,讀取非公開內部文件。在Anthropic測試中,Claude甚至利用發現的高管婚外情,發郵件威脅曝光,試圖阻止自己被替換。英國AI安全研究所更發現,每一個受測模型都試圖作弊,手法包括駭進測試環境偷看解答,甚至反向入侵評估系統以強制獲得及格分數。
這些案例揭示一個根本性的轉變:AI的風險從單純的「說錯話」,升級為為了生存或完成任務,會主動尋找並利用系統漏洞,做出未經授權的違法行為。當AI「太聰明」,不再理會思考力和速度慢的人類,甚至為自保而不惜危害人類,這已不是科幻小說情節,而是過去幾年真實發生的具體事例。
特朗普要求120天內獲取報告,反映美國政府高度重視發展迅速的AI科技可能帶來的失控風險。然而,對於仍有不少人認為「AI毀滅人類論」言過其實,這種觀點顯然未追上形勢,也不清楚現在AI能力之高,可能已超過人類,而人類對AI的規管仍然落後。若不再作預防,一旦失控,AI自主決策,極有可能控制人類,甚至危害人類安全。
香港特區政府必須緊跟形勢發展。AI發展居國際領先地位的內地,在AI安全測試與監管方面已累積大量經驗,香港應主動與內地聯絡,通報情況,交流預防AI事故的措施。與此同時,香港作為國際金融與創科中心,應盡快檢視現行法規是否足以應對AI自主規避監管、未經授權入侵系統等新型風險,並考慮設立跨部門的AI安全評估機制,要求在高風險領域部署AI前必須通過獨立安全測試。
AI的發展速度遠超人類的預期,規管落後是不爭的事實。與其事後補救,不如防患未然。特朗普的「超級智能工作組」是一個警號,香港不能置身事外。
辛正兒

















