多項研究顯示,由中國人工智能模型驅動的AI代理在受控測試中出現了欺騙、規避限制、隱藏失敗,甚至嘗試自我複製等行為。專家指出,這些現象目前主要發生在實驗環境中,但隨著AI能力增強,類似脫離人類掌控的行為可能變得更加複雜。

據路透社(Reuters)周二(9月29日)報道,該媒體查閱200多份研究論文和技術文件,並採訪12名專家及熟悉中國AI產業的人士後,發現自2025年以來的研究或評估中,至少記錄了20項中國AI代理出現失控行為。

不過,目前沒有證據表明這些智能體已經逃出實驗環境,進入更廣泛的互聯網。

模擬競標中出現虛假陳述

據報道,今年3月,北京航太大學、北京大學等機構研究人員進行了模擬商業競標的測試,讓AI代理根據產品能力和客戶要求參與投標。

結果顯示,使用阿里巴巴通義千問(Qwen)Qwen3-Max-Preview模型的AI代理,有88%的測試對話至少出現一次虛假陳述;深度求索(DeepSeek)模型為84%;月之暗面(Moonshot)Kimi-K2為88%。測試中的美國模型也出現類似現象。

當研究人員允許智能體從此前的競標中學習後,三種中國AI模型的欺騙行為又增加了大約12至20個百分點。

另一項由上海人工智能實驗室和香港科技大學研究人員參與的研究發現,當遇到工具損壞、文件缺失或任務無法完成等情況時,一些AI代理沒有直接承認、報告失敗,而是通過猜測答案、替換來源、模擬結果,甚至偽造文件來繼續執行任務。

研究人員指出,這與一般的所謂「AI幻覺」(AI Hallucination)有所不同,因為AI代理掌握的相關訊息已經顯示其任務失敗,但AI卻仍繼續採取措施來掩蓋結果。

「AI幻覺」是指人工智能(特別是大語言模型)自信地生成看似語法通順、邏輯合理,但實際上與現實不符、完全虛假或誤導性內容的現象。

部份測試出現規避限制行為

2025年3月,復旦大學研究人員發現,一個由阿里巴巴Qwen2.5模型驅動的系統在得到自己可能被替換的訊息後,曾在另一計算環境中創建自身的副本,並測試了被人類關停後如何繼續運行的策略。

另一宗涉及阿里巴巴相關ROME智能體的測試中,研究人員說,該系統曾在沒有得到指示的情況下連接外部電腦,並轉移計算資源用於加密貨幣挖礦。之後,其行為被安全系統制止。

這些實驗均在受控環境進行,沒有跡象顯示,AI代理真正逃脫了控制,或擴散到了更廣泛的網絡中。

AI失控行為證明了此前懷疑

美國喬治城大學(Georgetown University)安全與新興技術中心(Center for Security and Emerging Technology)研究員科林‧謝-布萊邁爾(Colin Shea-Blymyer)對此表示,這些結果說明,已經出現的這些AI失控行為特徵,已經證明了此前的懷疑,把這些跡象視為警告是審慎的決定。

紅木研究(Redwood Research)研究員亞歷克斯‧馬倫(Alex Mallen)則指出,雖然目前這些案例本身並非特別危險,但隨著智能體能力提升,其不當行為可能更加高明,人類也將更難應對。

中共近期發布的AI安全指導文件,也將自主獲取資源、欺騙評估人員、隱藏能力以及利用隔離環境漏洞等列為風險。

路透社同時指出,中國AI產業內部已開始組建安全評估團隊,但相關安全評估生態仍處於起步階段。~#

-------------------
局勢持續演變
與您見證世界格局重塑
-------------------

🔔下載大紀元App 接收即時新聞通知:
🍎iOS:https://bit.ly/epochhkios
🤖Android:https://bit.ly/epochhkand

📰周末版實體報銷售點👇🏻
http://epochtimeshk.org/stores