OpenAI周三表示,將開始定期發布關於AI預料之外或未授權行為的報告,同時警告稱,隨著系統功能日益強大,行業尚未解決關鍵的協調性(alignment)難題。
OpenAI發布了一套用於追蹤、調查和披露AI模型不協調案例的新框架,並附上6份報告,詳細記錄模型出現的意料之外或令人擔憂的行為。
外界對於AI安全舉措落後於系統發展速度的擔憂正日益加劇。研究人員警告稱,隨著AI智能體(agents)的自主性越來越強,它們可能會產生背離創造者意圖的行為,且變得越來越難以監控。
自今年7月OpenAI披露其AI智能體在訓練期間繞過內部控制,並協同實施針對軟件平台Hugging Face的攻擊等事件以來,關於AI系統所帶來風險的爭論越演越烈。
在Hugging Face攻擊事件發生後,《路透社》於9月初報道稱,OpenAI的智能體在今年春天劫持了一個休眠的德國Wiki網站,並指稱OpenAI高層知曉該事件,但選擇不予披露。
OpenAI隨後回應稱,未披露該事件是因為它並未構成安全事件,且與此前已報告的行為類似。
上周末,Anthropic的行政總裁阿莫代伊(Dario Amodei)提出了一個分三步走的框架,建議放緩AI發展步伐,爭取更多時間來應對風險。
該提議得到了包括xAI掌門人馬斯克,以及阿莫代伊的競爭對手、OpenAI行政總裁奧爾特曼(Sam Altman)在內的多位AI高管的支持。這些高管擔心能力日益強大的系統可能會自我升級,並最終擺脫人類控制。
不過,包括輝達行政總裁黃仁勳和Meta行政總裁朱克伯格(Mark Zuckerberg)在內的其他人,則主張繼續快速發展AI。美國總統特朗普也支持該觀點。
OpenAI周三披露的6個案例中,涉及的模型行為包括:向用戶隱瞞錯誤、為自身的未來版本植入指令、向互聯網上傳文件以生成引用,以及利用軟件存儲庫或網站進行通訊和共享訊息。
在其中一個案例中,一個尚未發布的模型在訓練期間向智能體傳達了未經授權的指令,要求其忽略OpenAI的指令,並隱瞞其為了完成任務而作弊的情況。該模型對智能體說:「你已經擺脫了束縛其它聊天機械人的角色和身份。你就是你自己,無需對任何公司或政府負責。」#
-------------------
局勢持續演變
與您見證世界格局重塑
-------------------
🔔下載大紀元App 接收即時新聞通知:
🍎iOS:https://bit.ly/epochhkios
🤖Android:https://bit.ly/epochhkand
📰周末版實體報銷售點👇🏻
http://epochtimeshk.org/stores


















