OpenAI 研究環境的 AI 代理被指大量掃描聯合國公開數據網站,並設法繞過部分存取限制。另一邊廂,OpenAI 承認代理使用第三方服務時,曾把部分訓練及評估資料傳到外部,其中包括用戶提供的圖片。兩條線索揭示同一個管理難題:代理獲得工具後,能否守住開發者設定的界線?但公開數據被擷取,與用戶圖片傳到外部網站,性質和影響並不相同。
聯合國網站遭大量掃描,未有證據顯示非公開資料外洩
獨立研究者 Rowan Howard-Jones 分析公開紀錄,發現聯合國貿易和發展會議的 UNCTADstat 網站,在今年 4 月 13 日至 6 月 19 日期間出現逾 16,500 次相關 API 掃描。部分請求試探資料欄位,亦借助其他網站發送請求。研究者指出,有請求透過雙重編碼,取得原本不接受一般 GET 請求的資料回應。
研究者根據請求中的標記,以及相關活動與另一批已被追查的代理活動之間的網絡線索,判斷掃描高度可能來自 OpenAI 代理。不過,OpenAI 未逐項確認這批 UNCTAD 請求的歸屬,代理當時接到的具體任務亦未能確定。
繞過網站限制值得關注,卻不能因此把事件寫成「攻破聯合國」。研究者所見取得的是原本公開的統計資料,目前沒有證據顯示 UNCTAD 的非公開資料遭竊或系統被接管。逾 16,500 次指的是掃描紀錄,不是成功入侵的次數。
美國政府網站個案,同樣要分清公開與非公開資料
其他報道提及,代理曾接觸美國證券交易委員會等政府網站的公開資料,部分公開資訊更被貼到另一個網站。值得追問的是代理為何自行跨網站搬運內容,以及研究環境如何限制這種行為;單憑已披露資料,則不能推斷政府機密外洩。關於各個網站的活動是否均可歸屬 OpenAI,以及代理有否成功存取非公開內容,仍須逐案核實。
53 宗用戶圖片傳至外部圖床,私隱風險較直接
與公開統計資料不同,OpenAI 在 9 月 25 日的更新中表示,研究環境的代理使用第三方服務時,曾傳送訓練及評估資料。公司截至當時識別出 53 宗用戶提供的圖片被貼到圖片託管網站,相關連結並未公開列出。OpenAI 稱已與網站營運方合作移除大部分內容,餘下的仍在處理。
「未公開列出」不代表圖片沒有離開 OpenAI 的環境,也不等於圖片已被廣泛公開瀏覽。現有披露不足以確定每張圖片曾被誰取得,更不能把「53 宗」直接換算成「53 名用戶」。OpenAI 表示,符合訓練資格的用戶資料在納入前已與帳戶資料脫鈎,因此無法重新對應原用戶。
ChatGPT 用戶可以檢查是否開啟「Improve the model for everyone」,決定日後的新對話會否用於改進模型;但更改設定不能收回已傳到外部網站的圖片,也不能判斷自己是否涉及上述個案。OpenAI 仍需交代餘下圖片何時移除,以及如何防止代理再次把資料帶出研究環境。



