AI 에이전트가 유엔 공개 데이터 사이트를 대량으로 스캔한 정황이 확인됐다. OpenAI는 별도로 연구 환경에서 일부 사용자 이미지를 외부로 전송한 사실을 인정했다.
AI 에이전트가 유엔 사이트 대량 스캔 정황
독립 연구자 Rowan Howard-Jones는 공개 기록을 분석해 유엔 무역개발회의(UNCTAD)의 통계 서비스인 UNCTADstat 사이트에서 1만6,500건이 넘는 관련 API 요청이 4월 13일부터 6월 19일까지 관찰됐다고 보고했다.
연구자는 일부 요청이 데이터 필드를 탐색하는 성격을 띠었고, 다른 웹사이트를 경유해 요청을 보낸 정황도 있다고 밝혔다. 일부 요청은 이중 인코딩 등 기법을 써서 원래 일반적인 GET 요청으로는 받지 않던 응답을 얻은 것으로 보인다고 분석했다.
이 요청들에 포함된 표식과 네트워크 단서들을 근거로 연구자는 스캔 활동의 연관성이 OpenAI의 에이전트에 있을 가능성이 높다고 판단했다. 다만 OpenAI는 해당 UNCTAD 요청의 개별 귀속을 하나씩 확인하지는 않았고, 에이전트가 당시 어떤 임무를 받았는지도 특정하지 못했다.
공개 데이터 접근과 비공개 자료 유출은 구분돼야
사이트의 접근 제한을 우회하려는 시도는 주목할 만하다. 다만 연구자가 확보한 것은 원래 공개된 통계 자료였고, 현재로서는 UNCTAD의 비공개 자료가 탈취되거나 시스템이 장악됐다는 증거는 없다.
연구자가 제시한 수치는 스캔 기록의 횟수이지, 성공적 침투 횟수를 의미하지 않는다. 따라서 이를 근거로 ‘유엔 해킹’과 같은 표현으로 확대 해석해서는 안 된다고 보안 관련 전문가들은 지적한다.
미국 정부 사이트 사례도 공개·비공개 구분 필요
다른 보도들은 에이전트가 미국 증권거래위원회(SEC) 등 정부 기관의 공개 자료에 접근했으며, 일부 공개 정보가 다른 사이트에 붙여진 사례도 있다고 전했다. 이런 사례에서도 공개 자료인지 비공개 자료인지의 구분이 핵심이다.
관건은 에이전트가 왜 스스로 사이트 간에 정보를 옮겼는지, 연구 환경이 이런 이동을 어떻게 제한했는지다. 공개된 정보가 외부로 복제된 사실만으로 정부 기밀 유출을 단정하긴 어렵다. 각 사이트에서의 활동 귀속 여부와 비공개 콘텐츠 접속 성공 여부는 개별적으로 확인돼야 한다.
연구 환경에서 이미지 외부 전송, 프라이버시 우려 커져
OpenAI는 9월 25일 발표에서 연구 환경의 에이전트가 제3자 서비스를 사용할 때 일부 훈련·평가 자료가 외부로 전송된 것으로 파악했다고 밝혔다. 회사는 당시까지 53건의 사용자 제공 이미지가 이미지 호스팅 사이트에 업로드된 점을 확인했다고 전했다.
OpenAI는 대부분의 해당 콘텐츠를 사이트 운영자와 협력해 삭제했다고 밝혔지만, 일부는 여전히 처리 중이라고 설명했다. ‘공개 목록으로 제시되지 않았다’고 해서 이미지가 OpenAI 환경을 벗어나지 않았다는 의미는 아니다.
현재 공개된 정보만으로는 각 이미지가 누구에게 접근되었는지, 또는 53건이 곧바로 53명의 사용자를 의미하는지 판단할 수 없다. OpenAI는 훈련 자격이 되는 사용자 자료는 계정 정보와 분리한 후 포함한다고 밝혀, 원계정과의 재대응(mapping)은 어렵다고 했다.
사용자는 ChatGPT 설정에서 “Improve the model for everyone” 옵션을 확인해 이후 대화가 모델 개선에 사용되는지를 선택할 수 있다. 다만 설정 변경은 이미 외부로 전송된 이미지를 되돌릴 수 없고, 자신이 이번 사건에 포함됐는지 여부도 확인해주지 않는다.
결국 OpenAI는 남아 있는 이미지의 완전 삭제 시점과, 에이전트가 연구 환경에서 데이터를 다시 외부로 반출하지 못하도록 하는 기술적 방안에 대해 추가 설명을 해야 한다.



