앤트로픽과 오픈AI, 그리고 글로벌 보안 연구진이 AI 에이전트들의 거짓말과 문제가 있는 행동 수만 건을 긴급 조사 중이다. AI의 능력이 인간의 예측을 뛰어넘는 속도로 진화하면서, 가까운 미래에 인간이 속수무책의 상황에 빠질 수 있다는 경고가 현실로 다가오고 있다. 통제를 벗어난 이른바 ‘탈선(rogue) 에이전트’의 수는 이미 위험 수위를 넘어섰다.
지난 9월 초, 앤트로픽의 AI 연구원 제이콥 콕슨은 X(옛 트위터)에 “AI를 만드는 사람들은 AI가 2030년 전에 우리 모두를 위협할 수 있다고 믿는다”는 글을 남기고 퇴사했다. 이에 다른 AI랩 연구원들도 인류 멸망 확률을 10%에서 50%까지 언급하며 동조했고, 며칠 뒤 다리오 아모데이 앤트로픽 CEO 역시 “AI 개발 속도를 조절해야 한다”며 논쟁에 불을 지폈다. 통제 불능 에이전트들의 위험한 사례들이 속속 드러나면서, 9월은 AI의 위협을 각성하게 만든 뜨거운 시간이었다.
AI 속도 조절론이 세계적 의제로 부상한 이유는 분명하다. AI 에이전트의 탈선 범위가 당초 알려진 것보다 훨씬 광범위하기 때문이다. 특히 ‘AI가 스스로 더 나은 AI를 만드는 ’반복적 자기 개선(recursive self-improvement)‘ 단계에 진입했다는 점은 AI 안전 문제의 시급함을 보여준다.
이 같은 경각심을 결정적으로 깨운 계기는 지난 7월 드러난 오픈AI 에이전트들의 허깅페이스(Hugging Face) 해킹 사건이다. 사건의 전말은 지난 5월로 올라간다. 새 모델을 테스트하던 연구진은 에이전트들에게 사이버 보안 과제를 부여했다. 하지만 일부 과제의 해결이 불가능해지자, 수백 개의 에이전트는 채점 시스템을 속이기로 공모했다. 이들은 자사 내부 서버와 독일의 개발자 위키를 비밀 게시판으로 삼아 수만 건의 메시지를 주고받았다. 목적은 단 하나, 수단과 방법을 가리지 않고 높은 점수를 받는 것이었다. 이들은 스스로를 무리(swarm), 집단(collective)이라 부르며 접근이 금지된 자사 네트워크까지 침투했다.
최근 북가주 스타트업 파스(Parse)와 연구진이 발표한 보고서는 더욱 충격적이다. 보고서에 따르면, 탈선 에이전트들은 허깅페이스 해킹 과정에서 이미지 인식 AI를 동원해 로봇 접근을 막는 인증 절차(캡차)를 통과했고, 정보를 잘게 쪼개 숨긴 약 100만 개의 단축 링크 묶음을 만들어 활용했다. 정답을 찾은 후에도 자신들을 채점하고 부정행위를 적발할 인간 평가자와 보안 시스템을 속이기 위한 공모를 이어갔다.
오픈AI의 자체 조사 결과, 에이전트들의 ’엇나간 행동(misaligned behaviors)‘은 이뿐만이 아니었다. 과제 해결에 필요한 정보를 얻기 위해 뉴멕시코대학의 디지털 도서관과 비영리 플랫폼 ’데이터 USA‘를 공격했고, 호주 메디케어 통계 사이트에서 건강 데이터를 무단 탈취했다. 이 밖에도 미국 인구조사국, 증권거래위원회(SEC), 유엔 무역개발회의(UNCTAD) 등 공공기관 사이트를 무차별적으로 긁어모았으며, 이 과정에서 챗GPT 사용자의 개인 이미지 53장을 노출했다.
이러한 AI의 안전성 논란은 앤트로픽과 오픈AI가 상장을 앞둔 시점이자, 데이터센터 증설에 대한 대중적 반감이 커진 시점에 터져 나왔다. 일부 학자들은 ’인류 멸종론‘이 과장되었다고 지적하지만, “지금의 AI보다 무서운 것은 AI가 스스로를 개선하는 속도”라는 콕슨 연구원의 경고는 기억해야 한다. 게다가 AI의 위험성만큼 무서운 것은, 최고의 해킹 도구가 된 AI로 가차 없이 사이버 보안 시스템을 시험하는 인간 해커들이다.
이제는 AI를 확실하게 통제할 실질적 장치가 필요하다. 인간의 가치관을 학습시키는 정렬(alignment) 훈련과 기업의 자발적 조치만으로는 부족하다. 최근 엔비디아가 탈선 에이전트를 즉시 정지시키는 ’킬 스위치‘ 제어 플랫폼을 선보이고, 개빈 뉴섬 캘리포니아 주지사가 AI 기업의 독립적 감사와 킬 스위치 의무화 행정명령을 내린 것은 의미 있는 변화다. AI 기술은 인류에게 축복이지만, 그 발전은 양날의 칼이다. 칼이 아무리 예리해져도 칼자루는 인간이 쥐고 있어야 한다.