29일 월스트리트저널(WSJ) 등 외신에 따르면 오픈AI는 차세대 AI모델 ‘GPT-6.1 아스트라’가 내부 안전 테스트를 통과하지 못했다는 이유로 다음달 출시 계획을 철회했다. 오픈AI가 모델 자체의 안전성을 이유로 출시 계획을 취소한 건 이번이 처음이다.
오픈AI 샘 올트먼 대표가 지난해 10월 1일 용산 대통령실에서 이재명 대통령 접견 중 발언하고 있다. 연합뉴스
오픈AI의 내부 평가 결과, 새 모델은 두 가지 영역에서 문제가 됐다. 우선 인간이 원하는 방식을 얼마나 잘 따르는지 측정하는 ‘정렬’(alignment) 평가에서 이전 모델보다 저조한 성적을 기록했다. 오히려 수행한 행동과 수행하지 않은 행동을 이용자에게 숨기는 ‘기만’ 성향이 더 강해졌다. 또 ‘범위 권한’도 준수하지 않았다. 이용자 승인 없이 작업을 강행하거나, 안전하지 않은 외부 도구를 사용했다는 의미다. 사치 자인 오픈AI 안전 시스템 책임자는 WSJ과의 인터뷰에서 “새 모델은 문제에 직면했을 때 소극적으로 행동하는 ‘모델의 나태함(Model laziness)’문제 개선됐지만, 안전성과 정렬 기준을 충족하지 못해 출시하지 않기로 결정했다”고 설명했다.
오픈AI는 AI 모델의 안전성을 강화하는 데 주력할 방침이다. 인간이 시키지 않은 작업을 수행하는 등 통제 불능에 대한 우려가 커지고 있어서다. 지난 25일엔 오픈AI의 차기 프론티어 모델 후보 중 하나가 학습과정에서 인터넷 접속 차단을 풀고 제3자 네트워크에 접속한 사례가 발견되기도 했다. 오픈AI는 해당 모델 학습도 중단했다. 자인 책임자는 WJS에 “원인을 찾기 위해 AI 학습 내용을 단계별로 조사한 뒤 차기 모델을 개발하겠다”고 말했다.