비드래프트(VIDRAFT, 대표 김민식)는 자사의 AI 안전성 진단·평가 시스템 ‘AX-RAY’가 정부 ‘사이버 보안 특화 인공지능 파운데이션 모델 개발’ 사업에서 모델 안전성 검증 기술로 활용된다고 밝혔다.
비드래프트는 네이버클라우드가 이끄는 컨소시엄의 일원으로 참여해 보안 AI 모델 개발과 함께 해당 AI 모델 자체의 안전성을 검증하는 역할을 맡는다.
이번 검증 기술의 바탕이 된 연구는 최근 공개한 arXiv 논문 ‘The Mask Is Not the Model’이다. 비드래프트 연구진은 자기회귀 모델이 미래 토큰 정보를 앞선 계산에 사용하는 ‘인과 누설(Causal Leakage)’을 순전파 두 번만으로 탐지하는 기술을 개발했다.
연구진에 따르면 인위적으로 주입한 결함 192건을 모두 층 단위로 찾아냈으며, 실제 ‘NVIDIA Nemotron-H-8B’와 ‘Zyphra Zamba2-1.2B’의 특정 PyTorch 실행 경로에서도 동일한 결함을 실증했다.
이러한 결함은 성능지표를 실제보다 좋아 보이게 만들 수 있으며 미래 정보가 현재 예측에 유입될 경우 손실과 PPL이 낮아져 모델이 더 뛰어난 것처럼 보일 수 있다는 게 회사 측 설명이다.
비드래프트는 해당 진단 기술을 AX-RAY의 구조적 안전성 검사 모듈에 접목했으며 고객 모델의 육성과 경량화, 최종 구조적 위험 점검까지 이어지는 AI 품질검사(QA) 역할도 담당한다.
또한 단순한 정책·윤리 체크리스트를 넘어 실제 코드와 실행 경로를 측정하는 ‘계측형 안전성’으로 확장할 계획으로, 관련 기술은 논문 공개 전 국내 특허 출원과 심사 청구를 완료했다.
한편 비드래프트는 전 국민 대상 ‘모두의 AI’ 사업에서도 이스트소프트 컨소시엄에 참여해 모델 성능 최적화와 경량화를 담당하고 있다.
김민식 대표는 “모델을 만드는 회사는 많지만 남이 만든 모델이 구조적으로 적합한지 검증할 수 있는 회사는 드물다”며 “논문 연구를 바탕으로 구현된 검증 기술을 국가 보안 AI 검증에 본격 적용하고 기술 신뢰도를 높여나가겠다”라고 말했다.