
자사 프런티어 모델의 내부 추론 과정을 무단으로 빼내려던 대규모 적대적 증류(Adversarial Distillation) 시도가 오픈AI 보안망에 걸렸다.
오픈AI는 자사 모델이 생성하는 보호된 추론(Protected Reasoning) 데이터를 조직적으로 추출하려 한 정황을 포착하고, 관련 네트워크와 계정을 전면 차단했다고 밝혔다. 지난 7월 첫째 주에 처음 감지된 이번 수법은 시스템의 데이터베이스를 직접 침해하거나 이용자 대화록을 들여다보는 방식이 아니었다. 프롬프트 구조와 모델 상호작용을 정교하게 조작해, 내부적으로 숨겨져 있어야 할 추론 레이어가 요청자의 화면에 노출되도록 유도하는 기법이 쓰였다.
이른바 '적대적 증류'는 타사 모델의 고성능 출력물이나 내부 추론 과정을 체계적으로 수집한 뒤, 이를 자체 모델의 훈련 및 복제, 성능 개량에 무단 활용하는 행위를 뜻한다. 오픈AI 측은 "특정 모델에만 국한된 보안 허점이 아니라 프런티어 모델 전반이 직면한 구조적 위협"이라며 프런티어 모델 포럼(Frontier Model Forum)을 통해 관련 정황을 주요 기술 기업들과 공유했다.
공격자들이 사용한 수법도 구체적으로 공개됐다. 한 대화 세션에서 발생한 암호화된 추론 값을 복사한 뒤, 이를 다른 대화 세션의 모델에 입력해 숨겨진 추론 내역을 다시 복호화하고 기록하도록 요구하는 교차 세션 허점을 노렸다. 보안 연구자들의 책임 있는 제보(Responsible Disclosure) 역시 실제 공격 경로를 파악하고 방어 체계를 가동하는 데 한몫했다.
수집 시도는 7월 1일부터 소규모로 탐지되기 시작했다. 그러다 7월 24일과 25일 양일간 4000명이 넘는 계정에서 1만6000건에 달하는 추출 프롬프트가 동시다발적으로 쏟아졌다. 정밀 조사 결과 전체 연관 네트워크에 연결된 이용자 계정만 1만5000명을 넘어서는 것으로 집계됐다. 회사는 7월 28일까지 관련 공격 경로를 완전히 차단 조치했다.
이번 공격을 주도한 주체에 대해 오픈AI는 단일 집단인지 여부는 단정하기 어렵다면서도, 활동의 핵심 축이 중국 킴(Kimi) 개발사인 묜샷 AI(Moonshot AI)와 연관된 인물들로 파악됐다고 평가했다. 안전장치가 제거된 내부 추론 데이터가 타사 모델 훈련에 가공 없이 투입될 경우, AI 모델의 안전 기준 자체가 무력화될 수 있다는 우려도 덧붙였다.
대응 조치도 가파르게 이뤄졌다. 오픈AI는 즉각 관련 사기 계정을 제한하거나 영구 차단하고, 신규 가입 절차와 인프라 접근 통제를 대폭 강화했다. 조직 및 제품군 전반에서 숨겨진 추론 보호 알고리즘을 개편하는 한편, 이미 암호화된 추론 값을 확보했더라도 이를 재생해 원본 내용을 복구할 수 있던 허점을 폐쇄했다. 실시간으로 응답을 내보내는 스트리밍 과정에서 추론 레이어가 노출될 가능성이 감지되면 출력을 즉시 보류하는 정밀 검사 모듈도 추가 투입됐다.
제3자 API 서비스를 통해 우회 접근을 시도한 계정과 제공업체 역시 식별을 마치는 대로 접근권을 박탈했다. 오픈AI는 클라우드 파트너사들과 긴밀히 협력해 통제 범위를 확장하는 한편, 정부 차원의 위협 정보 공유 채널 및 업계 파트너들과 손잡고 추출 방지 기술과 실시간 탐지 체계를 고도화해 나갈 방침이다.






