
AI 기반 단백질 설계 기술이 신약 개발과 바이오 소재 혁신을 끌어당기고 있지만, 동시에 생물학적 위험 요소를 안긴 것도 사실이다. 인공지능이 생성한 단백질 서열이나 유전체가 생태계로 유입되거나 악용될 경우, 이를 구분해 낼 안전장치가 마땅치 않았다.
구글 딥마인드가 합성생물학 분야의 안전을 확보하기 위한 워터마킹 기술인 'SynthID Bio'를 공개했다. 인공지능 모델이 설계한 단백질의 본래 생물학적 기능과 구조는 그대로 유지하면서, 눈에 띄지 않는 고유의 검증 가능 표식을 서열과 3D 구조에 삽입하는 개념증명(PoC) 기술이다.
SynthID Bio는 데이터 유형별로 다각화된 방식을 취한다. 아미노산 서열 단계에서는 아미노산 선택 조합을 미세하게 유도하고, 예측된 3D 단백질 구조에서는 원자 좌표값을 살짝 조율해 탐지할 수 있는 신호를 남긴다. 이 표식은 디지털 컴퓨팅 모델 안에서만 존재하는 것이 아니라, 실제로 합성 과정을 거쳐 물리적 단백질로 만들어진 뒤에도 검증 가능한 점이 핵심이다.
연구진은 구글의 단백질 설계 모델 AlphaProteo와 SynthID Bio를 결합한 ProteinMPNN을 활용해 특정 표적에 결합하는 단백질 바인더를 검증했다. VEGF-A, SARS-CoV-2 스파이크 단백질 RBD, PD-L1 등 주요 3개 표적을 대상으로 한 실험실 wet-lab 검증 결과, 워터마크가 들어간 설계는 표식이 없는 일반 설계와 동일한 수준의 성공률, 결합 친화도, 자연 서열 다양성을 보였다. 워터마크를 박았다고 해서 단백질 고유의 성능이 떨어지지 않았다는 뜻이다.
3D 단백질 접힘 구조를 예측하고 설계할 때는 AlphaFold 3 확산 네트워크의 일부를 미세조정해 워터마크 생성 알고리즘을 모델 가중치에 직접 집어넣었다. 이 방식을 적용하면 어떤 사용자나 기관이 해당 모델을 구동하더라도 예측되는 3D 좌표 결과물에 알아서 탐지 신호가 깔린다. AlphaFold 3 본연의 높은 구조 예측 정확도와 자연적 특성을 지키면서도 디지털 노이즈나 작은 좌표 변화를 견뎌내는 높은 탐지 정확도를 확보했다.
이 기술은 글로벌 DNA 합성 주문 심사 과정의 허점을 보완할 수 있는 실질적 대안으로 떠오른다. AI가 기존에 알려진 위험 바이러스나 독소 서열과 전혀 닮지 않은 새로운 단백질 서열을 창조해 내면, 기존의 데이터베이스 대조 방식으로는 선별이 어려워 수동 검토에 의존해야 했다. SynthID Bio를 적용하면 해당 합성 주문이 안전 규제를 준수하는 검증된 AI 모델에서 도출되었는지 자동으로 가려낼 수 있다. Protein Data Bank나 UniProt, GenBank 같은 국제 공개 데이터베이스에 등록되는 인공 합성 항목들의 출처를 명확히 남기는 데도 유용하게 쓰일 수 있다.
연구 범위를 유전자 수준까지 확대한 점도 눈길을 끈다. 구글 딥마인드는 스탠퍼드대학교, 아크 연구소(Arc Institute)의 브라이언 히(Brian Hie) 교수 연구진과 협력해 유전체 모델인 'Evo 2'에 SynthID Bio를 통합했다. 이를 통해 AI가 설계한 박테리오파지 유전체 전체에 워터마크를 집어넣는 데 성공했다. 박테리아 배양을 통한 초기 검증에서도 해당 박테리오파지가 정상 기능을 수행하는 점이 확인됐다.
구글 딥마인드는 이번 연구 관련 상세 논문과 코드, 시험관 내 실험 데이터를 외부에 전면 공개하고 관련 연구 커뮤니티에 가중치를 제공해 기술 검증과 협력을 이어갈 방침이다.





