
신뢰·안전(Trust & Safety) AI 기술 기업 무스비(Musubi)가 실시간 콘텐츠 정책 판정을 위한 전용 의사결정 모델 ‘PolicyLM-1.7B’를 오픈웨이트로 전격 공개했다. 아파치(Apache) 2.0 라이선스가 적용되어 플랫폼 기업과 개발자가 소스코드를 내려받아 자체 인프라에서 곧바로 구동할 수 있다.
이번 모델은 라이브 채팅, 게임 로비, 다이렉트 메시지(DM), 사용자 닉네임처럼 대화나 텍스트가 유저들에게 노출되기 직전 수십 밀리초(ms) 단위로 유해성을 가려내야 하는 환경을 주요 타깃으로 삼는다.
기존 콘텐츠 모더레이션 시스템은 크게 두 가지 방식에 의존해왔다. 전통적인 고정 분류기(Classifier)는 속도가 빠르고 구동 비용이 저렴하지만, 서비스별 정책 문서를 스스로 이해하지 못해 규칙이 바뀔 때마다 라벨링 데이터를 새로 만들고 모델을 재학습해야 하는 치명적인 한계가 있었다. 반면 대규모 언어모델(LLM)은 자연어로 적힌 정책 지침을 잘 읽어내지만, 엄청난 연산량 탓에 응답 지연(Latency)이 길고 운영 비용이 높아 초당 수천 건이 넘는 실시간 채팅 스캔에 적용하기 어려웠다.
PolicyLM-1.7B는 이 두 방식의 중간 지점을 정확히 노려 설계된 소형 의사결정 모델이다. 텍스트 설명이나 답변 문장을 길게 생성하는 대신, 입력된 메시지와 운영자가 작성한 정책 기준을 동시에 읽어 들인 뒤 미리 지정된 각 라벨 범주에 대해 0부터 1 사이의 점수 형태 확률값을 한 번에 반환한다.
운영자는 모델을 다시 훈련하거나 임베딩 캐시를 재구축할 필요 없이 평문(Plain English) 텍스트로 유해 카테고리와 판정 규칙을 추가·수정하기만 하면 된다. 즉시 바뀐 정책이 실시간 트래픽 판정에 반영되는 구조다.
성능 지표에서도 실시간 운영 가능성을 확인했다. 무스비 측이 공개한 측정 데이터에 따르면 6개 규정 범주를 기준으로 짧은 채팅 메시지를 검사할 때 24GB VRAM을 갖춘 엔비디아 L4 GPU 환경에서 중앙값 지연시간은 35ms에 불과했다. 고급 카탈로그 스펙인 H100 GPU에서는 22ms 수준까지 줄어든다. 전체 처리 시간을 100ms 미만으로 유지해 일반 노트북이나 24GB 급 단일 GPU 한 장으로도 충분히 운영 가능하다. 이미 맞춤형 미세조정을 거친 버전이 하루 100만 건 이상의 트래픽을 처리하는 글로벌 플랫폼에 탑재돼 동작 중이다.
평가 프레임워크에서는 총 19개 언어에 대한 판정 테스트가 수행됐으며 영어 환경에서 가장 정교한 성능을 나타냈다. 실행 모드는 두 가지로 나뉜다. 위반 사례가 상대적으로 드문 라이브 채팅 환경에 맞춘 ‘정밀(precision)’ 프리셋과 유해 콘텐츠 비중이 높거나 누락에 따른 위험 요소가 커 정밀 검토 대기열로 보내야 하는 상황에 맞춘 ‘균형(balanced)’ 프리셋을 선택할 수 있다. 문맥 창(Context Window)은 정책 가이드라인 문구와 사용자 메시지를 더해 최대 2048토큰까지 지원한다.
다만 모델 특성에 따른 제약 사항도 명확히 고지됐다. 메시지를 단건 단위로 평가하도록 맞춰져 있어 이전 대화 맥락이나 맥락 데이터 흐름을 완벽히 계산에 넣지 못하며, 어떤 이유로 해당 점수가 부여됐는지 문장 형태의 사유를 설명해주지 않는다. 문맥이 매우 길거나 서로 연관성이 없는 카테고리를 한 번에 대량으로 주입할 경우, 또는 은어나 유해해 보이지만 정상적인 친목 대화 등에서는 오탐(False Positive) 가능성이 커질 수 있어 실제 서비스 투입 전 각 플랫폼 데이터 기반의 컷오프(Cut-off) 임계값 조정이 권장된다.
한편 PolicyLM-1.7B의 기반 파운데이션 모델은 'Qwen3-1.7B-Base'에서 파생되어 파인튜닝 과정을 거친 'BidirLM-1.7B-Embedding'을 바탕으로 제작됐다.





