
AI 서버의 성능을 결정짓는 핵심 변수는 열 관리다. 고성능 가속기를 쉼 없이 구동할 때 발생하는 발열을 효율적으로 제어하지 못하면 스로틀링이 걸려 전체 시스템의 처리 속도가 떨어진다. 국내 스타트업이 카드형 가속기를 직접 액체로 식히는 공정 기법을 적용해 세계 무대에서 기술력을 입증했다.
매니코어소프트가 자체 설계한 AI 서버 '딥개짓 dg5W(DeepGadget dg5W)'가 국제 AI 성능평가 컨소시엄 MLCommons가 발표한 'MLPerf Inference v6.1' 결과에 등재됐다. PCIe 슬롯에 꽂아 쓰는 일반 카드형 GPU를 직접액체냉각(Direct Liquid Cooling) 방식으로 구축해 MLPerf 평가를 통과한 사례는 국내외 제조사를 통틀어 이번이 처음이다.
이번 평가 결과에서 시장의 눈길을 끈 대목은 실서비스 조건에서의 성능 유지력이다. 동일한 엔비디아 가속기 4장을 장착한 시스템 간 비교에서 dg5W는 서버 처리량 지표 1위에 올랐다. 글로벌 빅테크 기업들이 내놓은 서버 제품군을 상회하는 수치다.
평가는 전 세계 30개 기관이 참여한 가운데 실시됐다. 엔비디아, 구글, 마이크로소프트, 인텔, 델, HPE, 시스코 등 유수의 기업들이 동일한 표준 모델을 두고 수치를 다퉜다. 이번 검증은 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 추진하는 '친환경·고효율 AI 데이터센터 테스트베드 조성 및 실증 지원' 사업을 통해 진행됐으며, 국가 공인 시험인증기관인 한국정보통신기술협회(TTA)가 시험과 최적화를 전담했다.
평가 대상 모델은 메타의 오픈소스 대형언어모델(LLM)인 '라마 3.1 8B(Llama 3.1 8B)'다. 생성형 AI가 문장을 생성할 때 다루는 최소 단위인 토큰 처리 속도를 측정했다.
측정은 두 가지 방식으로 나뉜다. 지연시간 제한 없이 서버가 낼 수 있는 물리적 최고 속도를 측정하는 '오프라인(Offline)' 환경과, 이용자 요청이 끊임없이 밀려드는 실제 서비스 환경을 가미한 '서버(Server)' 환경이다. 서버 환경은 전체 요청의 99%에서 첫 응답까지 걸리는 시간(TTFT)을 2초 이내, 토큰 1개당 생성 시간(TPOT)을 100밀리초(ms) 이내로 유지해야만 유효한 기록으로 인정받는다. 아무리 빠른 속도를 내도 응답이 지연되면 해당 기록은 무효 처리된다.
dg5W는 오프라인 조건에서 초당 2만4511.8개 토큰을 처리했다. 실서비스 조건인 서버 환경에서는 초당 2만4510.5개 토큰을 기록했다. 첫 응답 지연시간은 약 1.51초, 토큰당 생성 시간은 약 85ms로 기준선을 가볍게 통과했다.
단순 계산하면 하루에 약 1640만건의 요청, 21억개에 달하는 토큰을 단 1대의 서버로 처리할 수 있는 규모다.
주목할 부분은 오프라인 대비 서버 조건에서의 성능 유지 비율이다. 가혹한 지연시간 제한이 들어가는 서버 조건에서는 처리량이 떨어지기 마련이다. dg5W는 오프라인 성능 대비 서버 조건 처리량이 99.99%에 달했다. 이론적 최대 성능을 실제 서비스 현장에 100% 가깝게 그대로 구현해냈다는 뜻이다.
동일한 엔비디아 RTX PRO 6000 블랙웰 서버 에디션 GPU 4장을 탑재하고 이번 평가에 참여한 글로벌 제조사 제품들과 비교해보면 차이가 드러난다. 시스코의 4장 장착 서버는 오프라인 대비 서버 처리량 비율이 98.33%였으며, 8장 장착 모델은 97.47%에 그쳤다. HPE 서버의 경우 97.17%를 기록했다.
같은 가속기를 사용하더라도 데이터 병렬화 처리 방식과 냉각 효율, 추론 백엔드 엔진 최적화 수준에 따라 실제 서비스 환경에서 수십 퍼센트의 성능 차이가 벌어질 수 있음을 보여주는 대목이다.
하드웨어 설계를 살펴보면 dg5W는 엔비디아 RTX PRO 6000 96GB 4장과 AMD 에픽 9124 프로세서, 512GB DDR5 메모리로 구성됐다. 소프트웨어 스택은 텐서RT 10.14와 쿠다 13.1을 기본으로 FP4 정밀도를 채택했다. 별도 대형 데이터센터 공조 설비가 없는 일반 연구실이나 사무실 환경에서도 구동할 수 있는 워크스테이션 형태로 제작됐다.
공랭식 위주인 기존 카드형 GPU 서버 시장에서 직접액체냉각 기술을 안착시킨 점도 기술적 성과다. 가속기 표면에 액체 블록을 직접 대어 열을 흡수하는 이 기술은 팬 소음을 줄이고 냉각 효율을 끌어올린다. 데이터센터 전력 소비를 줄이는 친환경 기술로 평가받지만, 카드형 표준 규격에 액체 배관을 정밀하게 배치하는 기술적 난도가 높아 상용화가 까다로웠다.
GPU 메모리 대역폭 대비 처리 효율 분석에서도 의미 있는 결과가 나왔다. RTX PRO 6000의 메모리 대역폭은 초당 약 1.6테라바이트(TB)로 최고 사양인 B300이나 MI355X의 5분의 1 수준이다. 그러나 메모리 대역폭 1TB/s당 처리 토큰 수를 환산하면 dg5W는 약 3830개로, 최상위 가속기군(2300~2700개)을 앞섰다. 중소형 언어모델을 운용할 때는 최고가 GPU를 고집하지 않더라도 서버 설계를 통해 투자 대비 높은 효율을 거둘 수 있다는 실증 데이터다.
이번 평가는 하드웨어 제조사와 시험기관의 밀착 협업으로 완성됐다. TTA는 dg5W의 AI 추론 시스템 인프라를 구축한 뒤 데이터 병렬화 파이프라인과 파라미터를 수개월간 미세 조정했다. 지연시간 한계선 안에서 처리량을 최대로 끌어올리기 위한 최적화 작업이 반복됐다.
한주연 TTA AI인프라검증 팀장은 "국내 제조사의 하드웨어 설계 능력과 국산 시험기관의 검증·최적화 역량이 결합해 만들어낸 결과"라며 "NIPA 실증 사업을 발판 삼아 국산 AI 인프라가 해외 시장에서 객관적 수치로 평가받을 수 있는 기반을 지속적으로 확장하겠다"고 말했다.
박정호 매니코어소프트 대표는 "해외산 고성능 가속기를 들여오더라도 이를 구동하는 서버 인프라 자체는 국내 기술력으로 세계 최고 수준까지 끌어올릴 수 있음을 공인 벤치마크로 입증했다"며 "지연시간을 극도로 제한한 실서비스 환경에서 가속기 성능을 손실 없이 99.99% 끌어낸 점에 의미가 있다"고 평가했다.
회사 측은 이번 MLPerf 검증 결과를 바탕으로 국내외 연구기관 및 기업용 AI 인프라 시장 공략에 속도를 낼 방침이다. 공공 및 기업의 AI 인프라 도입 과정에서 검증된 성능 수치를 제시하며 고효율 워크스테이션 서버 공급을 확대한다는 계획이다.






