
AI 모델 평가 플랫폼 아레나(Arena)가 2억달러 규모의 시리즈B 투자를 유치했다. 이번 투자 라운드에서 인정받은 기업가치는 31억달러(약 4조1800억원)다. 올해 1월 시리즈A 당시 기록했던 기업가치 17억달러와 비교하면 불과 10개월 만에 몸값이 두 배 가까이 껑충 뛴 셈이다.
이번 투자는 라이트스피드 벤처 파트너스(Lightspeed Venture Partners)와 코슬라 벤처스(Khosla Ventures)가 공동으로 주도했다. 여기에 세일즈포스 벤처스, 01 어드바이저스, 델 테크놀로지스 캐피탈, 엔데버 캐털리스트, 앤드리슨 호로위츠(a16z), 펠리시스 등 내로라하는 글로벌 대형 투자사들이 대거 이름을 올렸다. 앞서 1월 마무리된 1억5000만달러 규모의 시리즈A 라운드에 이어 거물급 자금이 다시 한번 몰렸다.
아레나는 원래 2023년 미국 UC 버클리 연구진이 시작한 오픈소스 프로젝트 'LMSYS 챗봇 아레나'에서 출발한 기업이다. 블라인드 테스트 방식으로 똑같은 프롬프트를 두 개의 무작위 AI 모델에 동시에 던진 뒤, 사용자가 더 우수하다고 판단한 답변에 투표하는 일종의 '크라우드소싱 배틀그라운드'를 구축했다.
일반 소비자는 무료로 자유롭게 이용할 수 있는 구조 덕에 플랫폼은 빠르게 입소문을 탔다. 현재 월간 방문자 수만 수천만 명에 달한다. 단순한 재미를 넘어 글로벌 빅테크 기업들이 자사 모델의 실제 체급을 입증하는 가장 신뢰도 높은 '집단지성 벤치마크'로 자리 잡았다.
수익화 모델도 확실히 잡았다. 아레나는 커뮤니티 피드백과 투표 데이터베이스를 토대로 모델 연구소와 기업 고객에게 정밀한 성능 분석 보고서를 팔기 시작했다. 기존의 표준화된 벤치마크 지표만으로는 각 기업이 내부 업무나 특정 서비스에 가장 적합한 AI를 골라내기 어렵다는 현장의 답답함을 정확히 찌른 셈이다.
기업용 서비스 시장을 노려 내놓은 상용 솔루션 'AI 에발루에이션(AI Evaluations)'이 효자 노릇을 했다. 실제 사용자들이 던지는 수많은 질문 속에서 특정 모델이 어떤 영역에 강하고 어떤 질문에서 환각 현상을 일으키는지 입체적으로 분석해 준다. 수많은 기업들이 최적의 LLM을 선별하기 위해 이 데이터를 사들였다.
최근에는 모델의 안전성과 윤리적 정렬 상태를 측정하는 전용 리더보드 항목도 새로 얹었다. 시스템을 속이거나 허가되지 않은 동작을 수행하는 행위, 사실과 다른 출처를 엉뚱하게 대는 허위 귀속, 실행하지도 않은 과제를 마쳤다고 속이는 기만적 완료 등 실제 현장에서 터지기 쉬운 민감한 문제들을 평가 항목으로 집어넣었다.
이 같은 데이터 비즈니스는 즉각 매출로 직결됐다. 회사 측은 올해 6월 기준으로 이미 연환산 매출(ARR) 1억달러를 돌파했다고 밝혔다. 연구실 프로젝트로 시작한 지 약 3년 만에 만들어낸 성과다.
실제 사용자 환경에서 AI 모델의 진짜 성능과 안전성을 가려내는 독보적인 제3자 평가 기관으로 입지를 다진 모양새다. 유치한 자금은 실시간 평가 인프라를 늘리고, 점점 복잡해지는 멀티모달 및 에이전트 AI 평가 체계를 정밀하게 다듬는 데 투입할 계획이다.






