
아이퀘스트 리서치(IQuest Research)가 소프트웨어 엔지니어링과 도구 활용, 장기 작업 수행에 초점을 맞춘 대규모 인공지능(AI) 모델 ‘아이퀘스트-Q1(IQuest-Q1)’을 공개했다. 관련 모델 가중치와 기술 자료는 깃허브(GitHub)와 허깅페이스(Hugging Face), 공식 블로그를 통해 배포됐다.
이번에 공개된 모델은 저장소 탐색과 터미널 조작, 도구 호출, 긴 문맥 유지를 초기 훈련 단계부터 반영한 점이 특징이다. 추론이나 도구 사용 능력을 사후에 덧붙이는 기존 방식에서 벗어나, 멀티스텝 작업 완료를 목표로 설계됐다.
자연어 지시만으로 인터랙티브 애플리케이션을 단번에 구현하는 시연도 함께 공개됐다. 3D 환경과 캐릭터 이동, 점수 체계, 상점 시스템을 갖춘 1인칭 슈팅(FPS) 게임이나 연속 트랙 레이싱 게임을 생성하는 식이다. 기존 코드베이스의 오류를 추적해 강화학습 로그를 분석하고 원인을 찾아 고치는 디버깅 과정도 지원한다.
아키텍처 측면에서는 디코더 전용 트랜스포머(Transformer)와 희소 혼합 전문가(Sparse Mixture-of-Experts) 구조를 채택했다. 전체 파라미터는 약 3200억 개에 달하지만, 토큰당 활성화되는 규모는 약 150억 개 수준으로 최적화됐다. 훈련은 사전훈련, 중간훈련, 사후훈련 등 세 단계로 나뉘어 진행됐다.
사후훈련 과정에서는 소프트웨어 엔지니어링과 일반 추론 능력을 다듬기 위해 지도 미세조정과 강화학습이 적용됐다. 여러 교사 모델의 강점을 학생 모델의 온폴리시(On-Policy) 롤아웃에 통합하는 멀티 교사 온폴리시 증류(Multi-Teacher On-Policy Distillation) 기법도 활용됐다.
회사는 NL2Repo, 사이버짐(CyberGym), 터미널벤치(Terminal-Bench 2.1), 딥SWE(DeepSWE v1.1), 잡벤치(JobBench) 등 다양한 벤치마크를 통해 코드 생성과 터미널 제어 성능을 평가했다고 밝혔다. 상세한 성능 수치와 평가 설정은 공식 기술 보고서에 명시됐다.






