
아마존웹서비스(AWS)가 Amazon Bedrock에서 Z.ai의 플래그십 모델 ‘GLM 5.3’을 정식 제공한다. AWS는 이번 라인업 추가를 통해 복잡한 시스템 엔지니어링과 장기 수행형 에이전트 작업에 특화된 고성능 선택지를 기업 고객에게 제시했다.
GLM 5.3은 전문가 혼합(Mixture-of-Experts) 구조 기반의 오픈 웨이트 모델이다. 전체 파라미터는 7530억개에 달하며, 실제 추론 및 토큰 생성 시에는 약 400억개 파라미터가 활성화되는 방식으로 동작한다. 전작인 GLM 5.2와 동일한 기반 모델을 유지하면서도 후학습(Post-training) 과정을 확장 설계해 개발 작업 전반의 정밀도를 끌어올렸다.
이번 모델은 최대 100만 토큰에 이르는 컨텍스트 창과 12만8000개 출력 토큰을 지원한다. 시스템 내부 추론 기능이 상시 활성화되어 있어 이용자가 작업 성격에 맞춰 추론 노력 수준을 직접 조절할 수 있다. 지연 시간 단축이 중요한 단기 작업부터 긴 문맥을 유지해야 하는 대규모 코드베이스 수정까지 토큰 소비와 성능 간 균형을 유연하게 맞추는 구조다.
개발 및 운영 효율화를 위한 비용 제어 장치도 마련됐다. 해당 플랫폼에서 제공되는 GLM 5.3은 명시적 프롬프트 캐싱 기능을 지원해 시스템 프롬프트나 공통 메시지 구간에 캐시 지점을 지정할 수 있다. 반복 호출 시 동일한 맥락을 매번 재전송할 필요가 없어 호출 지연 시간과 입력 비용을 동시에 줄여준다.
서비스 접근성 측면에서는 미국 및 글로벌 교차 리전(Cross-Region) 추론 프로필이 적용됐다. 트래픽 상황에 따라 요청을 보안 상태로 최적 리전에 자동 배정하는 방식이다. 자격을 갖춘 기업 고객은 기존 Amazon Bedrock 콘솔이나 전용 API, OpenAI 호환 응답 API 등을 통해 즉시 엔지니어링 현장에 투입할 수 있다. 상세 구동 엔드포인트와 서비스 티어별 가격 체계는 AWS 공식 문서에 명시됐다.






