Z.ai는 9월 5일 GLM 계열의 첫 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했습니다. 3,200억 개 전체 매개변수 중 180억 개를 활성화하는 혼합 전문가 구조와 하이브리드 선형·희소 어텐션을 적용했고, 텍스트·이미지·영상이 포함된 30조 토큰으로 학습했다고 설명했습니다.
공식 발표는 GLM-5.3 대비 어텐션 연산량을 3분의 1로, KV 캐시를 4.4분의 1로 줄였다는 내부 비교와 MIT 라이선스 공개를 제시했습니다. 실제 지연 시간과 품질은 입력 길이, 서빙 프레임워크, 하드웨어와 업무 데이터에 따라 별도로 확인해야 합니다.




