AI Notes

Z.AI GLM-5.3 풀 오픈웨이트 출시: 같은 base, post-training만으로 얻은 coding·agent·cyber capability

Z.AI가 GLM-5.2와 같은 base에서 post-training만으로 만든 텍스트 전용 풀 GLM-5.3을 공개했습니다. 78 layer·1M context·256 routed expert MoE, CyberGym·ExploitGym·ExploitBench vendor 점수, custom 라이선스의 MaaS 보...

Z.AI GLM-5.3 풀 오픈웨이트 출시: 같은 base, post-training만으로 얻은 coding·agent·cyber capability 대표 이미지
Share:

원문 링크: WordPress 원문

AI NOTES · KO KOREAN EDITION

KO · 한국어 / EN · English BILINGUAL PAIR

2026년 8월 30일, Z.AI(중국 Zhipu AI의 상업용 브랜드)는 텍스트 생성용 풀 GLM-5.3 모델을 오픈웨이트로 공개했습니다. 이번 출시는 8월 26일 GLM-5.3-Flash를 정식 이름으로 발표한 데 이은 두 번째 단계입니다. 다만 이번 글은 일주일 전 stealth 출시로 화제를 모았던 GLM-5.3-Flash를 다루는 글이 아닙니다. 100만 토큰 context를 가진 텍스트 전용 풀 모델 GLM-5.3, 그리고 post-training 단계에서 빠르게 자라난 cyber capability가 어떤 의미인지, 어떤 라이선스 경계가 새로 생겼는지를 다룹니다.

핵심 결론 GLM-5.3은 GLM-5.2와 같은 base model에서 출발해 post-training만으로 coding·agent·cyber capability를 끌어올린 텍스트 생성용 오픈웨이트입니다. Z.ai는 CyberGym·ExploitGym·ExploitBench에서 동급 비교군 중 가장 좋은 성적을 공개했고, 같은 base에서 얻은 gain은 아키텍처가 아니라 사후 학습 데이터·방법의 결과라고 못 박았습니다. 라이선스는 permissive하지만 일정 매출 이상의 MaaS 사업자에게는 Z.AI 보안 심의를 요구하는 custom 조항이 붙었습니다. 그리고 78개 layer·1M context·256 routed expert의 MoE 구조는 누구나 직접 받아서 띄워볼 수 있습니다.

GLM-5.3은 무엇이 새로우나

Z.ai는 Hugging Face에 공개한 모델 카드에서 한 문장으로 정리합니다. “GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training.”[1] GLM-5.3은 새로운 base를 사전 학습한 모델이 아닙니다. GLM-5.2의 base 위에 alignment, instruction tuning, tool-use 학습, long-horizon reasoning data, 그리고 cyber-related data까지 포함한 post-training 파이프라인을 다시 돌린 결과물입니다.

같은 사실은 benchmark 표에서도 그대로 읽힙니다. Terminal Bench 2.1에서 GLM-5.2 81.0이 GLM-5.3 88.2로, Terminal Bench 3.0에서 4.6이 28.3으로, DeepSWE v1.1에서 46.2가 66.9로, Toolathlon Verified에서 59.9가 73.0으로, AutomationBench v1.0.6에서 26.2가 48.2로, Agents’ Last Exam에서 23.8이 28.5로, HLE w/ Tools에서 54.7이 62.5로 모두 올랐습니다.[1] 같은 base가 6~12개월 사이에 저 폭으로 점프한 것은 base가 아니라 post-training 변화의 효과로 보는 해석이 자연스럽습니다.

여기서 GLM-5.3과 GLM-5.3-Flash를 헷갈리면 안 됩니다. Z.ai의 모델 카드 설명에 따르면 GLM-5.3-Flash는 “the first natively multimodal model in the GLM-5 series”로, 별도로 새 base에서 학습된 모델입니다.[2] GLM-5.3 풀 모델은 텍스트 전용이고, 같은 base를 공유하지만 사후 학습만으로 강화된 형제 모델입니다.

아키텍처는 그대로, 가중치만 다시

GLM-5.3의 config.json은 78개 layer, 6144 hidden_size, 12288 intermediate_size, 256 routed expert, 8 active expert per token, 1 shared expert, 64 attention head, 1,048,576 token max_position_embeddings, 154,880 vocab_size를 보여줍니다.[1] attention은 qk_nope_head_dim 192 / qk_rope_head_dim 64 의 분할 구조와 q_lora_rank 2048, kv_lora_rank 512 로 MLA-style 압축을 사용하고, router는 noaux_tc 방식의 sigmoid scoring을 씁니다.

같은 base를 공유한다는 vendor 진술은 config의 GlmMoeDsaForCausalLM 아키텍처 문자열이 양쪽 모델에서 동일하다는 점에서도 일관됩니다. 실제로 benchmark에서 GLM-5.3과 GLM-5.2의 점수 차이는 layer 수·hidden_size 차이에서 오는 것이 아니라 post-training data·recipe의 차이에서 옵니다. Z.ai는 그 차이를 코드 라인이 아닌 “every gain”이라는 표현으로 명시했습니다.[1]

같은 base라는 사실은 같은 family 안에 Flash·full·distill을 공존시키려는 Z.ai 전략을 보여줍니다. Flash는 45 layer, 4096 hidden_size, 288 routed expert로 더 가볍지만 multimodal이고, 풀 GLM-5.3은 78 layer, 6144 hidden_size, 256 routed expert로 더 깊지만 텍스트 전용입니다.[1][2] 이 분업 구조는 Flash가 pricing·serving·multimodal loop를 맡고, 풀 GLM-5.3이 long-horizon reasoning과 code-heavy agent workload를 맡도록 제품 포지셔닝을 나눈 것입니다.

Coding·agent benchmark의 실제 모습

Z.ai가 공개한 벤치마크는 7개 closed·open frontier 계열 모델을 함께 놓고 비교합니다. GLM-5.3의 coding·agent 관련 행을 보면 다음과 같습니다.[1]

Terminal Bench 2.1

GLM-5.3 88.2

GLM-5.2 81.0

Opus 4.8 85.0

GPT-5.6 Sol 88.8

Terminal Bench 3.0

GLM-5.3 28.3

GLM-5.2 4.6

Opus 4.8 21.1

GPT-5.6 Sol 34.6

DeepSWE v1.1

GLM-5.3 66.9

GLM-5.2 46.2

Opus 4.8 58.0

GPT-5.6 Sol 72.7

Toolathlon Verified

GLM-5.3 73.0

GLM-5.2 59.9

Opus 4.8 76.2

GPT-5.6 Sol 74.9

AutomationBench v1.0.6

GLM-5.3 48.2

GLM-5.2 26.2

Opus 4.8 41.0

GPT-5.6 Sol 45.8

Agents’ Last Exam

GLM-5.3 28.5

GLM-5.2 23.8

Opus 4.8 25.7

GPT-5.6 Sol 28.6

HLE w/ Tools

GLM-5.3 62.5

GLM-5.2 54.7

Opus 4.8 57.9

GPT-5.6 Sol 64.5

해석은 단조롭지 않습니다. Terminal Bench 2.1에서 GLM-5.3은 GPT-5.6 Sol에 0.6점 뒤지고 Opus 4.8보다는 3.2점 위입니다. Terminal Bench 3.0에서는 GPT-5.6 Sol·Fable 5 다음으로 셋째입니다. DeepSWE에서는 Fable 5·GPT-5.6 Sol 다음, Opus 4.8 위입니다. Toolathlon Verified에서는 Fable 5·Opus 4.8·Kimi K3 다음, GPT-5.6 Sol 위입니다.

즉 “GLM-5.3이 모든 coding benchmark 1위”는 사실이 아닙니다. Z.ai 모델 카드도 직접 그렇게 쓰지 않습니다. 단, GLM-5.2 대비로는 모든 coding·agent 행에서 큰 폭의 상승이 있고, AutomationBench v1.0.6처럼 동급 비교에서 1위인 행도 존재합니다. 이 점은 같은 base에서 출발했다는 진술과 정합적입니다. 아키텍처가 같더라도 post-training recipe가 바뀌면 tool-use·long-horizon task에서 큰 폭의 점프가 가능하다는 사례입니다.

같은 base, post-training gain, 그리고 custom 라이선스 boundary가 한 줄로 이어집니다. 같은 base, post-training gain, 그리고 custom 라이선스 boundary가 한 줄로 이어집니다.

Cyber capability emergence: 새로운 governance 질문

이번 모델 카드에서 가장 눈에 띄는 새 진술은 cyber capability 부분입니다.[1]

“Emergent Cyber Capability: As we scaled post training, cyber capability developed faster than we expected. GLM-5.3 is state of the art on CyberGym for vulnerability discovery, and its gains are largest further up the exploitation chain, where it more than doubles GLM-5.2 on exploitation benchmarks.”

수치로 보면 다음과 같습니다.[1]

CyberGym

GLM-5.3 84.5

GLM-5.2 77.2

Opus 4.8 78.1

GPT-5.6 Sol 83.6

ExploitGym (2h / 6h)

GLM-5.3 105 / 130

GLM-5.2 29 / 39

Opus 4.8 80 / 120

GPT-5.6 Sol 216 / 293

ExploitBench

GLM-5.3 54.4

GLM-5.2 24.4

Opus 4.8 40.0

GPT-5.6 Sol 76.5

CyberGym 84.5는 표에 나온 7개 모델 중 가장 높습니다. ExploitBench 54.4는 Opus 4.8·GPT-5.6 Sol 다음이고, ExploitGym의 2시간·6시간 두 구간 모두 GLM-5.2 대비 2배 이상입니다. Z.ai는 이 결과를 “gains are largest further up the exploitation chain”이라는 표현으로 정리합니다. 즉 vulnerability 식별에서 exploitation chain의 더 상위 단계로 갈수록 gain이 커진다는 뜻입니다.

여기서 두 가지 governance 질문을 명확히 분리해야 합니다.

첫째, 공개 웨이트 모델이 이 정도 cyber capability를 가지게 된 것은 어떤 의미인가입니다. cyber capability 자체는 vulnerability discovery, exploit chain 분석, CTF-style reasoning 같은 방어·연구용 task에서 측정됩니다. Z.ai가 공개한 표는 그 점수가 올라갔다는 사실이지, 모델이 어떻게 공격에 쓰여야 하는지를 설명하지 않습니다. 이번 글에서는 그 수치의 의미를 해석하는 데서 멈추고, 공격 절차·악용 코드·대상 시스템 식별 같은 offensive instruction은 일절 다루지 않습니다.

둘째, 라이선스가 cyber capability에 대한 별도 제한을 두는가입니다. GLM-5.3의 라이선스 본문을 읽으면 “Model as a Service” 정의, 12개월 누적 매출 USD 10B 이상의 MaaS 사업자에 대한 Z.AI 보안 심의 의무 외에는 별도의 cyber 관련 조항이 없습니다.[1] 따라서 cyber capability의 governance 책임은 라이선스의 통제 영역이 아니라 배포자·운영자의 정책·법령 준수에 맡겨진 셈입니다. Z.ai는 모델 카드의 note에서 cyber 관련 eval에 모두 “no web tools, domain whitelist, isolated containers” 조건을 걸어 contamination과 cheating을 통제했다고 적시했지만, 이 조건은 eval 환경에 국한되고 공개된 가중치에는 적용되지 않습니다.

100만 토큰 context와 chat template 디테일

풀 GLM-5.3의 max_position_embeddings는 1,048,576입니다.[1] 모델 카드의 note는 reasoning effort 세 단계와 clear_thinking 기본값을 분명히 짚습니다.

“GLM-5.3 supports controlling the thinking budget through the reasoning_effort parameter, which accepts three levels: low , high , and max . It defaults to max if not passed (or if set to any other value). To use low or high , pass them explicitly.”[1] “In the chat template for GLM-5.3, clear_thinking defaults to false if not passed. For chat scenarios, explicitly pass clear_thinking=true .”[1]

이 두 줄은 운영자에게 중요합니다. reasoning_effort를 명시하지 않으면 max 로 동작하기 때문에, token budget을 의식하는 workload에서는 lowhigh 를 명시해야 합니다. clear_thinking=false 가 기본값이라는 것은 chat 시나리오에서 명시적으로 true 를 넘기지 않으면 누적된 chain-of-thought가 다음 turn에 잔존해 context 점유와 latency가 같이 증가할 수 있다는 뜻입니다. 이 두 디테일은 chat-style 운영 시 모델의 실제 비용·응답 시간을 좌우합니다.

로컬 배포 현실

Z.ai가 모델 카드에 적은 serve 경로는 다음과 같습니다.[1]

Flash 모델 카드는 같은 framework 목록을 적되, KTransformers tutorial을 별도로 분리하고 Ascend NPU 항목은 본문에 두지 않습니다.[2] 즉 풀 GLM-5.3은 Ascend NPU 호환을 명시적으로 적시했고, Flash는 적시하지 않았다는 차이가 운영 시 참고점이 됩니다.

체감적 추론 현실을 단순화하면 이렇습니다. 78 layer MoE는 num_experts_per_tok=8 로 매 토큰마다 8개 expert를 활성화합니다. expert 수는 256개이고 hidden_size가 6144이므로, 단일 GPU에 전체 가중치를 올리는 것은 표준 single-GPU 메모리로 어렵고 multi-GPU 또는 NVLink·PCIe Gen5 환경, 또는 Ascend NPU의 vLLM-Ascend·xLLM 배포를 전제로 합니다. Transformers 단일 추론은 reference용으로 가능하지만 serving 단계에서는 SGLang·vLLM·KTransformers의 expert parallelism을 권장합니다. Unsloth는 단일 GPU에서의 fine-tuning 효율을 위해 명시된 경로입니다.

alignment, tool-use, long-horizon reasoning, release 순서로 post-training 파이프라인이 구성됩니다. alignment, tool-use, long-horizon reasoning, release 순서로 post-training 파이프라인이 구성됩니다.

라이선스의 경계: permissive지만 조건이 붙었습니다

GLM-5.3 라이선스의 첫 번째 섹션은 MIT와 매우 유사합니다. “Permission is hereby granted, free of charge, to any person or entity obtaining a copy of this software… to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software; to run, deploy, fine-tune, or otherwise modify the Software and create derivative works from it.”[1]

다른 점은 두 번째 섹션입니다. Z.AI는 여기서 “Model as a Service”를 정의합니다. “Giving a third party access to language model inference or fine-tuning (e.g., via API) in a manner that allows such third party to exercise meaningful control over the inputs, parameters, or training data.”[1] 그리고 다음 조건을 붙입니다.

“If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 10 billion US dollars (or the equivalent in other currencies) in total over any consecutive 12 months, the Licensee must pass Z.AI’s security review before using the Software or its derivative works for any commercial purpose. The scope and method of the security review shall be reasonably determined by Z.AI.”[1]

이 조항의 의미를 풀어보면 다음과 같습니다. 모델을 임베디드 제품 기능으로만 쓰는 경우, 또는 단순히 다른 사람이 호스팅하는 모델에 요청을 relay만 하는 경우는 MaaS 정의에서 제외됩니다. 그러나 API 형태로 inference·fine-tuning을 제3자에게 제공하면서 그 제3자가 input·parameter·training data에 의미 있는 통제권을 갖는 경우, 그리고 라이선스 이용자와 그 계열사의 누적 매출이 12개월 동안 USD 10B를 넘는 경우, Z.AI의 보안 심의를 통과한 뒤에만 상업적 용도로 쓸 수 있습니다.

이 조건은 Flash 모델에는 없습니다. Flash는 license: mit 로 표준 MIT 라이선스를 사용합니다.[2] 두 모델의 라이선스 분기는 의도적입니다. 같은 base를 공유하지만 풀 모델은 capability gain이 더 크고 cyber capability가 emergent하게 나타났기 때문에, Z.AI는 commercial MaaS 운영자에 한정한 보안 심의 trigger를 추가한 것입니다.

운영자 입장에서는 두 가지를 사전에 확인해야 합니다. 첫째, 우리 사업이 MaaS 정의에 해당하는지. 임베디드·단순 relay면 trigger가 발동하지 않습니다. 둘째, 12개월 누적 매출이 USD 10B를 넘는 임계치인지. 이 조건은 open-weights 오픈 생태계에서 자주 보는 매출 cap과는 다른 형식이지만, scope는 “commercial use of the Software or its derivative works”로 좁혀져 있습니다. 라이선스 적용 범위가 Z.AI 라이선스를 받는 운영자의 어떤 사업 라인에 어떻게 닿는지 사전에 counsel 검토가 필요한 영역입니다.

같은 base에서 갈라진 두 제품의 비교

GLM-5.3과 GLM-5.3-Flash는 같은 family이지만 다른 방향을 봅니다.[1][2]

modality

GLM-5.3 (full) text-only

GLM-5.3-Flash native multimodal (text·image·video·file)

num_hidden_layers

GLM-5.3 (full) 78

GLM-5.3-Flash 45

hidden_size

GLM-5.3 (full) 6144

GLM-5.3-Flash 4096

n_routed_experts

GLM-5.3 (full) 256

GLM-5.3-Flash 288

max_position_embeddings

GLM-5.3 (full) 1,048,576

GLM-5.3-Flash 1,048,576

attention 분업

GLM-5.3 (full) sparse + indexer, MLA-style

GLM-5.3-Flash 3:1 hybrid (linear + deepseek sparse), mHC

라이선스

GLM-5.3 (full) custom glm-5.3

GLM-5.3-Flash MIT

발표 시점

GLM-5.3 (full) 2026-08-30

GLM-5.3-Flash 2026-08-26

serve stack

GLM-5.3 (full) SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth, Ascend NPU

GLM-5.3-Flash SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth

같은 base를 공유하지만 풀 모델은 layer 수와 hidden_size를 키우고 텍스트에 집중합니다. Flash는 layer 수를 줄이고 mHC와 hybrid attention으로 serving 효율을 끌어올리며 multimodal을 추가합니다. 라이선스 분기도 의도적입니다. 풀 모델의 MaaS 보안 심의 trigger는 emergent cyber capability에 대한 governance 장치로 읽힙니다.

지금 우리 팀이 할 일

이번 출시를 실제로 운영에 가져올지 결정할 때, 다음 순서로 검증하면 비용을 줄일 수 있습니다.

engineering 경로와 governance 경로를 동시에 걸어야 운영 리스크가 닫힙니다. engineering 경로와 governance 경로를 동시에 걸어야 운영 리스크가 닫힙니다.

GLM-5.3이 남긴 의미

GLM-5.3은 base를 새로 학습하지 않고도 post-training만으로 coding·agent·cyber capability를 끌어올릴 수 있다는 증거입니다. 같은 base를 공유하는 Flash가 serving 효율과 multimodal을 가져갔다면, 풀 GLM-5.3은 long-horizon reasoning과 cyber-related evaluation에서 점프했습니다. Z.AI는 이 gain이 emergent cyber capability를 동반한다는 사실을 모델 카드에 명시적으로 적시했고, 같은 사실이 MaaS 보안 심의 trigger라는 라이선스 조건으로 이어졌습니다.

운영자 입장에서는 두 갈래의 답을 동시에 가져가야 합니다. 하나는 가중치와 config를 받아 직접 검증하는 길입니다. SGLang, vLLM, KTransformers, Unsloth, Ascend NPU에서 serve stack을 우리 workload로 측정하고, chat template의 reasoning_effort·clear_thinking 을 명시적으로 통제합니다. 다른 하나는 governance를 사전에 잠그는 길입니다. MaaS 정의·USD 10B 임계치·상업적 용도 범위를 회사 정책으로 정리하고, cyber capability의 사용 범위를 명시한 정책으로 닫습니다.

두 갈래를 같이 가져가지 않으면, 이번 출시는 흥미로운 출시가 아니라 운영 리스크가 됩니다.

참고 자료

[1] Z.AI — GLM-5.3 model card, custom license, config (Hugging Face)

https://huggingface.co/zai-org/GLM-5.3

[2] Z.AI — GLM-5.3-Flash model card and MIT license (Hugging Face)

https://huggingface.co/zai-org/GLM-5.3-Flash

[3] Z.AI — GLM-5.3 raw config.json (architecture & dimensions)

https://huggingface.co/zai-org/GLM-5.3/blob/main/config.json

다음 액션

실전 운영/리서치 사례를 주간으로 받아보려면 블로그를 북마크하고, 필요한 주제는 문의로 남겨주세요.

관련 글

← 블로그로 돌아가기