앤트로픽은 9월 말 Z.ai의 오픈 웨이트 모델 GLM-5.3이 자사 클로드 미토스 프리뷰에 필적하는 취약점 악용 코드 작성 능력을 보였다고 밝혔습니다. 모델 가중치가 공개된 상태라 안전장치를 우회한 악용 가능성도 함께 제기한 것이 이번 발표의 핵심입니다.
앤트로픽의 발표문에 따르면 GLM-5.3은 악용(exploit) 작성 벤치마크 전 항목에서 클로드 미토스 프리뷰와 근소한 차이를 보였습니다. 해당 능력 평가는 자사 안전·보안 연구 조직 CAISI가 독립적으로 수행했습니다. 이는 단순한 우려 표명이 아니라 측정 가능한 성능 비교에 근거한 지적이라는 점에서 이번 논쟁의 출발점입니다.

출처: 조사 출처
앤트로픽은 GLM-5.3의 가중치가 공개되어 있어 안전장치를 쉽게 제거(abliteration)한 버전이 이미 배포될 수 있다고 지적했습니다. 이는 가중치를 비공개하고 유료 접근만 허용하는 자사 모델과 대비되는 구조적 차이입니다. The Decoder는 이 경고가 앤트로픽의 사업 이해관계와도 부합한다고 평가했습니다. 대신 능력 수치 자체는 독립 확인을 거쳤고, 어블리터레이션 버전도 실제 공개돼 있는 것으로 확인되었습니다.
Z.ai는 SCMP를 통해 이번 경고에 반박하는 입장을 내놓은 것으로 전해졌습니다. 반박 글에서 자사 취약점 통계를 제시한 것으로 알려졌으나, 389개 취약점과 4,249건 규모라는 수치와 공식 X 게시물 전문은 아직 확인되지 않았습니다. SCMP 원문은 접근 제한으로 직접 채증이 이뤄지지 않았고, 국내 보도는 ZDNet 코리아의 인용 기사를 경유하고 있습니다.
오픈 웨이트 중국 모델이 최상위 폐쇄 모델의 공격용 능력에 도달했다는 전제는 지금까지 통용돼 온 '폐쇄 모델 우위' 통념과 어긋납니다. 그런데 이번 수치는 단일 기관의 벤치마크에 의존하고 있어, 동일 조건에서의 반복 관측은 아직 부족합니다. 구조적 안전장치 우위를 논하려면 어블리터레이션 버전의 실제 악용 사례 축적이 선행돼야 합니다.
앤트로픽의 주장은 능력 격차 축소와 안전장치 취약성이라는 두 축에서 대체로 사실로 확인되었습니다. 앞으로 Z.ai의 공식 통계 원문과 반복 벤치마크 결과가 추가로 확인되는지가 쟁점이 될 것입니다.