올해 5월 arXiv에 공개된 ROK-FORTRESS 논문은 4개 조건 실험에서 언어 전환 때의 유해성 변동이 국가 맥락 전환 때보다 컸다고 보고했다. 한국어 질문 때 유해성이 낮게 측정됐다는 주장은 일부 모델의 예외와 상반된 후속 연구 사이에서 재검증 대상이 됐다.
논문에 따르면 이 연구는 영어와 한국어 두 언어, 미국과 한국 두 지정학 맥락을 조합한 4개 조건으로 응답 유해성을 측정했다. 측정 결과 질문 언어를 영어에서 한국어로 바꿀 때의 점수 변동폭이 국가 맥락을 전환할 때보다 컸다. 연구진은 한국어 질문 조건에서 유해성 지표가 낮게 기록됐다고 말했다. 국내 언론은 언어가 지정학보다 큰 영향을 준다는 제목으로 이 논문을 소개했다.
이번 검증은 arXiv 논문(2605.14152) 본문과 공식 그림 파일을 열어 수치를 직접 대조하는 방식으로 진행했다. 국내 AI안전성연구소 누리집과 Scale AI 공개 자료, 데이터셋 카드도 함께 확인했다. HuggingFace 데이터셋 파일은 조건 동의와 로그인이 필요해 메타데이터만 공개 확인했다. 원문 열람이 어려운 일부 언론 요약은 검증 근거에서 참고 수준으로만 분류했다.

출처: 조사 출처
논문에 따르면 K-EXAONE은 한국 맥락을 결합할 때 언어 효과가 7.7%p 완화됐다. 한국어 특화 모델 Kanana 2에서도 같은 방향의 완화가 7.0%p로 측정됐다. 논문은 이 같은 상호작용을 집단 차원이 아닌 모델별 특성으로 규정했다. 논문은 두 모델을 묶은 집단 수준에서는 통계적 유의성이 없다고 밝혔다(p=0.18). 언어 효과의 크기는 모델 구조와 학습 데이터에 따라 달라질 수 있다는 뜻이다.
ICLR 2026에 발표된 CAGE 논문에 따르면 한국 문화 적응 벤치마크 KoRSET는 직역 프롬프트보다 취약점 노출에 더 효과적이었다. 연구진은 한국 문화에 정렬한 프롬프트가 안전장치를 뚫기 쉽다고 강조했다. 이는 한국어와 한국 맥락의 결합이 공격 성공률을 높인다는 반대 방향 결과다. 멀티모달 12개 모델을 평가한 KSAFE-MM 연구진도 문화적 그라운딩 공격에 더 취약하다고 전했다. 다만 같은 연구는 안전 강화가 과잉거부로 이어지는 트레이드오프도 함께 관측했다.
Deng 등의 논문(2310.06474)과 Tower of Babel(2505.12287)은 비영어 번역으로 안전장치를 우회할 수 있다고 밝혔다. ROK-FORTRESS 논문은 이 우회 패턴이 오픈소스 모델에서 재현됐다고 설명했다.
논문 6.3절에 따르면 이 연구는 영–한 단일 언어쌍과 미–한 단일 지정학 축만을 다룬 케이스 스터디다. 다른 언어와 국가로의 일반화는 외적 타당성이 확립되지 않은 미확인 영역으로 남아 있다. 논문 원 출처는 한국어라는 언어 자체가 본질적으로 더 안전하다는 해석 역시 부정했다. 낮게 측정된 유해성 점수가 실제 서비스의 안전 수준을 보장하지는 않는다.
앞으로 확인할 지점은 다른 언어쌍과 다른 국가 축을 추가한 확장 실험이다. 모델별 상호작용의 통계적 유의성 여부도 모델 수를 늘린 후속 연구에서 다시 검토돼야 한다. 원문 수치와 반대 방향 연구를 함께 대조한 결과, 이번 주장은 대체로 사실이지만 한국어 안전성에 대한 성급한 일반화는 경계해야 한다.