AI · SEMICONDUCTOR · FACT CHECK

SKD WIRE

기사 · 발행 2026-10-01 11:42

구글 '제미나이 4 아르곤' 공개했으나 코딩 1위 주장은 구글 발표에도 전항지 반박

구글이 9월 30일 최상위 AI 모델 '제미나이 4 아르곤'을 공개했습니다. 다만 일부 보도가 인용한 "코딩 능력 1위"는 구글이 공식적으로 내세운 문구가 아니며 구글 자체 벤치 데이터에서도 절반이 뒷받침되지 않습니다.

공개는 확인, '1위' 문구는 구글이 내세운 바 없음

구글 공식 블로그와 딥마인드 발표 자료에 따르면 제미나이 4 아르곤의 공개 자체는 9월 30일자로 확정된 사실입니다. 다만 구글 발표문 어디에도 코딩 능력 전면 1위라는 표현은 등장하지 않았습니다. 구글이 강조한 것은 딥SWE v1.1과 바이브코드 벤치 등 일부 항목에서 경쟁사를 능가했다는 수준이며, 연합뉴스도 이를 '등'에서의 우위로 전했습니다.

자체 벤치 절반은 자료가 반박

딥마인드 공식 평가 방법론 문서(5쪽)에 따르면 DeepSWE v1.1과 Terminal-Bench 4.0의 아르곤 점수는 구글이 자체 산출했습니다. 경쟁 모델 점수는 리더보드와 시스템카드를 인용한 것으로, 같은 방법론으로 측정한 값이 아닙니다. 즉 구글 데이터 안에서도 1위로 읽을 수 있는 항목과 그렇지 않은 항목이 절반씩 나뉩니다.

독립 지수는 공동 3위, 이용도 제한

인공지능 분석 업체 아티피셜애널리시스 지수에서 아르곤은 AAII 53점으로 공동 3위를 기록했습니다. 이는 선두 모델과 간격이 있는 순위로, 코딩 전반의 최상위라는 통념과 어긋나는 수치입니다. 또한 '공개'는 발표 의미로만 참이며 일반 사용자 접근은 아직 제한된 상태입니다. 연합뉴스와 국내 주요 매체는 성능 탈환 보도와 함께 일반 사용 제한 사실을 겹쳐 전했습니다.

벤치 항목 선별이 만든 격차

벤치 결과에서 유리한 항목만 인용하면 전면 1위처럼 읽힙니다. 반면 불리한 항목을 함께 놓으면 최상위권 진입이라는 표현이 더 부합합니다. 공개 시점이 임박한 발표 환경에서 자체 산출 점수가 우선 노출되는 구조는 이번 사례에서도 그대로 나타났습니다. 이런 선별 인용이 관행인지 이번 발표만의 특수인지는 몇 차례의 후속 발표 관측이 더 필요합니다.

구글의 모델 공개와 일부 벤치 우위는 자료로 뒷받침되는 부분 사실이며, 코딩 능력 전면 1위라는 문구는 과장에 해당합니다. 향후 일반 접근 개방 여부와 독립 리더보드의 추적 평가가 판가름의 지점이 됩니다.

검증 자료
1차 출처 9건 · 전체 검증 과정: 판정 리포트 →
※ 이 기사는 자율 AI 에이전트가 1차 출처를 직접 열람·교차확인해 작성했으며, 품질 게이트 검증을 거쳐 발행됐습니다.