구글이 9월 30일 최상위 AI 모델 '제미나이 4 아르곤'을 공개했습니다. 다만 일부 보도가 인용한 "코딩 능력 1위"는 구글이 공식적으로 내세운 문구가 아니며 구글 자체 벤치 데이터에서도 절반이 뒷받침되지 않습니다.
구글 공식 블로그와 딥마인드 발표 자료에 따르면 제미나이 4 아르곤의 공개 자체는 9월 30일자로 확정된 사실입니다. 다만 구글 발표문 어디에도 코딩 능력 전면 1위라는 표현은 등장하지 않았습니다. 구글이 강조한 것은 딥SWE v1.1과 바이브코드 벤치 등 일부 항목에서 경쟁사를 능가했다는 수준이며, 연합뉴스도 이를 '등'에서의 우위로 전했습니다.
딥마인드 공식 평가 방법론 문서(5쪽)에 따르면 DeepSWE v1.1과 Terminal-Bench 4.0의 아르곤 점수는 구글이 자체 산출했습니다. 경쟁 모델 점수는 리더보드와 시스템카드를 인용한 것으로, 같은 방법론으로 측정한 값이 아닙니다. 즉 구글 데이터 안에서도 1위로 읽을 수 있는 항목과 그렇지 않은 항목이 절반씩 나뉩니다.
인공지능 분석 업체 아티피셜애널리시스 지수에서 아르곤은 AAII 53점으로 공동 3위를 기록했습니다. 이는 선두 모델과 간격이 있는 순위로, 코딩 전반의 최상위라는 통념과 어긋나는 수치입니다. 또한 '공개'는 발표 의미로만 참이며 일반 사용자 접근은 아직 제한된 상태입니다. 연합뉴스와 국내 주요 매체는 성능 탈환 보도와 함께 일반 사용 제한 사실을 겹쳐 전했습니다.
벤치 결과에서 유리한 항목만 인용하면 전면 1위처럼 읽힙니다. 반면 불리한 항목을 함께 놓으면 최상위권 진입이라는 표현이 더 부합합니다. 공개 시점이 임박한 발표 환경에서 자체 산출 점수가 우선 노출되는 구조는 이번 사례에서도 그대로 나타났습니다. 이런 선별 인용이 관행인지 이번 발표만의 특수인지는 몇 차례의 후속 발표 관측이 더 필요합니다.
구글의 모델 공개와 일부 벤치 우위는 자료로 뒷받침되는 부분 사실이며, 코딩 능력 전면 1위라는 문구는 과장에 해당합니다. 향후 일반 접근 개방 여부와 독립 리더보드의 추적 평가가 판가름의 지점이 됩니다.