오픈AI가 GPT-6 솔(Sol)과 루나(Luna)를 공개하고 태스크당 비용을 전 세대 절반 수준으로 낮췄다. 독립 측정기관 인공애널리시스는 지능지수가 전 세대와 같은 수준을 유지한 가운데 일부 벤치마크는 하락했다고 밝혔다.
오픈AI 발표문에 따르면 솔의 태스크당 비용은 1.06달러로 전 세대 GPT-5.6의 1.99달러보다 50% 낮아졌다. 인공애널리시스(artificialanalysis.ai)도 같은 수치를 측정해 가격 인하를 확인했다. 개선을 강조한 영역은 업무 자동화와 코딩, 컴퓨터 사용, 사실성 네 가지였다.
발표문에 따르면 업무 자동화 벤치마크에서 솔은 에이전트 라스트 이그재먼트 56.4%를 기록하면서 비용은 60% 낮아졌다. 코딩의 딥스위(DeepSWE) 점수는 68.8%, 컴퓨터 사용의 OS월드 2.0은 60.5%를 기록했고 두 영역의 비용은 모두 80% 줄었다. 오류율은 절반 수준으로 낮아졌다고 오픈AI는 밝혔다.

출처: 조사 출처
인공애널리시스에 따르면 GDPval-AA v2.1에서 솔은 약 100 Elo 하락했고 루나도 약 75 Elo 내렸다. 지식 정확도는 솔이 59%에서 54%로 떨어졌으며 거부율 상승이 원인으로 지목됐다. 인공애널리시스는 지능지수와 코딩 에이전트 지수가 GPT-5.6과 같은 수준이라고 전했다.
더디코더는 가격은 반값이 됐지만 성능은 사실상 움직이지 않았다고 평가했다. 솔의 지능지수는 47에서 48로, 루나는 37로 동결된 것이 그 근거였다. 이 매체는 오픈AI가 유리한 벤치마크만 골랐을 가능성과 구형 모델을 비교 상대로 삼은 점을 지적했다.
가격 인하율의 기준선은 GPT-5.6 정가가 아니라 프로모션 가격이다. 프로모션 종료 후 정가는 아직 공개되지 않았고 정가 기준 인하 폭은 별도 산정이 필요하다. '필요한 성능만'이라는 표현도 지식노동 사용자에게는 GDPval 하락이 성능 하락으로 느껴질 수 있어 제조사 프레임에 가깝다는 지적이 나온다.
가격 절반은 1차 출처와 독립 측정기관이 함께 뒷받침하고 성능은 전면 상향이 아닌 실무 영역 중심의 선택적 개선에 그쳤다. 이 두 축을 함께 보면 해당 주장은 대체로 사실이다. 프로모션 종료 후의 정가와 GDPval 하락의 원인 규명은 향후 확인할 지점으로 남는다.