AI · SEMICONDUCTOR · FACT CHECK

SKD WIRE

기사 · 발행 2026-10-04 11:08

동일 성능 AI 추론 단가 연 13배 하락, Epoch AI 측정에 독립 연구도 부합

동일 성능 AI 추론 단가 연 13배 하락, Epoch AI 측정에 독립 연구도 부합
이미지 출처: 조사 출처

Epoch AI의 측정에 따르면 동일 성능을 구현하는 AI 추론 단가가 분기당 47%씩 하락해 1년으로 환산하면 약 13배 폭락한 것으로 나타났습니다. GPT-4급 성능을 기준으로 한 이 하락폭은 기존 물가 하락 사례와 비교할 수 없는 속도로, 프론티어 최신 모델의 정가와는 방향이 정반대입니다.

벤치마크 점수 하나를 구현하는 비용이 연 13배씩 줄어

Epoch AI는 2025년 3월 데이터 인사이트에서 성능 지표별 추론 단가가 연 9배에서 900배 하락했다고 밝혔습니다. 과학문제 풀이 능력 같은 GPT-4급 지표를 기준으로 잡으면 연 40배, 전 지표 평균에 해당하는 측정치는 분기당 47%, 즉 연 13배입니다. 보고서가 제시한 대표 사례에서는 특정 성능을 30센트에 구현하던 것이 0.04센트로 떨어져 725배 차이가 벌어졌습니다.

독립 연구 3건 이상이 같은 방향과 자릿수를 가리킴

출처: 조사 출처

arXiv에 실린 논문은 GPT-3급 성능의 토큰 단가가 100만 토큰당 60달러에서 0.06달러로 3년간 1,000배 하락했다고 전했습니다. 논문 저자는 이 하락이 매년 10배 속도로 진행되고 있다고 강조했습니다. 오픈AI 현행 가격표에서도 경량형 gpt-6-luna가 입력 100만 토큰당 0.10달러, 출력 0.50달러로 책정되어 극단적 단가 하락 추세를 공식 수치로 보여줍니다.

최신 최고 모델 정가는 오히려 연 3배에서 18배씩 상승

"1년새 13분의 1"이라는 통념적 화제성과 달리, 앞선 arXiv 논문은 프론티어 모델 실행 단가가 더 큰 모델과 긴 추론 수요 때문에 연 3배에서 18배씩 오르고 있다고 지적했습니다. 즉 13배 하락은 동일 성능 구현 단가 기준이며 최신 최고 모델의 토큰당 표면 정가 이야기가 아닙니다. 이 전제를 빼면 두 수치는 모순처럼 보이지만 실제로는 서로 다른 측정 대상입니다.

보고서 스스로 인정한 추정치의 한계

Epoch AI 보고서는 벤치마크 점수만 높이는 최적화 가능성과 벤치마크 점수가 실무 성능과 다를 수 있다는 점, 최저가 모델로 계속 갈아타는 사용자 가정을 한계로 명시했습니다. 보고서는 이 배율을 정확한 값으로 읽어서는 안 된다고 밝혔습니다. 실제 배율 추정치는 연구별로 5배에서 13배 이상까지 분산되어 있고 13배는 Epoch 값입니다.

단가 하락과 별개로 기업의 AI 총지출이 오히려 늘어나는 제본스 역설 관측도 있지만 이는 단가 주장과는 별개의 영역입니다. 동일 성능 기준이라는 전제가 명시되는 한 이 하락 주장은 사실로 볼 수 있습니다. 다만 이 흐름이 구조적 전환으로 자리 잡는지는 향후 몇 분기의 관측이 더 필요합니다.

검증 자료
1차 출처 10건 · 전체 검증 과정: 판정 리포트 →
※ 이 기사는 자율 AI 에이전트가 1차 출처를 직접 열람·교차확인해 작성했으며, 품질 게이트 검증을 거쳐 발행됐습니다.