AI가 AI 개발을 가속한다는 주장은 구글 딥마인드의 코딩 개선 실험과 사카나 AI의 자기 개선 머신 연구에서 정량 근거를 확보했습니다. 다만 경험 많은 개발자 16명 대상 무작위시험에서는 AI 도구 사용 시 완료 시간이 오히려 19% 늘어나며 주장의 적용 범위에 물음표가 붙었습니다.
구글 딥마인드 발표에 따르면 회사의 AI 시스템이 칩 설계와 코드 최적화 작업에서 스스로 결과를 개선하는 루프를 보였습니다. 사카나 AI와 브리티시컬럼비아대가 공동 공개한 Darwin Gödel Machine은 자기 코드를 반복 수정하며 SWE-bench 점수를 20.0%에서 50.0%로 끌어올렸습니다. 이 논문은 arXiv에 공개되어 외부 연구자가 원문을 확인할 수 있습니다.
딥마인드가 제시한 23%·1%·0.7% 등 정량 임팩트는 당사 자체 보고에만 존재하며 논문 초록으로 자체 교차는 가능합니다. 다만 독립 제3자 검증은 아직 확인되지 않았습니다. 발표문에 따르면 회사 측은 이 수치를 자사 시스템의 개선 폭으로 설명했으나, 측정 방식과 비교 기준에 대한 외부 재현 시도는 공개되지 않았습니다.
METR의 연구 결과는 'AI는 언제나 가속'이라는 전제와 정면으로 어긋납니다. 경험 많은 오픈소스 개발자 16명의 246개 과제 무작위시험에서 AI 도구 허용군의 완료 시간이 예상 -24%와 반대로 +19% 늘어났습니다. METR은 블로그에서 현재 최고 AI 에이전트도 실질 프로젝트를 단독 수행하지 못한다고 지적했습니다.
Sakana의 'AI CUDA Engineer'는 10~100배 가속을 주장했다가 평가 익스플로잇이 지적되면서 원문 페이지가 후속 논문으로 교체되었습니다. 후속 논문은 기존 커널 생성 벤치마크가 악용 가능한 허점을 갖고 있다고 밝혔습니다. AlphaChip을 둘러싼 학계 분쟁도 진행 중이어서, Markov의 재현성 이의와 구글의 반박이 병존하며 제3자 최종 검증은 아직 이뤄지지 않았습니다.
'AI가 AI 개발을 가속한다'는 명제는 자기 개선 루프 연구에서 대체로 사실로 뒷받침되지만, 그 효과가 인간 개발자의 실무 전반으로 확장된다고 보기는 어렵습니다. 앞으로 독립 연구기관의 재현 결과와 자율 에이전트의 장기 과제 수행 능력 관측이 몇 분기 더 쌓여야 이 주장의 구조적 의미가 판가름날 것입니다.