애피어 리서치는 10월 1일 AI 에이전트가 스스로 도구를 만들어 쓰는 프레임워크 SMITH가 NeurIPS 2026에 채택됐다고 밝혔습니다. 발표 수치는 4B 모델이 30B급 모델의 성능을 넘어섰다는 것이지만, 이 비교는 상대 모델의 학습 조건에 따라 좁아집니다.
보도자료와 arXiv 논문에 따르면 SMITH는 에이전트가 외부 도구를 사용하는 데 그치지 않고 필요한 도구를 직접 작성하는 방식입니다. '추론 토큰 비용 32배 절감'은 이 가운데 특정 조건을 충족하는 시나리오에서 나온 수치이며, 이 조건이 생략된 표현이 언론 제목에 쓰였습니다. 논문 자체는 적용 범위를 조건부로 서술하고 있습니다.

출처: 조사 출처
논문에 따르면 4B Qwen3에 SMITH를 적용한 모델이 held-out 평가에서 macro-avg 79.9로 최고 성능을 기록했습니다. 다만 비교 대상 30B 모델(LATM* Qwen3-30B-A3B, 74.1)은 추론 시점에만 도구를 작성하는 미학습 방식이라는 한정어가 붙습니다. 이 한정어가 생략되면 학습된 대규모 모델을 이겼다는 인상을 줄 수 있습니다. 350M 규모의 LFM-2.5 모델이 SMITH 도구로 42.9를 달성한 것도 확인되는 수치입니다.
애피어 보도자료와 저자 프로젝트 페이지는 각각 NeurIPS 2026 채택(Poster)을 밝혔고 두 자료의 내용은 서로 일치합니다. 다만 NeurIPS 2026 가상사이트가 아직 개장하지 않아 학회 측 목록으로 직접 대조하는 데에는 성공하지 못했습니다. OpenReview API 검색도 캡차로 직접 확인이 막혀 있는 상태입니다.
ZDNet과 한국경제 기사는 모두 10월 1일 회사 배포 보도자료를 기반으로 하며, 그 수치는 arXiv 논문과 일치했습니다. 회사 발표와 논문이 어긋나는 부분은 발견되지 않았습니다. 다만 출처의 상당 부분이 당사자 배포 자료로 수렴하는 만큼, 독립적인 제3자 평가는 아직 확인되지 않았습니다.
SMITH의 도구 자작 방식이 에이전트 운영 비용 구조를 실제로 바꾸는지는 여러 벤치마크와 학회 측 채택 기록이 공개된 뒤에 관측이 더 필요합니다. 이번 발표의 수치와 채택 주장은 제시된 한정 조건 안에서 대체로 사실입니다.