AI 스타트업 노타가 멀티모달 모델 경량화 기술을 담은 논문을 NeurIPS 2026에 채택받았으며 GPU 메모리를 47% 줄였다고 발표했습니다. 다만 47%라는 수치의 유일한 출처는 노타 자신의 발표이고 논문 원문은 아직 공개되지 않았습니다.
회사 발표에 따르면 노타의 경량화 논문은 세계 3대 AI 학회로 꼽히는 NeurIPS 2026에 채택되었습니다. NeurIPS 공식 사이트가 이번 연도 가상사이트를 폐쇄했다는 공지를 올린 상태라 채택 목록의 독립 열람은 아직 어렵습니다. 저자 소속이 노타라는 점도 현재로서는 매체 보도를 통해서만 확인되는 상황입니다.

출처: 조사 출처
ZDNet을 비롯해 뉴스타운·e4ds·이데일리·이머니뉴스 등 다섯 매체가 같은 수치를 일관되게 전했습니다. 발표 내용은 31GB(약 47% 감소)의 메모리 절감으로 40GB GPU 한 장으로 구동이 가능하다는 것이며, 추가 학습 없이 1회 압축으로 처리된다고 전했습니다. 매체 간 수치 차이가 없다는 점은 보도 과정에서의 왜곡 가능성을 낮추지만, 각 매체가 참조한 근거는 결국 같은 회사 발표입니다.
논문 원문은 arXiv와 OpenReview 어디에도 해당 제목으로 등재되지 않아 독립적인 성능 검증이 불가능한 상태입니다. 노타 자사 블로그에도 NeurIPS 관련 보도자료가 게재되지 않아 발표 원문 텍스트를 1차 출처에서 직접 확보하지 못했습니다. 회사 공식 소셜 채널 역시 로그인 접근이 막혀 확인이 제한됩니다.
발표에 따르면 310억 파라미터 모델에서 전문가를 25% 제거해도 성능이 98%를 유지하고 50%를 제거하면 91%를 유지한다고 합니다. 통념적으로 전문가 절반 제거 시 성능 손실이 더 크다고 여겨지는 것과 비교하면 다소 높은 수치이지만, 제거 비율별 성능 구간을 함께 공개한 점은 과장보다 정보를 더 많이 제공하는 방향입니다. 다만 이 수치 역시 회사 측정 결과로서 학회 인용 이전까지는 외부 재측정이 이뤄지지 않았습니다.
47% 절감은 발표된 사실로는 확인되지만 과학적 재현으로는 아직 확립되지 않은 상태이고, 이번 결과의 타당성은 논문 원문이 공개되는 시점을 기준으로 판단할 수 있는 것으로 보입니다. 이에 이번 주장은 대체로 사실로 정리됩니다.