중국과학원이 9월 공개한 뇌 영감 모델 '스파이킹브레인'는 400만 토큰 길이에서 트랜스포머 대비 100배 이상 빠른 처리 속도를 보고했습니다. 다만 논문 본문에 따르면 직접 측정값은 100만 토큰 구간의 26.5배이며, 400만 구간 수치는 피팅 곡선에 기반한 추정치입니다.
논문 5.2절에 따르면 개발팀은 Qwen2.5를 자원 한계로 400만 토큰에서 평가하기 어렵다고 밝혔습니다. 피팅 곡선 기반으로 100배 이상을 보수적으로 추정했다는 설명을 덧붙였습니다. 직접 측정값은 NVIDIA H100 환경의 시퀀스 병렬 조건에서 Qwen2.5-7B 대비 100만 토큰 기준 26.5배입니다.

출처: 조사 출처
GitHub 기술 문서에 따르면 가속은 TTFT, 즉 첫 토큰 생성까지의 시간에 한정된 개선입니다. 디코딩 속도는 모바일 CPU 256k 기준 15.39배, MetaX C550 128k 기준 1.41~2.75배 수준을 기록했습니다. 전 구간 처리 속도가 100배 빨라진 것은 아닙니다.
논문 결과에 따르면 HellaSwag·ARC-C 등 일부 벤치마크에서는 비교 트랜스포머 모델보다 낮은 점수를 보였습니다. 에너지 97.7% 절감 주장도 연산 단위 에너지 모델에 기반한 추정치로 실측 결과가 아닙니다. 이 모델은 속도와 효율을 얻는 대신 일부 언어 이해 성능을 내려놓은 트레이드오프 구조입니다.
중국 영문 국영매체 China Daily와 36kr가 이 모델을 소개했지만, 수치의 출처는 모두 개발 주체인 중국과학원 팀의 자체 보고입니다. 제3기관의 독립 재현 결과는 아직 확인되지 않았습니다. TMLR 게재는 GitHub의 수용 기록으로 대체 확인된 상태이며, 가중치는 ModelScope를 통해 공개됐습니다.
100배 가속 주장은 외삽 추정이라는 단서를 논문 스스로 명시한 점에서 자기 규정이 되어 있는 상태입니다. 요구 조건을 정리하면, 긴 시퀀스에서의 첫 응답 지연 개선은 자체 보고로 대체로 사실에 부합하며, 디코딩 속도와 벤치마크 성능은 통념과 다른 절충안입니다. 독립 재현 결과와 400만 토큰 실측 평가가 이루어지는지 여러 분기의 관측이 더 필요합니다.