
노타가 공개한 키미 K3 모델 경량화 결과 이미지. [사진=노타]
[디지털데일리 구아현기자] AI 모델 경량화 기업 노타는 문샷AI의 초거대 모델 ‘키미 K3(Kimi K3)’를 경량화해 구동에 필요한 그래픽처리장치(GPU)를 최대 절반으로 줄였다고 5일 밝혔다.
키미 K3는 입력값에 따라 필요한 모듈만 선택적으로 활성화하는 전문가 혼합(Mixture-of-Experts·MoE) 구조를 채택한 모델이다. 구동에는 엔비디아의 고성능 GPU B300이 8장 필요해 기업과 개발자가 활용하기에는 비용 부담이 컸다.
키미 K3는 학습 단계부터 가중치와 활성값을 각각 4비트와 8비트로 낮춰 설계돼, 일반적인 양자화 방식으로는 추가 압축이 제한적이었다. 노타는 자체 개발한 ‘비균일 전문가 프루닝(Non-uniform Expert Pruning)’ 기술로 이 문제를 해결했다. 모델 층별 특성과 모듈 중요도를 분석해 핵심 전문가는 보존하고 기여도가 낮은 모듈만 선별 제거하는 방식이다.
노타는 이를 통해 키미 K3의 전문가 모듈을 각각 25%, 50% 줄인 경량화 모델 2종을 공개했다. 구동에 필요한 GPU 수도 기존 8장에서 각각 6장, 4장으로 줄였다.
노타가 자체 평가한 결과, 50% 경량화 모델은 층별 전문가를 동일 비율로 제거하는 기존 REAP 방식보다 대다수 벤치마크에서 높은 성능 보존율을 기록했다. 고난도 추론 능력을 평가하는 GPQA-Diamond와 지시 수행 능력을 평가하는 IFEval 점수는 각각 2.52점, 2.22점 높았다.
앞서 노타가 공개한 업스테이지 ‘솔라 오픈2’ 경량화 모델은 공개 2주 만에 누적 다운로드 6만8000회를 기록했다.
김태호 노타 최고기술책임자(CTO)는 “비균일 전문가 프루닝 기술로 솔라 오픈2에 이어 키미 K3까지 경량화해 주요 성능을 유지하면서 필요한 GPU를 최대 절반으로 줄였다”며 “다양한 프론티어급 모델을 한정된 연산 자원에서도 효율적으로 활용할 수 있도록 기술 적용 범위를 확대하겠다”고 말했다.
노타가 공개한 솔라 오픈2와 키미 K3 경량화 모델은 허깅페이스에서 확인할 수 있다.
Copyright ⓒ 디지털데일리. 무단전재 및 재배포 금지
[PLAY IT] ‘루이? 위!’ 불어 번역 시켜보니…번역은 ‘글쎄’
2026-08-08 06:00:00소프트뱅크, 클라우드·AI 매출 31%↑…"수익화 단계 진입"
2026-08-07 16:12:24美 공화당 '가짜뉴스법' 항의에…방미통위 "차별 조항 없어"
2026-08-07 15:01:49CJ ENM, 인도·중동·남미 공략 본격화…글로벌 콘텐츠 영토 넓힌다
2026-08-07 11:46:23GS리테일, 2028년 영업익 3800억원 목표…비핵심 자산도 정리
2026-08-07 10:51:59그라비티, 2분기 영업익 276억원…전년比 40.2% 증가
2026-08-08 06:14:49메가스터디교육, 2분기 매출 2047억원…영업익 13% 감소
2026-08-07 17:14:34[단독] SOOP서 'KTV 국민방송' 본다…국무회의·정부 브리핑 실시간 송출
2026-08-07 17:01:57[DD퇴근길] 美 의회, 쿠팡 편들며 한국 정보통신망법에 정색
2026-08-07 17:00:0010년 만에 돌아오는 'e스포츠 대상'…연례 시상식으로 다시 열린다
2026-08-07 16:36:13