NOREX

기술 배경

왜 이 구성인가

로컬에서 언어 모델을 돌릴 때 실제로 결정적인 요소만 설명합니다.

왜 24GB인가

30B급 모델을 4bit로 양자화하면 약 17GB 정도를 차지합니다. 여기에 컨텍스트를 담을 여유까지 고려하면 24GB가 실사용 경계선입니다. 4GB급 그래픽카드는 모델을 적재하는 것 자체가 불가능합니다.

왜 대역폭인가

언어 모델이 토큰을 하나 생성할 때마다 가중치 전체를 메모리에서 읽습니다. 따라서 생성 속도는 연산 성능보다 메모리 대역폭에 거의 비례합니다. RTX 3090은 936 GB/s로, 브랜드 저가형에 쓰이는 96 GB/s 대비 9.75배입니다.

로컬 운용의 의미

종량 과금이 없고, 호출 한도가 없으며, 데이터가 외부로 나가지 않습니다. 외부 반출이 제한된 자료를 다루는 환경, 또는 사용량이 많아 API 비용이 고정비로 누적되는 환경에서 유리합니다.

전력 설계

그래픽카드 전력을 280W로 제한한 상태로 출하합니다. 언어 모델 추론은 메모리 대역폭에 좌우되므로 코어 클럭을 낮춰도 생성 속도가 거의 떨어지지 않습니다. 대신 발열과 소음이 줄고 부품 수명에 유리합니다.