오픈소스 특집 · 내 기기에서 직접 돌려보기

내 컴퓨터는 얼마나 큰 모델을 돌릴 수 있나

앞에서는 개념을 다뤘고, 이번 절은 직접 해봅니다. 그래픽카드나 Mac 모델을 선택하고 결론을 바로 확인하세요. 보고 나면 로컬에서 모델을 돌리는 문턱이 대부분의 사람이 생각하는 것보다 낮다는 걸 알게 됩니다.

먼저 한 번 계산해 봅니다
플랫폼
모델명
정밀도
후보 모델은 모두 실제로 다운로드할 수 있는 Apache 2.0 가중치입니다. 환산값은 추정치이며, 실행 가능성 판단을 돕는 용도이므로 실측을 대신할 수는 없습니다.

맨 아래 Qwen3.8-Max는 무엇을 골라도 빨간색으로 남습니다. 목록의 오류가 아닙니다. 이 챕터 3강에서 다룬, 가중치를 처음으로 공개한 그 플래그십입니다. 2.4조 파라미터를 위 공식에 넣으면 1560 GB가 필요하고, 목록에서 가장 비싼 기기로 바꿔도 모자랍니다. 그래도 표에 남겨 둔 이유는 「가중치가 공개되었다」와 「내가 돌릴 수 있다」가 서로 다른 이야기이기 때문이고, 이 숫자를 직접 보는 편이 「모델이 매우 크다」라는 문장을 읽는 것보다 훨씬 와닿기 때문입니다.

공식은 어디서 나왔나

위 결론은 표를 찾아본 게 아니고, 곱셈 하나입니다.

필요한 VRAM(GB) ≈ 파라미터 수(B) × 정밀도 계수
예: 8B 모델을 INT4로 돌리면 8 × 0.65 ≈ 5.2 GB

설명이 필요한 건 이 계수입니다. 가중치만 순수하게 적재한다면 INT4는 파라미터당 0.5바이트라서 8B 모델은 4 GB면 됩니다. 그런데 모델이 돌아가려면 대화 과정에서 쌓이는 중간 상태를 담아둘 공간이 따로 필요합니다. 2부에서 다룬 KV Cache입니다. 계수에는 이 부분의 오버헤드가 이미 포함되어 있으니, 바깥에서 여유분을 한 번 더 곱하지 마세요. 그러면 어떤 기기로도 못 돌린다는 결론이 나옵니다.

네 가지 정밀도 구간

양자화는 파라미터 하나하나를 더 적은 비트로 저장하는 것입니다. 비트가 적을수록 용량은 작아지고, 대가는 정밀도 손실입니다.

FP32
× 4.0
전체 정밀도. 사실상 훈련에만 쓰이고, 로컬 추론을 이렇게 돌리는 사람은 없습니다.
FP16
× 2.6
반정밀도. 모델 공개 시의 원본 포맷이고, 품질의 기준선입니다.
INT8
× 1.3
용량이 절반. 품질 손실은 보통 알아채기 어렵습니다. VRAM이 넉넉하다면 무난한 선택입니다.
INT4
× 0.65
용량이 원래의 4분의 1. 대부분의 일상 과제에서 차이는 느껴지지만 수용할 만합니다.
로컬 실행에 가장 많이 씀

위 계산기에서 정밀도를 FP16에서 INT4로 바꿔보면 돌릴 수 있는 모델이 어떻게 달라지는지 볼 수 있습니다. 양자화는 로컬 배포의 문턱을 낮추는 가장 효과적인 한 수입니다. 8 GB 그래픽카드는 FP16의 8B 모델을 못 돌리지만, INT4로 바꾸면 여유롭습니다.

양자화의 손실은 균등하게 분포하지 않습니다. 일상 문답, 요약, 리라이팅 같은 과제에서는 INT4로 충분하지만, 긴 사슬의 추론이나 정확한 계산이 필요한 과제에서는 점수 하락이 좀 더 뚜렷해집니다. 요구 수준이 높은 상황이라면, 한 단계 큰 모델을 INT4로 돌리기보다 한 단계 작은 모델을 INT8로 돌리는 편이 낫습니다.
두 가지 하드웨어, 두 가지 논리

NVIDIA 그래픽카드

  • VRAM을 독점하므로, 표기된 용량을 거의 그대로 쓸 수 있습니다
  • 대역폭이 높아 생성이 빠르고, 같은 크기 모델에서 체감이 확실히 매끄럽습니다
  • 용량이 절대적인 상한이고, 소비자용 카드는 현재 32 GB 정도가 최대입니다
  • 소프트웨어 생태계가 가장 성숙해서, 문제가 생겨도 대개 해법을 검색할 수 있습니다

Apple Silicon

  • CPU와 GPU가 통합 메모리를 공유하며, 시스템이 전부를 GPU에 넘겨주지 않습니다
  • 계산기는 할당 가능한 약 75%로 환산하며, 이는 보수적인 추정입니다
  • 용량 이점이 커서, 고급 모델은 소비자용 그래픽카드가 넘볼 수 없는 크기까지 담습니다
  • 대역폭은 보통 같은 가격대의 외장 GPU에 못 미쳐, 큰 모델에서 생성 속도가 다소 느립니다

간단히 말하면 NVIDIA는 속도로, Apple은 용량으로 승부합니다. 30B 이상의 모델을 돌리고 싶다면 메모리가 큰 Mac이 소비자용 그래픽카드보다 현실적인 경우가 많고, 응답 속도를 원한다면 외장 GPU가 더 적합합니다.

통합 메모리에서 GPU가 쓸 수 있는 비율은 macOS에서 iogpu.wired_limit_max로 조정할 수 있습니다. 75%는 기본 상태에서의 보수적 추정이며 절대적인 상한은 아닙니다.
MoE 모델의 특수한 점

결과 목록에서 A가 붙은 것은 MoE 모델입니다. 예를 들어 Qwen3-30B-A3B는 총 파라미터 30B에 매번 실제로 활성화되는 것은 3B라는 뜻입니다. 이런 모델에는 밟기 쉬운 함정이 하나 있습니다.

VRAM은 총 파라미터로 계산하고, 속도는 활성 파라미터로 계산합니다. 30B MoE 모델은 30B을 담을 VRAM을 준비해야 하지만, 실제로 돌아가는 속도는 3B에 가깝습니다. 자리는 많이 차지하고, 빠르게 돕니다.

즉 MoE는 VRAM이 넉넉하면서 빠른 응답을 원하는 상황, 예컨대 메모리가 큰 Mac에 특히 잘 맞습니다. 반대로 VRAM이 빠듯하다면 같은 점유량에서 덴스 모델 중 작은 것을 고르는 편이 더 이득입니다.

몇 가지 면책 설명

위의 모든 수치는 추정치이고, 실제 점유량은 다음 요인들에도 영향을 받습니다.

그래서 계산기가 주는 것은 실행 가능성 판단이고, 정확한 예산이 아닙니다. 결론이 「간신히」라면, 못 돌린다고 보고 준비하세요.

다음 단계

무엇을 돌릴 수 있는지 알았다면, 다음 절에서 실제로 설치합니다. 도구는 두 개입니다. 커맨드라인의 Ollama와 그래픽 인터페이스의 LM Studio로, 10분이면 끝까지 돌려볼 수 있습니다.