Ollama와 LM Studio 시작하기
지난 절에서 무엇을 돌릴 수 있는지 계산했고, 이번 절에서 그것을 설치합니다. 도구는 두 개, 하나는 커맨드라인이고 하나는 그래픽 인터페이스입니다. 처음 써도 10분이면 끝까지 돌려볼 수 있습니다.
Ollama
- 명령 한 줄로 다운로드하고 실행하며, 군더더기 단계가 없습니다
- 설치하면 백그라운드에서 자동으로 서비스를 띄워, 프로그램이 바로 호출할 수 있습니다
- 인터페이스가 OpenAI 형식과 호환되어, 기존 API 호출 코드는 주소만 바꾸면 됩니다
- 그래픽 인터페이스가 없어서 모델 교체와 파라미터 조정을 모두 명령으로 해야 합니다
LM Studio
- 모델 브라우저가 내장되어, 용량과 양자화 구간을 보고 내려받을지 결정할 수 있습니다
- 현재 기기가 감당할 수 있는지 알려주므로 처음 하는 사람에게 친절합니다
- 로컬 서버도 띄울 수 있고, 마찬가지로 OpenAI 형식과 호환됩니다
- Apple 칩에서 MLX 엔진을 지원해, 범용 포맷보다 빠릅니다
Ollama를 설치했다면 명령 한 줄이면 됩니다. 지난 절에서 8B를 돌릴 수 있다고 계산했다고 해봅시다.
ollama run qwen3:8b
이 한 줄이 전부입니다. 로컬에 없으면 먼저 내려받고, 다 받으면 자동으로 대화로 들어갑니다. 실행 없이 다운로드만 하려면 run을 pull로 바꾸세요. 그 밖에 자주 쓰는 명령입니다.
# 어떤 모델을 내려받았고 각각 용량을 얼마나 쓰는지 확인
ollama list
# 안 쓰는 건 삭제, 로컬 모델은 디스크를 많이 차지한다
ollama rm qwen3:8b
# 현재 VRAM을 점유하고 있는 모델 확인
ollama ps
설치하면 Ollama가 로컬 11434 포트로 서비스를 제공하고, 인터페이스 형식은 OpenAI와 같습니다. 즉 7부에서 작성한 호출 코드에서 base_url만 이쪽으로 돌리면 돌아가고, 모델명에는 태그명을 넣으면 됩니다.
from openai import OpenAI
# 로컬 서비스는 키를 검증하지 않으므로 api_key에는 비어 있지 않은 값을 아무거나 넣으면 된다
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "양자화가 무엇인지 한 문장으로 설명해 줘"}],
)
print(resp.choices[0].message.content)
위 명령의 8b는 예시입니다. 여러분이 실제로 어떤 숫자를 넣어야 하는지는 기기에 따라 다릅니다. 아래에서 골라 보면 그대로 복사해 갈 수 있는 명령이 바로 나옵니다.
콜론 뒤의 문자열은 아무렇게나 붙인 게 아니고, 각 구간에 의미가 있습니다.
ollama.com/library의 해당 모델 tags 페이지에서 현재 어떤 크기와 구간이 있는지 확인하는 것을 권합니다. 확인일 2026-08-07.
모델 라이브러리에서 검색하기
모델명을 검색하면 목록에 각 양자화 버전의 용량이 나옵니다. 인터페이스가 내 기기 기준으로 어느 것을 감당할 수 있는지 알려주는데, 이 점이 커맨드라인보다 훨씬 직관적입니다.
다운로드하고 바로 대화하기
모델을 로드할 때 컨텍스트 길이와 GPU 할당을 조정할 수 있습니다. 이 두 파라미터는 VRAM 점유량에 직접 영향을 주니, 먼저 기본값으로 돌려본 뒤에 조정하세요.
프로그램에서 호출해야 하면 로컬 서버 켜기
서버 패널에서 시작하면 되고, 마찬가지로 OpenAI 호환 인터페이스입니다. 사용법은 위의 Ollama 예제와 같고 포트만 다릅니다.
Mac 사용자는 MLX 버전 선택에 주의하기
모델에 MLX 포맷이 있으면 그것을 우선하세요. Apple 칩에 맞춰 최적화된 엔진이라, 같은 모델이라도 속도가 범용 포맷보다 확실히 좋습니다.
- 컨텍스트를 너무 크게 열어 VRAM이 바로 터집니다. 가장 자주 나오는 문제입니다. 모델을 로드할 때는 VRAM이 충분해 보이지만, 컨텍스트를 수십 K로 올리는 순간 KV Cache가 불어나 뻗습니다. 증상은 생성 중간에 멈추거나, 속도가 갑자기 쓸 수 없을 만큼 느려지는 것입니다. 먼저 기본 컨텍스트로 끝까지 돌려보고, 긴 글이 필요해지면 한 단계씩 올리세요.
- VRAM이 부족해도 오류가 안 날 수 있습니다. 어떤 도구는 담기지 않는 부분을 자동으로 시스템 메모리에 두고 CPU로 계산합니다. 결과는 돌아가긴 하는데 열 배 이상 느려지는 것입니다. 생성 속도가 터무니없이 느리다면, 먼저 VRAM에 완전히 들어갔는지 확인하세요.
- 디스크가 잠식됩니다. 8B의 Q4 모델 하나가 3~4 GB이니, 몇 개만 써봐도 수십 GB입니다. 주기적으로
ollama list로 확인하고 안 쓰는 건 삭제하세요.
여기까지 오면 모델을 쓰는 방식이 세 가지 손에 들어옵니다. 서로 대체 관계가 아니고, 각각의 자리가 있습니다.
- 로컬 실행. 데이터를 외부로 보낼 수 없을 때, 장기간 고빈도로 호출할 때, 또는 서비스 제공자의 영향을 전혀 받고 싶지 않을 때. 대가는 능력의 상한이 하드웨어에 제한된다는 점입니다.
- 공식 API. 최고의 능력이 필요하고 운영을 신경 쓰고 싶지 않을 때. 사용량만큼 지불합니다.
- 중계 사이트. 편의성과 위험이 함께 옵니다. 구체적인 취사선택은 「API 중계 사이트가 뭔가요」 절에서 다뤘고, 데이터가 제3자를 거치는 문제가 얽혀 있으니 선택하기 전에 한 번 다시 보는 것을 권합니다.
이 장은 여기서 끝입니다. 이제 어떤 모델의 개방 수준을 스스로 판단할 수 있고, 작은 모델이 어떻게 만들어지며 그 대가가 무엇인지 알고, 자기 기기에서 직접 돌릴 수 있을 것입니다.