오픈소스 특집 · 오픈소스는 대체 무엇을 여는가

진짜 오픈소스 vs 가짜 오픈소스: 라이선스 읽는 법

거의 모든 업체가 자기는 「오픈소스」라고 말하지만, 이 단어가 뜻하는 바는 업체마다 크게 다릅니다. 어떤 곳은 상업적 이용이 완전히 자유롭고, 어떤 곳은 사용자 수가 늘면 별도 계약을 맺어야 하며, 어떤 곳은 논문 한 편을 냈을 뿐입니다. 어디가 오픈소스인지 외우는 것보다 스스로 판별하는 법을 익히는 편이 훨씬 쓸모 있습니다.

세 가지 질문, 다 물으면 답이 나온다

라이선스를 전부 읽을 필요는 없습니다. 아래 세 가지를 순서대로 물어보면 대부분의 모델은 개방 수준이 분명하게 잡힙니다.

질문 1가중치 파일을 내려받을 수 있는가?

내려받을 수 있어야 그다음 이야기가 성립합니다. API 호출로만 쓸 수 있는 모델은 홍보 문구가 어떻게 쓰여 있든 앞 절에서 말한 통제권을 손에 넣을 수 없습니다. 이 질문 하나로 절반 이상이 걸러집니다.

질문 2상업적으로 쓸 수 있는가? 부가 조건은 없는가?

여기서 가장 많이 걸려 넘어집니다. 상업적 이용은 허용하되 사용자 규모 상한을 붙인 라이선스가 있고, 연구 목적으로만 제한하는 라이선스도 있습니다. 제품을 만들기 전에 확인하지 않았다가 사용자 수가 늘어난 뒤에야 추가 라이선스가 필요하다는 걸 알게 되면 상당히 곤란해집니다.

질문 3그 출력으로 새 모델을 학습시킬 수 있는가?

쉽게 말해 증류(distillation)에 쓸 수 있느냐입니다. 이 조항이 그 모델을 바탕으로 자기 모델을 만들 수 있는지를 결정하며, 뒤의 두 절에서 펼쳐 다룰 주제입니다. 업체 간 입장 차이가 가장 큰 항목이기도 합니다.

읽기만 해서는 익힌 것이 아닙니다. 지금 검토하고 있는 모델을 하나 골라 직접 한 번 훑어보세요. 아래 마법사가 바로 위의 세 질문을 하나씩 물어보고, 다 답하면 그 모델이 어느 등급에 속하는지 바로 알려 줍니다.

가중치 파일을 내려받을 수 있나요?
1번째 질문 / 총 3문항
같은 잣대로 다섯 곳 재기

아래에서는 각 업체에 같은 네 가지 질문을 던집니다. 네 번째는 학습 데이터가 공개되어 있는가입니다. 이 항목을 넣은 이유는 한 가지를 분명히 하기 위해서입니다. 대형 모델 분야에서 「오픈소스」라는 단어는 이미 다시 정의된 상태입니다.

Qwen3 전 라인업
부가 조건 없음
Apache 2.0
  • O가중치 다운로드
  • O상업적 이용, 사용자 수 제한 없음
  • O새 모델 학습에 사용 가능
  • X학습 데이터 미공개
Mistral 7B
부가 조건 없음
Apache 2.0
  • O가중치 다운로드
  • O상업적 이용, 사용자 수 제한 없음
  • O새 모델 학습에 사용 가능
  • X학습 데이터 미공개
DeepSeek-R1
부가 조건 없음
MIT License
  • O가중치 다운로드
  • O상업적 이용, 신청 불필요
  • O증류를 공식적으로 명시 허용
  • X학습 데이터 미공개
Llama 3
상업 이용에 조건 있음
Llama 3 Community License
  • O가중치 다운로드
  • 월간 활성 사용자 7억 초과 시 별도 라이선스 필요
  • O새 모델 학습에 사용 가능
  • X학습 데이터 미공개
GPT-4 / Claude / Gemini Ultra
API 전용
공개 가중치 라이선스 없음
  • X가중치 다운로드 불가
  • X로컬 배포 불가
  • X학습에 사용 불가
  • X학습 데이터 미공개
각 업체 공식 라이선스 원문 기준: Meta Llama 3 Community License 제2조(직전 역월 월간 활성 사용자 7억 초과 시 Meta에 별도 상업 라이선스를 신청해야 함), Mistral 공식 릴리스 노트(Apache 2.0, without restrictions), DeepSeek 공식 공지 2025-01-20(MIT License, 증류를 통한 다른 모델 학습을 명시적으로 허용), Qwen3 공식 릴리스 노트. 확인일 2026-08-07.
세 등급으로 정리하면
1등급 · 가중치 공개, 부가 조건 없음
Apache 2.0, MIT 같은 표준 오픈소스 라이선스를 씁니다. 다운로드, 수정, 상업적 이용, 재배포, 새 모델 학습 어느 쪽도 별도로 양해를 구할 필요가 없고 사용자 수 기준도 없습니다. 법무 검토가 가장 수월합니다.
대표:Qwen3 전 라인업, Mistral 7B, DeepSeek-R1
2등급 · 가중치는 공개하되 자체 조항이 붙음
업체가 직접 작성한 라이선스로, 보통 상업적 이용 규모, 사용 범위, 표기 의무에 제한을 겁니다. 기술적으로는 문제없이 쓸 수 있지만, 사업적으로는 자신이 그 선에 걸릴지를 먼저 계산해 봐야 합니다.
대표:Llama 3 시리즈
3등급 · API만 제공
가중치를 받을 수 없으니 로컬 배포, 온프레미스, 추가 학습이라는 선택지도 사라집니다. 성능은 가장 뛰어날 수 있지만, 여러분이 빌리는 것은 사용권입니다.
대표:GPT-4, Claude, Gemini Ultra
반드시 짚고 넘어가야 할 사실
위 다섯 곳 모두 학습 데이터는 공개하지 않았습니다.전통적인 소프트웨어의 오픈소스 기준으로 보면 소스 코드에 해당하는 것은 학습 데이터와 학습 코드이고, 컴파일 산출물만 주는 것은 오픈소스로 치지 않습니다. 대형 모델 분야에서 말하는 오픈소스는 실제로는 가중치 공개를 가리킵니다. 업계가 암묵적으로 받아들인 완화된 정의이므로, 이 단어를 쓸 때는 그 경계를 분명히 알고 있어야 합니다.

마찬가지로 눈여겨볼 점은 라이선스가 바뀐다는 것입니다. Qwen은 2.5 세대에서 등급형 라이선스를 썼습니다. 대부분의 크기는 Apache 2.0이었고 3B와 72B에는 별도 조항이 있었습니다. Qwen3에 와서야 전 라인업이 Apache 2.0으로 통일되었습니다. 선정할 때 봐야 할 것은 자신이 쓰려는 그 구체적인 버전의 라이선스이지, 그 회사에 대한 전반적인 인상이 아닙니다.

Qwen2.5 시리즈는 대부분의 크기가 Apache 2.0을 적용했고, 그중 3B는 Qwen Research 라이선스, 72B는 Qwen 라이선스를 적용했습니다. Qwen3 시리즈 8개 모델은 모두 Apache 2.0으로 통일했습니다. 출처: Qwen 공식 릴리스 노트.
이 자가 점검 목록을 가져가세요

다음에 모델을 평가할 때 순서대로 훑어보세요.

첫째,공식 저장소에서 라이선스 파일 자체를 찾습니다. 보도자료나 홍보 페이지는 보지 않습니다.
둘째,자신이 쓰려는 그 구체적인 크기의 라이선스를 확인합니다. 같은 시리즈 안에서도 다를 수 있습니다.
셋째,자체 라이선스라면 사용자 규모, 사용 범위, 지역 이 세 가지 제한을 집중해서 찾습니다.
넷째,학습에 쓸 수 있는지 확인합니다. 이후 파인튜닝과 증류의 여지가 있는지가 여기서 결정됩니다.

다음 절에서는 다른 각도를 봅니다. 이 업체들은 왜 오픈소스로 공개할까요. 오픈소스에는 돈이 들고, 가중치는 한번 내보내면 거둬들일 수 없습니다. 자선사업을 하는 곳은 한 군데도 없습니다.