한국 오픈 LLM 정리 — EXAONE·Kanana·HyperCLOVA X·Solar 구동 사양

CanRun · 2026년 9월 30일 업데이트

아래 판정 표의 한국 모델 여덟 종은 Q4_K_M(4비트급 양자화)·8k 컨텍스트 기준으로 메모리가 적게는 1.9GB, 많게는 64.4GB 필요합니다. 가장 적게 드는 모델은 EXAONE 4.0 1.2B, 가장 많이 드는 모델은 Solar Open 100B입니다. 시스템 RAM이 32GB면 Solar Open 100B는 표에 나온 어떤 그래픽카드에도 들어가지 않습니다. EXAONE 4.0 1.2B·HyperCLOVA X SEED 1.5B·Kanana 1.5 8B는 표의 여섯 구성 모두에서 쾌적하게 돌아갑니다(보정된 추정). 다만 RTX 4060에서 Kanana 1.5 8B는 메모리 여유가 빠듯합니다. 32B급 EXAONE 두 모델은 RTX 3090에서 쾌적하게 돌아가지만, RTX 5060 Ti 16GB에서는 부분 오프로드로 겨우 돌아갑니다. 두 결과 모두 보정된 추정입니다. GPU에 다 올리려면 24GB급 카드가 필요합니다.

CanRun에 등록된 한국 모델 아홉 종

네 제작사 모두 모델 카드에 한국어와 영어를 지원한다고 적어 두었습니다. 다만 CanRun은 답변 품질을 평가하지 않습니다.

구조와 라이선스

MoE(전문가 혼합)는 토큰마다 전문가 일부만 골라 계산하는 구조입니다. 그래서 표의 파라미터 열에는 MoE 모델의 전체 파라미터와 활성 파라미터를 함께 적었습니다. Kanana 1.5 15.7B-A3B의 활성 파라미터 3B는 카카오가 직접 밝힌 수치가 아닙니다. 모델 이름과 카드 설명에서 나온 값이고, 카드에는 토큰당 연산량이 8B 모델의 약 37%라고 적혀 있습니다. Solar 두 모델도 MoE이고, 나머지 여섯은 dense 모델입니다.

라이선스를 보면 EXAONE 세 모델은 EXAONE AI Model License 1.2 NC(비상업), Kanana 1.5 8B는 Apache-2.0(오픈)입니다. 나머지는 제작사마다 따로 정한 약관(별도 약관)을 따릅니다.

GGUF 출처와 컨텍스트

GGUF는 llama.cpp 계열 도구가 쓰는 모델 파일 형식입니다. EXAONE의 GGUF는 LG AI연구원이 직접 올린 공식 파일입니다. Kanana 두 모델과 HyperCLOVA X SEED 1.5B, Solar Open 100B는 mradermacher가 올린 커뮤니티 파일이고, Solar Open 2는 prometheusAIR가 올린 커뮤니티 파일입니다.

HyperCLOVA X SEED Think 14B의 GGUF는 naver-ellm이 올린 Q4_K_M 파일 하나뿐입니다. 네이버 클라우드가 llama.cpp를 고쳐 만든 포크가 이 파일을 가리키고, 파일의 카드에서도 이 포크를 쓰라고 안내합니다. naver-ellm에는 Hugging Face의 인증 표시가 없어서 CanRun은 이 파일을 커뮤니티 파일로 표시합니다.

최대 컨텍스트는 모델이 한 번에 다룰 수 있는 토큰 길이입니다. Solar Open 2(1024k)와 EXAONE 4.5 33B(256k)가 길고, HyperCLOVA X SEED 1.5B(16k)가 가장 짧습니다. HyperCLOVA X SEED Think 14B는 표에 config 파일의 값을 적었고, 모델 카드에는 32k라고 나와 있습니다.

EXAONE 4.5 33B는 이미지 입력을 받는 비전-언어 모델이라, 표의 파라미터 수에 비전 인코더가 들어 있습니다. 이미지를 넣을 때 쓰는 비전 프로젝터(mmproj)는 별도 파일이라 메모리 수치에는 넣지 않았습니다. 모델 카드에 따르면 EXAONE 세 모델과 HyperCLOVA X SEED Think 14B는 리즈닝(생각) 모드를 켜고 끌 수 있습니다. CanRun은 이 가운데 EXAONE 4.0 32B·4.5 33B와 HyperCLOVA X SEED Think 14B를 리즈닝 모델로 분류합니다. Solar Open 2는 전문가 가중치와 공유 가중치가 각각 얼마인지 확인하지 못했습니다. 그래서 사양·메모리 표에만 넣고 판정 표에서는 뺐습니다.

필요한 메모리 — 8GB부터 24GB급까지

필요 메모리는 기본 양자화 파일 크기에 f16 KV 캐시와 연산 버퍼를 더한 값입니다. KV 캐시는 지금까지 나눈 대화, 즉 컨텍스트를 담아 두는 메모리이고, 연산 버퍼는 계산에 쓰는 임시 메모리입니다. 기본 양자화는 Q4_K_M입니다. Q4_K_M GGUF가 없는 Solar Open 2만 IQ4_XS로 계산했습니다.

8k 컨텍스트에서 모델에 필요한 메모리(기본 양자화 파일 + f16 KV 캐시 + 연산 버퍼)
모델파라미터기본 양자화 파일8k KV 캐시8k 합계
EXAONE 4.0 1.2B1.28BQ4_K_M · 0.8GB0.5GB1.9GB
HyperCLOVA X SEED 1.5B1.59BQ4_K_M · 1.0GB0.8GB2.4GB
Kanana 1.5 8B8.03BQ4_K_M · 4.9GB1.1GB6.6GB
HyperCLOVA X SEED Think 14B14.75BQ4_K_M · 8.9GB1.3GB10.8GB
Kanana 1.5 15.7B-A3B15.7B (활성 3B)Q4_K_M · 10.4GB1.1GB12.1GB
EXAONE 4.0 32B32BQ4_K_M · 19.3GB0.5GB20.5GB
EXAONE 4.5 33B34.35BQ4_K_M · 20.1GB0.5GB21.2GB
Solar Open 100B102.65B (활성 12B)Q4_K_M · 62.3GB1.6GB64.4GB
Solar Open 2 250B250.29B (활성 15B)IQ4_XS · 136.2GB0.4GB137.2GB

그래픽카드는 OS가 VRAM 일부를 따로 씁니다(Windows에서 화면 출력을 맡은 GPU라면 약 0.6GB). 맥은 기본 설정에서 GPU가 통합 메모리의 약 70%를 씁니다.

8k 필요량은 카드 상자에 적힌 용량이 아니라 사용 가능 메모리와 비교해야 합니다. Windows에서 화면 출력을 맡은 카드는 OS가 VRAM 일부를 먼저 쓰기 때문입니다.

  • 8GB(RTX 4060, 사용 가능 7.4GB): EXAONE 4.0 1.2B(1.9GB)부터 Kanana 1.5 8B(6.6GB)까지 들어갑니다. Kanana 1.5 8B는 여유가 거의 없으니 ollama ps로 확인하세요.
  • 12GB(RTX 3060 12GB, 사용 가능 11.4GB): HyperCLOVA X SEED Think 14B(10.8GB)까지 들어갑니다. 다만 이 모델도 여유가 거의 없습니다.
  • 16GB(RTX 5060 Ti 16GB, 사용 가능 15.4GB): Kanana 1.5 15.7B-A3B(12.1GB)가 Q4_K_M 그대로 들어갑니다. 활성 파라미터가 약 3B라도 파일 크기는 전체 파라미터 수로 정해집니다.
  • 24GB급(RTX 3090, 사용 가능 23.4GB): EXAONE 4.0 32B(20.5GB)와 4.5 33B(21.2GB)가 GPU에 다 올라갑니다.
  • Solar: Solar Open 100B(64.4GB)는 이 글에 나오는 어떤 그래픽카드 한 장에도 들어가지 않습니다. Solar Open 2는 그보다 훨씬 큽니다.

KV 캐시 — EXAONE 32B급이 적게 늘어나는 이유

KV 캐시는 컨텍스트 길이에 비례해 커지고, 토큰당 크기는 모델 구조마다 다릅니다.

모델별 KV 캐시: 토큰당 바이트(각 모델 config 기준)와 컨텍스트 길이별 f16 KV 캐시 크기
모델토큰당 KV8k32k
Solar Open 100B192 KiB1.6GB6.4GB
HyperCLOVA X SEED Think 14B152 KiB1.3GB5.1GB
Kanana 1.5 15.7B-A3B128 KiB1.1GB4.3GB
Kanana 1.5 8B128 KiB1.1GB4.3GB
HyperCLOVA X SEED 1.5B96 KiB0.8GB—
EXAONE 4.0 32B64 KiB0.5GB2.1GB
EXAONE 4.5 33B64 KiB0.5GB2.1GB
EXAONE 4.0 1.2B60 KiB0.5GB2.0GB

표의 ‘—’는 모델이 지원하는 길이보다 긴 컨텍스트라는 뜻입니다. KV 캐시를 q8_0·q4_0으로 두면 f16의 약 54%·29% 크기가 됩니다.

EXAONE 4.0 32B·4.5 33B의 토큰당 KV는 훨씬 작은 모델인 EXAONE 4.0 1.2B와 비슷하고, Kanana 두 모델의 절반입니다. HyperCLOVA X SEED 1.5B는 최대 컨텍스트가 16k라서 32k 칸에 대시가 표시됩니다.

모델 카드에 따르면 EXAONE 4.0 32B·4.5 33B는 로컬(슬라이딩 윈도) 어텐션 층과 글로벌 어텐션 층을 3:1로 섞어 씁니다. 슬라이딩 윈도 층의 캐시는 윈도 길이까지만 커지고 그 뒤로는 늘지 않습니다. EXAONE 4.5 카드에 적힌 윈도 길이는 4k 토큰입니다. EXAONE 4.0 1.2B는 모든 층이 글로벌 어텐션입니다. 이 모델의 토큰당 KV가 작은 것은 모델 자체가 작기 때문입니다.

CanRun 계산은 글로벌 층의 KV만 셉니다. 그래서 토큰당 열은 KV가 늘어나는 속도를 제대로 보여 줍니다. 하지만 EXAONE 4.0 32B·4.5 33B의 KV와 필요 메모리에는 슬라이딩 윈도 층이 윈도 길이만큼 차지하는 고정량이 빠져 있어, 실제보다 작게 나옵니다. 긴 컨텍스트 이야기는 ‘KV 캐시와 컨텍스트 길이 — 컨텍스트를 늘리면 VRAM이 얼마나 더 필요할까’ 가이드에서 자세히 다룹니다.

자주 쓰는 여섯 구성별 판정

8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. PC는 시스템 RAM 32GB(DDR5)에 Windows를, 맥은 표에 적힌 통합 메모리 용량을 가정합니다. 표의 배지는 Q4_K_M 기준 판정입니다. Q4_K_M으로 돌릴 수 없는 조합에는 양자화를 낮추거나 시스템 RAM을 늘렸을 때의 판정이 한 줄 더 붙습니다.

8k 컨텍스트·f16 KV 캐시 기준 판정입니다. PC는 시스템 RAM 32GB(DDR5)와 Windows를, 맥은 칸에 적은 통합 메모리 용량을 기준으로 합니다. 속도는 오차 범위와 신뢰 라벨을 붙인 추정치입니다.
하드웨어EXAONE 4.0 1.2BHyperCLOVA X SEED 1.5BKanana 1.5 8BHyperCLOVA X SEED Think 14BKanana 1.5 15.7B-A3BEXAONE 4.0 32BEXAONE 4.5 33BSolar Open 100B
GeForce RTX 40608GB
쾌적
추정 145.0 tok/s127.6–162.4보정된 추정 ±12%
쾌적
추정 104.9 tok/s92.3–117.5보정된 추정 ±12%
쾌적
추정 31.8 tok/s28.0–35.6보정된 추정 ±12%
겨우 가능
추정 8.4 tok/s5.9–10.9이론 추정 ±30%
겨우 가능
추정 19.3 tok/s13.5–25.1이론 추정 ±30%
불가IQ4_XS: 겨우 가능
추정 3.5 tok/s2.8–4.1보정된 추정 ±20%
불가IQ4_XS: 겨우 가능
추정 3.3 tok/s2.6–3.9보정된 추정 ±20%
불가RAM 64GB라면: 겨우 가능
GeForce RTX 3060 12GB12GB
쾌적
추정 191.9 tok/s168.9–214.9보정된 추정 ±12%
쾌적
추정 138.8 tok/s122.2–155.5보정된 추정 ±12%
쾌적
추정 42.0 tok/s37.0–47.1보정된 추정 ±12%
원활
추정 24.7 tok/s17.3–32.1이론 추정 ±30%
겨우 가능
추정 19.3 tok/s13.5–25.1이론 추정 ±30%
겨우 가능
추정 4.0 tok/s3.2–4.8보정된 추정 ±20%
겨우 가능
추정 3.8 tok/s3.0–4.5보정된 추정 ±20%
불가RAM 64GB라면: 겨우 가능
GeForce RTX 5060 Ti 16GB16GB
쾌적
추정 238.8 tok/s210.1–267.4보정된 추정 ±12%
쾌적
추정 172.8 tok/s152.0–193.5보정된 추정 ±12%
쾌적
추정 52.3 tok/s46.0–58.6보정된 추정 ±12%
쾌적
추정 30.8 tok/s21.5–40.0이론 추정 ±30%
쾌적
추정 65.7 tok/s52.6–78.8보정된 추정 ±20%
겨우 가능
추정 6.1 tok/s4.9–7.4보정된 추정 ±20%
겨우 가능
추정 5.6 tok/s4.5–6.7보정된 추정 ±20%
불가RAM 64GB라면: 겨우 가능
GeForce RTX 309024GB
쾌적
추정 498.9 tok/s439.0–558.8보정된 추정 ±12%
쾌적
추정 360.9 tok/s317.6–404.2보정된 추정 ±12%
쾌적
추정 109.3 tok/s96.2–122.4보정된 추정 ±12%
쾌적
추정 64.3 tok/s45.0–83.5이론 추정 ±30%
쾌적
추정 137.3 tok/s109.8–164.7보정된 추정 ±20%
쾌적
추정 33.0 tok/s29.0–36.9보정된 추정 ±12%
쾌적
추정 31.8 tok/s28.0–35.6보정된 추정 ±12%
불가RAM 64GB라면: 겨우 가능
GeForce RTX 509032GB
쾌적
추정 955.1 tok/s840.5–1,069.8보정된 추정 ±12%
쾌적
추정 691.0 tok/s608.1–773.9보정된 추정 ±12%
쾌적
추정 209.3 tok/s184.2–234.4보정된 추정 ±12%
쾌적
추정 123.0 tok/s86.1–160.0이론 추정 ±30%
쾌적
추정 235.0 tok/s188.0–282.0보정된 추정 ±20%
쾌적
추정 63.1 tok/s55.5–70.7보정된 추정 ±12%
쾌적
추정 60.9 tok/s53.6–68.2보정된 추정 ±12%
불가RAM 64GB라면: 겨우 가능
Apple M4 Pro24/48/64GB
쾌적
추정 124.7 tok/s99.8–149.7보정된 추정 ±20%
24GB 구성
쾌적
추정 90.2 tok/s72.2–108.3보정된 추정 ±20%
24GB 구성
쾌적
추정 27.3 tok/s21.9–32.8보정된 추정 ±20%
24GB 구성
원활
추정 16.1 tok/s11.2–20.9이론 추정 ±30%
24GB 구성
쾌적
추정 26.7 tok/s21.4–32.0보정된 추정 ±20%
24GB 구성
겨우 가능
추정 4.8 tok/s3.4–6.2이론 추정 ±30%
24GB 구성
겨우 가능
추정 8.0 tok/s6.4–9.5보정된 추정 ±20%
48GB 구성
불가IQ4_XS: 겨우 가능
추정 10.1 tok/s7.1–13.1이론 추정 ±30%
64GB 구성

이론 추정(±30%)은 MoE 전문가를 시스템 RAM에 두는 경우처럼 아직 벤치마크로 확인하지 못한 구성에 붙습니다. 실제보다 느리게 추정했을 가능성이 큽니다.

작은 세 모델: EXAONE 4.0 1.2B·HyperCLOVA X SEED 1.5B·Kanana 1.5 8B는 한국에서 흔한 8GB 카드인 RTX 4060을 포함해 표의 모든 구성에서 쾌적하게 돌아갑니다(보정된 추정).

Kanana 1.5 15.7B-A3B: RTX 5060 Ti 16GB·RTX 3090·RTX 5090에서는 모델이 GPU에 다 올라가고, M4 Pro 24GB 구성에서는 통합 메모리에 다 올라갑니다. 네 구성 모두 쾌적하게 돌아갑니다(보정된 추정). RTX 3060 12GB와 RTX 4060에서는 Q4_K_M이 GPU에 다 올라가지 않습니다. CanRun 계산으로는 전문가 가중치를 시스템 RAM에 두는 방식(MoE 전문가 RAM 배치)으로 겨우 돌아갑니다. 이 값은 이론 추정이고, 실제보다 느리게 계산됐을 가능성이 큽니다. RTX 3060 12GB에서는 IQ4_XS로 낮추면 GPU에 다 올라갑니다(다음 절 참고). RTX 4060에서는 IQ4_XS도 GPU에 다 올라가지 않습니다.

HyperCLOVA X SEED Think 14B: 커스텀 아키텍처라서 공식 llama.cpp가 지원하는지 확인되지 않았습니다. 그래서 표에 나온 이 모델의 속도는 모두 이론 추정입니다. RTX 4060에서는 부분 오프로드로 겨우 돌아가고, RTX 3060 12GB와 M4 Pro 24GB 구성에서는 원활하게 돌아갑니다. RTX 5060 Ti 16GB·RTX 3090·RTX 5090에서는 쾌적하게 돌아갑니다. 이 모델에서 믿을 만한 값은 공식으로 계산한 메모리 쪽입니다. 필요량 10.8GB는 RTX 3060 12GB에 아슬아슬하게 들어갑니다.

EXAONE 4.0 32B·4.5 33B: RTX 3090·RTX 5090에서는 GPU에 다 올라가 쾌적하게 돌아갑니다. RTX 3060 12GB·RTX 5060 Ti 16GB에서는 가중치 일부를 시스템 RAM에 두는 부분 오프로드로 겨우 돌아갑니다. 두 경우 모두 보정된 추정입니다. RTX 4060에서도 Q4_K_M이 부분 오프로드로 올라가기는 합니다. 하지만 추정 속도가 리즈닝 모델에 적용하는 속도 하한에 조금 못 미쳐서 표에는 ‘불가’로 표시됩니다. 표에 붙은 힌트처럼 IQ4_XS로 낮추면 겨우 돌아갑니다(보정된 추정).

Solar Open 100B: 시스템 RAM이 32GB면 다섯 그래픽카드 모두 메모리가 모자라 돌릴 수 없습니다. 표에 붙은 RAM 힌트를 보면 시스템 RAM이 64GB일 때는 겨우 돌아갑니다. 이 결과는 MoE 전문가 RAM 배치 방식으로 계산한 이론 추정입니다.

M4 Pro 행: 표의 M4 Pro 줄에는 모델마다 Q4_K_M 판정이 가장 좋은 구성 가운데 메모리가 가장 작은 구성이 나옵니다. 어느 구성에서도 돌릴 수 없는 모델이면 가장 큰 구성이 나옵니다. 그래서 판정 아래의 ‘24GB 구성’ 같은 줄을 함께 봐야 합니다. EXAONE 4.0 32B는 24GB 구성에서 CPU 전용으로 겨우 돌아갑니다(이론 추정). EXAONE 4.5 33B는 48GB 구성에서 통합 메모리에 다 올라가지만, 역시 겨우 돌아갑니다(보정된 추정). 이 구성에서 EXAONE 4.5 33B의 추정 속도는 아래 판정 기준표의 ‘원활’ 기준에 조금 못 미칩니다. 표에는 반올림한 값이 표시돼서 기준과 같은 숫자로 보입니다. M4 Pro 줄의 Solar Open 100B에 64GB 구성이 나오는 것은 어느 구성에서도 Q4_K_M이 들어가지 않기 때문입니다. 여기에는 IQ4_XS로 낮추면 겨우 돌아간다는 힌트가 붙습니다. 이 힌트는 CPU 전용 방식으로 계산한 이론 추정입니다.

하드웨어별 전체 결과는 GeForce RTX 4060, GeForce RTX 3060 12GB, GeForce RTX 5060 Ti 16GB, GeForce RTX 3090, GeForce RTX 5090, Apple M4 Pro 페이지에서 볼 수 있습니다.

조금 넘칠 때 — 양자화, 시스템 RAM, 전문가 오프로드

양자화를 한 단계 낮추면 RTX 3060 12GB에서 Kanana 1.5 15.7B-A3B는 GPU에 다 올라갑니다. 하지만 RTX 5060 Ti 16GB에서 EXAONE 4.5 33B는 그래도 다 올라가지 않습니다. Solar Open 100B를 돌릴 수 있는지는 시스템 RAM 용량에 달려 있습니다.

Kanana 1.5 15.7B-A3B와 12GB 카드

RTX 3060 12GB에서 Q4_K_M은 12.1GB가 필요해 사용 가능 메모리 11.4GB를 넘습니다. CanRun 계산에서는 이럴 때 전문가 가중치를 시스템 RAM에 두는데, 그러면 겨우 돌아갑니다(이론 추정). IQ4_XS는 10.4GB라서 GPU에 다 올라가고, 쾌적하게 돌아갑니다(보정된 추정). 품질 등급도 Q4_K_M과 같은 ‘균형’입니다. 여유가 넉넉하지 않으니 ollama ps로 확인하세요. Q2_K로 낮춰도 쾌적하게 돌아가지만 품질 등급이 ‘손실 큼’이라 권하지 않습니다. 등급 설명은 ‘GGUF 양자화 등급 정리 — Q4_K_M·IQ4_XS·Q8_0 무엇을 받을까’ 가이드를 참고하세요.

GeForce RTX 3060 12GB에서 Kanana 1.5 15.7B-A3B: 양자화별 판정 (8k 컨텍스트·f16 KV 캐시)
양자화품질 등급판정속도메모리
Q8_0준무손실겨우 가능
추정 12.1 tok/s8.5–15.7이론 추정 ±30%
3.0 / 12.0GB + RAM 15.9GB
Q4_K_M균형겨우 가능
추정 19.3 tok/s13.5–25.1이론 추정 ±30%
3.0 / 12.0GB + RAM 9.6GB
IQ4_XS균형쾌적
추정 59.2 tok/s47.3–71.0보정된 추정 ±20%
11.0 / 12.0GB
Q2_K손실 큼쾌적
추정 70.1 tok/s56.1–84.1보정된 추정 ±20%
8.7 / 12.0GB

이론 추정(±30%)은 MoE 전문가를 시스템 RAM에 두는 경우처럼 아직 벤치마크로 확인하지 못한 구성에 붙습니다. 실제보다 느리게 추정했을 가능성이 큽니다.

EXAONE 4.5 33B와 16GB 카드

RTX 5060 Ti 16GB에서 EXAONE 4.5 33B의 Q4_K_M은 부분 오프로드로 겨우 돌아갑니다(보정된 추정). IQ4_XS도 19.1GB가 필요해 사용 가능 메모리 15.4GB를 넘으므로, 여전히 부분 오프로드로 돌아갑니다. Q6_K·Q8_0은 돌릴 수 없습니다. EXAONE 4.0 32B도 IQ4_XS에서 18.5GB가 필요합니다. 그러니 32B급 EXAONE은 양자화를 낮추기보다 메모리 24GB급 카드를 목표로 잡는 편이 낫습니다.

GeForce RTX 5060 Ti 16GB에서 EXAONE 4.5 33B: 양자화별 판정 (8k 컨텍스트·f16 KV 캐시)
양자화품질 등급판정속도메모리
Q8_0준무손실불가
추정 1.9 tok/s1.5–2.3보정된 추정 ±20%
16.0 / 16.0GB + RAM 20.9GB
Q6_K준무손실불가
추정 3.0 tok/s2.4–3.5보정된 추정 ±20%
16.0 / 16.0GB + RAM 12.8GB
Q4_K_M균형겨우 가능
추정 5.6 tok/s4.5–6.7보정된 추정 ±20%
16.0 / 16.0GB + RAM 5.8GB
IQ4_XS균형겨우 가능
추정 7.5 tok/s6.0–9.0보정된 추정 ±20%
16.0 / 16.0GB + RAM 3.7GB

Solar Open 100B와 전문가 오프로드

Solar Open 100B는 Q4_K_M·8k에서 64.4GB가 필요합니다. 판정 표의 MoE 모델은 Kanana 1.5 15.7B-A3B와 Solar Open 100B입니다. 두 모델이 GPU에 다 올라가지 않으면, CanRun은 전문가 가중치를 전부 시스템 RAM에 두고 나머지만 GPU에 올린다고 보고 계산합니다. 그래서 시스템 RAM이 32GB면 표의 어느 그래픽카드에서도 들어가는 양자화가 없고, 64GB면 겨우 돌아갑니다. 이 값은 이론 추정이라 실제보다 느리게 나왔을 가능성이 큽니다. 자세한 결과는 Solar Open 100B 페이지에서 볼 수 있습니다.

전문가 일부만 GPU에 두고 나머지를 RAM에 두는 방식은 CanRun이 계산하지 않습니다. llama.cpp 서버 README에 따르면 --cpu-moe는 MoE 가중치를 전부 CPU 쪽에 두고, --n-cpu-moe N은 앞쪽 N개 층의 MoE 가중치만 CPU 쪽에 둡니다. Ollama FAQ에는 이런 전문가 배치 옵션이 나오지 않습니다.

실행 명령 (Windows 먼저)

Ollama는 감지한 GPU 메모리가 24GiB 미만이면 4k, 24~48GiB면 32k, 48GiB 이상이면 256k 토큰을 기본 컨텍스트 길이로 씁니다 (Ollama 문서, 2026-09-29 확인). 그래서 8k 컨텍스트는 직접 지정해야 합니다. RTX 3060 12GB에서 Kanana 1.5 15.7B-A3B IQ4_XS를 돌린다면, 먼저 트레이에 있는 Ollama 앱을 종료합니다. 그다음 PowerShell에서 $env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve로 서버를 띄우고, 다른 창에서 ollama run hf.co/mradermacher/kanana-1.5-15.7b-a3b-instruct-GGUF:IQ4_XS를 실행합니다. hf.co/… 주소 형식은 Hugging Face 문서를 따랐습니다. macOS·Linux에서는 OLLAMA_CONTEXT_LENGTH=8192 ollama serve로 띄웁니다. Windows에서 이 설정을 계속 쓰려면 ‘계정의 환경 변수 편집’에서 이 변수를 추가하고 Ollama를 다시 실행하세요. 관리자 권한은 필요 없습니다. llama.cpp라면 llama-server -hf mradermacher/kanana-1.5-15.7b-a3b-instruct-GGUF:IQ4_XS -c 8192 -ngl all -fa on으로 실행합니다.

EXAONE을 돌리기 전에는 llama.cpp 버전부터 확인하세요. LG의 EXAONE 4.0·4.5 GGUF 카드에 필요한 최소 빌드가 각각 적혀 있습니다. Ollama에서 EXAONE이 로드되는지는 CanRun이 시험해 보지 않았습니다. Ollama를 최신 버전으로 업데이트한 뒤 실행해 보고, ollama ps로 GPU에 다 올라갔는지 확인하세요.

이 숫자는 얼마나 확실한가

CanRun이 보정에 쓰는 공개 벤치마크 가운데 한국 모델을 잰 자료는 아직 없습니다. 그래서 이 글의 속도는 모두 추정입니다. 보정된 추정의 오차 범위는 NVIDIA·AMD 그래픽카드에 dense 모델을 다 올릴 때 ±12%, MoE·부분 오프로드·맥에서 ±20%입니다. 이론 추정은 ±30%입니다. 표에서 속도가 이론 추정으로 나오는 이유는 세 가지입니다.

  • HyperCLOVA X SEED Think 14B의 모든 구성: 공식 llama.cpp가 이 모델을 지원하는지 확인되지 않았습니다.
  • RTX 4060·RTX 3060 12GB의 Kanana 1.5 15.7B-A3B, Solar Open 100B의 RAM 힌트: 전문가를 시스템 RAM에 두는 방식은 검증할 공개 벤치마크 결과가 없습니다. CanRun이 이 방식의 속도를 낮게 계산하는 편이라, 실제보다 느리게 나왔을 가능성이 큽니다.
  • M4 Pro에서 CPU 전용으로 계산한 경우(24GB 구성 EXAONE 4.0 32B, 64GB 구성 Solar 힌트): 통합 메모리 기기에서 CPU로만 돌리는 경우는 아직 검증하지 못했습니다.

판정 표 아래에 붙은 ‘보수적’ 주석은 두 번째 경우를 말합니다. HyperCLOVA X SEED Think 14B에는 해당하지 않습니다.

리즈닝 모델(EXAONE 4.0 32B·4.5 33B, HyperCLOVA X SEED Think 14B)은 답하기 전에 생각 과정을 먼저 출력합니다. 그래서 CanRun은 이 모델들에 속도 기준을 1.5배 엄격하게 적용합니다. 아래 기준표는 리즈닝 모델이 아닌 경우의 기본 기준입니다. RTX 4060에서 EXAONE 4.0 32B가 ‘불가’로 나오는 것도 Q4_K_M 추정 속도가 리즈닝 모델의 속도 하한에 조금 못 미치기 때문입니다. RTX 3060 12GB에서 HyperCLOVA X SEED Think 14B가 ‘쾌적’이 아닌 ‘원활’로 나오는 것도 같은 이유입니다(이론 추정). 리즈닝 모드를 끄고 쓴다면 이렇게 엄격한 기준까지는 필요 없어서, 판정이 실제보다 낮게 나올 수 있습니다. 모드를 끄는 방법은 모델 카드를 참고하세요.

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

메모리 수치는 공식으로 계산한 값입니다. 파일 크기는 Hugging Face에 올라온 실제 GGUF 크기를, KV 캐시는 모델 config를 바탕으로 합니다. 다만 앞에서 말한 두 가지는 빠져 있습니다. EXAONE 4.0 32B·4.5 33B의 슬라이딩 윈도 층 KV와 EXAONE 4.5의 비전 프로젝터입니다. 어느 런타임 빌드가 모델을 지원하는지, Ollama가 실제로 모델을 GPU와 CPU에 어떻게 나눠 올리는지는 CanRun이 확인할 수 없습니다. ollama ps를 실행해 PROCESSOR 열이 100% GPU인지, CPU/GPU 비율로 나뉘어 있는지 보세요(Ollama FAQ 참고).

더 알아보려면 다음 페이지를 보세요.

자주 묻는 질문

한국 오픈 LLM을 돌리려면 메모리가 얼마나 필요한가요?

Q4_K_M·8k 기준으로 EXAONE 4.0 1.2B는 1.9GB, Solar Open 100B는 64.4GB가 필요합니다. 판정 표의 나머지 한국 모델 여섯 종은 그 사이에 있습니다. Solar Open 2는 IQ4_XS로도 137.2GB가 필요합니다. 이 값을 카드 상자에 적힌 용량이 아니라 사용 가능 메모리와 비교하세요. 자세한 내용은 ‘로컬 LLM 사양 — VRAM 8~32GB로 돌릴 수 있는 모델 (2026)’ 가이드와 ‘맥에서 로컬 LLM 돌리기 — M4·M5 통합 메모리는 얼마나 필요할까’ 가이드에 있습니다.

EXAONE·Kanana·HyperCLOVA X SEED·Solar를 상업적으로 써도 되나요?

모델마다 다릅니다. EXAONE 세 모델은 비상업 라이선스(EXAONE AI Model License 1.2 NC)이고, Kanana 1.5 8B는 Apache-2.0입니다. Kanana 1.5 15.7B-A3B와 HyperCLOVA X SEED, Solar는 제작사마다 따로 정한 약관을 따릅니다. CanRun의 라이선스 배지는 법률 조언이 아닙니다. 상업적으로 쓰기 전에 모델 카드에 연결된 라이선스 원문을 꼭 읽어 보세요.

한국 모델은 Ollama와 llama.cpp에서 돌아가나요?

대부분은 llama.cpp 계열 도구에서 쓸 수 있는 GGUF 파일이 있어 돌려 볼 수 있습니다. 다만 CanRun이 직접 시험해 보지는 않았습니다. 예외는 HyperCLOVA X SEED Think 14B입니다. GGUF 카드에서 네이버 클라우드의 llama.cpp 포크를 쓰라고 안내하고 있어, 공식 llama.cpp와 Ollama에서 돌아가는지는 확인되지 않았습니다. Solar Open 2도 커뮤니티 GGUF만 있고 선형 어텐션을 섞은 구조라서, 쓰려는 런타임이 지원하는지 따로 확인해야 합니다. EXAONE은 LG 공식 GGUF가 있습니다. 카드에 적힌 최소 llama.cpp 빌드 이상으로 먼저 업데이트하세요.

Kanana 1.5 15.7B-A3B는 16GB 카드에서 쾌적한데 EXAONE 4.0 32B는 왜 아닌가요?

메모리에 다 들어가느냐 아니냐의 차이입니다. Kanana 1.5 15.7B-A3B는 8k에서 12.1GB가 필요해, RTX 5060 Ti 16GB의 사용 가능 메모리 15.4GB 안에 들어갑니다. 그래서 쾌적하게 돌아갑니다(보정된 추정). EXAONE 4.0 32B는 20.5GB가 필요해 다 들어가지 않습니다. CanRun 계산으로는 가중치 일부를 시스템 RAM에 두는 부분 오프로드로 겨우 돌아갑니다(보정된 추정). MoE인 Kanana는 토큰마다 약 3B 파라미터만 계산하므로 GPU에 다 올라가면 빠릅니다. 반면 dense 모델은 일부만 넘쳐도 느린 시스템 RAM 때문에 속도가 크게 떨어집니다.

내 PC에는 어떤 한국 모델을 고르면 되나요?

8k 필요 메모리가 카드의 사용 가능 메모리보다 조금 작은 모델 가운데 가장 큰 모델을 고르고, 그다음 라이선스를 확인하세요. 12GB 카드와 16GB 카드에서는 Kanana 1.5 15.7B-A3B에 맞는 양자화가 다릅니다.

  • 12GB(RTX 3060 12GB): Q4_K_M 대신 IQ4_XS로 낮추면 Kanana 1.5 15.7B-A3B가 GPU에 다 올라가 쾌적하게 돌아갑니다(보정된 추정).
  • 16GB(RTX 5060 Ti 16GB): Kanana 1.5 15.7B-A3B를 Q4_K_M 그대로 쾌적하게 돌릴 수 있습니다(보정된 추정).

모델끼리 품질을 비교하려면 각 제작사가 모델 카드에 올린 평가 결과를 보세요.

출처

이 페이지의 속도는 오차 범위와 신뢰 라벨을 붙인 추정치이거나, 출처를 밝힌 공개 벤치마크 결과입니다. 판정은 표마다 적어 둔 구성을 기준으로 합니다.