DDR5-6000 듀얼채널 CPU에서 돌아가는 로컬 LLM

GPU 없음: 모델 전체를 시스템 RAM에서 돌립니다

CPU만으로 추론한다고 보고, RAM 4GB는 OS 몫으로 뺐습니다. 8k 컨텍스트와 f16 KV 캐시 기준이며, 판정은 RAM 용량별로 보여 줍니다.

사양

메모리 구성
16GB · 32GB · 64GB · 96GB
메모리 대역폭
96.0 GB/s
출시 연도
2022

판정 요약

Q4_K_M(없으면 가장 가까운 양자화), 8k 컨텍스트 기준입니다.

  • 16GB쾌적0개원활0개겨우 가능13개불가16개양자화를 더 낮추면 3개가 더 돌아갑니다.
  • 32GB쾌적0개원활0개겨우 가능21개불가8개양자화를 더 낮추면 1개가 더 돌아갑니다.
  • 64GB쾌적0개원활0개겨우 가능21개불가8개양자화를 더 낮추면 3개가 더 돌아갑니다.
  • 96GB쾌적0개원활0개겨우 가능24개불가5개양자화를 더 낮추면 1개가 더 돌아갑니다.

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

한국 모델

EXAONE, HyperCLOVA X SEED, Kanana, Solar가 이 기기에서 어떻게 돌아가는지 보여 줍니다.

DDR5-6000 듀얼채널 CPU 전체 모델 판정

옆으로 밀면 모든 열을 볼 수 있습니다.

모델 29개(판정·속도 순), 메모리 96GB
모델판정속도양자화메모리실행 방식컨텍스트참고
EXAONE 4.0 1.2B
겨우 가능
추정 36.5 tok/s29.2–43.9보정된 추정 ±20%
Q4_K_MRAM 1.3GBCPU 전용최대 64k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
HyperCLOVA X SEED 1.5B
겨우 가능
추정 26.4 tok/s21.2–31.7보정된 추정 ±20%
Q4_K_MRAM 1.8GBCPU 전용최대 16k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
Qwen3.5 35B-A3B
겨우 가능
추정 20.1 tok/s16.1–24.1보정된 추정 ±20%
Q4_K_MRAM 22.8GBCPU 전용최대 256k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
gpt-oss-20b
겨우 가능
추정 18.0 tok/s14.4–21.7보정된 추정 ±20%
MXFP4RAM 12.3GBCPU 전용최대 128k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
  • 리즈닝 모델
Qwen3 30B-A3B (2507)
겨우 가능
추정 14.7 tok/s11.7–17.6보정된 추정 ±20%
Q4_K_MRAM 19.4GBCPU 전용최대 128k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
Gemma 4 26B-A4B
겨우 가능
추정 14.3 tok/s11.4–17.1보정된 추정 ±20%
Q4_K_MRAM 17.3GBCPU 전용최대 256k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
Kanana 1.5 15.7B-A3B
겨우 가능
추정 13.5 tok/s10.8–16.1보정된 추정 ±20%
Q4_K_MRAM 11.5GBCPU 전용최대 32k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
gpt-oss-120b
겨우 가능
추정 13.4 tok/s10.8–16.1보정된 추정 ±20%
MXFP4RAM 63.7GBCPU 전용최대 128k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
  • 리즈닝 모델
DeepSeek R1 Distill Llama 8B
겨우 가능
추정 8.0 tok/s6.4–9.6보정된 추정 ±20%
Q4_K_MRAM 6.0GBCPU 전용최대 64k
  • 리즈닝 모델
Kanana 1.5 8B
겨우 가능
추정 8.0 tok/s6.4–9.6보정된 추정 ±20%
Q4_K_MRAM 6.0GBCPU 전용최대 32k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
Llama 3.1 8B
겨우 가능
추정 8.0 tok/s6.4–9.6보정된 추정 ±20%
Q4_K_MRAM 6.0GBCPU 전용최대 128k
  • CPU로만 추론하므로 겨우 돌아가는 수준을 넘지 못합니다.
Qwen3.5 9B
겨우 가능
추정 7.8 tok/s6.3–9.4보정된 추정 ±20%
Q4_K_MRAM 6.1GBCPU 전용최대 256k—
Qwen3 8B
겨우 가능
추정 7.7 tok/s6.2–9.2보정된 추정 ±20%
Q4_K_MRAM 6.2GBCPU 전용최대 32k—
Qwen3.5 122B-A10B
겨우 가능
추정 6.4 tok/s5.1–7.7보정된 추정 ±20%
Q4_K_MRAM 78.5GBCPU 전용최대 256k—
Gemma 4 12B
겨우 가능
추정 6.3 tok/s5.0–7.5보정된 추정 ±20%
Q4_K_MRAM 7.7GBCPU 전용최대 128k—
Gemma 3 12B
겨우 가능
추정 6.1 tok/s4.9–7.3보정된 추정 ±20%
Q4_K_MRAM 7.8GBCPU 전용최대 128k—
HyperCLOVA X SEED Think 14B
겨우 가능
추정 4.7 tok/s3.3–6.1이론 추정 ±30%
Q4_K_MRAM 10.2GBCPU 전용최대 32k
  • 리즈닝 모델
Solar Open 100B
겨우 가능
추정 4.6 tok/s3.7–5.6보정된 추정 ±20%
Q4_K_MRAM 63.9GBCPU 전용최대 64k—
Qwen3 14B
겨우 가능
추정 4.6 tok/s3.7–5.6보정된 추정 ±20%
Q4_K_MRAM 10.3GBCPU 전용최대 32k—
Phi-4
겨우 가능
추정 4.5 tok/s3.6–5.4보정된 추정 ±20%
Q4_K_MRAM 10.7GBCPU 전용최대 16k
  • 리즈닝 모델
Mistral Small 3.2 24B
겨우 가능
추정 3.1 tok/s2.5–3.7보정된 추정 ±20%
Q4_K_MRAM 15.7GBCPU 전용최대 32k—
Gemma 3 27B
겨우 가능
추정 2.8 tok/s2.2–3.3보정된 추정 ±20%
Q4_K_MRAM 17.2GBCPU 전용최대 64k—
Qwen3.5 27B
겨우 가능
추정 2.7 tok/s2.2–3.3보정된 추정 ±20%
Q4_K_MRAM 17.6GBCPU 전용최대 64k—
Qwen3 32B
겨우 가능
추정 2.2 tok/s1.8–2.6보정된 추정 ±20%
Q4_K_MRAM 21.9GBCPU 전용최대 8k—
DeepSeek R1 Distill Qwen 32B
불가Q2_K (품질 손실 큼): 겨우 가능
추정 3.3 tok/s2.7–4.0보정된 추정 ±20%
Q2_KRAM 14.5GBCPU 전용최대 8k
  • 리즈닝 모델
EXAONE 4.0 32B
불가
추정 2.4 tok/s1.9–2.9보정된 추정 ±20%
Q4_K_MRAM 19.9GBCPU 전용—
  • 메모리에는 들어가지만 너무 느려서 실제로 쓰기 어렵습니다.
  • 리즈닝 모델
EXAONE 4.5 33B
불가
추정 2.3 tok/s1.9–2.8보정된 추정 ±20%
Q4_K_MRAM 20.6GBCPU 전용—
  • 메모리에는 들어가지만 너무 느려서 실제로 쓰기 어렵습니다.
  • 리즈닝 모델
Llama 3.3 70B
불가
추정 1.1 tok/s0.8–1.3보정된 추정 ±20%
Q4_K_MRAM 45.2GBCPU 전용—
  • 메모리에는 들어가지만 너무 느려서 실제로 쓰기 어렵습니다.
Solar Open 2 250B
불가
—IQ4_XS136.6GB 필요——
  • 약 136.6GB가 필요한데, 여유 RAM은 92.0GB입니다.

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

메모리 용량별 판정

메모리 구성별 Q4_K_M 판정입니다. 속도는 모델 페이지에서 확인하세요.
모델16GB32GB64GB96GB
EXAONE 4.0 1.2B겨우 가능겨우 가능겨우 가능겨우 가능
HyperCLOVA X SEED 1.5B겨우 가능겨우 가능겨우 가능겨우 가능
Qwen3.5 35B-A3B불가겨우 가능겨우 가능겨우 가능
gpt-oss-20b불가겨우 가능겨우 가능겨우 가능
Qwen3 30B-A3B (2507)불가겨우 가능겨우 가능겨우 가능
Gemma 4 26B-A4B불가겨우 가능겨우 가능겨우 가능
Kanana 1.5 15.7B-A3B겨우 가능겨우 가능겨우 가능겨우 가능
gpt-oss-120b불가불가불가겨우 가능
DeepSeek R1 Distill Llama 8B겨우 가능겨우 가능겨우 가능겨우 가능
Kanana 1.5 8B겨우 가능겨우 가능겨우 가능겨우 가능
Llama 3.1 8B겨우 가능겨우 가능겨우 가능겨우 가능
Qwen3.5 9B겨우 가능겨우 가능겨우 가능겨우 가능
Qwen3 8B겨우 가능겨우 가능겨우 가능겨우 가능
Qwen3.5 122B-A10B불가불가불가겨우 가능
Gemma 4 12B겨우 가능겨우 가능겨우 가능겨우 가능
Gemma 3 12B겨우 가능겨우 가능겨우 가능겨우 가능
HyperCLOVA X SEED Think 14B겨우 가능겨우 가능겨우 가능겨우 가능
Solar Open 100B불가불가불가겨우 가능
Qwen3 14B겨우 가능겨우 가능겨우 가능겨우 가능
Phi-4겨우 가능겨우 가능겨우 가능겨우 가능
Mistral Small 3.2 24B불가겨우 가능겨우 가능겨우 가능
Gemma 3 27B불가겨우 가능겨우 가능겨우 가능
Qwen3.5 27B불가겨우 가능겨우 가능겨우 가능
Qwen3 32B불가겨우 가능겨우 가능겨우 가능
DeepSeek R1 Distill Qwen 32B불가불가불가불가
EXAONE 4.0 32B불가불가불가불가
EXAONE 4.5 33B불가불가불가불가
Llama 3.3 70B불가불가불가불가
Solar Open 2 250B불가불가불가불가

DDR5-6000 듀얼채널 CPU 벤치마크 결과

이 기기로 잰 공개 벤치마크 결과는 아직 없습니다.

자주 묻는 질문

이 CPU 구성에서 돌릴 수 있는 가장 큰 모델은 무엇인가요?

Qwen3.5 122B-A10B Q4_K_M(78.26GB 파일)입니다. RAM 96GB에서 돌리며, 속도는 추정 6.4 tok/s (5.1–7.7, 보정된 추정 ±20%)입니다.

DDR5-6000 듀얼채널 CPU에서 원활하게 돌아가는 로컬 LLM은 몇 개인가요?

Q4_K_M·8k 컨텍스트, 메모리 96GB 기준으로 등록된 모델 29개를 보면 쾌적 0개, 원활 0개, 겨우 가능 24개, 불가 5개입니다.

DDR5-6000 듀얼채널 CPU에서 Llama 3.3 70B 같은 70B 모델을 돌릴 수 있나요?

메모리에는 들어가지만 너무 느려서 실제로 쓰기 어렵습니다. 속도는 추정 1.1 tok/s (0.8–1.3, 보정된 추정 ±20%)입니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.