Apple M5에서 돌아가는 로컬 LLM
통합 메모리: 기본 설정에서는 GPU가 약 70%까지 쓸 수 있습니다
8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. 판정은 메모리 용량별로 보여 줍니다.
사양
- 메모리 구성
- 16GB · 24GB · 32GB
- 메모리 대역폭
- 153.6 GB/s
- FP16 연산
- 10.0 TFLOPS
- 출시 연도
- 2025
판정 요약
Q4_K_M(없으면 가장 가까운 양자화), 8k 컨텍스트 기준입니다.
- 16GB쾌적2개원활8개겨우 가능3개불가16개양자화를 더 낮추면 3개가 더 돌아갑니다.
- 24GB쾌적2개원활10개겨우 가능7개불가10개양자화를 더 낮추면 3개가 더 돌아갑니다.
- 32GB쾌적2개원활12개겨우 가능9개불가6개양자화를 더 낮추면 1개가 더 돌아갑니다.
판정 읽는 법
- 쾌적
- GPU에 전부 올라가고 20 tok/s 이상
- 원활
- GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
- 겨우 가능
- 2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
- 불가
- 메모리에 안 들어가거나 2 tok/s 미만
한국 모델
EXAONE, HyperCLOVA X SEED, Kanana, Solar가 이 기기에서 어떻게 돌아가는지 보여 줍니다.
Apple M5 전체 모델 판정
옆으로 밀면 모든 열을 볼 수 있습니다.
| 모델 | 판정 | 속도 | 양자화 | 메모리 | 실행 방식 | 컨텍스트 | 참고 |
|---|---|---|---|---|---|---|---|
| EXAONE 4.0 1.2B | 쾌적 | 추정 70.2 tok/s56.1–84.2보정된 추정 ±20% | Q4_K_M | 1.9 / 22.4GB | 통합 메모리 | 최대 32k | — |
| HyperCLOVA X SEED 1.5B | 쾌적 | 추정 50.8 tok/s40.6–60.9보정된 추정 ±20% | Q4_K_M | 2.4 / 22.4GB | 통합 메모리 | 최대 16k | — |
| gpt-oss-20b | 원활 | 추정 20.1 tok/s16.1–24.2보정된 추정 ±20% | MXFP4 | 12.9 / 22.4GB | 통합 메모리 | 최대 64k |
|
| Qwen3 30B-A3B (2507) | 원활 | 추정 16.4 tok/s13.1–19.7보정된 추정 ±20% | Q4_K_M | 19.9 / 22.4GB | 통합 메모리 | 최대 16k |
|
| Gemma 4 26B-A4B | 원활 | 추정 15.9 tok/s12.8–19.1보정된 추정 ±20% | Q4_K_M | 17.9 / 22.4GB | 통합 메모리 | 최대 64k |
|
| DeepSeek R1 Distill Llama 8B | 원활 | 추정 15.4 tok/s12.3–18.5보정된 추정 ±20% | Q4_K_M | 6.6 / 22.4GB | 통합 메모리 | 최대 16k |
|
| Kanana 1.5 8B | 원활 | 추정 15.4 tok/s12.3–18.5보정된 추정 ±20% | Q4_K_M | 6.6 / 22.4GB | 통합 메모리 | 최대 32k |
|
| Llama 3.1 8B | 원활 | 추정 15.4 tok/s12.3–18.5보정된 추정 ±20% | Q4_K_M | 6.6 / 22.4GB | 통합 메모리 | 최대 32k |
|
| Kanana 1.5 15.7B-A3B | 원활 | 추정 15.0 tok/s12.0–18.0보정된 추정 ±20% | Q4_K_M | 12.1 / 22.4GB | 통합 메모리 | 최대 16k | — |
| Qwen3.5 9B | 원활 | 추정 15.0 tok/s12.0–18.0보정된 추정 ±20% | Q4_K_M | 6.7 / 22.4GB | 통합 메모리 | 최대 128k | — |
| Qwen3 8B | 원활 | 추정 14.8 tok/s11.8–17.7보정된 추정 ±20% | Q4_K_M | 6.8 / 22.4GB | 통합 메모리 | 최대 32k |
|
| Gemma 4 12B | 원활 | 추정 12.0 tok/s9.6–14.4보정된 추정 ±20% | Q4_K_M | 8.2 / 22.4GB | 통합 메모리 | 최대 64k | — |
| Gemma 3 12B | 원활 | 추정 11.8 tok/s9.4–14.1보정된 추정 ±20% | Q4_K_M | 8.4 / 22.4GB | 통합 메모리 | 최대 32k | — |
| Qwen3 14B | 원활 | 추정 8.9 tok/s7.1–10.7보정된 추정 ±20% | Q4_K_M | 10.9 / 22.4GB | 통합 메모리 | 최대 8k | — |
| Qwen3.5 35B-A3B | 겨우 가능 | 추정 22.4 tok/s15.7–29.1이론 추정 ±30% | Q4_K_M | RAM 22.8GB | CPU 전용 | 최대 256k |
|
| HyperCLOVA X SEED Think 14B | 겨우 가능 | 추정 9.0 tok/s6.3–11.8이론 추정 ±30% | Q4_K_M | 10.8 / 22.4GB | 통합 메모리 | 최대 64k |
|
| Phi-4 | 겨우 가능 | 추정 8.6 tok/s6.9–10.3보정된 추정 ±20% | Q4_K_M | 11.3 / 22.4GB | 통합 메모리 | 최대 16k |
|
| Mistral Small 3.2 24B | 겨우 가능 | 추정 5.9 tok/s4.7–7.1보정된 추정 ±20% | Q4_K_M | 16.2 / 22.4GB | 통합 메모리 | 최대 32k |
|
| Gemma 3 27B | 겨우 가능 | 추정 5.4 tok/s4.3–6.4보정된 추정 ±20% | Q4_K_M | 17.8 / 22.4GB | 통합 메모리 | 최대 32k |
|
| Qwen3.5 27B | 겨우 가능 | 추정 5.2 tok/s4.2–6.3보정된 추정 ±20% | Q4_K_M | 18.2 / 22.4GB | 통합 메모리 | 최대 32k | — |
| EXAONE 4.0 32B | 겨우 가능 | 추정 4.6 tok/s3.7–5.6보정된 추정 ±20% | Q4_K_M | 20.5 / 22.4GB | 통합 메모리 | 최대 32k |
|
| EXAONE 4.5 33B | 겨우 가능 | 추정 4.5 tok/s3.6–5.4보정된 추정 ±20% | Q4_K_M | 21.2 / 22.4GB | 통합 메모리 | 최대 16k |
|
| Qwen3 32B | 겨우 가능 | 추정 2.4 tok/s1.7–3.2이론 추정 ±30% | Q4_K_M | RAM 21.9GB | CPU 전용 | 최대 16k | — |
| DeepSeek R1 Distill Qwen 32B | 불가Q2_K (품질 손실 큼): 겨우 가능 | 추정 6.4 tok/s5.1–7.6보정된 추정 ±20% | Q2_K | 15.0 / 22.4GB | 통합 메모리 | 최대 32k |
|
| gpt-oss-120b | 불가 | — | MXFP4 | 64.3GB 필요 | — | — |
|
| Llama 3.3 70B | 불가 | — | Q4_K_M | 45.8GB 필요 | — | — |
|
| Qwen3.5 122B-A10B | 불가 | — | Q4_K_M | 79.0GB 필요 | — | — |
|
| Solar Open 100B | 불가 | — | Q4_K_M | 64.4GB 필요 | — | — |
|
| Solar Open 2 250B | 불가 | — | IQ4_XS | 137.2GB 필요 | — | — |
|
리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).
메모리 용량별 판정
| 모델 | 16GB | 24GB | 32GB |
|---|---|---|---|
| EXAONE 4.0 1.2B | 쾌적 | 쾌적 | 쾌적 |
| HyperCLOVA X SEED 1.5B | 쾌적 | 쾌적 | 쾌적 |
| gpt-oss-20b | 불가 | 원활 | 원활 |
| Qwen3 30B-A3B (2507) | 불가 | 겨우 가능 | 원활 |
| Gemma 4 26B-A4B | 불가 | 겨우 가능 | 원활 |
| DeepSeek R1 Distill Llama 8B | 원활 | 원활 | 원활 |
| Kanana 1.5 8B | 원활 | 원활 | 원활 |
| Llama 3.1 8B | 원활 | 원활 | 원활 |
| Kanana 1.5 15.7B-A3B | 겨우 가능 | 원활 | 원활 |
| Qwen3.5 9B | 원활 | 원활 | 원활 |
| Qwen3 8B | 원활 | 원활 | 원활 |
| Gemma 4 12B | 원활 | 원활 | 원활 |
| Gemma 3 12B | 원활 | 원활 | 원활 |
| Qwen3 14B | 원활 | 원활 | 원활 |
| Qwen3.5 35B-A3B | 불가 | 불가 | 겨우 가능 |
| HyperCLOVA X SEED Think 14B | 겨우 가능 | 겨우 가능 | 겨우 가능 |
| Phi-4 | 겨우 가능 | 겨우 가능 | 겨우 가능 |
| Mistral Small 3.2 24B | 불가 | 겨우 가능 | 겨우 가능 |
| Gemma 3 27B | 불가 | 겨우 가능 | 겨우 가능 |
| Qwen3.5 27B | 불가 | 겨우 가능 | 겨우 가능 |
| EXAONE 4.0 32B | 불가 | 불가 | 겨우 가능 |
| EXAONE 4.5 33B | 불가 | 불가 | 겨우 가능 |
| Qwen3 32B | 불가 | 불가 | 겨우 가능 |
| DeepSeek R1 Distill Qwen 32B | 불가 | 불가 | 불가 |
| gpt-oss-120b | 불가 | 불가 | 불가 |
| Llama 3.3 70B | 불가 | 불가 | 불가 |
| Qwen3.5 122B-A10B | 불가 | 불가 | 불가 |
| Solar Open 100B | 불가 | 불가 | 불가 |
| Solar Open 2 250B | 불가 | 불가 | 불가 |
Apple M5 벤치마크 결과
이 기기로 잰 공개 벤치마크 결과는 아직 없습니다.
자주 묻는 질문
Apple M5에 통째로 올라가는 가장 큰 모델은 무엇인가요?
Qwen3.5 35B-A3B IQ4_XS(18.17GB 파일)입니다. 8k 컨텍스트에서 통합 메모리 32GB에 전부 올라가고, 속도는 추정 27.4 tok/s (21.9–32.8, 보정된 추정 ±20%)입니다.
Apple M5에서 원활하게 돌아가는 로컬 LLM은 몇 개인가요?
Q4_K_M·8k 컨텍스트, 메모리 32GB 기준으로 등록된 모델 29개를 보면 쾌적 2개, 원활 12개, 겨우 가능 9개, 불가 6개입니다.
Apple M5에서 Llama 3.3 70B 같은 70B 모델을 돌릴 수 있나요?
아니요. Llama 3.3 70B Q4_K_M에는 약 45.8GB가 필요한데, 이 구성의 GPU 메모리는 22.4GB, 여유 시스템 RAM은 28.0GB입니다.
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.