Apple M3 Ultra에서 돌아가는 로컬 LLM

통합 메모리: 기본 설정에서는 GPU가 약 70%까지 쓸 수 있습니다

8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. 판정은 메모리 용량별로 보여 줍니다.

사양

메모리 구성
96GB · 256GB · 512GB
메모리 대역폭
819.0 GB/s
FP16 연산
57.0 TFLOPS
출시 연도
2025

판정 요약

Q4_K_M(없으면 가장 가까운 양자화), 8k 컨텍스트 기준입니다.

  • 96GB쾌적22개원활4개겨우 가능2개불가1개
  • 256GB쾌적24개원활4개겨우 가능1개불가0개
  • 512GB쾌적24개원활4개겨우 가능1개불가0개

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

한국 모델

EXAONE, HyperCLOVA X SEED, Kanana, Solar가 이 기기에서 어떻게 돌아가는지 보여 줍니다.

Apple M3 Ultra 전체 모델 판정

옆으로 밀면 모든 열을 볼 수 있습니다.

모델 29개(판정·속도 순), 메모리 512GB
모델판정속도양자화메모리실행 방식컨텍스트참고
EXAONE 4.0 1.2B
쾌적
추정 274.4 tok/s219.5–329.3보정된 추정 ±20%
Q4_K_M1.9 / 358.4GB통합 메모리최대 64k—
HyperCLOVA X SEED 1.5B
쾌적
추정 198.5 tok/s158.8–238.2보정된 추정 ±20%
Q4_K_M2.4 / 358.4GB통합 메모리최대 16k—
Qwen3.5 35B-A3B
쾌적
추정 115.5 tok/s92.4–138.6보정된 추정 ±20%
Q4_K_M23.4 / 358.4GB통합 메모리최대 256k—
gpt-oss-20b
쾌적
115.5 tok/s8k 추정 103.8 tok/s (83.1–124.6, 보정된 추정 ±20%)실측 1건 (2k 컨텍스트)
MXFP412.9 / 358.4GB통합 메모리최대 128k
  • 리즈닝 모델
Qwen3 30B-A3B (2507)
쾌적
추정 84.4 tok/s67.5–101.3보정된 추정 ±20%
Q4_K_M19.9 / 358.4GB통합 메모리최대 64k—
Gemma 4 26B-A4B
쾌적
추정 82.2 tok/s65.7–98.6보정된 추정 ±20%
Q4_K_M17.9 / 358.4GB통합 메모리최대 128k—
Kanana 1.5 15.7B-A3B
쾌적
추정 77.4 tok/s61.9–92.9보정된 추정 ±20%
Q4_K_M12.1 / 358.4GB통합 메모리최대 32k—
gpt-oss-120b
쾌적
추정 77.4 tok/s61.9–92.8보정된 추정 ±20%
MXFP464.3 / 358.4GB통합 메모리최대 128k
  • 리즈닝 모델
DeepSeek R1 Distill Llama 8B
쾌적
추정 60.1 tok/s48.1–72.1보정된 추정 ±20%
Q4_K_M6.6 / 358.4GB통합 메모리최대 32k
  • 리즈닝 모델
Kanana 1.5 8B
쾌적
추정 60.1 tok/s48.1–72.1보정된 추정 ±20%
Q4_K_M6.6 / 358.4GB통합 메모리최대 32k—
Llama 3.1 8B
쾌적
추정 60.1 tok/s48.1–72.1보정된 추정 ±20%
Q4_K_M6.6 / 358.4GB통합 메모리최대 64k—
Qwen3.5 9B
쾌적
추정 58.7 tok/s47.0–70.4보정된 추정 ±20%
Q4_K_M6.7 / 358.4GB통합 메모리최대 256k—
Qwen3 8B
쾌적
추정 57.8 tok/s46.2–69.3보정된 추정 ±20%
Q4_K_M6.8 / 358.4GB통합 메모리최대 32k—
Gemma 4 12B
쾌적
추정 47.1 tok/s37.7–56.5보정된 추정 ±20%
Q4_K_M8.2 / 358.4GB통합 메모리최대 128k—
Gemma 3 12B
쾌적
추정 46.0 tok/s36.8–55.2보정된 추정 ±20%
Q4_K_M8.4 / 358.4GB통합 메모리최대 128k—
Qwen3.5 122B-A10B
쾌적
추정 36.8 tok/s29.4–44.1보정된 추정 ±20%
Q4_K_M79.0 / 358.4GB통합 메모리최대 128k—
HyperCLOVA X SEED Think 14B
쾌적
추정 35.3 tok/s24.7–46.0이론 추정 ±30%
Q4_K_M10.8 / 358.4GB통합 메모리최대 16k
  • 리즈닝 모델
Qwen3 14B
쾌적
추정 34.8 tok/s27.9–41.8보정된 추정 ±20%
Q4_K_M10.9 / 358.4GB통합 메모리최대 32k—
Phi-4
쾌적
추정 33.6 tok/s26.9–40.3보정된 추정 ±20%
Q4_K_M11.3 / 358.4GB통합 메모리최대 8k
  • 리즈닝 모델
Solar Open 2 250B
쾌적
추정 27.7 tok/s22.2–33.3보정된 추정 ±20%
IQ4_XS137.2 / 358.4GB통합 메모리최대 64k—
Solar Open 100B
쾌적
추정 26.7 tok/s21.4–32.1보정된 추정 ±20%
Q4_K_M64.4 / 358.4GB통합 메모리최대 16k—
Mistral Small 3.2 24B
쾌적
추정 23.0 tok/s18.4–27.6보정된 추정 ±20%
Q4_K_M16.2 / 358.4GB통합 메모리최대 16k—
Gemma 3 27B
쾌적
추정 20.9 tok/s16.7–25.1보정된 추정 ±20%
Q4_K_M17.8 / 358.4GB통합 메모리최대 16k—
Qwen3.5 27B
쾌적
추정 20.4 tok/s16.3–24.5보정된 추정 ±20%
Q4_K_M18.2 / 358.4GB통합 메모리최대 8k—
EXAONE 4.0 32B
원활
추정 18.1 tok/s14.5–21.8보정된 추정 ±20%
Q4_K_M20.5 / 358.4GB통합 메모리최대 128k
  • 리즈닝 모델
EXAONE 4.5 33B
원활
추정 17.5 tok/s14.0–21.0보정된 추정 ±20%
Q4_K_M21.2 / 358.4GB통합 메모리최대 128k
  • 리즈닝 모델
Qwen3 32B
원활
추정 16.4 tok/s13.2–19.7보정된 추정 ±20%
Q4_K_M22.5 / 358.4GB통합 메모리최대 32k
  • Q2_K (품질 손실 큼): 쾌적
DeepSeek R1 Distill Qwen 32B
원활
추정 16.4 tok/s13.1–19.7보정된 추정 ±20%
Q4_K_M22.6 / 358.4GB통합 메모리최대 32k
  • 리즈닝 모델
Llama 3.3 70B
겨우 가능
추정 8.0 tok/s6.4–9.6보정된 추정 ±20%
Q4_K_M45.8 / 358.4GB통합 메모리최대 128k
  • IQ4_XS: 원활

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

메모리 용량별 판정

메모리 구성별 Q4_K_M 판정입니다. 속도는 모델 페이지에서 확인하세요.
모델96GB256GB512GB
EXAONE 4.0 1.2B쾌적쾌적쾌적
HyperCLOVA X SEED 1.5B쾌적쾌적쾌적
Qwen3.5 35B-A3B쾌적쾌적쾌적
gpt-oss-20b쾌적쾌적쾌적
Qwen3 30B-A3B (2507)쾌적쾌적쾌적
Gemma 4 26B-A4B쾌적쾌적쾌적
Kanana 1.5 15.7B-A3B쾌적쾌적쾌적
gpt-oss-120b쾌적쾌적쾌적
DeepSeek R1 Distill Llama 8B쾌적쾌적쾌적
Kanana 1.5 8B쾌적쾌적쾌적
Llama 3.1 8B쾌적쾌적쾌적
Qwen3.5 9B쾌적쾌적쾌적
Qwen3 8B쾌적쾌적쾌적
Gemma 4 12B쾌적쾌적쾌적
Gemma 3 12B쾌적쾌적쾌적
Qwen3.5 122B-A10B겨우 가능쾌적쾌적
HyperCLOVA X SEED Think 14B쾌적쾌적쾌적
Qwen3 14B쾌적쾌적쾌적
Phi-4쾌적쾌적쾌적
Solar Open 2 250B불가쾌적쾌적
Solar Open 100B쾌적쾌적쾌적
Mistral Small 3.2 24B쾌적쾌적쾌적
Gemma 3 27B쾌적쾌적쾌적
Qwen3.5 27B쾌적쾌적쾌적
EXAONE 4.0 32B원활원활원활
EXAONE 4.5 33B원활원활원활
Qwen3 32B원활원활원활
DeepSeek R1 Distill Qwen 32B원활원활원활
Llama 3.3 70B겨우 가능겨우 가능겨우 가능

Apple M3 Ultra 벤치마크 결과

보정에 쓰는 공개 벤치마크입니다. 측정 조건(컨텍스트·백엔드·플래그)은 위 추정과 다를 수 있습니다.

Apple M3 Ultra 벤치마크 결과
모델양자화백엔드컨텍스트프롬프트 (tok/s)생성 (tok/s)플래그출처측정일
gpt-oss-20bMXFP4llama.cpp2k2,816.0115.5—github.com2025-08-15
llama-2-7bQ4_0llama.cpp5121,471.092.1Metalgithub.com2025-03-15

자주 묻는 질문

Apple M3 Ultra에 통째로 올라가는 가장 큰 모델은 무엇인가요?

Solar Open 2 250B IQ4_XS(136.24GB 파일)입니다. 8k 컨텍스트에서 통합 메모리 512GB에 전부 올라가고, 속도는 추정 27.7 tok/s (22.2–33.3, 보정된 추정 ±20%)입니다.

Apple M3 Ultra에서 원활하게 돌아가는 로컬 LLM은 몇 개인가요?

Q4_K_M·8k 컨텍스트, 메모리 512GB 기준으로 등록된 모델 29개를 보면 쾌적 24개, 원활 4개, 겨우 가능 1개, 불가 0개입니다.

Apple M3 Ultra에서 Llama 3.3 70B 같은 70B 모델을 돌릴 수 있나요?

Q4_K_M, 통합 메모리 기준 판정: 겨우 가능, 속도: 추정 8.0 tok/s (6.4–9.6, 보정된 추정 ±20%).

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.