Apple M4에서 Qwen3 30B-A3B (2507) 돌릴 수 있을까?
원활Q4_K_M 파일이 통합 메모리에 올라갑니다. GPU가 쓸 수 있는 22.4GB 중 19.9GB를 씁니다. 판정: 원활, 속도: 추정 12.8 tok/s (10.2–15.4, 보정된 추정 ±20%).
통합 메모리 32GB · 120.0 GB/s · FP16 8.5 TFLOPS. 8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. 판정은 메모리 용량별로 보여 줍니다.
메모리 용량별 판정
이 페이지는 32GB 구성 기준입니다. 다른 용량은 아래와 같습니다.
- 16GB불가
- 24GB겨우 가능추정 12.8 tok/s (9.0–16.6, 이론 추정 ±30%)
- 32GB원활추정 12.8 tok/s (10.2–15.4, 보정된 추정 ±20%)
Apple M4에서 Qwen3 30B-A3B (2507): 양자화별 판정
| 양자화 | 파일 크기 | 판정 | 속도 | 메모리 | 실행 방식 | 참고 |
|---|---|---|---|---|---|---|
| Q2_K | 11.26GB | 원활 | 추정 17.8 tok/s14.2–21.3보정된 추정 ±20% | 12.6 / 22.4GB | 통합 메모리 | — |
| IQ4_XS | 16.38GB | 원활 | 추정 14.0 tok/s11.2–16.8보정된 추정 ±20% | 17.8 / 22.4GB | 통합 메모리 | — |
| Q4_K_M기준 | 18.56GB | 원활 | 추정 12.8 tok/s10.2–15.4보정된 추정 ±20% | 19.9 / 22.4GB | 통합 메모리 | — |
| Q8_0 | 32.48GB | 불가 | — | 약 33.9GB가 필요한데, 여유 메모리는 28.0GB입니다(GPU가 쓸 수 있는 양 22.4GB). | — | — |
Q4_K_M 기준 메모리 사용 내역
- 가중치
- 18.6GB
- KV 캐시
- 0.8GB
- 연산 버퍼
- 0.6GB
- 여유
- 2.5GB
- GPU가 못 쓰는 영역
- 9.6GB
컨텍스트 길이와 KV 캐시
| 컨텍스트 | KV f16 | KV q8_0 | KV q4_0 |
|---|---|---|---|
| 4k | 19.5GB원활 추정 14.9 tok/s11.9–17.9보정된 추정 ±20% | 19.3GB원활 추정 16.2 tok/s13.0–19.4보정된 추정 ±20% | 19.2GB원활 추정 17.0 tok/s13.6–20.3보정된 추정 ±20% |
| 8k | 19.9GB원활 추정 12.8 tok/s10.2–15.4보정된 추정 ±20% | 19.6GB원활 추정 14.8 tok/s11.8–17.7보정된 추정 ±20% | 19.4GB원활 추정 16.1 tok/s12.9–19.3보정된 추정 ±20% |
| 16k | 20.8GB원활 추정 9.9 tok/s8.0–11.9보정된 추정 ±20% | 20.1GB원활 추정 12.5 tok/s10.0–15.1보정된 추정 ±20% | 19.7GB원활 추정 14.6 tok/s11.7–17.5보정된 추정 ±20% |
| 32k | 21.8GB겨우 가능 추정 6.9 tok/s4.8–8.9이론 추정 ±30% | 21.1GB원활 추정 9.6 tok/s7.7–11.6보정된 추정 ±20% | 20.3GB원활 추정 12.3 tok/s9.8–14.8보정된 추정 ±20% |
| 64k | 25.0GB겨우 가능 추정 4.3 tok/s3.0–5.5이론 추정 ±30% | 22.0GB겨우 가능 추정 6.6 tok/s4.6–8.6이론 추정 ±30% | 21.5GB원활 추정 9.4 tok/s7.5–11.2보정된 추정 ±20% |
| 128k | 33.1GB미탑재 | 25.5GB겨우 가능 추정 4.0 tok/s2.8–5.3이론 추정 ±30% | 22.2GB겨우 가능 추정 6.3 tok/s4.4–8.2이론 추정 ±30% |
| 256k | 47.2GB미탑재 | 35.2GB미탑재 | 25.9GB겨우 가능 추정 3.8 tok/s2.7–5.0이론 추정 ±30% |
S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가
Q4_K_M 기준으로 판정(원활)이 유지되는 컨텍스트는 f16 KV 캐시에서 16k, q8_0에서 32k까지입니다.
예상 속도
- 생성
- 추정 12.8 tok/s (10.2–15.4, 보정된 추정 ±20%)
- 프롬프트 처리
- 약 383 tok/s (230–536, 대략적 추정 ±40%)
이 조합의 벤치마크 결과
이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.
다른 선택지
Apple M4 Pro에서 Qwen3 30B-A3B (2507)
쾌적Q4_K_M: 쾌적, 추정 29.1 tok/s (23.3–34.9, 보정된 추정 ±20%)
실행 방법
Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.
파일: Qwen3-30B-A3B-Instruct-2507-Q4_K_M.gguf (18.56GB, unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF).
llama-server -hf unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF:Q4_K_M -c 8192 -ngl all -fa on- -ngl all: 모든 층을 GPU에 올립니다.
- -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
- --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.43GB로 줄어듭니다.
터미널:
OLLAMA_CONTEXT_LENGTH=8192 ollama serve
ollama run hf.co/unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF:Q4_K_M- Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
/set parameter num_ctx 8192
관련 페이지
자주 묻는 질문
Apple M4에서 Qwen3 30B-A3B (2507) 돌릴 수 있나요?
Q4_K_M 파일이 통합 메모리에 올라갑니다. GPU가 쓸 수 있는 22.4GB 중 19.9GB를 씁니다. 판정: 원활, 속도: 추정 12.8 tok/s (10.2–15.4, 보정된 추정 ±20%). Q4_K_M에는 8k 컨텍스트 기준 19.9GB가 필요하고, 통합 메모리 중 GPU가 쓸 수 있는 양은 22.4GB입니다.
Apple M4에서 Qwen3 30B-A3B (2507) 컨텍스트는 얼마까지 쓸 수 있나요?
Q4_K_M 기준으로 판정(원활)이 유지되는 컨텍스트는 f16 KV 캐시에서 16k(KV 1.6GB), q8_0 KV 캐시에서 32k(KV 1.7GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 256k입니다.
어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?
추천 파일은 Q4_K_M(18.56GB)입니다. 판정: 원활, 속도: 추정 12.8 tok/s (10.2–15.4, 보정된 추정 ±20%). 같은 판정이 나오는 파일 가운데 가장 큰 파일이기도 합니다.
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.