Apple M4 Pro에서 Llama 3.1 8B 돌릴 수 있을까?

쾌적Q4_K_M 파일이 통합 메모리에 올라갑니다. GPU가 쓸 수 있는 16.8GB 중 6.6GB를 씁니다. 판정: 쾌적, 속도: 추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%).

통합 메모리: 기본 설정에서는 GPU가 약 70%까지 쓸 수 있습니다별도 약관 · Llama 3.1 · 상업적으로 쓰기 전 약관 확인커뮤니티 GGUF · bartowski

통합 메모리 24GB · 273.0 GB/s · FP16 17.0 TFLOPS. 8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. 판정은 메모리 용량별로 보여 줍니다.

메모리 용량별 판정

이 페이지는 24GB 구성 기준입니다. 다른 용량은 아래와 같습니다.

  • 24GB쾌적추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%)
  • 48GB쾌적추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%)
  • 64GB쾌적추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%)

Apple M4 Pro에서 Llama 3.1 8B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K3.18GB쾌적
추정 38.5 tok/s30.8–46.2보정된 추정 ±20%
4.8 / 16.8GB통합 메모리—
IQ4_XS4.45GB쾌적
추정 29.7 tok/s23.7–35.6보정된 추정 ±20%
6.1 / 16.8GB통합 메모리—
Q4_K_M기준4.92GB쾌적
추정 27.3 tok/s21.9–32.8보정된 추정 ±20%
6.6 / 16.8GB통합 메모리—
Q8_08.54GB원활
추정 17.0 tok/s13.6–20.4보정된 추정 ±20%
10.2 / 16.8GB통합 메모리—

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
통합 메모리
가중치
4.9GB
KV 캐시
1.1GB
연산 버퍼
0.6GB
여유
10.2GB
GPU가 못 쓰는 영역
7.2GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
6.0GB쾌적
추정 30.0 tok/s24.0–36.0보정된 추정 ±20%
5.7GB쾌적
추정 31.5 tok/s25.2–37.7보정된 추정 ±20%
5.6GB쾌적
추정 32.3 tok/s25.8–38.7보정된 추정 ±20%
8k
6.6GB쾌적
추정 27.3 tok/s21.9–32.8보정된 추정 ±20%
6.1GB쾌적
추정 29.8 tok/s23.8–35.8보정된 추정 ±20%
5.8GB쾌적
추정 31.3 tok/s25.1–37.6보정된 추정 ±20%
16k
7.7GB쾌적
추정 23.2 tok/s18.5–27.8보정된 추정 ±20%
6.7GB쾌적
추정 27.0 tok/s21.6–32.4보정된 추정 ±20%
6.2GB쾌적
추정 29.6 tok/s23.7–35.5보정된 추정 ±20%
32k
10.0GB원활
추정 17.8 tok/s14.2–21.3보정된 추정 ±20%
8.0GB쾌적
추정 22.7 tok/s18.2–27.2보정된 추정 ±20%
6.9GB쾌적
추정 26.7 tok/s21.3–32.0보정된 추정 ±20%
64k
14.6GB원활
추정 12.1 tok/s9.7–14.5보정된 추정 ±20%
10.6GB원활
추정 17.2 tok/s13.8–20.7보정된 추정 ±20%
8.5GB쾌적
추정 22.2 tok/s17.8–26.7보정된 추정 ±20%
128k
23.8GB미탑재
15.8GB원활
추정 11.6 tok/s9.3–13.9보정된 추정 ±20%
11.5GB원활
추정 16.7 tok/s13.3–20.0보정된 추정 ±20%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 16k, q8_0에서 32k까지입니다.

예상 속도

생성
추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%)
프롬프트 처리
약 765 tok/s (459–1,071, 대략적 추정 ±40%)

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf (4.92GB, bartowski/Meta-Llama-3.1-8B-Instruct-GGUF).

llama.cpp
llama-server -hf bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M -c 8192 -ngl all -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.57GB로 줄어듭니다.
Ollama

터미널:

OLLAMA_CONTEXT_LENGTH=8192 ollama serve
ollama run hf.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

Apple M4 Pro에서 Llama 3.1 8B 돌릴 수 있나요?

Q4_K_M 파일이 통합 메모리에 올라갑니다. GPU가 쓸 수 있는 16.8GB 중 6.6GB를 씁니다. 판정: 쾌적, 속도: 추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%). Q4_K_M에는 8k 컨텍스트 기준 6.6GB가 필요하고, 통합 메모리 중 GPU가 쓸 수 있는 양은 16.8GB입니다.

Apple M4 Pro에서 Llama 3.1 8B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 16k(KV 2.1GB), q8_0 KV 캐시에서 32k(KV 2.3GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(4.92GB)입니다. 판정: 쾌적, 속도: 추정 27.3 tok/s (21.9–32.8, 보정된 추정 ±20%). 같은 판정이 나오는 파일 가운데 가장 큰 파일이기도 합니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.