Apple M4 Pro에서 gpt-oss-120b 돌릴 수 있을까?

불가MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 44.8GB보다 19.5GB가 모자랍니다. RAM 64GB 구성에서는 쓸 만한 속도로 도는 양자화 파일도 없습니다.

통합 메모리: 기본 설정에서는 GPU가 약 70%까지 쓸 수 있습니다오픈 라이선스 · Apache-2.0llama.cpp 팀 · ggml-org리즈닝 모델

통합 메모리 64GB · 273.0 GB/s · FP16 17.0 TFLOPS. 8k 컨텍스트와 f16 KV 캐시를 기준으로 계산했습니다. 판정은 메모리 용량별로 보여 줍니다.

메모리 용량별 판정

이 페이지는 64GB 구성 기준입니다. 다른 용량은 아래와 같습니다.

  • 24GB불가
  • 48GB불가
  • 64GB불가

Apple M4 Pro에서 gpt-oss-120b: 양자화별 판정

등록된 GGUF 파일 1개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
MXFP4기준63.39GB불가—약 64.3GB가 필요한데, 여유 메모리는 60.0GB입니다(GPU가 쓸 수 있는 양 44.8GB).——

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

MXFP4 기준 메모리 사용 내역

MXFP4 파일은 들어가지 않습니다. 64.3GB가 필요한데 쓸 수 있는 메모리는 44.8GB라서, 나눠 보여 줄 내역이 없습니다.

컨텍스트 길이와 KV 캐시

KV 캐시

MXFP4 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
64.1GB미탑재
64.0GB미탑재
64.0GB미탑재
8k
64.3GB미탑재
64.1GB미탑재
64.1GB미탑재
16k
64.6GB미탑재
64.4GB미탑재
64.2GB미탑재
32k
65.4GB미탑재
64.8GB미탑재
64.5GB미탑재
64k
66.9GB미탑재
65.8GB미탑재
65.2GB미탑재
128k
69.9GB미탑재
67.7GB미탑재
66.5GB미탑재

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

MXFP4 기준으로는 컨텍스트를 얼마로 잡아도 들어가지 않습니다. 4k에서도 64.1GB가 필요한데, 쓸 수 있는 메모리는 44.8GB입니다.

예상 속도

생성
—
프롬프트 처리
프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

이 파일은 통합 메모리 중 GPU가 쓸 수 있는 44.8GB에 들어가지 않아서 실행 명령이 없습니다.

관련 페이지

자주 묻는 질문

Apple M4 Pro에서 gpt-oss-120b 돌릴 수 있나요?

MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 44.8GB보다 19.5GB가 모자랍니다. RAM 64GB 구성에서는 쓸 만한 속도로 도는 양자화 파일도 없습니다. MXFP4에는 8k 컨텍스트 기준 64.3GB가 필요하고, 통합 메모리 중 GPU가 쓸 수 있는 양은 44.8GB입니다.

Apple M4 Pro에서 gpt-oss-120b 컨텍스트는 얼마까지 쓸 수 있나요?

컨텍스트를 얼마로 잡아도 들어가지 않습니다. 4k에서도 MXFP4에는 64.1GB가 필요한데, 쓸 수 있는 메모리는 44.8GB입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

이 구성에서 돌아가는 양자화 파일이 없습니다. 가장 작은 파일(MXFP4, 63.39GB)도 8k 컨텍스트에서 64.3GB가 필요한데, 통합 메모리 중 GPU가 쓸 수 있는 양은 44.8GB입니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.