GeForce RTX 5060 Ti 16GB에서 gpt-oss-120b 돌릴 수 있을까?

불가MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 15.4GB보다 48.9GB가 모자랍니다. 시스템 RAM 96GB 구성의 판정: 겨우 가능, 속도: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%).

VRAM 16GB · 448.0 GB/s · FP16 23.7 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 5060 Ti 16GB에서 gpt-oss-120b: 양자화별 판정

등록된 GGUF 파일 1개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
MXFP4기준63.39GB불가—약 64.3GB가 필요한데, 쓸 수 있는 VRAM은 15.4GB, 여유 RAM은 28.0GB입니다.——

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

MXFP4 기준 메모리 사용 내역

아래 메모리·컨텍스트·속도 수치는 시스템 RAM 96GB 구성(위에서 안내한 RAM 용량) 기준입니다. 32GB로는 어떤 양자화 파일도 들어가지 않습니다.

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
시스템 RAM
가중치
0.8GB
KV 캐시
0.3GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
13.7GB
시스템 RAM의 가중치
62.6GB

컨텍스트 길이와 KV 캐시

KV 캐시

MXFP4 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
64.1GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.0GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.0GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
8k
64.3GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.1GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.1GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
16k
64.6GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.4GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.2GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
32k
65.4GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.8GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64.5GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
64k
66.9GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
65.8GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
65.2GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
128k
69.9GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
67.7GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%
66.5GB겨우 가능
추정 13.9 tok/s9.7–18.1이론 추정 ±30%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

시스템 RAM 96GB 기준: MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k, q8_0에서 128k까지입니다.

예상 속도

생성
시스템 RAM 96GB 기준: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%)
프롬프트 처리
프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.

판정 근거: 전문가를 시스템 RAM에서 돌립니다. 이 방식에서 원활하게 돌아가려면 30 tok/s 이상 나와야 합니다.

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

MXFP4 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

아래 명령은 시스템 RAM 96GB 구성(위에서 안내한 RAM 용량)을 기준으로 합니다.

파일: gpt-oss-120b-MXFP4.gguf (63.39GB, ggml-org/gpt-oss-120b-GGUF).

llama.cpp
llama-server -hf ggml-org/gpt-oss-120b-GGUF:MXFP4 -c 8192 -ngl all --n-cpu-moe 36 -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • --n-cpu-moe 36: 36개 층의 전문가를 모두 시스템 RAM에 둡니다. 이 추정도 같은 설정을 가정합니다.
  • 값을 30까지 줄여도 메모리에 들어가고, CPU에 두는 층이 적을수록 생성이 빨라집니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.16GB로 줄어듭니다.
Ollama

Ollama에는 전문가만 RAM에 두는 옵션이 없어서, 이 방식은 llama.cpp에서만 쓸 수 있습니다.

관련 페이지

자주 묻는 질문

GeForce RTX 5060 Ti 16GB에서 gpt-oss-120b 돌릴 수 있나요?

MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 15.4GB보다 48.9GB가 모자랍니다. 시스템 RAM 96GB 구성의 판정: 겨우 가능, 속도: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%). MXFP4에는 8k 컨텍스트 기준 64.3GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 15.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 5060 Ti 16GB에서 gpt-oss-120b 컨텍스트는 얼마까지 쓸 수 있나요?

시스템 RAM 96GB 기준: MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k(KV 4.8GB), q8_0 KV 캐시에서 128k(KV 2.6GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

RAM 32GB로는 돌아가는 양자화 파일이 없습니다. RAM 96GB 구성이라면 MXFP4 파일이 돌아갑니다(판정: 겨우 가능). 속도는 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%)입니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.