GeForce RTX 3060 12GB에서 gpt-oss-120b 돌릴 수 있을까?
불가MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 11.4GB보다 52.9GB가 모자랍니다. 시스템 RAM 96GB 구성의 판정: 겨우 가능, 속도: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%).
VRAM 12GB · 360.0 GB/s · FP16 12.7 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.
GeForce RTX 3060 12GB에서 gpt-oss-120b: 양자화별 판정
| 양자화 | 파일 크기 | 판정 | 속도 | 메모리 | 실행 방식 | 참고 |
|---|---|---|---|---|---|---|
| MXFP4기준 | 63.39GB | 불가 | — | 약 64.3GB가 필요한데, 쓸 수 있는 VRAM은 11.4GB, 여유 RAM은 28.0GB입니다. | — | — |
리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).
MXFP4 기준 메모리 사용 내역
아래 메모리·컨텍스트·속도 수치는 시스템 RAM 96GB 구성(위에서 안내한 RAM 용량) 기준입니다. 32GB로는 어떤 양자화 파일도 들어가지 않습니다.
- 가중치
- 0.8GB
- KV 캐시
- 0.3GB
- 연산 버퍼
- 0.6GB
- OS 예약
- 0.6GB
- 여유
- 9.7GB
- 시스템 RAM의 가중치
- 62.6GB
컨텍스트 길이와 KV 캐시
| 컨텍스트 | KV f16 | KV q8_0 | KV q4_0 |
|---|---|---|---|
| 4k | 64.1GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.0GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.0GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
| 8k | 64.3GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.1GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.1GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
| 16k | 64.6GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.4GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.2GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
| 32k | 65.4GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.8GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 64.5GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
| 64k | 66.9GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 65.8GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 65.2GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
| 128k | 69.9GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 67.7GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% | 66.5GB겨우 가능 추정 13.9 tok/s9.7–18.1이론 추정 ±30% |
S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가
시스템 RAM 96GB 기준: MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k, q8_0에서 128k까지입니다.
예상 속도
- 생성
- 시스템 RAM 96GB 기준: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%)
- 프롬프트 처리
- 프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.
판정 근거: 전문가를 시스템 RAM에서 돌립니다. 이 방식에서 원활하게 돌아가려면 30 tok/s 이상 나와야 합니다.
이 조합의 벤치마크 결과
이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.
다른 선택지
GeForce RTX 3060 12GB에서 원활하게 도는 더 작은 모델
원활Qwen3.5 35B-A3B: 원활, 추정 20.4 tok/s (14.3–26.5, 이론 추정 ±30%)
같은 GPU에 시스템 RAM 96GB
겨우 가능MXFP4: 겨우 가능, 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%)
실행 방법
MXFP4 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.
아래 명령은 시스템 RAM 96GB 구성(위에서 안내한 RAM 용량)을 기준으로 합니다.
파일: gpt-oss-120b-MXFP4.gguf (63.39GB, ggml-org/gpt-oss-120b-GGUF).
llama-server -hf ggml-org/gpt-oss-120b-GGUF:MXFP4 -c 8192 -ngl all --n-cpu-moe 36 -fa on- -ngl all: 모든 층을 GPU에 올립니다.
- --n-cpu-moe 36: 36개 층의 전문가를 모두 시스템 RAM에 둡니다. 이 추정도 같은 설정을 가정합니다.
- 값을 32까지 줄여도 메모리에 들어가고, CPU에 두는 층이 적을수록 생성이 빨라집니다.
- -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
- --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.16GB로 줄어듭니다.
Ollama에는 전문가만 RAM에 두는 옵션이 없어서, 이 방식은 llama.cpp에서만 쓸 수 있습니다.
관련 페이지
자주 묻는 질문
GeForce RTX 3060 12GB에서 gpt-oss-120b 돌릴 수 있나요?
MXFP4에는 64.3GB가 필요해서, 쓸 수 있는 메모리 11.4GB보다 52.9GB가 모자랍니다. 시스템 RAM 96GB 구성의 판정: 겨우 가능, 속도: 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%). MXFP4에는 8k 컨텍스트 기준 64.3GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 11.4GB, 여유 시스템 RAM은 28.0GB입니다.
GeForce RTX 3060 12GB에서 gpt-oss-120b 컨텍스트는 얼마까지 쓸 수 있나요?
시스템 RAM 96GB 기준: MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k(KV 4.8GB), q8_0 KV 캐시에서 128k(KV 2.6GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.
어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?
RAM 32GB로는 돌아가는 양자화 파일이 없습니다. RAM 96GB 구성이라면 MXFP4 파일이 돌아갑니다(판정: 겨우 가능). 속도는 추정 13.9 tok/s (9.7–18.1, 이론 추정 ±30%)입니다.
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.