GeForce RTX 3060 12GB에서 gpt-oss-20b 돌릴 수 있을까?

겨우 가능MXFP4 기준으로 어텐션은 GPU(2.0GB)에, 전문가는 시스템 RAM(11.5GB)에 둡니다. 판정: 겨우 가능, 속도: 추정 18.5 tok/s (12.9–24.0, 이론 추정 ±30%).

VRAM 12GB · 360.0 GB/s · FP16 12.7 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 3060 12GB에서 gpt-oss-20b: 양자화별 판정

등록된 GGUF 파일 1개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
MXFP4기준12.11GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
2.0 / 12.0GB + RAM 11.5GBMoE 전문가 RAM 배치전문가를 시스템 RAM에서 돌립니다. 이 방식에서 원활하게 돌아가려면 30 tok/s 이상 나와야 합니다.

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

MXFP4 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
시스템 RAM
가중치
0.7GB
KV 캐시
0.2GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
10.0GB
시스템 RAM의 가중치
11.5GB

컨텍스트 길이와 KV 캐시

KV 캐시

MXFP4 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
12.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
12.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
12.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
8k
12.9GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
12.8GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
12.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
16k
13.2GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
13.0GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
12.9GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
32k
13.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
13.3GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
13.1GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
64k
14.8GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
14.1GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
13.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
128k
17.0GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
15.5GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%
14.7GB겨우 가능
추정 18.5 tok/s12.9–24.0이론 추정 ±30%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k, q8_0에서 128k까지입니다.

예상 속도

생성
추정 18.5 tok/s (12.9–24.0, 이론 추정 ±30%)
프롬프트 처리
프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.

판정 근거: 전문가를 시스템 RAM에서 돌립니다. 이 방식에서 원활하게 돌아가려면 30 tok/s 이상 나와야 합니다.

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

MXFP4 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: gpt-oss-20b-MXFP4.gguf (12.11GB, ggml-org/gpt-oss-20b-GGUF).

llama.cpp
llama-server -hf ggml-org/gpt-oss-20b-GGUF:MXFP4 -c 8192 -ngl all --n-cpu-moe 24 -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • --n-cpu-moe 24: 24개 층의 전문가를 모두 시스템 RAM에 둡니다. 이 추정도 같은 설정을 가정합니다.
  • 값을 5까지 줄여도 메모리에 들어가고, CPU에 두는 층이 적을수록 생성이 빨라집니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.11GB로 줄어듭니다.
Ollama

Ollama에는 전문가만 RAM에 두는 옵션이 없어서, 이 방식은 llama.cpp에서만 쓸 수 있습니다.

관련 페이지

자주 묻는 질문

GeForce RTX 3060 12GB에서 gpt-oss-20b 돌릴 수 있나요?

MXFP4 기준으로 어텐션은 GPU(2.0GB)에, 전문가는 시스템 RAM(11.5GB)에 둡니다. 판정: 겨우 가능, 속도: 추정 18.5 tok/s (12.9–24.0, 이론 추정 ±30%). MXFP4에는 8k 컨텍스트 기준 12.9GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 11.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 3060 12GB에서 gpt-oss-20b 컨텍스트는 얼마까지 쓸 수 있나요?

MXFP4 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k(KV 3.2GB), q8_0 KV 캐시에서 128k(KV 1.7GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

등록된 파일은 MXFP4(12.11GB) 하나뿐입니다. 판정: 겨우 가능, 속도: 추정 18.5 tok/s (12.9–24.0, 이론 추정 ±30%).

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.