GeForce RTX 5060 Ti 16GB에서 gpt-oss-20b 돌릴 수 있을까?
쾌적MXFP4 파일이 VRAM에 전부 올라가고 2.5GB가 남습니다. 판정: 쾌적, 속도: 실측 111.6 tok/s (2k 컨텍스트, 1건; 8k 추정 88.1 tok/s, 70.5–105.8, 보정된 추정 ±20%).
VRAM 16GB · 448.0 GB/s · FP16 23.7 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.
GeForce RTX 5060 Ti 16GB에서 gpt-oss-20b: 양자화별 판정
| 양자화 | 파일 크기 | 판정 | 속도 | 메모리 | 실행 방식 | 참고 |
|---|---|---|---|---|---|---|
| MXFP4기준 | 12.11GB | 쾌적 | 111.6 tok/s8k 추정 88.1 tok/s (70.5–105.8, 보정된 추정 ±20%)실측 1건 (2k 컨텍스트) | 13.5 / 16.0GB | 풀 GPU | — |
리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).
MXFP4 기준 메모리 사용 내역
- 가중치
- 12.1GB
- KV 캐시
- 0.2GB
- 연산 버퍼
- 0.6GB
- OS 예약
- 0.6GB
- 여유
- 2.5GB
컨텍스트 길이와 KV 캐시
| 컨텍스트 | KV f16 | KV q8_0 | KV q4_0 |
|---|---|---|---|
| 4k | 12.7GB쾌적 추정 92.2 tok/s73.8–110.6보정된 추정 ±20% | 12.7GB쾌적 추정 94.2 tok/s75.4–113.1보정된 추정 ±20% | 12.7GB쾌적 추정 95.3 tok/s76.3–114.4보정된 추정 ±20% |
| 8k | 12.9GB쾌적 111.6 tok/s8k 추정 88.1 tok/s (70.5–105.8, 보정된 추정 ±20%)실측 1건 (2k 컨텍스트) | 12.8GB쾌적 추정 91.9 tok/s73.5–110.3보정된 추정 ±20% | 12.7GB쾌적 추정 94.1 tok/s75.2–112.9보정된 추정 ±20% |
| 16k | 13.2GB쾌적 추정 81.0 tok/s64.8–97.2보정된 추정 ±20% | 13.0GB쾌적 추정 87.6 tok/s70.1–105.1보정된 추정 ±20% | 12.9GB쾌적 추정 91.6 tok/s73.3–109.9보정된 추정 ±20% |
| 32k | 13.7GB쾌적 추정 69.7 tok/s55.8–83.7보정된 추정 ±20% | 13.3GB쾌적 추정 80.1 tok/s64.1–96.1보정된 추정 ±20% | 13.1GB쾌적 추정 87.1 tok/s69.7–104.5보정된 추정 ±20% |
| 64k | 14.8GB쾌적 추정 54.5 tok/s43.6–65.4보정된 추정 ±20% | 14.1GB쾌적 추정 68.4 tok/s54.7–82.1보정된 추정 ±20% | 13.7GB쾌적 추정 79.2 tok/s63.4–95.1보정된 추정 ±20% |
| 128k | 17.0GB겨우 가능 추정 18.5 tok/s12.9–24.0이론 추정 ±30% | 15.5GB겨우 가능 추정 18.5 tok/s12.9–24.0이론 추정 ±30% | 14.7GB쾌적 추정 67.1 tok/s53.7–80.5보정된 추정 ±20% |
S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가
MXFP4 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 64k, q8_0에서 64k까지입니다.
예상 속도
- 생성
- 실측 111.6 tok/s (2k 컨텍스트, 1건; 8k 추정 88.1 tok/s, 70.5–105.8, 보정된 추정 ±20%)
- 프롬프트 처리
- 약 3,318 tok/s (1,991–4,645, 대략적 추정 ±40%)
이 조합의 벤치마크 결과
보정에 쓰는 공개 벤치마크입니다. 측정 조건(컨텍스트·백엔드·플래그)은 위 추정과 다를 수 있습니다.
| 하드웨어 | 양자화 | 백엔드 | 컨텍스트 | 프롬프트 (tok/s) | 생성 (tok/s) | 플래그 | 출처 | 측정일 |
|---|---|---|---|---|---|---|---|---|
| GeForce RTX 5060 Ti 16GB | MXFP4 | llama.cpp | 2k | 3,821.0 | 111.6 | — | github.com | 2025-08-15 |
다른 선택지
GeForce RTX 5060 Ti 16GB에서 원활하게 도는 더 큰 모델
원활Qwen3.5 35B-A3B: 원활, 추정 20.4 tok/s (14.3–26.5, 이론 추정 ±30%)
실행 방법
MXFP4 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.
파일: gpt-oss-20b-MXFP4.gguf (12.11GB, ggml-org/gpt-oss-20b-GGUF).
llama-server -hf ggml-org/gpt-oss-20b-GGUF:MXFP4 -c 8192 -ngl all -fa on- -ngl all: 모든 층을 GPU에 올립니다.
- -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
- --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.11GB로 줄어듭니다.
PowerShell(트레이의 Ollama를 먼저 종료하세요):
$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/ggml-org/gpt-oss-20b-GGUF:MXFP4- Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
/set parameter num_ctx 8192
관련 페이지
가이드: 로컬 LLM 사양 — VRAM 8~32GB로 돌릴 수 있는 모델 (2026)
GeForce RTX 5060 Ti 16GB에서 다른 모델
다른 하드웨어에서 gpt-oss-20b
자주 묻는 질문
GeForce RTX 5060 Ti 16GB에서 gpt-oss-20b 돌릴 수 있나요?
MXFP4 파일이 VRAM에 전부 올라가고 2.5GB가 남습니다. 판정: 쾌적, 속도: 실측 111.6 tok/s (2k 컨텍스트, 1건; 8k 추정 88.1 tok/s, 70.5–105.8, 보정된 추정 ±20%). MXFP4에는 8k 컨텍스트 기준 12.9GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 15.4GB, 여유 시스템 RAM은 28.0GB입니다.
GeForce RTX 5060 Ti 16GB에서 gpt-oss-20b 컨텍스트는 얼마까지 쓸 수 있나요?
MXFP4 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 64k(KV 1.6GB), q8_0 KV 캐시에서 64k(KV 0.9GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.
어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?
등록된 파일은 MXFP4(12.11GB) 하나뿐입니다. 판정: 쾌적, 속도: 실측 111.6 tok/s (2k 컨텍스트, 1건; 8k 추정 88.1 tok/s, 70.5–105.8, 보정된 추정 ±20%).
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.