GeForce RTX 4060에서 Gemma 3 12B 돌릴 수 있을까?
겨우 가능Q4_K_M 파일은 VRAM이 1.0GB 모자라서 가중치의 14%를 시스템 RAM에서 돌립니다. 판정: 겨우 가능, 속도: 추정 16.7 tok/s (13.4–20.1, 보정된 추정 ±20%). 품질 손실이 큰 Q2_K까지 낮출 때의 판정: 쾌적, 속도: 추정 35.9 tok/s (31.6–40.2, 보정된 추정 ±12%).
VRAM 8GB · 272.0 GB/s · FP16 15.1 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.
GeForce RTX 4060에서 Gemma 3 12B: 양자화별 판정
| 양자화 | 파일 크기 | 판정 | 속도 | 메모리 | 실행 방식 | 참고 |
|---|---|---|---|---|---|---|
| Q2_K | 4.77GB | 쾌적 | 추정 35.9 tok/s31.6–40.2보정된 추정 ±12% | 6.5 / 8.0GB | 풀 GPU | — |
| IQ4_XS | 6.55GB | 원활 | 추정 23.8 tok/s19.0–28.5보정된 추정 ±20% | 8.0 / 8.0GB + RAM 0.3GB | 부분 오프로드 | 모델이 GPU에 다 올라가지 않습니다. 쾌적하게 돌리려면 모델 전체가 GPU 메모리에 있어야 합니다. |
| Q4_K_M기준 | 7.30GB | 겨우 가능 | 추정 16.7 tok/s13.4–20.1보정된 추정 ±20% | 8.0 / 8.0GB + RAM 1.0GB | 부분 오프로드 | GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다. |
| Q8_0 | 12.51GB | 겨우 가능 | 추정 5.6 tok/s4.5–6.7보정된 추정 ±20% | 8.0 / 8.0GB + RAM 6.2GB | 부분 오프로드 | — |
Q4_K_M 기준 메모리 사용 내역
- 가중치
- 6.3GB
- KV 캐시
- 0.5GB
- 연산 버퍼
- 0.6GB
- OS 예약
- 0.6GB
- 시스템 RAM의 가중치
- 1.0GB
컨텍스트 길이와 KV 캐시
| 컨텍스트 | KV f16 | KV q8_0 | KV q4_0 |
|---|---|---|---|
| 4k | 8.1GB원활 추정 19.1 tok/s15.3–23.0보정된 추정 ±20% | 8.0GB원활 추정 20.3 tok/s16.3–24.4보정된 추정 ±20% | 7.9GB원활 추정 21.0 tok/s16.8–25.2보정된 추정 ±20% |
| 8k | 8.4GB겨우 가능 추정 16.7 tok/s13.4–20.1보정된 추정 ±20% | 8.2GB겨우 가능 추정 18.7 tok/s15.0–22.5보정된 추정 ±20% | 8.0GB원활 추정 20.0 tok/s16.0–24.0보정된 추정 ±20% |
| 16k | 9.0GB겨우 가능 추정 13.2 tok/s10.6–15.8보정된 추정 ±20% | 8.5GB겨우 가능 추정 16.1 tok/s12.9–19.3보정된 추정 ±20% | 8.3GB겨우 가능 추정 18.1 tok/s14.5–21.8보정된 추정 ±20% |
| 32k | 10.2GB겨우 가능 추정 8.9 tok/s7.1–10.7보정된 추정 ±20% | 9.2GB겨우 가능 추정 12.4 tok/s9.9–14.8보정된 추정 ±20% | 8.7GB겨우 가능 추정 15.2 tok/s12.2–18.2보정된 추정 ±20% |
| 64k | 12.7GB겨우 가능 추정 4.9 tok/s3.9–5.9보정된 추정 ±20% | 10.7GB겨우 가능 추정 8.0 tok/s6.4–9.6보정된 추정 ±20% | 9.6GB겨우 가능 추정 11.2 tok/s9.0–13.5보정된 추정 ±20% |
| 128k | 15.9GB겨우 가능 추정 2.8 tok/s2.3–3.4보정된 추정 ±20% | 13.6GB겨우 가능 추정 4.3 tok/s3.4–5.1보정된 추정 ±20% | 11.4GB겨우 가능 추정 7.0 tok/s5.6–8.4보정된 추정 ±20% |
S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가
Q4_K_M 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k, q8_0에서 128k까지입니다.
예상 속도
- 생성
- 추정 16.7 tok/s (13.4–20.1, 보정된 추정 ±20%)
- 프롬프트 처리
- 프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.
판정 근거: GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.
이 조합의 벤치마크 결과
이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.
다른 선택지
GeForce RTX 4060에서 원활하게 도는 더 작은 모델
쾌적Qwen3.5 9B: 쾌적, 추정 31.0 tok/s (27.3–34.7, 보정된 추정 ±12%)
Gemma 3 12B의 더 낮은 양자화
원활IQ4_XS(6.55GB): 원활, 추정 23.8 tok/s (19.0–28.5, 보정된 추정 ±20%)
Gemma 3 12B, 쾌적하게 돌리는 가장 싼 GPU
쾌적GeForce RTX 3060 12GB: 실거래가 US$250(2026-08-09 기준), 속도 추정 32.2 tok/s (28.3–36.0, 보정된 추정 ±12%).
실행 방법
Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.
파일: google_gemma-3-12b-it-Q4_K_M.gguf (7.30GB, bartowski/google_gemma-3-12b-it-GGUF).
llama-server -hf bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M -c 8192 -ngl 41 -fa on- -ngl 41: 전체 48층 중 41층을 GPU에 올립니다. VRAM이 넘치면 1~2 줄이세요.
- -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
- --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.29GB로 줄어듭니다.
PowerShell(트레이의 Ollama를 먼저 종료하세요):
$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M- Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
- Ollama는 GPU와 CPU에 층을 자동으로 나눕니다.
/set parameter num_ctx 8192
관련 페이지
자주 묻는 질문
GeForce RTX 4060에서 Gemma 3 12B 돌릴 수 있나요?
Q4_K_M 파일은 VRAM이 1.0GB 모자라서 가중치의 14%를 시스템 RAM에서 돌립니다. 판정: 겨우 가능, 속도: 추정 16.7 tok/s (13.4–20.1, 보정된 추정 ±20%). 품질 손실이 큰 Q2_K까지 낮출 때의 판정: 쾌적, 속도: 추정 35.9 tok/s (31.6–40.2, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 8.4GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 7.4GB, 여유 시스템 RAM은 28.0GB입니다.
GeForce RTX 4060에서 Gemma 3 12B 컨텍스트는 얼마까지 쓸 수 있나요?
Q4_K_M 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k(KV 8.6GB), q8_0 KV 캐시에서 128k(KV 4.6GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.
어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?
추천 파일은 Q4_K_M(7.30GB)입니다. 판정: 겨우 가능, 속도: 추정 16.7 tok/s (13.4–20.1, 보정된 추정 ±20%). 같은 판정(겨우 가능)이 나오는 가장 큰 파일은 Q8_0(12.51GB)이고, 속도는 추정 5.6 tok/s (4.5–6.7, 보정된 추정 ±20%)입니다.
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.