GeForce RTX 3060 12GB에서 Gemma 3 12B 돌릴 수 있을까?

쾌적Q4_K_M 파일이 VRAM에 전부 올라가고 3.0GB가 남습니다. 판정: 쾌적, 속도: 추정 32.2 tok/s (28.3–36.0, 보정된 추정 ±12%).

VRAM 12GB · 360.0 GB/s · FP16 12.7 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 3060 12GB에서 Gemma 3 12B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K4.77GB쾌적
추정 47.5 tok/s41.8–53.2보정된 추정 ±12%
6.5 / 12.0GB풀 GPU—
IQ4_XS6.55GB쾌적
추정 35.6 tok/s31.3–39.8보정된 추정 ±12%
8.3 / 12.0GB풀 GPU—
Q4_K_M기준7.30GB쾌적
추정 32.2 tok/s28.3–36.0보정된 추정 ±12%
9.0 / 12.0GB풀 GPU—
Q8_012.51GB겨우 가능
추정 10.6 tok/s8.5–12.7보정된 추정 ±20%
12.0 / 12.0GB + RAM 2.2GB부분 오프로드GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
가중치
7.3GB
KV 캐시
0.5GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
3.0GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
8.1GB쾌적
추정 33.3 tok/s29.3–37.3보정된 추정 ±12%
8.0GB쾌적
추정 33.9 tok/s29.8–37.9보정된 추정 ±12%
7.9GB쾌적
추정 34.2 tok/s30.1–38.3보정된 추정 ±12%
8k
8.4GB쾌적
추정 32.2 tok/s28.3–36.0보정된 추정 ±12%
8.2GB쾌적
추정 33.2 tok/s29.2–37.2보정된 추정 ±12%
8.0GB쾌적
추정 33.8 tok/s29.8–37.9보정된 추정 ±12%
16k
9.0GB쾌적
추정 30.1 tok/s26.5–33.7보정된 추정 ±12%
8.5GB쾌적
추정 32.0 tok/s28.2–35.8보정된 추정 ±12%
8.3GB쾌적
추정 33.1 tok/s29.2–37.1보정된 추정 ±12%
32k
10.2GB쾌적
추정 26.7 tok/s23.5–29.9보정된 추정 ±12%
9.2GB쾌적
추정 29.8 tok/s26.2–33.4보정된 추정 ±12%
8.7GB쾌적
추정 31.9 tok/s28.0–35.7보정된 추정 ±12%
64k
12.7GB겨우 가능
추정 11.9 tok/s9.6–14.3보정된 추정 ±20%
10.7GB쾌적
추정 26.3 tok/s23.1–29.4보정된 추정 ±12%
9.6GB쾌적
추정 29.6 tok/s26.0–33.1보정된 추정 ±12%
128k
17.6GB겨우 가능
추정 3.2 tok/s2.6–3.9보정된 추정 ±20%
13.6GB겨우 가능
추정 8.9 tok/s7.1–10.6보정된 추정 ±20%
11.4GB원활
추정 25.1 tok/s20.1–30.1보정된 추정 ±20%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k, q8_0에서 64k까지입니다.

예상 속도

생성
추정 32.2 tok/s (28.3–36.0, 보정된 추정 ±12%)
프롬프트 처리
약 1,778 tok/s (1,067–2,489, 대략적 추정 ±40%)

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: google_gemma-3-12b-it-Q4_K_M.gguf (7.30GB, bartowski/google_gemma-3-12b-it-GGUF).

llama.cpp
llama-server -hf bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M -c 8192 -ngl all -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.29GB로 줄어듭니다.
Ollama

PowerShell(트레이의 Ollama를 먼저 종료하세요):

$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

GeForce RTX 3060 12GB에서 Gemma 3 12B 돌릴 수 있나요?

Q4_K_M 파일이 VRAM에 전부 올라가고 3.0GB가 남습니다. 판정: 쾌적, 속도: 추정 32.2 tok/s (28.3–36.0, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 8.4GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 11.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 3060 12GB에서 Gemma 3 12B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k(KV 2.1GB), q8_0 KV 캐시에서 64k(KV 2.3GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(7.30GB)입니다. 판정: 쾌적, 속도: 추정 32.2 tok/s (28.3–36.0, 보정된 추정 ±12%). 같은 판정이 나오는 파일 가운데 가장 큰 파일이기도 합니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.