GeForce RTX 3090에서 Gemma 3 12B 돌릴 수 있을까?

쾌적Q4_K_M 파일이 VRAM에 전부 올라가고 15.0GB가 남습니다. 판정: 쾌적, 속도: 추정 83.6 tok/s (73.6–93.6, 보정된 추정 ±12%).

VRAM 24GB · 936.0 GB/s · FP16 35.6 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 3090에서 Gemma 3 12B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K4.77GB쾌적
추정 123.5 tok/s108.6–138.3보정된 추정 ±12%
6.5 / 24.0GB풀 GPU—
IQ4_XS6.55GB쾌적
추정 92.5 tok/s81.4–103.5보정된 추정 ±12%
8.3 / 24.0GB풀 GPU—
Q4_K_M기준7.30GB쾌적
추정 83.6 tok/s73.6–93.6보정된 추정 ±12%
9.0 / 24.0GB풀 GPU—
Q8_012.51GB쾌적
추정 50.2 tok/s44.2–56.2보정된 추정 ±12%
14.2 / 24.0GB풀 GPU—

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
가중치
7.3GB
KV 캐시
0.5GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
15.0GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
8.1GB쾌적
추정 86.6 tok/s76.2–97.0보정된 추정 ±12%
8.0GB쾌적
추정 88.0 tok/s77.5–98.6보정된 추정 ±12%
7.9GB쾌적
추정 88.8 tok/s78.2–99.5보정된 추정 ±12%
8k
8.4GB쾌적
추정 83.6 tok/s73.6–93.6보정된 추정 ±12%
8.2GB쾌적
추정 86.4 tok/s76.0–96.7보정된 추정 ±12%
8.0GB쾌적
추정 87.9 tok/s77.4–98.5보정된 추정 ±12%
16k
9.0GB쾌적
추정 78.2 tok/s68.9–87.6보정된 추정 ±12%
8.5GB쾌적
추정 83.2 tok/s73.2–93.2보정된 추정 ±12%
8.3GB쾌적
추정 86.1 tok/s75.8–96.5보정된 추정 ±12%
32k
10.2GB쾌적
추정 69.4 tok/s61.0–77.7보정된 추정 ±12%
9.2GB쾌적
추정 77.5 tok/s68.2–86.9보정된 추정 ±12%
8.7GB쾌적
추정 82.8 tok/s72.9–92.7보정된 추정 ±12%
64k
12.7GB쾌적
추정 56.5 tok/s49.7–63.3보정된 추정 ±12%
10.7GB쾌적
추정 68.3 tok/s60.1–76.5보정된 추정 ±12%
9.6GB쾌적
추정 76.9 tok/s67.6–86.1보정된 추정 ±12%
128k
17.6GB쾌적
추정 41.2 tok/s36.3–46.2보정된 추정 ±12%
13.6GB쾌적
추정 55.1 tok/s48.5–61.7보정된 추정 ±12%
11.4GB쾌적
추정 67.2 tok/s59.1–75.3보정된 추정 ±12%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k, q8_0에서 128k까지입니다.

예상 속도

생성
추정 83.6 tok/s (73.6–93.6, 보정된 추정 ±12%)
프롬프트 처리
약 4,984 tok/s (2,990–6,978, 대략적 추정 ±40%)

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: google_gemma-3-12b-it-Q4_K_M.gguf (7.30GB, bartowski/google_gemma-3-12b-it-GGUF).

llama.cpp
llama-server -hf bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M -c 8192 -ngl all -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.29GB로 줄어듭니다.
Ollama

PowerShell(트레이의 Ollama를 먼저 종료하세요):

$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/bartowski/google_gemma-3-12b-it-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

GeForce RTX 3090에서 Gemma 3 12B 돌릴 수 있나요?

Q4_K_M 파일이 VRAM에 전부 올라가고 15.0GB가 남습니다. 판정: 쾌적, 속도: 추정 83.6 tok/s (73.6–93.6, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 8.4GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 23.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 3090에서 Gemma 3 12B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 128k(KV 8.6GB), q8_0 KV 캐시에서 128k(KV 4.6GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(7.30GB)입니다. 판정: 쾌적, 속도: 추정 83.6 tok/s (73.6–93.6, 보정된 추정 ±12%). 같은 판정(쾌적)이 나오는 가장 큰 파일은 Q8_0(12.51GB)이고, 속도는 추정 50.2 tok/s (44.2–56.2, 보정된 추정 ±12%)입니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.