GeForce RTX 4060에서 Qwen3 14B 돌릴 수 있을까?

겨우 가능Q4_K_M 파일은 VRAM이 3.5GB 모자라서 가중치의 39%를 시스템 RAM에서 돌립니다. 판정: 겨우 가능, 속도: 추정 8.1 tok/s (6.5–9.7, 보정된 추정 ±20%). 품질 손실이 큰 Q2_K까지 낮출 때의 판정: 원활, 속도: 추정 23.3 tok/s (18.7–28.0, 보정된 추정 ±20%).

VRAM 8GB · 272.0 GB/s · FP16 15.1 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 4060에서 Qwen3 14B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K5.75GB원활
추정 23.3 tok/s18.7–28.0보정된 추정 ±20%
8.0 / 8.0GB + RAM 0.3GB부분 오프로드모델이 GPU에 다 올라가지 않습니다. 쾌적하게 돌리려면 모델 전체가 GPU 메모리에 있어야 합니다.
IQ4_XS8.14GB겨우 가능
추정 9.7 tok/s7.8–11.7보정된 추정 ±20%
8.0 / 8.0GB + RAM 2.7GB부분 오프로드GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.
Q4_K_M기준9.00GB겨우 가능
추정 8.1 tok/s6.5–9.7보정된 추정 ±20%
8.0 / 8.0GB + RAM 3.5GB부분 오프로드GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.
Q8_015.70GB겨우 가능
추정 3.6 tok/s2.9–4.3보정된 추정 ±20%
8.0 / 8.0GB + RAM 10.2GB부분 오프로드—

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
시스템 RAM
가중치
5.5GB
KV 캐시
1.3GB
연산 버퍼
0.6GB
OS 예약
0.6GB
시스템 RAM의 가중치
3.5GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
10.2GB겨우 가능
추정 9.8 tok/s7.8–11.7보정된 추정 ±20%
9.9GB겨우 가능
추정 10.7 tok/s8.6–12.8보정된 추정 ±20%
9.7GB겨우 가능
추정 11.3 tok/s9.0–13.5보정된 추정 ±20%
8k
10.9GB겨우 가능
추정 8.1 tok/s6.5–9.7보정된 추정 ±20%
10.3GB겨우 가능
추정 9.6 tok/s7.7–11.5보정된 추정 ±20%
10.0GB겨우 가능
추정 10.5 tok/s8.4–12.7보정된 추정 ±20%
16k
12.3GB겨우 가능
추정 5.9 tok/s4.7–7.0보정된 추정 ±20%
11.1GB겨우 가능
추정 7.8 tok/s6.3–9.4보정된 추정 ±20%
10.4GB겨우 가능
추정 9.3 tok/s7.5–11.2보정된 추정 ±20%
32k
15.2GB겨우 가능
추정 3.5 tok/s2.8–4.2보정된 추정 ±20%
12.7GB겨우 가능
추정 5.5 tok/s4.4–6.6보정된 추정 ±20%
11.3GB겨우 가능
추정 7.5 tok/s6.0–9.0보정된 추정 ±20%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k, q8_0에서 32k까지입니다.

예상 속도

생성
추정 8.1 tok/s (6.5–9.7, 보정된 추정 ±20%)
프롬프트 처리
프롬프트 처리 속도는 모델 전체가 GPU에서 돌 때만 추정합니다.

판정 근거: GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: Qwen3-14B-Q4_K_M.gguf (9.00GB, unsloth/Qwen3-14B-GGUF).

llama.cpp
llama-server -hf unsloth/Qwen3-14B-GGUF:Q4_K_M -c 8192 -ngl 24 -fa on
  • -ngl 24: 전체 40층 중 24층을 GPU에 올립니다. VRAM이 넘치면 1~2 줄이세요.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.72GB로 줄어듭니다.
Ollama

PowerShell(트레이의 Ollama를 먼저 종료하세요):

$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/unsloth/Qwen3-14B-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • Ollama는 GPU와 CPU에 층을 자동으로 나눕니다.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

GeForce RTX 4060에서 Qwen3 14B 돌릴 수 있나요?

Q4_K_M 파일은 VRAM이 3.5GB 모자라서 가중치의 39%를 시스템 RAM에서 돌립니다. 판정: 겨우 가능, 속도: 추정 8.1 tok/s (6.5–9.7, 보정된 추정 ±20%). 품질 손실이 큰 Q2_K까지 낮출 때의 판정: 원활, 속도: 추정 23.3 tok/s (18.7–28.0, 보정된 추정 ±20%). Q4_K_M에는 8k 컨텍스트 기준 10.9GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 7.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 4060에서 Qwen3 14B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(겨우 가능)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k(KV 5.4GB), q8_0 KV 캐시에서 32k(KV 2.9GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 32k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(9.00GB)입니다. 판정: 겨우 가능, 속도: 추정 8.1 tok/s (6.5–9.7, 보정된 추정 ±20%). 같은 판정(겨우 가능)이 나오는 가장 큰 파일은 Q8_0(15.70GB)이고, 속도는 추정 3.6 tok/s (2.9–4.3, 보정된 추정 ±20%)입니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.