GeForce RTX 5070에서 Qwen3 14B 돌릴 수 있을까?

쾌적Q4_K_M 파일이 VRAM에 전부 올라가고 0.5GB가 남습니다. 판정: 쾌적, 속도: 추정 45.5 tok/s (40.0–50.9, 보정된 추정 ±12%).

VRAM 12GB · 672.0 GB/s · FP16 30.9 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다. GeForce RTX 5070 Ti Laptop도 메모리 구성이 같아서(12GB, 672.0 GB/s) 생성 속도 추정치는 같고, 프롬프트 처리 속도만 다릅니다. 프롬프트 처리 속도: 이 GPU 약 4,326 tok/s (2,596–6,056, 대략적 추정 ±40%), GeForce RTX 5070 Ti Laptop 약 4,200 tok/s (2,520–5,880, 대략적 추정 ±40%).

GeForce RTX 5070에서 Qwen3 14B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K5.75GB쾌적
추정 66.3 tok/s58.4–74.3보정된 추정 ±12%
8.3 / 12.0GB풀 GPU—
IQ4_XS8.14GB쾌적
추정 49.6 tok/s43.7–55.6보정된 추정 ±12%
10.7 / 12.0GB풀 GPU—
Q4_K_M기준9.00GB쾌적
추정 45.5 tok/s40.0–50.9보정된 추정 ±12%
11.5 / 12.0GB풀 GPU—
Q8_015.70GB겨우 가능
추정 5.8 tok/s4.6–7.0보정된 추정 ±20%
12.0 / 12.0GB + RAM 6.2GB부분 오프로드—

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
가중치
9.0GB
KV 캐시
1.3GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
0.5GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
10.2GB쾌적
추정 48.6 tok/s42.8–54.5보정된 추정 ±12%
9.9GB쾌적
추정 50.3 tok/s44.2–56.3보정된 추정 ±12%
9.7GB쾌적
추정 51.2 tok/s45.0–57.3보정된 추정 ±12%
8k
10.9GB쾌적
추정 45.5 tok/s40.0–50.9보정된 추정 ±12%
10.3GB쾌적
추정 48.4 tok/s42.6–54.2보정된 추정 ±12%
10.0GB쾌적
추정 50.1 tok/s44.1–56.2보정된 추정 ±12%
16k
12.3GB겨우 가능
추정 20.3 tok/s16.2–24.3보정된 추정 ±20%
11.1GB쾌적
추정 45.1 tok/s39.7–50.5보정된 추정 ±12%
10.4GB쾌적
추정 48.2 tok/s42.4–54.0보정된 추정 ±12%
32k
15.2GB겨우 가능
추정 6.6 tok/s5.3–7.9보정된 추정 ±20%
12.7GB겨우 가능
추정 16.9 tok/s13.5–20.3보정된 추정 ±20%
11.3GB쾌적
추정 44.7 tok/s39.3–50.0보정된 추정 ±12%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 8k, q8_0에서 16k까지입니다.

예상 속도

생성
추정 45.5 tok/s (40.0–50.9, 보정된 추정 ±12%)
프롬프트 처리
약 4,326 tok/s (2,596–6,056, 대략적 추정 ±40%)

이 조합의 벤치마크 결과

이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: Qwen3-14B-Q4_K_M.gguf (9.00GB, unsloth/Qwen3-14B-GGUF).

llama.cpp
llama-server -hf unsloth/Qwen3-14B-GGUF:Q4_K_M -c 8192 -ngl all -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.72GB로 줄어듭니다.
Ollama

PowerShell(트레이의 Ollama를 먼저 종료하세요):

$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/unsloth/Qwen3-14B-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

GeForce RTX 5070에서 Qwen3 14B 돌릴 수 있나요?

Q4_K_M 파일이 VRAM에 전부 올라가고 0.5GB가 남습니다. 판정: 쾌적, 속도: 추정 45.5 tok/s (40.0–50.9, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 10.9GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 11.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 5070에서 Qwen3 14B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 8k(KV 1.3GB), q8_0 KV 캐시에서 16k(KV 1.4GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 32k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(9.00GB)입니다. 판정: 쾌적, 속도: 추정 45.5 tok/s (40.0–50.9, 보정된 추정 ±12%). 같은 판정이 나오는 파일 가운데 가장 큰 파일이기도 합니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.