GeForce RTX 4060에서 Llama 3.1 8B 돌릴 수 있을까?

쾌적Q4_K_M 파일이 VRAM에 전부 올라가고 0.8GB가 남습니다. 판정: 쾌적, 속도: 실측 38.1 tok/s (4k 컨텍스트, 1건; 8k 추정 31.8 tok/s, 28.0–35.6, 보정된 추정 ±12%).

VRAM 8GB · 272.0 GB/s · FP16 15.1 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

GeForce RTX 4060에서 Llama 3.1 8B: 양자화별 판정

등록된 GGUF 파일 4개, 작은 파일부터, 8k 컨텍스트 기준
양자화파일 크기판정속도메모리실행 방식참고
Q2_K3.18GB쾌적
추정 44.8 tok/s39.4–50.1보정된 추정 ±12%
5.4 / 8.0GB풀 GPU—
IQ4_XS4.45GB쾌적
추정 34.5 tok/s30.3–38.6보정된 추정 ±12%
6.7 / 8.0GB풀 GPU—
Q4_K_M기준4.92GB쾌적
38.1 tok/s8k 추정 31.8 tok/s (28.0–35.6, 보정된 추정 ±12%)실측 1건 (4k 컨텍스트)
7.2 / 8.0GB풀 GPU—
Q8_08.54GB겨우 가능
추정 9.6 tok/s7.7–11.5보정된 추정 ±20%
8.0 / 8.0GB + RAM 2.8GB부분 오프로드GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.

Q4_K_M 기준 메모리 사용 내역

가중치·KV 캐시·연산 버퍼는 모델이 쓰고, OS 예약은 화면 출력 드라이버가 씁니다.
GPU 메모리
가중치
4.9GB
KV 캐시
1.1GB
연산 버퍼
0.6GB
OS 예약
0.6GB
여유
0.8GB

컨텍스트 길이와 KV 캐시

KV 캐시

Q4_K_M 기준으로 컨텍스트 길이와 KV 캐시 종류에 따른 필요 메모리, 판정, 예상 tok/s를 보여 줍니다.
컨텍스트KV f16KV q8_0KV q4_0
4k
6.0GB쾌적
추정 34.9 tok/s30.7–39.1보정된 추정 ±12%
5.7GB쾌적
추정 36.6 tok/s32.2–41.0보정된 추정 ±12%
5.6GB쾌적
추정 37.5 tok/s33.0–42.0보정된 추정 ±12%
8k
6.6GB쾌적
38.1 tok/s8k 추정 31.8 tok/s (28.0–35.6, 보정된 추정 ±12%)실측 1건 (4k 컨텍스트)
6.1GB쾌적
추정 34.7 tok/s30.5–38.8보정된 추정 ±12%
5.8GB쾌적
추정 36.4 tok/s32.1–40.8보정된 추정 ±12%
16k
7.7GB원활
추정 22.3 tok/s17.8–26.7보정된 추정 ±20%
6.7GB쾌적
추정 31.4 tok/s27.6–35.1보정된 추정 ±12%
6.2GB쾌적
추정 34.4 tok/s30.3–38.5보정된 추정 ±12%
32k
10.0GB겨우 가능
추정 7.6 tok/s6.1–9.1보정된 추정 ±20%
8.0GB겨우 가능
추정 18.7 tok/s15.0–22.5보정된 추정 ±20%
6.9GB쾌적
추정 31.0 tok/s27.3–34.7보정된 추정 ±12%
64k
13.5GB겨우 가능
추정 3.3 tok/s2.7–4.0보정된 추정 ±20%
10.6GB겨우 가능
추정 6.4 tok/s5.1–7.7보정된 추정 ±20%
8.5GB겨우 가능
추정 15.2 tok/s12.1–18.2보정된 추정 ±20%
128k
22.1GB겨우 가능
추정 2.0 tok/s1.6–2.4보정된 추정 ±20%
14.1GB겨우 가능
추정 3.2 tok/s2.5–3.8보정된 추정 ±20%
11.5GB겨우 가능
추정 5.2 tok/s4.2–6.3보정된 추정 ±20%

S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 8k, q8_0에서 16k까지입니다.

예상 속도

생성
실측 38.1 tok/s (4k 컨텍스트, 1건; 8k 추정 31.8 tok/s, 28.0–35.6, 보정된 추정 ±12%)
프롬프트 처리
약 2,114 tok/s (1,268–2,960, 대략적 추정 ±40%)

이 조합의 벤치마크 결과

보정에 쓰는 공개 벤치마크입니다. 측정 조건(컨텍스트·백엔드·플래그)은 위 추정과 다를 수 있습니다.

이 조합의 벤치마크 결과
하드웨어양자화백엔드컨텍스트프롬프트 (tok/s)생성 (tok/s)플래그출처측정일
GeForce RTX 4060Q4_K_Mllama.cpp4k1,528.038.1ctx-weightedlocalscore.ai2026-08-09

다른 선택지

실행 방법

Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.

파일: Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf (4.92GB, bartowski/Meta-Llama-3.1-8B-Instruct-GGUF).

llama.cpp
llama-server -hf bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M -c 8192 -ngl all -fa on
  • -ngl all: 모든 층을 GPU에 올립니다.
  • -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
  • --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.57GB로 줄어듭니다.
Ollama

PowerShell(트레이의 Ollama를 먼저 종료하세요):

$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M
  • Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
  • /set parameter num_ctx 8192

관련 페이지

자주 묻는 질문

GeForce RTX 4060에서 Llama 3.1 8B 돌릴 수 있나요?

Q4_K_M 파일이 VRAM에 전부 올라가고 0.8GB가 남습니다. 판정: 쾌적, 속도: 실측 38.1 tok/s (4k 컨텍스트, 1건; 8k 추정 31.8 tok/s, 28.0–35.6, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 6.6GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 7.4GB, 여유 시스템 RAM은 28.0GB입니다.

GeForce RTX 4060에서 Llama 3.1 8B 컨텍스트는 얼마까지 쓸 수 있나요?

Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 8k(KV 1.1GB), q8_0 KV 캐시에서 16k(KV 1.1GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.

어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?

추천 파일은 Q4_K_M(4.92GB)입니다. 판정: 쾌적, 속도: 실측 38.1 tok/s (4k 컨텍스트, 1건; 8k 추정 31.8 tok/s, 28.0–35.6, 보정된 추정 ±12%). 같은 판정이 나오는 파일 가운데 가장 큰 파일이기도 합니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.