GeForce RTX 4070에서 Llama 3.1 8B 돌릴 수 있을까?
쾌적Q4_K_M 파일이 VRAM에 전부 올라가고 4.8GB가 남습니다. 판정: 쾌적, 속도: 추정 58.9 tok/s (51.8–65.9, 보정된 추정 ±12%).
VRAM 12GB · 504.0 GB/s · FP16 29.1 TFLOPS. 시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다. GeForce RTX 4070 Super도 메모리 구성이 같아서(12GB, 504.0 GB/s) 생성 속도 추정치는 같고, 프롬프트 처리 속도만 다릅니다. 프롬프트 처리 속도: 이 GPU 약 4,074 tok/s (2,444–5,704, 대략적 추정 ±40%), GeForce RTX 4070 Super 약 4,970 tok/s (2,982–6,958, 대략적 추정 ±40%).
GeForce RTX 4070에서 Llama 3.1 8B: 양자화별 판정
| 양자화 | 파일 크기 | 판정 | 속도 | 메모리 | 실행 방식 | 참고 |
|---|---|---|---|---|---|---|
| Q2_K | 3.18GB | 쾌적 | 추정 82.9 tok/s73.0–92.9보정된 추정 ±12% | 5.4 / 12.0GB | 풀 GPU | — |
| IQ4_XS | 4.45GB | 쾌적 | 추정 63.9 tok/s56.2–71.5보정된 추정 ±12% | 6.7 / 12.0GB | 풀 GPU | — |
| Q4_K_M기준 | 4.92GB | 쾌적 | 추정 58.9 tok/s51.8–65.9보정된 추정 ±12% | 7.2 / 12.0GB | 풀 GPU | — |
| Q8_0 | 8.54GB | 쾌적 | 추정 36.7 tok/s32.3–41.1보정된 추정 ±12% | 10.8 / 12.0GB | 풀 GPU | — |
Q4_K_M 기준 메모리 사용 내역
- 가중치
- 4.9GB
- KV 캐시
- 1.1GB
- 연산 버퍼
- 0.6GB
- OS 예약
- 0.6GB
- 여유
- 4.8GB
컨텍스트 길이와 KV 캐시
| 컨텍스트 | KV f16 | KV q8_0 | KV q4_0 |
|---|---|---|---|
| 4k | 6.0GB쾌적 추정 64.7 tok/s56.9–72.4보정된 추정 ±12% | 5.7GB쾌적 추정 67.8 tok/s59.6–75.9보정된 추정 ±12% | 5.6GB쾌적 추정 69.5 tok/s61.2–77.9보정된 추정 ±12% |
| 8k | 6.6GB쾌적 추정 58.9 tok/s51.8–65.9보정된 추정 ±12% | 6.1GB쾌적 추정 64.2 tok/s56.5–71.9보정된 추정 ±12% | 5.8GB쾌적 추정 67.5 tok/s59.4–75.6보정된 추정 ±12% |
| 16k | 7.7GB쾌적 추정 49.9 tok/s43.9–55.9보정된 추정 ±12% | 6.7GB쾌적 추정 58.1 tok/s51.2–65.1보정된 추정 ±12% | 6.2GB쾌적 추정 63.8 tok/s56.1–71.4보정된 추정 ±12% |
| 32k | 10.0GB쾌적 추정 38.3 tok/s33.7–42.9보정된 추정 ±12% | 8.0GB쾌적 추정 48.9 tok/s43.0–54.7보정된 추정 ±12% | 6.9GB쾌적 추정 57.4 tok/s50.5–64.3보정된 추정 ±12% |
| 64k | 14.6GB겨우 가능 추정 4.8 tok/s3.8–5.7보정된 추정 ±20% | 10.6GB쾌적 추정 37.1 tok/s32.6–41.5보정된 추정 ±12% | 8.5GB쾌적 추정 47.9 tok/s42.1–53.6보정된 추정 ±12% |
| 128k | 22.1GB겨우 가능 추정 2.0 tok/s1.6–2.4보정된 추정 ±20% | 15.8GB겨우 가능 추정 3.5 tok/s2.8–4.2보정된 추정 ±20% | 11.5GB원활 추정 30.9 tok/s24.7–37.1보정된 추정 ±20% |
S = 쾌적 · A = 원활 · B = 겨우 가능 · F = 불가
Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k, q8_0에서 64k까지입니다.
예상 속도
- 생성
- 추정 58.9 tok/s (51.8–65.9, 보정된 추정 ±12%)
- 프롬프트 처리
- 약 4,074 tok/s (2,444–5,704, 대략적 추정 ±40%)
이 조합의 벤치마크 결과
이 조합으로 잰 공개 벤치마크 결과는 아직 없습니다. 위 수치는 모두 추정치입니다.
다른 선택지
GeForce RTX 4070에서 원활하게 도는 더 큰 모델
원활Qwen3.5 35B-A3B: 원활, 추정 20.4 tok/s (14.3–26.5, 이론 추정 ±30%)
쾌적하게 돌아가는 더 큰 양자화 파일
쾌적Q8_0(8.54GB): 쾌적, 추정 36.7 tok/s (32.3–41.1, 보정된 추정 ±12%)
실행 방법
Q4_K_M 파일을 쓰는 명령입니다. 두 도구 모두 처음 실행할 때 Hugging Face에서 파일을 내려받습니다.
파일: Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf (4.92GB, bartowski/Meta-Llama-3.1-8B-Instruct-GGUF).
llama-server -hf bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M -c 8192 -ngl all -fa on- -ngl all: 모든 층을 GPU에 올립니다.
- -fa on: 플래시 어텐션을 켭니다. KV 캐시를 양자화하려면 필요합니다.
- --cache-type-k q8_0 --cache-type-v q8_0: 8k 기준 KV 캐시가 0.57GB로 줄어듭니다.
PowerShell(트레이의 Ollama를 먼저 종료하세요):
$env:OLLAMA_CONTEXT_LENGTH="8192"; ollama serve
ollama run hf.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M- Ollama는 24GB 미만 GPU에서 컨텍스트 기본값이 4k입니다. 서버를 띄울 때 OLLAMA_CONTEXT_LENGTH를 지정하거나, 대화 안에서 /set parameter num_ctx를 쓰세요.
/set parameter num_ctx 8192
관련 페이지
자주 묻는 질문
GeForce RTX 4070에서 Llama 3.1 8B 돌릴 수 있나요?
Q4_K_M 파일이 VRAM에 전부 올라가고 4.8GB가 남습니다. 판정: 쾌적, 속도: 추정 58.9 tok/s (51.8–65.9, 보정된 추정 ±12%). Q4_K_M에는 8k 컨텍스트 기준 6.6GB가 필요하고, 이 구성에서 쓸 수 있는 메모리는 11.4GB, 여유 시스템 RAM은 28.0GB입니다.
GeForce RTX 4070에서 Llama 3.1 8B 컨텍스트는 얼마까지 쓸 수 있나요?
Q4_K_M 기준으로 판정(쾌적)이 유지되는 컨텍스트는 f16 KV 캐시에서 32k(KV 4.3GB), q8_0 KV 캐시에서 64k(KV 4.6GB)까지입니다. 모델이 지원하는 최대 컨텍스트는 128k입니다.
어떤 양자화 파일을 받아야 하고, 속도는 얼마나 나오나요?
추천 파일은 Q4_K_M(4.92GB)입니다. 판정: 쾌적, 속도: 추정 58.9 tok/s (51.8–65.9, 보정된 추정 ±12%). 같은 판정(쾌적)이 나오는 가장 큰 파일은 Q8_0(8.54GB)이고, 속도는 추정 36.7 tok/s (32.3–41.1, 보정된 추정 ±12%)입니다.
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.