Radeon RX 7900 XT에서 돌아가는 로컬 LLM

시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.

사양

VRAM
20GB
메모리 대역폭
800.0 GB/s
FP16 연산
103.0 TFLOPS
출시 연도
2022
가격
출시가 US$899

판정 요약

Q4_K_M(없으면 가장 가까운 양자화), 8k 컨텍스트 기준입니다.

  • 쾌적18개원활3개겨우 가능3개불가5개양자화를 더 낮추면 2개가 더 돌아갑니다.

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

한국 모델

EXAONE, HyperCLOVA X SEED, Kanana, Solar가 이 기기에서 어떻게 돌아가는지 보여 줍니다.

Radeon RX 7900 XT 전체 모델 판정

dense 모델을 GPU와 CPU에 나눠 올리면 속도가 크게 떨어집니다. 전체 속도가 느린 CPU 쪽에 맞춰지기 때문입니다. 전문가만 시스템 RAM에 두는 MoE 모델은 훨씬 덜 느려집니다.

옆으로 밀면 모든 열을 볼 수 있습니다.

모델 29개(판정·속도 순)
모델판정속도양자화메모리실행 방식컨텍스트참고
EXAONE 4.0 1.2B
쾌적
추정 475.1 tok/s418.1–532.1보정된 추정 ±12%
Q4_K_M2.5 / 20.0GB풀 GPU최대 64k—
HyperCLOVA X SEED 1.5B
쾌적
추정 343.7 tok/s302.5–385.0보정된 추정 ±12%
Q4_K_M3.0 / 20.0GB풀 GPU최대 16k—
Gemma 4 26B-A4B
쾌적
추정 138.4 tok/s110.7–166.1보정된 추정 ±20%
Q4_K_M18.5 / 20.0GB풀 GPU최대 32k—
Kanana 1.5 15.7B-A3B
쾌적
추정 130.4 tok/s104.3–156.4보정된 추정 ±20%
Q4_K_M12.7 / 20.0GB풀 GPU최대 32k—
DeepSeek R1 Distill Llama 8B
쾌적
추정 104.1 tok/s91.6–116.6보정된 추정 ±12%
Q4_K_M7.2 / 20.0GB풀 GPU최대 64k
  • 리즈닝 모델
Kanana 1.5 8B
쾌적
추정 104.1 tok/s91.6–116.6보정된 추정 ±12%
Q4_K_M7.2 / 20.0GB풀 GPU최대 32k—
Llama 3.1 8B
쾌적
추정 104.1 tok/s91.6–116.6보정된 추정 ±12%
Q4_K_M7.2 / 20.0GB풀 GPU최대 64k—
gpt-oss-20b
쾌적
101.9 tok/s8k 추정 174.9 tok/s (139.9–209.9, 보정된 추정 ±20%)실측 1건 (2k 컨텍스트)
MXFP413.5 / 20.0GB풀 GPU최대 128k
  • 리즈닝 모델
Qwen3.5 9B
쾌적
추정 101.7 tok/s89.5–113.9보정된 추정 ±12%
Q4_K_M7.3 / 20.0GB풀 GPU최대 256k—
Qwen3 8B
쾌적
추정 100.0 tok/s88.0–112.0보정된 추정 ±12%
Q4_K_M7.4 / 20.0GB풀 GPU최대 32k—
Gemma 4 12B
쾌적
추정 81.5 tok/s71.7–91.3보정된 추정 ±12%
Q4_K_M8.8 / 20.0GB풀 GPU최대 128k—
Gemma 3 12B
쾌적
추정 79.6 tok/s70.1–89.2보정된 추정 ±12%
Q4_K_M9.0 / 20.0GB풀 GPU최대 128k—
HyperCLOVA X SEED Think 14B
쾌적
추정 61.2 tok/s42.8–79.6이론 추정 ±30%
Q4_K_M11.4 / 20.0GB풀 GPU최대 32k
  • 리즈닝 모델
Qwen3 14B
쾌적
추정 60.3 tok/s53.1–67.6보정된 추정 ±12%
Q4_K_M11.5 / 20.0GB풀 GPU최대 32k—
Phi-4
쾌적
추정 58.2 tok/s51.2–65.1보정된 추정 ±12%
Q4_K_M11.9 / 20.0GB풀 GPU최대 16k
  • 리즈닝 모델
Mistral Small 3.2 24B
쾌적
추정 39.8 tok/s35.0–44.6보정된 추정 ±12%
Q4_K_M16.8 / 20.0GB풀 GPU최대 16k—
Gemma 3 27B
쾌적
추정 36.2 tok/s31.9–40.6보정된 추정 ±12%
Q4_K_M18.4 / 20.0GB풀 GPU최대 16k—
Qwen3.5 27B
쾌적
추정 35.4 tok/s31.1–39.6보정된 추정 ±12%
Q4_K_M18.8 / 20.0GB풀 GPU최대 16k—
Qwen3.5 35B-A3B
원활
추정 20.4 tok/s14.3–26.5이론 추정 ±30%
Q4_K_M2.6 / 20.0GB + RAM 21.4GBMoE 전문가 RAM 배치최대 256k
  • 모델이 GPU에 다 올라가지 않습니다. 쾌적하게 돌리려면 모델 전체가 GPU 메모리에 있어야 합니다.
  • IQ4_XS: 쾌적
EXAONE 4.0 32B
원활
추정 18.4 tok/s14.7–22.1보정된 추정 ±20%
Q4_K_M20.0 / 20.0GB + RAM 1.1GB부분 오프로드최대 16k
  • IQ4_XS: 쾌적
  • 리즈닝 모델
EXAONE 4.5 33B
원활
추정 14.2 tok/s11.4–17.0보정된 추정 ±20%
Q4_K_M20.0 / 20.0GB + RAM 1.8GB부분 오프로드최대 8k
  • IQ4_XS: 쾌적
  • 리즈닝 모델
Qwen3 30B-A3B (2507)
겨우 가능
추정 19.2 tok/s13.4–24.9이론 추정 ±30%
Q4_K_M2.9 / 20.0GB + RAM 17.7GBMoE 전문가 RAM 배치최대 128k
  • 전문가를 시스템 RAM에서 돌립니다. 이 방식에서 원활하게 돌아가려면 20 tok/s 이상 나와야 합니다.
  • IQ4_XS: 쾌적
Qwen3 32B
겨우 가능
추정 9.4 tok/s7.6–11.3보정된 추정 ±20%
Q4_K_M20.0 / 20.0GB + RAM 3.1GB부분 오프로드최대 32k
  • GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.
  • IQ4_XS: 원활
  • Q2_K (품질 손실 큼): 쾌적
DeepSeek R1 Distill Qwen 32B
겨우 가능
추정 9.3 tok/s7.4–11.1보정된 추정 ±20%
Q4_K_M20.0 / 20.0GB + RAM 3.2GB부분 오프로드최대 16k
  • Q2_K (품질 손실 큼): 쾌적
  • 리즈닝 모델
Qwen3.5 122B-A10B
불가UD-Q2_K_XL (품질 손실 큼): 겨우 가능
추정 17.5 tok/s12.2–22.7이론 추정 ±30%
UD-Q2_K_XL20.0 / 20.0GB + RAM 24.2GB부분 오프로드최대 64k
  • GPU에 90%도 올라가지 않습니다. 이렇게 GPU와 CPU에 나눠 돌리면 겨우 돌아가는 수준에 그칩니다.
  • RAM 64GB라면: 겨우 가능
Llama 3.3 70B
불가Q2_K (품질 손실 큼): 겨우 가능
추정 3.6 tok/s2.9–4.3보정된 추정 ±20%
Q2_K20.0 / 20.0GB + RAM 10.2GB부분 오프로드최대 16k—
gpt-oss-120b
불가
—MXFP464.3GB 필요——
  • 약 64.3GB가 필요한데, 쓸 수 있는 VRAM은 19.4GB, 여유 RAM은 28.0GB입니다.
  • RAM 96GB라면: 겨우 가능
  • 리즈닝 모델
Solar Open 100B
불가
—Q4_K_M64.4GB 필요——
  • 약 64.4GB가 필요한데, 쓸 수 있는 VRAM은 19.4GB, 여유 RAM은 28.0GB입니다.
  • RAM 64GB라면: 겨우 가능
Solar Open 2 250B
불가
—IQ4_XS137.2GB 필요——
  • 약 137.2GB가 필요한데, 쓸 수 있는 VRAM은 19.4GB, 여유 RAM은 28.0GB입니다.
  • RAM 128GB라면: 겨우 가능

리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).

Radeon RX 7900 XT 벤치마크 결과

보정에 쓰는 공개 벤치마크입니다. 측정 조건(컨텍스트·백엔드·플래그)은 위 추정과 다를 수 있습니다.

Radeon RX 7900 XT 벤치마크 결과
모델양자화백엔드컨텍스트프롬프트 (tok/s)생성 (tok/s)플래그출처측정일
gpt-oss-20bMXFP4llama.cpp2k4,252.0101.9ROCmgithub.com2025-08-15

자주 묻는 질문

Radeon RX 7900 XT에 통째로 올라가는 가장 큰 모델은 무엇인가요?

Qwen3.5 35B-A3B IQ4_XS(18.17GB 파일)입니다. 8k 컨텍스트에서 20GB에 전부 올라가고, 속도는 추정 235.0 tok/s (188.0–282.0, 보정된 추정 ±20%)입니다.

Radeon RX 7900 XT에서 원활하게 돌아가는 로컬 LLM은 몇 개인가요?

Q4_K_M·8k 컨텍스트 기준으로 등록된 모델 29개를 보면 쾌적 18개, 원활 3개, 겨우 가능 3개, 불가 5개입니다.

Radeon RX 7900 XT에서 Llama 3.3 70B 같은 70B 모델을 돌릴 수 있나요?

Q2_K (품질 손실 큼), 부분 오프로드 기준 판정: 겨우 가능, 속도: 추정 3.6 tok/s (2.9–4.3, 보정된 추정 ±20%).

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.