16GB VRAM GPU에서 Olllama를 사용해 LLM 성능 비교
RTX 4080 (16GB VRAM)에서 LLM 속도 테스트
로컬에서 대규모 언어 모델(Large Language Models, LLM)을 실행하면 개인 정보 보호, 오프라인 사용성, 그리고 제로 API 비용을 얻을 수 있습니다. 이 벤치마크는 RTX 4080에서 Ollama를 통해 실행된 14가지 인기 LLM의 성능을 RTX 4080으로 측정하기에서 무엇을 기대할 수 있는지를 정확히 보여줍니다.
16GB VRAM을 가진 GPU를 사용할 때, 저는 끊임없는 트레이드오프에 직면했습니다: 잠재적으로 더 좋은 품질을 가진 더 큰 모델, 아니면 더 빠른 추론을 제공하는 더 작은 모델. LLM 성능에 대해 더 자세히 알고 싶으시다면—처리량 vs 지연 시간, VRAM 한계, 병렬 요청, 런타임별 벤치마크—LLM 성능: 벤치마크, 병목 현상 및 최적화를 참조하십시오.
이 기사는 Ollama에 초점을 맞춥니다. 동일한 16 GB 등급의 GPU를 llama.cpp로 19K, 32K, 64K 컨텍스트(밀집(Dense) 및 MoE 체크포인트에 대한 VRAM, GPU 부하, 초당 토큰 수)로 측정한 내용은 llama.cpp를 이용한 16 GB VRAM LLM 벤치마크 (속도와 컨텍스트)에서 확인할 수 있습니다.
처리량과 VRAM 분할이 허용 가능한 수준으로 보인다면, 에이전트 스타일의 워크로드에서는 여전히 Qwen과 Gemma 스타일의 스택에 대해 적절한 온도와 페널티 프리셋이 필요합니다. Qwen과 Gemma를 위한 에이전틱 추론 매개변수를 참조하세요.

요약 (TL;DR)
Ollama 0.17.7과 RTX 4080 16GB 환경에서의 LLM 성능 비교표를 업데이트했습니다. (2026-03-09) Qwen 3.5 9b, 9bq8, 27b 및 35b 모델이 추가되었습니다:
| 모델 | RAM+VRAM 사용량 | CPU/GPU 분할 | 초당 토큰 수 |
|---|---|---|---|
| gpt-oss:20b | 14 GB | 100% GPU | 139.93 |
| qwen3.5:9b | 9.3 GB | 100% GPU | 90.89 |
| ministral-3:14b | 13 GB | 100% GPU | 70.13 |
| qwen3:14b | 12 GB | 100% GPU | 61.85 |
| qwen3.5:9b-q8_0 | 13 GB | 100% GPU | 61.22 |
| qwen3-coder:30b | 20 GB | 25%/75% CPU/GPU | 57.17 |
| qwen3-vl:30b-a3b | 22 GB | 30%/70% CPU/GPU | 50.99 |
| glm-4.7-flash | 21 GB | 27%/73% CPU/GPU | 33.86 |
| nemotron-3-nano:30b | 25 GB | 38%/62% CPU/GPU | 32.77 |
| qwen3.5:35b | 27 GB | 43%/57% CPU/GPU | 20.66 |
| devstral-small-2:24b | 19 GB | 18%/82% CPU/GPU | 18.67 |
| mistral-small3.2:24b | 19 GB | 18%/82% CPU/GPU | 18.51 |
| gpt-oss:120b | 66 GB | 78%/22% CPU/GPU | 12.64 |
| qwen3.5:27b | 24 GB | 43%/57% CPU/GPU | 6.48 |
핵심 통찰: VRAM에 완전히 포함된 모델은 훨씬 더 빠릅니다. GPT-OSS 20B는 초당 139.93 토큰을 달성하는 반면, CPU 오프로딩이 많은 GPT-OSS 120B는 초당 12.64 토큰으로 느리게 작동합니다. 이는 11배의 속도 차이입니다.
테스트 하드웨어 구성
이 벤치마크는 다음 시스템에서 수행되었습니다:
- GPU: NVIDIA RTX 4080 (16GB VRAM)
- CPU: Intel Core i7-14700 (8 P-코어 + 12 E-코어)
- RAM: 64GB DDR5-6000
이것은 로컬 LLM 추론을 위한 일반적인 하이엔드 컨슈머 구성을 나타냅니다. 16GB VRAM이 중요한 제약 조건입니다—이는 어떤 모델이 GPU에서만 실행되는지, 어떤 모델이 CPU 오프로딩을 필요로 하는지를 결정합니다.
모델이 VRAM 용량을 초과할 때 CPU 성능이 오프로드된 레이어의 추론 속도에 직접적인 영향을 미치므로, Ollama가 Intel CPU 코어를 어떻게 사용하는지 이해하는 것이 중요합니다.
이 벤치마크의 목적
주요 목표는 현실적인 조건 하에서의 추론 속도를 측정하는 것이었습니다. 저의 경험상 Mistral Small 3.2 24B는 언어 품질에서, Qwen3 14B는 저의 특정 사용 사례에 대해 지시 이끄는 능력(instruction-following)에서 뛰어나다는 것을 이미 알고 있었습니다.
이 벤치마크는 실용적인 질문에 답합니다: 각 모델은 얼마나 빠르게 텍스트를 생성할 수 있으며, VRAM 한계를 초과할 때의 속도 페널티는 무엇인가?
테스트 매개변수는 다음과 같았습니다:
- 컨텍스트 크기: 19,000 토큰. 이는 저의 Generate 요청에서 평균적인 값입니다.
- 프롬프트: “호주 자치령과 수도의 날씨와 기후를 비교하세요” (원문: “compare weather and climate between capital cities of australia”)
- 지표: 평가速率 (eval rate, 생성 중 초당 토큰 수)
Ollama 설치 및 버전
모든 테스트는 테스트 당시 최신 릴리스인 Ollama 버전 0.15.2를 사용했습니다. 나중에 Qwen3.5 모델을 추가하기 위해 Ollama v 0.17.7로 다시 실행했습니다. 이 벤치마크에서 사용된 Ollama 명령어의 완전한 참고자료를 보려면 Ollama 치트시트를 확인하세요.
간단히 요약하면 - Linux에 Ollama를 설치하는 방법:
curl -fsSL https://ollama.com/install.sh | sh
설치를 확인합니다:
ollama --version
공간 제약으로 인해 다른 드라이브에 모델을 저장해야 한다면, Ollama 모델을 다른 드라이브로 이동하는 방법을 확인해 보세요.
테스트된 모델
알파벳 순서로 다음 모델들이 벤치마크되었습니다:
| 모델 | 파라미터 | 양자화 | 비고 |
|---|---|---|---|
| devstral-small-2:24b | 24B | Q4_K_M | 코드 중심 |
| glm-4.7-flash | 30B | Q4_K_M | 사고 모델 |
| gpt-oss:20b | 20B | Q4_K_M | 전체적으로 가장 빠름 |
| gpt-oss:120b | 120B | Q4_K_M | 테스트된 모델 중 가장 큼 |
| ministral-3:14b | 14B | Q4_K_M | Mistral의 효율적인 모델 |
| mistral-small3.2:24b | 24B | Q4_K_M | 뛰어난 언어 품질 |
| nemotron-3-nano:30b | 30B | Q4_K_M | NVIDIA의 제품 |
| qwen3:14b | 14B | Q4_K_M | 최고의 지시 이끄는 능력 |
| qwen3.5:9b | 9B | Q4_K_M | 빠름, GPU 100% |
| qwen3.5:9b-q8_0 | 9B | Q8_0 | 더 높은 품질, GPU 100% |
| qwen3.5:27b | 27B | Q4_K_M | 훌륭한 품질, Ollama에서 느림 |
| qwen3-vl:30b-a3b | 30B | Q4_K_M | 비전 기능 보유 |
| qwen3-coder:30b | 30B | Q4_K_M | 코드 중심 |
| qwen3.5:35b | 35B | Q4_K_M | 좋은 코딩 능력 |
모든 모델을 다운로드하려면:
ollama pull gpt-oss:20b
ollama pull qwen3:14b
CPU 오프로딩 이해하기
모델의 메모리 요구량이 사용 가능한 VRAM을 초과하면, Ollama는 자동으로 모델 레이어를 GPU와 시스템 RAM 사이에 분배합니다. 출력은 “18%/82% CPU/GPU"와 같은 백분율 분할로 표시됩니다.
이는 성능에 막대한 영향을 미칩니다. 각 토큰 생성은 CPU와 GPU 메모리 사이의 데이터 전송을 필요로 하며—오프로드된 레이어마다 복합적으로 증가하는 병목 현상이 됩니다.
우리의 결과에서 패턴은 명확합니다:
- GPU 100% 모델: 초당 61-140 토큰
- GPU 70-82% 모델: 초당 19-51 토큰
- GPU 22% (주로 CPU): 초당 12.6 토큰
이것은 20B 파라미터 모델이 실제에서 120B 모델을 11배로 능가할 수 있는 이유를 설명합니다. 동시 요청을 처리할 것을 계획하고 있다면, Ollama가 병렬 요청을 처리하는 방식을 이해하는 것이 용량 계획에 필수적입니다. 위의 CPU 오프로드 분할은 사실 변형된 KV-캐시 및 가중치 버짓 문제입니다 — 16 GB GPU에서의 KV 캐시는 더 작은 모델로 내려가지 않고도 여유 공간을 되찾을 수 있는 정확한 수학과 OLLAMA_KV_CACHE_TYPE 설정을 안내합니다.
상세 벤치마크 결과
GPU에서 100% 실행되는 모델
GPT-OSS 20B — 속도 챔피언
ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b 14 GB 100% GPU 19000
eval count: 2856 token(s)
eval duration: 20.410517947s
eval rate: 139.93 tokens/s
초당 139.93 토큰으로, GPT-OSS 20B는 속도 비판적인 애플리케이션에서 명백한 승자입니다. 이 모델은 VRAM 중 14GB만 사용하여 더 큰 컨텍스트 윈도우나 다른 GPU 워크로드에 여유 공간을 남깁니다.
Qwen3 14B — 뛰어난 균형
ollama run qwen3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3:14b 12 GB 100% GPU 19000
eval count: 3094 token(s)
eval duration: 50.020594575s
eval rate: 61.85 tokens/s
Qwen3 14B는 제 경험상 최고의 지시 이끄는 능력을 제공하며, 12GB라는 쾌적한 메모리 footprint를 가집니다. 초당 61.85 토큰으로, 인터랙티브 사용에 충분한 응답 속도를 제공합니다.
Qwen3를 애플리케이션에 통합하는 개발자를 위해, 구조화된 JSON 응답을 추출하는 방법을 보려면 Ollama와 Qwen3를 이용한 LLM 구조화된 출력를 참고하세요.
Ministral 3 14B — 빠르고 컴팩트
ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
ministral-3:14b 13 GB 100% GPU 19000
eval count: 1481 token(s)
eval duration: 21.11734277s
eval rate: 70.13 tokens/s
Mistral의 더 작은 모델은 VRAM에 완전히 포함되면서 초당 70.13 토큰을 달성합니다. 최대 속도로 Mistral 계열의 품질이 필요할 때 현명한 선택입니다.
qwen3.5:9b - 빠르고 새로운 모델
ollama run qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b 6488c96fa5fa 9.3 GB 100% GPU 19000
eval count: 3802 token(s)
eval duration: 41.830174597s
eval rate: 90.89 tokens/s
qwen3.5:9b-q8_0 - q8 양자화
이 양자화는 q4와 비교할 때 qwen3.5:9b의 성능을 30% 떨어뜨립니다.
ollama run qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b-q8_0 441ec31e4d2a 13 GB 100% GPU 19000
eval count: 3526 token(s)
eval duration: 57.595540159s
eval rate: 61.22 tokens/s
CPU 오프로딩이 필요한 모델
qwen3-coder:30b - 텍스트 전용이므로 30b LLM 세트 중 가장 빠름
ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3-coder:30b 06c1097efce0 20 GB 25%/75% CPU/GPU 19000
22%/605%
eval count: 559 token(s)
eval duration: 9.77768875s
eval rate: 57.17 tokens/s
Qwen3-VL 30B — 부분 오프로드 시 최고 성능
ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3-vl:30b-a3b-instruct 22 GB 30%/70% CPU/GPU 19000
eval count: 1450 token(s)
eval duration: 28.439319709s
eval rate: 50.99 tokens/s
레이어의 30%가 CPU에 있더라도, Qwen3-VL은 초당 50.99 토큰을 유지합니다—이는 일부 GPU 100% 모델보다 빠릅니다. 비전 기능은 멀티모달 작업에 다양성을 더합니다.
Mistral Small 3.2 24B — 품질 vs 속도 트레이드오프
ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 19000
eval count: 831 token(s)
eval duration: 44.899859038s
eval rate: 18.51 tokens/s
Mistral Small 3.2는 우수한 언어 품질을 제공하지만 가파른 속도 페널티를 지불합니다. 초당 18.51 토큰으로, 인터랙티브 채팅에서 눈에 띄게 느리게 느껴집니다. 품질이 지연 시간보다 중요한 작업을 위해라면 가치가 있습니다.
GLM 4.7 Flash — MoE 사고 모델
ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
glm-4.7-flash 21 GB 27%/73% CPU/GPU 19000
eval count: 2446 token(s)
eval duration: 1m12.239164004s
eval rate: 33.86 tokens/s
GLM 4.7 Flash는 30B-A3B Mixture of Experts(MoE) 모델입니다—총 30B 파라미터 중 토큰당 활성 파라미터는 3B만 있습니다. “사고(thinking)” 모델로서, 응답 전에 내부 추론을 생성합니다. 초당 33.86 토큰은 사고 토큰과 출력 토큰 모두를 포함합니다. CPU 오프로딩에도 불구하고, MoE 아키텍처는 합리적으로 빠른 속도를 유지하게 합니다.
qwen3.5:35b - 자체 호스팅 성능이 적당히 좋은 새로운 모델
ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:35b 4af949f8bdf0 27 GB 43%/57% CPU/GPU 19000
eval count: 3418 token(s)
eval duration: 2m45.458926548s
eval rate: 20.66 tokens/s
GPT-OSS 120B — 헤비 히터
ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:120b 66 GB 78%/22% CPU/GPU 19000
eval count: 5008 token(s)
eval duration: 6m36.168233066s
eval rate: 12.64 tokens/s
16GB VRAM에서 120B 모델을 실행하는 것은 기술적으로 가능하지만 고통스럽습니다. 78%가 CPU에 오프로드되면서, 초당 12.64 토큰은 인터랙티브 사용을 짜증스럽게 만듭니다. 지연 시간이 중요하지 않는 배치 처리에 더 적합합니다.
qwen3.5:27b - 똑똑하지만 Ollama에서는 느림
ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:27b 193ec05b1e80 24 GB 43%/57% CPU/GPU 19000
eval count: 3370 token(s)
eval duration: 8m40.087510281s
eval rate: 6.48 tokens/s
저는 qwen3.5:27b를 테스트해 보았으며, OpenCode에서의 이 모델의 성능에 대해 매우 좋은 인상을 받았습니다. 매우 유능하고, 지식渊博하며, 도구 호출(tool calling)도 정말 좋습니다. 다만 제 머신에서 Ollama를 사용할 때는 느립니다. 다른 LLM 자체 호스팅 플랫폼을 시도해 보았고, 훨씬 더 높은 속도를 얻었습니다. Ollama를 떠나야 할 때라고 생각합니다. 나중에 이에 대해 조금 작성해 보겠습니다.
실용적인 권장 사항
인터랙티브 채팅을 위한
VRAM에 100% 포함된 모델을 사용하세요:
- GPT-OSS 20B — 최대 속도 (초당 139.93 토큰)
- Ministral 3 14B — Mistral 품질과 좋은 속도 (초당 70.13 토큰)
- Qwen3 14B — 최고의 지시 이끄는 능력 (초당 61.85 토큰)
더 나은 채팅 경험을 위해, 로컬 Ollama용 오픈소스 채트 UI를 고려해 보세요.
배치 처리를 위한
이것도 제 장비(14GB VRAM)에서의 결과입니다.
속도가 덜 중요할 때:
- Mistral Small 3.2 24B — 우수한 언어 품질
- Qwen3-VL 30B — 비전 + 텍스트 기능
속도가 전혀 중요하지 않을 때:
- Qwen3.5:35b - 좋은 코딩 능력
- Qwen3.5:27b - 매우 좋지만 Ollama에서는 느립니다. 이 모델을 llama.cpp에서 호스팅할 때 상당한 성공을 거두었습니다.
개발 및 코딩을 위한
Ollama로 애플리케이션을 구축하고 있다면:
대안 호스팅 옵션
Ollama의 제한 사항이 우려된다면 (Ollama의 품질 저하 우려를 참고), 로컬 LLM 호스팅 가이드에서 다른 옵션을 탐색하거나 Docker Model Runner vs Ollama를 비교해 보세요.
결론
16GB VRAM을 사용하면 현명하게 선택할 때 인상적인 속도로 능력 있는 LLM을 실행할 수 있습니다. 주요 발견 사항은 다음과 같습니다:
-
인터랙티브 사용을 위해 VRAM 한계 내로 유지하세요. 대부분의 실용적인 목적에서 초당 140 토큰의 20B 모델은 초당 12 토큰의 120B 모델보다 나습니다.
-
GPT-OSS 20B는 순수한 속도에서 승리하지만, Qwen3 14B는 지시 이끄는 작업에서 속도와 능력의 최고의 균형을 제공합니다.
-
CPU 오프로딩은 작동하지만 3-10배의 속도 저하를 예상하세요. 배치 처리에는 허용할 수 있지만, 채팅에는 짜증스러울 수 있습니다.
-
컨텍스트 크기가 중요합니다. 여기서 사용된 19K 컨텍스트는 VRAM 사용을 상당히 증가시킵니다. 더 나은 GPU 활용을 위해 컨텍스트를 줄이세요.
로컬 LLM과 웹 검색 결과를 결합한 AI 기반 검색을 위해, Ollama를 이용한 Perplexica 자체 호스팅을 확인하세요.
더 많은 벤치마크, VRAM과 처리량의 트레이드오프, 그리고 Ollama 및 다른 런타임에 걸친 성능 튜닝을 탐색하려면, 저희의 LLM 성능: 벤치마크, 병목 현상 및 최적화 허브를 확인해 보세요.
유용한 링크
내부 리소스
- Ollama 치트시트: 가장 유용한 Ollama 명령어들
- Ollama가 병렬 요청을 처리하는 방식
- Ollama가 Intel CPU 성능 코어 및 효율 코어를 사용하는 방식
- 로컬 LLM 호스팅: 2026년 완전 가이드 - Ollama, vLLM, LocalAI, Jan, LM Studio 등
- 2026년 오픈 모델의 효율적 프론티어