Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM

Тест скорости LLM на RTX 4080 с 16 ГБ видеопамяти

Содержимое страницы

Локальный запуск больших языковых моделей обеспечивает конфиденциальность, работу в автономном режиме и отсутствие затрат на API. Данный бенчмарк точно показывает, чего можно ожидать от 14 популярных LLM на Ollama на видеокарте RTX 4080.

Обладая видеокартой с 16 ГБ видеопамяти (VRAM), я постоянно сталкивался с компромиссом: большие модели с потенциально лучшим качеством или малые модели с более быстрым инференсом. Более подробная информация о производительности LLM — пропускная способность против латентности, ограничения VRAM, параллельные запросы и бенчмарки в разных средах выполнения — доступна в статье Производительность LLM: бенчмарки, узкие места и оптимизация.

В данной статье фокус сделан на Ollama. Для сравнения с той же категорией GPU на 16 ГБ, измеренной с помощью llama.cpp при контексте 19K, 32K и 64K (VRAM, загрузка GPU, токены в секунду для плотных и MoE-моделей), см. Бенчмарки LLM на 16 ГБ VRAM с llama.cpp (скорость и контекст).

После того как пропускная способность и распределение VRAM станут приемлемыми, для агентных задач по-прежнему требуются разумные пресеты температуры и штрафов для стеков типа Qwen и Gemma; см. Параметры агентного инференса для Qwen и Gemma.

Производительность LLM на Ollama - пересортика тараканов

Кратко (TL;DR)

Ниже представлена обновленная таблица сравнения производительности LLM на RTX 4080 16GB с Ollama 0.17.7, (2026-03-09) добавлены модели Qwen 3.5 9b, 9bq8, 27b и 35b:

Модель Использовано RAM+VRAM Разделение CPU/GPU Токенов/сек
gpt-oss:20b 14 ГБ 100% GPU 139.93
qwen3.5:9b 9.3 ГБ 100% GPU 90.89
ministral-3:14b 13 ГБ 100% GPU 70.13
qwen3:14b 12 ГБ 100% GPU 61.85
qwen3.5:9b-q8_0 13 ГБ 100% GPU 61.22
qwen3-coder:30b 20 ГБ 25%/75% CPU/GPU 57.17
qwen3-vl:30b-a3b 22 ГБ 30%/70% CPU/GPU 50.99
glm-4.7-flash 21 ГБ 27%/73% CPU/GPU 33.86
nemotron-3-nano:30b 25 ГБ 38%/62% CPU/GPU 32.77
qwen3.5:35b 27 ГБ 43%/57% CPU/GPU 20.66
devstral-small-2:24b 19 ГБ 18%/82% CPU/GPU 18.67
mistral-small3.2:24b 19 ГБ 18%/82% CPU/GPU 18.51
gpt-oss:120b 66 ГБ 78%/22% CPU/GPU 12.64
qwen3.5:27b 24 ГБ 43%/57% CPU/GPU 6.48

Ключевой вывод: Модели, которые полностью помещаются в VRAM, работают значительно быстрее. GPT-OSS 20B достигает 139.93 токенов/сек, в то время как GPT-OSS 120B с интенсивной выгрузкой на CPU «ползет» со скоростью 12.64 токена/сек — разница в скорости составляет 11 раз.

Настройка тестового оборудования

Бенчмарк был проведен на следующей системе:

  • GPU: NVIDIA RTX 4080 с 16 ГБ VRAM
  • CPU: Intel Core i7-14700 (8 P-ядер + 12 E-ядер)
  • RAM: 64 ГБ DDR5-6000

Это представляет собой распространенную конфигурацию потребительского оборудования высокого класса для локального инференса LLM. Видеопамять в 16 ГБ является критическим ограничением — она определяет, какие модели работают полностью на GPU, а каким требуется выгрузка на CPU.

Понимание того, как Ollama использует ядра Intel CPU становится важным, когда модели превышают вместимость VRAM, так как производительность CPU напрямую влияет на скорость инференса выгруженных слоев.

Цель данного бенчмарка

Основной целью было измерение скорости инференса в реалистичных условиях. Я уже знал из опыта, что Mistral Small 3.2 24B превосходит другие модели по качеству языка, в то время как Qwen3 14B предлагает лучшее следование инструкциям для моих конкретных случаев использования.

Данный бенчмарк отвечает на практический вопрос: Насколько быстро каждая модель может генерировать текст и какова цена в скорости при превышении лимитов VRAM?

Тестовые параметры были следующими:

  • Размер контекста: 19 000 токенов. Это среднее значение в моих запросах Generate.
  • Промпт: “compare weather and climate between capital cities of australia”
  • Метрика: eval rate (токенов в секунду во время генерации)

Установка и версия Ollama

Для всех тестов использовалась версия Ollama 0.15.2, последний выпуск на момент тестирования. Позже было проведено повторное тестирование на Ollama v 0.17.7 - для добавления моделей Qwen3.5. Полный справочник команд Ollama, использованных в этом бенчмарке, см. в Шпаргалке по Ollama.

Для быстрой установки Ollama на Linux:

curl -fsSL https://ollama.com/install.sh | sh

Проверка установки:

ollama --version

Если вам нужно хранить модели на другом диске из-за нехватки места, посмотрите, как переместить модели Ollama на другой диск.

Тестированные модели

Следующие модели были протестированы, в алфавитном порядке:

Модель Параметры Квантизация Примечания
devstral-small-2:24b 24B Q4_K_M Ориентирована на код
glm-4.7-flash 30B Q4_K_M Мыслящая модель
gpt-oss:20b 20B Q4_K_M Самая быстрая в целом
gpt-oss:120b 120B Q4_K_M Самая большая из протестированных
ministral-3:14b 14B Q4_K_M Эффективная модель Mistral
mistral-small3.2:24b 24B Q4_K_M Высокое качество языка
nemotron-3-nano:30b 30B Q4_K_M Предложение от NVIDIA
qwen3:14b 14B Q4_K_M Лучшее следование инструкциям
qwen3.5:9b 9B Q4_K_M Быстрая, полностью на GPU
qwen3.5:9b-q8_0 9B Q8_0 Более высокое качество, полностью на GPU
qwen3.5:27b 27B Q4_K_M Отличное качество, медленная в Ollama
qwen3-vl:30b-a3b 30B Q4_K_M С поддержкой зрения
qwen3-coder:30b 30B Q4_K_M Ориентирована на код
qwen3.5:35b 35B Q4_K_M Хорошие возможности для программирования

Для загрузки любой модели:

ollama pull gpt-oss:20b
ollama pull qwen3:14b

Понимание выгрузки на CPU

Когда требования модели к памяти превышают доступную VRAM, Ollama автоматически распределяет слои модели между GPU и системной RAM. Вывод показывает это в виде процентного разделения, например “18%/82% CPU/GPU”.

Это имеет огромные последствия для производительности. Каждая генерация токена требует передачи данных между памятью CPU и GPU — узкое место, которое усиливается с каждым слоем, выгруженным на CPU.

Паттерн очевиден из наших результатов:

  • Модели 100% GPU: 61-140 токенов/сек
  • Модели 70-82% GPU: 19-51 токенов/сек
  • GPU 22% (в основном CPU): 12.6 токенов/сек

Это объясняет, почему модель с 20B параметров может превзойти модель с 120B параметров в 11 раз на практике. Если вы планируете обслуживать несколько одновременных запросов, понимание того, как Ollama обрабатывает параллельные запросы становится essential для планирования емкости. Разделение выгрузки на CPU выше — это на самом деле проблема бюджета KV-кэша и весов в замаскированном виде — KV Cache на GPU 16 ГБ подробно разбирает точную математику и настройки OLLAMA_KV_CACHE_TYPE, которые позволяют вернуть запас производительности, не переходя на более мелкую модель.

Детальные результаты бенчмарка

Модели, работающие на 100% на GPU

GPT-OSS 20B — Чемпион скорости

ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000

NAME           SIZE     PROCESSOR    CONTEXT
gpt-oss:20b    14 GB    100% GPU     19000

eval count:           2856 token(s)
eval duration:        20.410517947s
eval rate:            139.93 tokens/s

Со скоростью 139.93 токенов/сек GPT-OSS 20B является очевидным победителем для приложений, где критична скорость. Он использует только 14 ГБ VRAM, оставляя запас для более крупных окон контекста или других задач на GPU.

Qwen3 14B — Отличный баланс

ollama run qwen3:14b --verbose
/set parameter num_ctx 19000

NAME         SIZE     PROCESSOR    CONTEXT
qwen3:14b    12 GB    100% GPU     19000

eval count:           3094 token(s)
eval duration:        50.020594575s
eval rate:            61.85 tokens/s

Qwen3 14B предлагает лучшее следование инструкциям, по моему опыту, с комфортным потреблением памяти в 12 ГБ. При 61.85 токенов/сек он достаточно отзывчив для интерактивного использования.

Для разработчиков, интегрирующих Qwen3 в приложения, см. Структурированный вывод LLM с Ollama и Qwen3 для извлечения структурированных JSON-ответов.

Ministral 3 14B — Быстрая и компактная

ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000

NAME               SIZE     PROCESSOR    CONTEXT
ministral-3:14b    13 GB    100% GPU     19000

eval count:           1481 token(s)
eval duration:        21.11734277s
eval rate:            70.13 tokens/s

Более маленькая модель от Mistral обеспечивает 70.13 токенов/сек, полностью помещаясь в VRAM. Сolidный выбор, когда вам нужно качество семейства Mistral на максимальной скорости.

qwen3.5:9b - быстрый и новый

ollama run  qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME          ID              SIZE      PROCESSOR    CONTEXT
qwen3.5:9b    6488c96fa5fa    9.3 GB    100% GPU     19000

eval count:           3802 token(s)
eval duration:        41.830174597s
eval rate:            90.89 tokens/s

qwen3.5:9b-q8_0 - q8 квантизация

Эта квантизация снижает производительность qwen3.5:9b на 30% по сравнению с q4.

ollama run  qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000

compare weather and climate between capital cities of australia
NAME               ID              SIZE     PROCESSOR    CONTEXT
qwen3.5:9b-q8_0    441ec31e4d2a    13 GB    100% GPU     19000

eval count:           3526 token(s)
eval duration:        57.595540159s
eval rate:            61.22 tokens/s

Модели, требующие выгрузки на CPU

qwen3-coder:30b - самая быстрая из набора LLM 30b благодаря работе только с текстом

ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME               ID              SIZE     PROCESSOR          CONTEXT
qwen3-coder:30b    06c1097efce0    20 GB    25%/75% CPU/GPU    19000
22%/605%

eval count:           559 token(s)
eval duration:        9.77768875s
eval rate:            57.17 tokens/s

Qwen3-VL 30B — Лучшая производительность при частичной выгрузке

ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000

NAME                         SIZE     PROCESSOR          CONTEXT
qwen3-vl:30b-a3b-instruct    22 GB    30%/70% CPU/GPU    19000

eval count:           1450 token(s)
eval duration:        28.439319709s
eval rate:            50.99 tokens/s

Несмотря на 30% слоев на CPU, Qwen3-VL сохраняет 50.99 токенов/сек — быстрее некоторых моделей, работающих на 100% на GPU. Возможность зрительного восприятия добавляет универсальности для мультимодальных задач.

Mistral Small 3.2 24B — Компромисс между качеством и скоростью

ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000

NAME                    SIZE     PROCESSOR          CONTEXT
mistral-small3.2:24b    19 GB    18%/82% CPU/GPU    19000

eval count:           831 token(s)
eval duration:        44.899859038s
eval rate:            18.51 tokens/s

Mistral Small 3.2 предлагает превосходное качество языка, но требует значительных затрат в скорости. При 18.51 токенах/сек он заметно медленнее для интерактивного чата. Стоит того для задач, где качество важнее латентности.

GLM 4.7 Flash — MoE мыслящая модель

ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000

NAME                 SIZE     PROCESSOR          CONTEXT
glm-4.7-flash        21 GB    27%/73% CPU/GPU    19000

eval count:           2446 token(s)
eval duration:        1m12.239164004s
eval rate:            33.86 tokens/s

GLM 4.7 Flash — это модель Mixture of Experts (MoE) с 30B-A3B — всего 30B параметров, но активных только 3B на токен. Как «мыслящая» модель, она генерирует внутреннее рассуждение перед ответами. Скорость 33.86 токенов/сек включает как токены размышления, так и выходные токены. Несмотря на выгрузку на CPU, архитектура MoE сохраняет приемлемую скорость.

qwen3.5:35b - Новая модель с приличной производительностью при самохостинге

ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME           ID              SIZE     PROCESSOR          CONTEXT
qwen3.5:35b    4af949f8bdf0    27 GB    43%/57% CPU/GPU    19000

eval count:           3418 token(s)
eval duration:        2m45.458926548s
eval rate:            20.66 tokens/s

GPT-OSS 120B — Тяжеловес

ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000

NAME            SIZE     PROCESSOR          CONTEXT
gpt-oss:120b    66 GB    78%/22% CPU/GPU    19000

eval count:           5008 token(s)
eval duration:        6m36.168233066s
eval rate:            12.64 tokens/s

Запуск модели 120B на 16 ГБ VRAM технически возможен, но болезнен. При 78% на CPU скорость 12.64 токенов/сек делает интерактивное использование раздражающим. Лучше подходит для пакетной обработки, где латентность не важна.

qwen3.5:27b - Умная, но медленная в Ollama

ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME           ID              SIZE     PROCESSOR          CONTEXT
qwen3.5:27b    193ec05b1e80    24 GB    43%/57% CPU/GPU    19000

eval count:           3370 token(s)
eval duration:        8m40.087510281s
eval rate:            6.48 tokens/s

Я протестировал qwen3.5:27b и получил чрезвычайно хорошее мнение о производительности этой модели с OpenCode. Она очень способная, эрудированная, действительно хороший вызов инструментов (tool calling), хотя она медленная на моей машине в Ollama. Я пробовал другие платформы самохостинга LLM и получал значительно более высокие скорости. Я считаю, что пришло время отпустить Ollama. Расскажу об этом немного позже.

Практические рекомендации

Для интерактивного чата

Используйте модели, которые помещаются на 100% в VRAM:

  1. GPT-OSS 20B — Максимальная скорость (139.93 т/с)
  2. Ministral 3 14B — Хорошая скорость с качеством Mistral (70.13 т/с)
  3. Qwen3 14B — Лучшее следование инструкциям (61.85 т/с)

Для лучшего опыта чата рассмотрите Чат-интерфейсы с открытым исходным кодом для локального Ollama.

Для пакетной обработки

Это опять же, на моем оборудовании - 14GB VRAM.

Когда скорость менее критична:

  • Mistral Small 3.2 24B — Превосходное качество языка
  • Qwen3-VL 30B — Возможность зрения + текста

Когда скорость вообще не критична:

  • Qwen3.5:35b - Хорошие возможности для программирования
  • Qwen3.5:27b - Исключительно хорошая, но медленная в Ollama. У меня был相当大的 успех при хостинге этой модели на llama.cpp.

Для разработки и программирования

Если вы строите приложения с Ollama:

Альтернативные варианты хостинга

Если ограничения Ollama вас беспокоят (см. Беспокойство по поводу деградации Ollama), рассмотрите другие варианты в Руководстве по локальному хостингу LLM или сравните Docker Model Runner против Ollama.

Заключение

С 16 ГБ VRAM вы можете запускать способные LLM на впечатляющих скоростях — если выбираете грамотно. Ключевые выводы:

  1. Оставайтесь в пределах лимитов VRAM для интерактивного использования. Модель 20B со скоростью 140 токенов/сек превосходит модель 120B со скоростью 12 токенов/сек для большинства практических задач.

  2. GPT-OSS 20B побеждает по чистой скорости, но Qwen3 14B предлагает лучший баланс скорости и возможностей для задач следования инструкциям.

  3. Выгрузка на CPU работает, но ожидайте замедления в 3-10 раз. Приемлемо для пакетной обработки, раздражающе для чата.

  4. Размер контекста имеет значение. Контекст 19K, использованный здесь, значительно увеличивает использование VRAM. Уменьшите контекст для лучшей утилизации GPU.

Для поиска с использованием ИИ, комбинирующего локальные LLM с веб-результатами, см. Самохостинг Perplexica с Ollama.

Чтобы изучить больше бенчмарков, компромиссы между VRAM и пропускной способностью и настройку производительности в Ollama и других средах выполнения, загляните в наш хаб Производительность LLM: бенчмарки, узкие места и оптимизация.

Полезные ссылки

Внутренние ресурсы

Внешние ссылки

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.