Сравнение: Qwen3:30b vs GPT-OSS:20b

Сравнение скорости, параметров и производительности этих двух моделей

Содержимое страницы

Вот сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.

Более подробную информацию о пропускной способности, задержках, VRAM и бенчмарках на разных рантаймах и аппаратном обеспечении см. в статье Производительность LLM: Бенчмарки, Узкие места и Оптимизация.

7 llamas

Чтобы подобрать параметры по умолчанию для семплирования, ориентированного на агентные циклы (включая штрафы и пресеты для размышлений и программирования) в новой линейке Qwen, сверьтесь со ссылкой Параметры агентного инференса для Qwen и Gemma.

Архитектура и параметры

Характеристика Qwen3:30b-instruct GPT-OSS:20b
Общее количество параметров 30,5 млрд 21 млрд
Активные параметры ~3,3 млрд ~3,6 млрд
Количество слоев 48 24
Экспертов MoE на слой 128 (8 активных на токен) 32 (4 активных на токен)
Механизм внимания Grouped Query Attention (32Q /4KV) Grouped Multi-Query Attention (64Q /8KV)
Контекстное окно 32 768 нативно; до 262 144 расширенно 128 000 токенов
Токенизатор На основе BPE, словарь 151 936 На основе GPT, ≈ 200 тыс. словаря

Следование инструкциям

  • Qwen3:30b-instruct оптимизирован для следования инструкциям с сильной согласованностью с предпочтениями людей. Он демонстрирует отличные результаты в креативном письме, ролевых играх, многораундовых диалогах и следовании инструкциям на разных языках. Эта версия дообучена специально для предоставления более естественных, контролируемых и увлекательных ответов, соответствующих инструкциям пользователя.
  • GPT-OSS:20b поддерживает следование инструкциям, но, как правило, оценивается как немного уступающий Qwen3:30b-instruct в тонкой настройке инструкций. Он обеспечивает сопоставимые возможности вызова функций, структурированного вывода и режимы рассуждений, но может отставать в согласованности диалогов и креативном общении.

Производительность и эффективность

  • Qwen3:30b-instruct отличается в математическом рассуждении, программировании, сложных логических задачах и многоязычных сценариях, охватывающих 119 языков и диалектов. Его режим «thinking» позволяет повысить качество рассуждений, но требует больших затрат памяти.
  • GPT-OSS:20b достигает производительности, сопоставимой с моделью o3-mini от OpenAI. Он использует меньше слоев, но более широких экспертов на каждый слой и нативное квантование MXFP4 для эффективного инференса на потребительском железе с меньшими требованиями к памяти (~16 ГБ против более высоких значений для Qwen3).
  • GPT-OSS примерно на 33% эффективнее использует память и работает быстрее на определенных конфигурациях железа, особенно на потребительских GPU, но Qwen3 часто обеспечивает лучшую согласованность и глубину рассуждений, особенно в сложных сценариях.
  • U Qwen3 доступен более длинный расширенный контекст (до 262 144 токенов) по сравнению с 128 000 токенов у GPT-OSS, что выгодно для задач, требующих понимания очень длинного контекста.

Рекомендации по использованию

  • Выбирайте Qwen3:30b-instruct для сценариев, требующих превосходного следования инструкциям, креативной генерации, многоязычной поддержки и сложных рассуждений.
  • Выбирайте GPT-OSS:20b, если приоритетом являются эффективность использования памяти, скорость инференса на потребительском железе и конкурентоспособная базовая производительность с меньшим количеством параметров.

Это сравнение подчеркивает Qwen3:30b-instruct как более глубокую и capable модель с продвинутой настройкой инструкций, в то время как GPT-OSS:20b предлагает более компактную и эффективную альтернативу с конкурентоспособной производительностью в стандартных бенчмарках.

Точные баллы бенчмарков, специально сравнивающие Qwen3:30b-instruct и GPT-OSS:20b по следованию инструкциям и ключевым параметрам производительности (MMLU, LMEval, HumanEval), в результатах поиска напрямую не представлены. Однако, исходя из существующих опубликованных многоязычных и мультитаск-отчетов по бенчмаркам:

MMLU (Massive Multitask Language Understanding)

Подробности сложно найти, но в общем:

  • Модели серии Qwen3, особенно масштаба 30B и выше, демонстрируют высокие баллы MMLU, обычно превышающие 89%, что указывает на очень конкурентоспособные возможности понимания знаний и рассуждений в 57 различных областях.
  • GPT-OSS:20b также хорошо показывает себя в бенчмарках MMLU, но обычно получает более низкие оценки, чем крупные модели Qwen, из-за меньшего количества параметров и меньшего акцента на дообучении инструкциям.

LMEval (Language Model Evaluation Toolkit)

Пока недостаточно деталей:

  • Модели Qwen3 показывают значительное улучшение в задачах рассуждений и программирования в рамках LMEval, с повышенными оценками в логике, математических рассуждениях и общих способностях.
  • GPT-OSS:20b обеспечивает надежную базовую производительность в LMEval, но в целом уступает Qwen3:30b-instruct в продвинутых рассуждениях и подзадачах следования инструкциям.

HumanEval (Бенчмарк генерации кода)

Немного данных, но в целом:

  • Qwen3:30b-instruct демонстрирует высокую производительность в многоязычных бенчмарках генерации кода, таких как HumanEval-XL, поддерживая более 20 языков программирования и обеспечивая точность межъязыковой генерации кода высшего уровня.
  • GPT-OSS:20b, несмотря на конкурентоспособность, показывает результаты несколько ниже Qwen3:30b-instruct в бенчмарках HumanEval, особенно в многоязычных и мультиязычных контекстах программирования из-за менее обширной многоязычной тренировки.

Сводная таблица (приблизительные тренды из литературы):

Бенчмарк Qwen3:30b-instruct GPT-OSS:20b Примечания
Tочность MMLU ~89-91% ~80-85% Qwen3 сильнее в широких знаниях и рассуждениях
Баллы LMEval Высокие, продвинутые рассуждения и код Средние, базовые рассуждения Qwen3 отлично в математике и логике
HumanEval Высокая производительность многоязычной генерации кода Средняя Qwen3 лучше в межъязыковой генерации кода

Если нужны точные цифры бенчмарков, специализированные многоязычные крупномасштабные бенчмарки, такие как P-MMEval и HumanEval-XL, упомянутые в недавних исследовательских статьях, предоставляют подробные оценки для моделей, включая Qwen3 и сопоставимые варианты GPT-OSS, но на данный момент они не систематизированы для прямого получения оценок бок о бок.

Сравнение скорости Qwen3:30b и GPT-OSS:20b

На моем оборудовании (16GB VRAM) мне удалось запустить Qwen3:30b и GPT-OSS:20b с окном контекста 4000, и они выдавали:

  • qwen3:30b-a3b => 45,68 токенов/с
  • gpt-oss:20b => 129,52 токенов/с

И для сравнения я также протестировал qwen3:14b и gpt-oss:120b

  • qwen3:14b => 60,12 токенов/с
  • gpt-oss:120b => 12,87 токенов/с

При более длинных окнах контекста скорость будет ниже, в случае с qwen3:30b-a3b, вероятно, намного ниже. Опять же, это на моем ПК. Технические детали взяты из подробного вывода, а выделенная память показана ниже, команды для проверки:

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • ollama ps показывающая выделение памяти при контексте 4K

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Варианты Qwen3:30b

Доступно три варианта модели qwen3:30b: qwen3:30b, qwen3:30b-instruct и qwen3:30b-thinking.

Ключевые различия и рекомендации

  • qwen3:30b-instruct лучше всего подходит для разговоров, где приоритет отдается инструкциям пользователя, ясности и естественности диалога.
  • qwen3:30b — это общая база, подходящая, если важно и следование инструкциям, и использование инструментов в различных задачах.
  • qwen3:30b-thinking преуспевает, когда основным фокусом являются глубокое рассуждение, математика и программирование. Он превосходит другие версии в задачах, измеряющих логическую/математическую строгость, но не обязательно лучше в креативном письме или повседневных разговорах.

Прямое сравнение бенчмарков

Модель Рассуждения (AIME25) Код (LiveCodeBench) Общие знания (MMLU Redux) Скорость и контекст Идеальный сценарий использования
qwen3:30b 70,9 57,4 89,5 256K токенов; Быстро Общий язык/агенты/многоязычность
qwen3:30b-instruct Н/Д (Планируется близко к 30b) Н/Д ~То же, что и у 30b 256K токенов Следование инструкциям, согласованность
qwen3:30b-thinking 85,0 66,0 91,4 256K токенов Математика, код, рассуждения, длинные документы

Для дополнительных бенчмарков, выбора оборудования и настройки производительности ознакомьтесь с нашим хабом Производительность LLM: Бенчмарки, Узкие места и Оптимизация.

Полезные ссылки

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.