Сравнение: Qwen3:30b vs GPT-OSS:20b
Сравнение скорости, параметров и производительности этих двух моделей
Вот сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.
Более подробную информацию о пропускной способности, задержках, VRAM и бенчмарках на разных рантаймах и аппаратном обеспечении см. в статье Производительность LLM: Бенчмарки, Узкие места и Оптимизация.

Чтобы подобрать параметры по умолчанию для семплирования, ориентированного на агентные циклы (включая штрафы и пресеты для размышлений и программирования) в новой линейке Qwen, сверьтесь со ссылкой Параметры агентного инференса для Qwen и Gemma.
Архитектура и параметры
| Характеристика | Qwen3:30b-instruct | GPT-OSS:20b |
|---|---|---|
| Общее количество параметров | 30,5 млрд | 21 млрд |
| Активные параметры | ~3,3 млрд | ~3,6 млрд |
| Количество слоев | 48 | 24 |
| Экспертов MoE на слой | 128 (8 активных на токен) | 32 (4 активных на токен) |
| Механизм внимания | Grouped Query Attention (32Q /4KV) | Grouped Multi-Query Attention (64Q /8KV) |
| Контекстное окно | 32 768 нативно; до 262 144 расширенно | 128 000 токенов |
| Токенизатор | На основе BPE, словарь 151 936 | На основе GPT, ≈ 200 тыс. словаря |
Следование инструкциям
- Qwen3:30b-instruct оптимизирован для следования инструкциям с сильной согласованностью с предпочтениями людей. Он демонстрирует отличные результаты в креативном письме, ролевых играх, многораундовых диалогах и следовании инструкциям на разных языках. Эта версия дообучена специально для предоставления более естественных, контролируемых и увлекательных ответов, соответствующих инструкциям пользователя.
- GPT-OSS:20b поддерживает следование инструкциям, но, как правило, оценивается как немного уступающий Qwen3:30b-instruct в тонкой настройке инструкций. Он обеспечивает сопоставимые возможности вызова функций, структурированного вывода и режимы рассуждений, но может отставать в согласованности диалогов и креативном общении.
Производительность и эффективность
- Qwen3:30b-instruct отличается в математическом рассуждении, программировании, сложных логических задачах и многоязычных сценариях, охватывающих 119 языков и диалектов. Его режим «thinking» позволяет повысить качество рассуждений, но требует больших затрат памяти.
- GPT-OSS:20b достигает производительности, сопоставимой с моделью o3-mini от OpenAI. Он использует меньше слоев, но более широких экспертов на каждый слой и нативное квантование MXFP4 для эффективного инференса на потребительском железе с меньшими требованиями к памяти (~16 ГБ против более высоких значений для Qwen3).
- GPT-OSS примерно на 33% эффективнее использует память и работает быстрее на определенных конфигурациях железа, особенно на потребительских GPU, но Qwen3 часто обеспечивает лучшую согласованность и глубину рассуждений, особенно в сложных сценариях.
- U Qwen3 доступен более длинный расширенный контекст (до 262 144 токенов) по сравнению с 128 000 токенов у GPT-OSS, что выгодно для задач, требующих понимания очень длинного контекста.
Рекомендации по использованию
- Выбирайте Qwen3:30b-instruct для сценариев, требующих превосходного следования инструкциям, креативной генерации, многоязычной поддержки и сложных рассуждений.
- Выбирайте GPT-OSS:20b, если приоритетом являются эффективность использования памяти, скорость инференса на потребительском железе и конкурентоспособная базовая производительность с меньшим количеством параметров.
Это сравнение подчеркивает Qwen3:30b-instruct как более глубокую и capable модель с продвинутой настройкой инструкций, в то время как GPT-OSS:20b предлагает более компактную и эффективную альтернативу с конкурентоспособной производительностью в стандартных бенчмарках.
Точные баллы бенчмарков, специально сравнивающие Qwen3:30b-instruct и GPT-OSS:20b по следованию инструкциям и ключевым параметрам производительности (MMLU, LMEval, HumanEval), в результатах поиска напрямую не представлены. Однако, исходя из существующих опубликованных многоязычных и мультитаск-отчетов по бенчмаркам:
MMLU (Massive Multitask Language Understanding)
Подробности сложно найти, но в общем:
- Модели серии Qwen3, особенно масштаба 30B и выше, демонстрируют высокие баллы MMLU, обычно превышающие 89%, что указывает на очень конкурентоспособные возможности понимания знаний и рассуждений в 57 различных областях.
- GPT-OSS:20b также хорошо показывает себя в бенчмарках MMLU, но обычно получает более низкие оценки, чем крупные модели Qwen, из-за меньшего количества параметров и меньшего акцента на дообучении инструкциям.
LMEval (Language Model Evaluation Toolkit)
Пока недостаточно деталей:
- Модели Qwen3 показывают значительное улучшение в задачах рассуждений и программирования в рамках LMEval, с повышенными оценками в логике, математических рассуждениях и общих способностях.
- GPT-OSS:20b обеспечивает надежную базовую производительность в LMEval, но в целом уступает Qwen3:30b-instruct в продвинутых рассуждениях и подзадачах следования инструкциям.
HumanEval (Бенчмарк генерации кода)
Немного данных, но в целом:
- Qwen3:30b-instruct демонстрирует высокую производительность в многоязычных бенчмарках генерации кода, таких как HumanEval-XL, поддерживая более 20 языков программирования и обеспечивая точность межъязыковой генерации кода высшего уровня.
- GPT-OSS:20b, несмотря на конкурентоспособность, показывает результаты несколько ниже Qwen3:30b-instruct в бенчмарках HumanEval, особенно в многоязычных и мультиязычных контекстах программирования из-за менее обширной многоязычной тренировки.
Сводная таблица (приблизительные тренды из литературы):
| Бенчмарк | Qwen3:30b-instruct | GPT-OSS:20b | Примечания |
|---|---|---|---|
| Tочность MMLU | ~89-91% | ~80-85% | Qwen3 сильнее в широких знаниях и рассуждениях |
| Баллы LMEval | Высокие, продвинутые рассуждения и код | Средние, базовые рассуждения | Qwen3 отлично в математике и логике |
| HumanEval | Высокая производительность многоязычной генерации кода | Средняя | Qwen3 лучше в межъязыковой генерации кода |
Если нужны точные цифры бенчмарков, специализированные многоязычные крупномасштабные бенчмарки, такие как P-MMEval и HumanEval-XL, упомянутые в недавних исследовательских статьях, предоставляют подробные оценки для моделей, включая Qwen3 и сопоставимые варианты GPT-OSS, но на данный момент они не систематизированы для прямого получения оценок бок о бок.
Сравнение скорости Qwen3:30b и GPT-OSS:20b
На моем оборудовании (16GB VRAM) мне удалось запустить Qwen3:30b и GPT-OSS:20b с окном контекста 4000, и они выдавали:
- qwen3:30b-a3b => 45,68 токенов/с
- gpt-oss:20b => 129,52 токенов/с
И для сравнения я также протестировал qwen3:14b и gpt-oss:120b
- qwen3:14b => 60,12 токенов/с
- gpt-oss:120b => 12,87 токенов/с
При более длинных окнах контекста скорость будет ниже, в случае с qwen3:30b-a3b, вероятно, намного ниже. Опять же, это на моем ПК. Технические детали взяты из подробного вывода, а выделенная память показана ниже, команды для проверки:
- ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
- ollama ps показывающая выделение памяти при контексте 4K
qwen3:30b-a3b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-a3b 19e422b02313 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 28.151133548s
load duration: 1.980696196s
prompt eval count: 16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate: 98.41 tokens/s
eval count: 1188 token(s)
eval duration: 26.007424856s
eval rate: 45.68 tokens/s
qwen3:30b-thinking
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-thinking ad815644918f 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 1m8.317354579s
load duration: 1.984986882s
prompt eval count: 18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate: 81.95 tokens/s
eval count: 2722 token(s)
eval duration: 1m6.11230524s
eval rate: 41.17 tokens/s
gpt-oss:20b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b aa4295ac10c3 14 GB 100% GPU 4096 4 minutes from now
total duration: 31.505397616s
load duration: 13.744361948s
prompt eval count: 75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate: 300.77 tokens/s
eval count: 2268 token(s)
eval duration: 17.510262884s
eval rate: 129.52 tokens/s
qwen3:14b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:14b bdbd181c33f2 10 GB 100% GPU 4096 4 minutes from now
total duration: 36.902729562s
load duration: 38.669074ms
prompt eval count: 18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate: 509.61 tokens/s
eval count: 2214 token(s)
eval duration: 36.828268069s
eval rate: 60.12 tokens/s
gpt-oss:120b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b f7f8e2f8f4e0 65 GB 78%/22% CPU/GPU 4096 2 minutes from now
49GB RAM + 14.4GB VRAM
total duration: 3m59.967272019s
load duration: 76.758783ms
prompt eval count: 75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate: 252.26 tokens/s
eval count: 3084 token(s)
eval duration: 3m59.592764501s
eval rate: 12.87 tokens/s
Варианты Qwen3:30b
Доступно три варианта модели qwen3:30b: qwen3:30b, qwen3:30b-instruct и qwen3:30b-thinking.
Ключевые различия и рекомендации
- qwen3:30b-instruct лучше всего подходит для разговоров, где приоритет отдается инструкциям пользователя, ясности и естественности диалога.
- qwen3:30b — это общая база, подходящая, если важно и следование инструкциям, и использование инструментов в различных задачах.
- qwen3:30b-thinking преуспевает, когда основным фокусом являются глубокое рассуждение, математика и программирование. Он превосходит другие версии в задачах, измеряющих логическую/математическую строгость, но не обязательно лучше в креативном письме или повседневных разговорах.
Прямое сравнение бенчмарков
| Модель | Рассуждения (AIME25) | Код (LiveCodeBench) | Общие знания (MMLU Redux) | Скорость и контекст | Идеальный сценарий использования |
|---|---|---|---|---|---|
| qwen3:30b | 70,9 | 57,4 | 89,5 | 256K токенов; Быстро | Общий язык/агенты/многоязычность |
| qwen3:30b-instruct | Н/Д (Планируется близко к 30b) | Н/Д | ~То же, что и у 30b | 256K токенов | Следование инструкциям, согласованность |
| qwen3:30b-thinking | 85,0 | 66,0 | 91,4 | 256K токенов | Математика, код, рассуждения, длинные документы |
Для дополнительных бенчмарков, выбора оборудования и настройки производительности ознакомьтесь с нашим хабом Производительность LLM: Бенчмарки, Узкие места и Оптимизация.
Полезные ссылки
- https://ollama.com/library/qwen3
- https://ollama.com/library/gpt-oss
- https://artificialanalysis.ai/articles/analysis-openai-gpt-oss-models
- https://artificialanalysis.ai/models/qwen3-30b-a3b-2507
- Установка и настройка Ollama
- Шпаргалка по Ollama - самые полезные команды
- Ограничение LLM с помощью структурированного вывода: Ollama, Qwen3 и Python или Go
- Проверка валидности структурированного вывода LLM на Python, которая работает
- Интеграция Ollama с Python: примеры REST API и Python-клиента
- Эффективный фронт открытых моделей в 2026 году