Porównanie: Qwen3:30b vs GPT-OSS:20b

Porównanie szybkości, parametrów i wydajności tych dwóch modeli

Page content

Oto porównanie Qwen3:30b i GPT-OSS:20b z naciskiem na przestrzeganie instrukcji oraz parametry wydajności, specyfikacje i prędkość.

Aby dowiedzieć się więcej na temat przepustowości, opóźnień, VRAM oraz wyników benchmarków w różnych środowiskach uruchomieniowych i na różnych sprzętach, zobacz Wydajność LLM: Benchmarki, wąskie gardła i optymalizacja.

7 lam

W przypadku domyślnych ustawień próbkowania skierowanych na pętle agenticzne w nowszej serii Qwen (w tym kary oraz predefiniowane ustawienia dla myślenia i kodowania), skonfrontuj je z parametrami inferencji agentic dla Qwen i Gemma.

Architektura i parametry

Cecha Qwen3:30b-instruct GPT-OSS:20b
Łączna liczba parametrów 30,5 miliarda 21 miliardów
Aktywowane parametry ~3,3 miliarda ~3,6 miliarda
Liczba warstw 48 24
Eksperci MoE na warstwę 128 (8 aktywnych na token) 32 (4 aktywne na token)
Mechanizm uwagi Grouped Query Attention (32Q /4KV) Grouped Multi-Query Attention (64Q /8KV)
Okno kontekstu 32 768 natywnych; do 262 144 po rozszerzeniu 128 000 tokenów
Tokenizator Bazujący na BPE, słownik 151 936 Bazujący na GPT, ≈ 200 tys. słów

Przestrzeganie instrukcji

  • Qwen3:30b-instruct został zoptymalizowany pod kątem przestrzegania instrukcji i wykazuje silne dopasowanie do preferencji ludzkich. Wykazuje doskonałe wyniki w pisaniu twórczym, odgrywaniu ról, wielorundowych dialogach i przestrzeganiu instrukcji wielojęzycznych. Ten wariant został dokładnie dostrojony specjalnie w celu zapewniania bardziej naturalnych, kontrolowanych i angażujących odpowiedzi zgodnych z instrukcjami użytkownika.
  • GPT-OSS:20b obsługuje przestrzeganie instrukcji, ale generalnie ocenia się go jako nieco gorszy niż Qwen3:30b-instruct pod względem precyzyjnego dostrojenia instrukcji. Zapewnia porównywalną obsługę wywołań funkcji, wyjścia strukturyzowane oraz tryby rozumowania, ale może odstawać w zakresie dopasowania konwersacyjnego i twórczych dialogów.

Wydajność i efektywność

  • Qwen3:30b-instruct wyróżnia się w rozumowaniu matematycznym, kodowaniu, złożonych zadaniach logicznych oraz w scenariuszach wielojęzycznych, obejmując 119 języków i dialektów. Jego tryb „myślenia” pozwala na rozszerzone rozumowanie, ale wiąże się z wyższymi kosztami pamięci.
  • GPT-OSS:20b osiąga wydajność porównywalną z modelem OpenAI o3-mini. Wykorzystuje mniej warstw, ale szerszych ekspertów na każdą warstwę oraz natywną kwantyzację MXFP4 dla wydajnej inferencji na sprzęcie konsumenckim z niższymi wymaganiami pamięciowymi (~16 GB w porównaniu z wyższymi dla Qwen3).
  • GPT-OSS jest około 33% bardziej efektywny pamięciowo i szybszy na określonych konfiguracjach sprzętowych, szczególnie na kartach graficznych konsumenckich, jednak Qwen3 często zapewnia lepsze dopasowanie i głębię rozumowania, zwłaszcza w złożonych zastosowaniach.
  • Qwen3 oferuje dłuższą dostępną opcję rozszerzonej długości kontekstu (do 262 144 tokenów) w porównaniu z 128 000 tokenów w GPT-OSS, co przynosi korzyści w zadaniach wymagających rozumienia bardzo długich kontekstów.

Zalecenia dotyczące użytkowania

  • Wybierz Qwen3:30b-instruct w przypadkach wymagających doskonałego przestrzegania instrukcji, generowania twórczego, obsługi wielu języków i złożonego rozumowania.
  • Wybierz GPT-OSS:20b, jeśli priorytetem jest efektywność pamięciowa, prędkość inferencji na sprzęcie konsumenckim i konkurencyjna wydajność bazowa przy mniejszej liczbie parametrów.

To porównanie wyróżnia Qwen3:30b-instruct jako głębszy, bardziej kompetentny model zaawansowanym dostrojeniem instrukcji, podczas gdy GPT-OSS:20b oferuje bardziej kompaktową, efektywną alternatywę z konkurencyjną wydajnością w standardowych benchmarkach.

Wyniki benchmarków bezpośrednio porównujące Qwen3:30b-instruct i GPT-OSS:20b w zakresie przestrzegania instrukcji oraz kluczowych parametrów wydajności (MMLU, LMEval, HumanEval) nie są bezpośrednio dostępne w wynikach wyszukiwania. Jednak na podstawie istniejących opublikowanych raportów benchmarkowych wielojęzycznych i wielozadaniowych:

MMLU (Massive Multitask Language Understanding)

Trudno znaleźć szczegółowe informacje, ale ogólnie:

  • Modele z serii Qwen3, szczególnie w skali 30B i większej, wykazują silne wyniki w MMLU, zazwyczaj przekraczające 89%, co wskazuje na bardzo konkurencyjną zdolność do przyswajania wiedzy i rozumowania w 57 różnorodnych domenach.
  • GPT-OSS:20b również radzi sobie dobrze w benchmarkach MMLU, ale zazwyczaj osiąga niższe wyniki niż większe modele Qwen ze względu na mniejszą liczbę parametrów i mniejszy nacisk na dostrojenie instrukcji.

LMEval (Zestaw narzędzi do oceny modeli językowych)

Niewiele szczegółów na ten moment:

  • Modele Qwen3 wykazują znaczną poprawę w rozumowaniu i zadaniach związanych z kodowaniem w ramach LMEval, z podwyższonymi wynikami w logice, rozumowaniu matematycznym i ogólnych zdolnościach.
  • GPT-OSS:20b zapewnia solidną wydajność bazową w LMEval, ale ogólnie ustępuje Qwen3:30b-instruct w zaawansowanych podzadaniach rozumowania i przestrzegania instrukcji.

HumanEval (Benchmark generowania kodu)

Niewiele danych, ale:

  • Qwen3:30b-instruct wykazuje silne wyniki w wielojęzycznych benchmarkach generowania kodu, takich jak HumanEval-XL, obsługując ponad 20 języków programowania i zapewniając wyższą dokładność generowania kodu międzyjęzykowego.
  • GPT-OSS:20b, mimo że konkurencyjny, osiąga nieco niższe wyniki niż Qwen3:30b-instruct w benchmarkach HumanEval, szczególnie w kontekście programowania wielojęzycznego i używania wielu języków, ze względu na mniej rozległe szkolenie wielojęzyczne.

Tabela podsumowująca (przybliżone trendy z literatury):

Benchmark Qwen3:30b-instruct GPT-OSS:20b Uwagi
Dokładność MMLU ~89-91% ~80-85% Qwen3 silniejszy w szerokiej wiedzy i rozumowaniu
Wyniki LMEval Wysokie, zaawansowane rozumowanie i kod Umiarkowane, bazowe rozumowanie Qwen3 przewyższa w matematyce i logice
HumanEval Wysoka wydajność generowania kodu wielojęzycznego Umiarkowana Qwen3 lepszy w generowaniu kodu międzyjęzykowego

Jeśli potrzebne są dokładne wartości z benchmarków, specjalistyczne wielojęzyczne, duże benchmarki, takie jak P-MMEval i HumanEval-XL, cytowane w niedawnych artykułach badawczych, zapewniają szczegółowe wyniki dla modeli, w tym Qwen3 i porównywalnych wariantów GPT-OSS, ale nie są one publicznie uporządkowane w celu bezpośredniego pobierania wyników obok siebie w tym momencie.

Porównanie prędkości Qwen3:30b i GPT-OSS:20b

Na moim sprzęcie (16 GB VRAM) uruchamiam Qwen3:30b i GPT-OSS:20b z oknem kontekstu 4000 tokenów, a generują one:

  • qwen3:30b-a3b => 45,68 tokenów/s
  • gpt-oss:20b => 129,52 tokenów/s

Dla porównania przetestowałem również qwen3:14b i gpt-oss:120b

  • qwen3:14b => 60,12 tokenów/s
  • gpt-oss:120b => 12,87 tokenów/s

Przy dłuższych oknach kontekstu prędkość będzie wolniejsza; w przypadku qwen3:30b-a3b prawdopodobnie znacznie wolniejsza. To znowu dotyczy mojego PC. Szczegóły techniczne pobrane z obszernego wyjścia oraz przydzielona pamięć znajduje się poniżej; polecenia do wypróbowania:

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • ollama ps pokazująca alokację pamięci przy kontekście 4K

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Warianty Qwen3:30b

Dostępne są trzy warianty modelu qwen3:30b: qwen3:30b, qwen3:30b-instruct i qwen3:30b-thinking.

Kluczowe różnice i zalecenia

  • qwen3:30b-instruct jest najlepszy do rozmów, w których priorytetem są instrukcje użytkownika, jasność i naturalny dialog.
  • qwen3:30b jest ogólną podstawą, odpowiednią, jeśli zarówno przestrzeganie instrukcji, jak i korzystanie z narzędzi są ważne w różnorodnych zadaniach.
  • qwen3:30b-thinking wykazuje doskonałe wyniki, gdy głównym celem jest głębokie rozumowanie, matematyka i kodowanie. Przewyższa pozostałe w zadaniach mierzących rygor logiczno-matematyczny, ale niekoniecznie jest lepsze w pisaniu twórczym lub swobodnych rozmowach.

Bezpośrednie porównanie benchmarków

Model Rozumowanie (AIME25) Kodowanie (LiveCodeBench) Ogólna wiedza (MMLU Redux) Prędkość i kontekst Idealne zastosowanie
qwen3:30b 70,9 57,4 89,5 256K tokenów; Szybko Ogólny język/agentów/wielojęzyczność
qwen3:30b-instruct N/A (Zaplanowane blisko 30b) N/A ~Taki sam jak 30b 256K tokenów Przestrzeganie instrukcji, dopasowanie
qwen3:30b-thinking 85,0 66,0 91,4 256K tokenów Matematyka, kod, rozumowanie, długie dokumenty

Aby uzyskać więcej benchmarków, opcji sprzętowych i ustawień wydajności, sprawdź nasz hub Wydajność LLM: Benchmarki, wąskie gardła i optymalizacja.

Przydatne linki

Subskrybuj

Otrzymuj nowe wpisy o systemach, infrastrukturze i inżynierii AI.