Porównanie: Qwen3:30b vs GPT-OSS:20b
Porównanie szybkości, parametrów i wydajności tych dwóch modeli
Oto porównanie Qwen3:30b i GPT-OSS:20b z naciskiem na przestrzeganie instrukcji oraz parametry wydajności, specyfikacje i prędkość.
Aby dowiedzieć się więcej na temat przepustowości, opóźnień, VRAM oraz wyników benchmarków w różnych środowiskach uruchomieniowych i na różnych sprzętach, zobacz Wydajność LLM: Benchmarki, wąskie gardła i optymalizacja.

W przypadku domyślnych ustawień próbkowania skierowanych na pętle agenticzne w nowszej serii Qwen (w tym kary oraz predefiniowane ustawienia dla myślenia i kodowania), skonfrontuj je z parametrami inferencji agentic dla Qwen i Gemma.
Architektura i parametry
| Cecha | Qwen3:30b-instruct | GPT-OSS:20b |
|---|---|---|
| Łączna liczba parametrów | 30,5 miliarda | 21 miliardów |
| Aktywowane parametry | ~3,3 miliarda | ~3,6 miliarda |
| Liczba warstw | 48 | 24 |
| Eksperci MoE na warstwę | 128 (8 aktywnych na token) | 32 (4 aktywne na token) |
| Mechanizm uwagi | Grouped Query Attention (32Q /4KV) | Grouped Multi-Query Attention (64Q /8KV) |
| Okno kontekstu | 32 768 natywnych; do 262 144 po rozszerzeniu | 128 000 tokenów |
| Tokenizator | Bazujący na BPE, słownik 151 936 | Bazujący na GPT, ≈ 200 tys. słów |
Przestrzeganie instrukcji
- Qwen3:30b-instruct został zoptymalizowany pod kątem przestrzegania instrukcji i wykazuje silne dopasowanie do preferencji ludzkich. Wykazuje doskonałe wyniki w pisaniu twórczym, odgrywaniu ról, wielorundowych dialogach i przestrzeganiu instrukcji wielojęzycznych. Ten wariant został dokładnie dostrojony specjalnie w celu zapewniania bardziej naturalnych, kontrolowanych i angażujących odpowiedzi zgodnych z instrukcjami użytkownika.
- GPT-OSS:20b obsługuje przestrzeganie instrukcji, ale generalnie ocenia się go jako nieco gorszy niż Qwen3:30b-instruct pod względem precyzyjnego dostrojenia instrukcji. Zapewnia porównywalną obsługę wywołań funkcji, wyjścia strukturyzowane oraz tryby rozumowania, ale może odstawać w zakresie dopasowania konwersacyjnego i twórczych dialogów.
Wydajność i efektywność
- Qwen3:30b-instruct wyróżnia się w rozumowaniu matematycznym, kodowaniu, złożonych zadaniach logicznych oraz w scenariuszach wielojęzycznych, obejmując 119 języków i dialektów. Jego tryb „myślenia” pozwala na rozszerzone rozumowanie, ale wiąże się z wyższymi kosztami pamięci.
- GPT-OSS:20b osiąga wydajność porównywalną z modelem OpenAI o3-mini. Wykorzystuje mniej warstw, ale szerszych ekspertów na każdą warstwę oraz natywną kwantyzację MXFP4 dla wydajnej inferencji na sprzęcie konsumenckim z niższymi wymaganiami pamięciowymi (~16 GB w porównaniu z wyższymi dla Qwen3).
- GPT-OSS jest około 33% bardziej efektywny pamięciowo i szybszy na określonych konfiguracjach sprzętowych, szczególnie na kartach graficznych konsumenckich, jednak Qwen3 często zapewnia lepsze dopasowanie i głębię rozumowania, zwłaszcza w złożonych zastosowaniach.
- Qwen3 oferuje dłuższą dostępną opcję rozszerzonej długości kontekstu (do 262 144 tokenów) w porównaniu z 128 000 tokenów w GPT-OSS, co przynosi korzyści w zadaniach wymagających rozumienia bardzo długich kontekstów.
Zalecenia dotyczące użytkowania
- Wybierz Qwen3:30b-instruct w przypadkach wymagających doskonałego przestrzegania instrukcji, generowania twórczego, obsługi wielu języków i złożonego rozumowania.
- Wybierz GPT-OSS:20b, jeśli priorytetem jest efektywność pamięciowa, prędkość inferencji na sprzęcie konsumenckim i konkurencyjna wydajność bazowa przy mniejszej liczbie parametrów.
To porównanie wyróżnia Qwen3:30b-instruct jako głębszy, bardziej kompetentny model zaawansowanym dostrojeniem instrukcji, podczas gdy GPT-OSS:20b oferuje bardziej kompaktową, efektywną alternatywę z konkurencyjną wydajnością w standardowych benchmarkach.
Wyniki benchmarków bezpośrednio porównujące Qwen3:30b-instruct i GPT-OSS:20b w zakresie przestrzegania instrukcji oraz kluczowych parametrów wydajności (MMLU, LMEval, HumanEval) nie są bezpośrednio dostępne w wynikach wyszukiwania. Jednak na podstawie istniejących opublikowanych raportów benchmarkowych wielojęzycznych i wielozadaniowych:
MMLU (Massive Multitask Language Understanding)
Trudno znaleźć szczegółowe informacje, ale ogólnie:
- Modele z serii Qwen3, szczególnie w skali 30B i większej, wykazują silne wyniki w MMLU, zazwyczaj przekraczające 89%, co wskazuje na bardzo konkurencyjną zdolność do przyswajania wiedzy i rozumowania w 57 różnorodnych domenach.
- GPT-OSS:20b również radzi sobie dobrze w benchmarkach MMLU, ale zazwyczaj osiąga niższe wyniki niż większe modele Qwen ze względu na mniejszą liczbę parametrów i mniejszy nacisk na dostrojenie instrukcji.
LMEval (Zestaw narzędzi do oceny modeli językowych)
Niewiele szczegółów na ten moment:
- Modele Qwen3 wykazują znaczną poprawę w rozumowaniu i zadaniach związanych z kodowaniem w ramach LMEval, z podwyższonymi wynikami w logice, rozumowaniu matematycznym i ogólnych zdolnościach.
- GPT-OSS:20b zapewnia solidną wydajność bazową w LMEval, ale ogólnie ustępuje Qwen3:30b-instruct w zaawansowanych podzadaniach rozumowania i przestrzegania instrukcji.
HumanEval (Benchmark generowania kodu)
Niewiele danych, ale:
- Qwen3:30b-instruct wykazuje silne wyniki w wielojęzycznych benchmarkach generowania kodu, takich jak HumanEval-XL, obsługując ponad 20 języków programowania i zapewniając wyższą dokładność generowania kodu międzyjęzykowego.
- GPT-OSS:20b, mimo że konkurencyjny, osiąga nieco niższe wyniki niż Qwen3:30b-instruct w benchmarkach HumanEval, szczególnie w kontekście programowania wielojęzycznego i używania wielu języków, ze względu na mniej rozległe szkolenie wielojęzyczne.
Tabela podsumowująca (przybliżone trendy z literatury):
| Benchmark | Qwen3:30b-instruct | GPT-OSS:20b | Uwagi |
|---|---|---|---|
| Dokładność MMLU | ~89-91% | ~80-85% | Qwen3 silniejszy w szerokiej wiedzy i rozumowaniu |
| Wyniki LMEval | Wysokie, zaawansowane rozumowanie i kod | Umiarkowane, bazowe rozumowanie | Qwen3 przewyższa w matematyce i logice |
| HumanEval | Wysoka wydajność generowania kodu wielojęzycznego | Umiarkowana | Qwen3 lepszy w generowaniu kodu międzyjęzykowego |
Jeśli potrzebne są dokładne wartości z benchmarków, specjalistyczne wielojęzyczne, duże benchmarki, takie jak P-MMEval i HumanEval-XL, cytowane w niedawnych artykułach badawczych, zapewniają szczegółowe wyniki dla modeli, w tym Qwen3 i porównywalnych wariantów GPT-OSS, ale nie są one publicznie uporządkowane w celu bezpośredniego pobierania wyników obok siebie w tym momencie.
Porównanie prędkości Qwen3:30b i GPT-OSS:20b
Na moim sprzęcie (16 GB VRAM) uruchamiam Qwen3:30b i GPT-OSS:20b z oknem kontekstu 4000 tokenów, a generują one:
- qwen3:30b-a3b => 45,68 tokenów/s
- gpt-oss:20b => 129,52 tokenów/s
Dla porównania przetestowałem również qwen3:14b i gpt-oss:120b
- qwen3:14b => 60,12 tokenów/s
- gpt-oss:120b => 12,87 tokenów/s
Przy dłuższych oknach kontekstu prędkość będzie wolniejsza; w przypadku qwen3:30b-a3b prawdopodobnie znacznie wolniejsza. To znowu dotyczy mojego PC. Szczegóły techniczne pobrane z obszernego wyjścia oraz przydzielona pamięć znajduje się poniżej; polecenia do wypróbowania:
- ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
- ollama ps pokazująca alokację pamięci przy kontekście 4K
qwen3:30b-a3b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-a3b 19e422b02313 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 28.151133548s
load duration: 1.980696196s
prompt eval count: 16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate: 98.41 tokens/s
eval count: 1188 token(s)
eval duration: 26.007424856s
eval rate: 45.68 tokens/s
qwen3:30b-thinking
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-thinking ad815644918f 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 1m8.317354579s
load duration: 1.984986882s
prompt eval count: 18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate: 81.95 tokens/s
eval count: 2722 token(s)
eval duration: 1m6.11230524s
eval rate: 41.17 tokens/s
gpt-oss:20b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b aa4295ac10c3 14 GB 100% GPU 4096 4 minutes from now
total duration: 31.505397616s
load duration: 13.744361948s
prompt eval count: 75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate: 300.77 tokens/s
eval count: 2268 token(s)
eval duration: 17.510262884s
eval rate: 129.52 tokens/s
qwen3:14b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:14b bdbd181c33f2 10 GB 100% GPU 4096 4 minutes from now
total duration: 36.902729562s
load duration: 38.669074ms
prompt eval count: 18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate: 509.61 tokens/s
eval count: 2214 token(s)
eval duration: 36.828268069s
eval rate: 60.12 tokens/s
gpt-oss:120b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b f7f8e2f8f4e0 65 GB 78%/22% CPU/GPU 4096 2 minutes from now
49GB RAM + 14.4GB VRAM
total duration: 3m59.967272019s
load duration: 76.758783ms
prompt eval count: 75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate: 252.26 tokens/s
eval count: 3084 token(s)
eval duration: 3m59.592764501s
eval rate: 12.87 tokens/s
Warianty Qwen3:30b
Dostępne są trzy warianty modelu qwen3:30b: qwen3:30b, qwen3:30b-instruct i qwen3:30b-thinking.
Kluczowe różnice i zalecenia
- qwen3:30b-instruct jest najlepszy do rozmów, w których priorytetem są instrukcje użytkownika, jasność i naturalny dialog.
- qwen3:30b jest ogólną podstawą, odpowiednią, jeśli zarówno przestrzeganie instrukcji, jak i korzystanie z narzędzi są ważne w różnorodnych zadaniach.
- qwen3:30b-thinking wykazuje doskonałe wyniki, gdy głównym celem jest głębokie rozumowanie, matematyka i kodowanie. Przewyższa pozostałe w zadaniach mierzących rygor logiczno-matematyczny, ale niekoniecznie jest lepsze w pisaniu twórczym lub swobodnych rozmowach.
Bezpośrednie porównanie benchmarków
| Model | Rozumowanie (AIME25) | Kodowanie (LiveCodeBench) | Ogólna wiedza (MMLU Redux) | Prędkość i kontekst | Idealne zastosowanie |
|---|---|---|---|---|---|
| qwen3:30b | 70,9 | 57,4 | 89,5 | 256K tokenów; Szybko | Ogólny język/agentów/wielojęzyczność |
| qwen3:30b-instruct | N/A (Zaplanowane blisko 30b) | N/A | ~Taki sam jak 30b | 256K tokenów | Przestrzeganie instrukcji, dopasowanie |
| qwen3:30b-thinking | 85,0 | 66,0 | 91,4 | 256K tokenów | Matematyka, kod, rozumowanie, długie dokumenty |
Aby uzyskać więcej benchmarków, opcji sprzętowych i ustawień wydajności, sprawdź nasz hub Wydajność LLM: Benchmarki, wąskie gardła i optymalizacja.
Przydatne linki
- https://ollama.com/library/qwen3
- https://ollama.com/library/gpt-oss
- https://artificialanalysis.ai/articles/analysis-openai-gpt-oss-models
- https://artificialanalysis.ai/models/qwen3-30b-a3b-2507
- Instalacja i konfiguracja Ollama
- Ściągawka Ollama - najprzydatniejsze polecenia
- Ograniczanie LLM za pomocą strukturyzowanego wyjścia: Ollama, Qwen3 i Python lub Go
- Walidacja strukturyzowanego wyjścia LLM w Pythonie, która się sprawdza
- Integracja Ollama z Pythonem: przykłady API REST i klienta Python
- Skuteczna granica otwartych modeli w 2026 roku