比較:Qwen3:30b と GPT-OSS:20b

これらの2つのモデルの速度、パラメータ、性能を比較する

目次

以下は、Qwen3:30b と GPT-OSS:20bの比較です。 指示への追従(Instruction Following)および性能パラメータ、仕様、速度に焦点を当てています。

スループット、レイテンシ、VRAM、およびランタイムやハードウェアにわたるベンチマークについては、LLM パフォーマンス:ベンチマーク、ボトルネックと最適化をご参照ください。

7 llamas

新しい Qwen シリーズ(ペナルティや思考モードとコーディングプリセットを含む)のエージェントループ向けのサンプリングデフォルト値については、Qwen と Gemma のエージェント推論パラメータと照合してください。

アーキテクチャとパラメータ

特徴 Qwen3:30b-instruct GPT-OSS:20b
総パラメータ数 305億 210億
アクティブパラメータ数 約33億 約36億
レイヤー数 48 24
1レイヤーあたりの MoE エキスパート数 128 (トークンあたり8個アクティブ) 32 (トークンあたり4個アクティブ)
注意機構 グループクエリアテンション (32Q /4KV) グループマルチクエリアテンション (64Q /8KV)
コンテキストウィンドウ 32,768 ネイティブ; 最大 262,144 拡張 128,000 トークン
トークナイザー BPE ベース、語彙数 151,936 GPT ベース、語彙数 約 20万

指示への追従

  • Qwen3:30b-instruct は、強力な人間好みとの整合性(Human Preference Alignment)を持つよう最適化され、指示への追従に特化しています。クリエイティブライティング、ロールプレイング、マルチターン対話、多言語環境での指示追従に優れています。このバリアントは、ユーザーの指示に準拠したより自然で制御可能かつ魅力的な応答を提供するために、特にファインチューニングされています。
  • GPT-OSS:20b は指示への追従をサポートしますが、微細な指示チューニングの観点では、通常 Qwen3:30b-instruct よりわずかに劣ると評価されています。関数呼び出し、構造化出力、推論モードは同等の性能を示しますが、会話の整合性やクリエイティブな対話では劣ることがあります。

性能と効率性

  • Qwen3:30b-instruct は、数学的推論、コーディング、複雑な論理タスク、および119の言語と方言をカバーする多言語シナリオに優れています。「思考(Thinking)」モードにより推論能力が強化されますが、メモリコストが高くなる点がデメリットです。
  • GPT-OSS:20b は、OpenAI の o3-mini モデルと同等の性能を実現しています。レイヤー数は少ないものの、レイヤーあたりのエキスパート幅が大きく、コンシューマー向けハードウェアでの効率的な推論のためにネイティブの MXFP4 量子化を使用しています(メモリ要件が低く、Qwen3 が高く設定されているのに対し約16GB)。
  • GPT-OSS は、特にコンシューマー向け GPU など特定のハードウェア構成において、メモリ効率と速度で約33% 優れています。しかし、複雑なユースケースでは、Qwen3 がより優れた整合性と推論の深さを提供する傾向があります。
  • Qwen3 は、GPT-OSS の 128,000 トークンと比較して、利用可能な拡張コンテキスト長オプションがより長く(最大 262,144 トークン)、非常に長いコンテキストの理解を必要とするタスクに適しています。

使用推奨

  • Qwen3:30b-instruct は、卓越した指示追従、クリエイティブ生成、多言語サポート、複雑な推論が求められるユースケースに選択してください。
  • GPT-OSS:20b は、メモリ効率、コンシューマー向けハードウェアでの推論速度、およびパラメータ数が少ないながらも競争力のあるベースライン性能が最優先の場合は選択してください。

この比較は、Qwen3:30b-instruct が高度な指示チューニングを持つより深く強力なモデルである一方、GPT-OSS:20b は標準的なベンチマークで競争力のあるパフォーマンスを提供する、よりコンパクトで効率的な代替手段であることを浮き彫りにしています。

指示追従および主要なパフォーマンスパラメータ(MMLU、LMEval、HumanEval)において Qwen3:30b-instruct と GPT-OSS:20b を直接比較するベンチマークスコアは、検索結果に直接掲載されていません。しかし、既存の公開されている多言語およびマルチタスクベンチマークレポートに基づくと、以下の通りです:

MMLU (Massive Multitask Language Understanding)

詳細は確認が困難ですが、以下の通りです:

  • Qwen3 シリーズのモデル、特に 30B スケール以上では、MMLU スコアが通常 89% を超える強力な結果を示しており、57 の多様な分野にわたって非常に競争力のある知識理解と推論能力を示しています。
  • GPT-OSS:20b も MMLU ベンチマークで良好なパフォーマンスを示しますが、より小さいパラメータ数と、指示ファインチューニングへの重点が低いことから、より大きな Qwen モデルよりは通常スコアが低くなります。

LMEval (Language Model Evaluation Toolkit)

現時点では詳細なデータは多くありません:

  • Qwen3 モデルは、LMEval において推論およびコード関連タスクで顕著な改善を示しており、論理、数学的推論、および一般的な能力のスコアが向上しています。
  • GPT-OSS:20b は LMEval で堅牢なベースライン性能を提供しますが、高度な推論や指示追従のサブタスクでは、通常 Qwen3:30b-instruct に劣ります。

HumanEval (Code Generation Benchmark)

データは多くありませんが、以下の通りです:

  • Qwen3:30b-instruct は、HumanEval-XL などの多言語コード生成ベンチマークで強力なパフォーマンスを示し、20 以上のプログラミング言語をサポートし、優れたクロスリンガルコード生成精度を提供しています。
  • GPT-OSS:20b は競争力がありますが、HumanEval ベンチマークでは、より広範な多言語トレーニングの欠如により、特に多言語およびマルチ言語プログラミングコンテキストにおいて、Qwen3:30b-instruct よりやや低いパフォーマンスを示します。

要約表(文献からの概略的なトレンド):

ベンチマーク Qwen3:30b-instruct GPT-OSS:20b 備考
MMLU 精度 約 89-91% 約 80-85% Qwen3 が広範な知識と推論において優位
LMEval スコア 高、高度な推論とコード 中、ベースライン推論 Qwen3 が数学と論理で優れる
HumanEval 多言語コード生成性能が高い 中 Qwen3 がクロスリンガルコード生成で優れる

正確なベンチマーク数値が必要である場合、最近の研究論文で言及されている P-MMEval や HumanEval-XL などの特殊な大規模多言語ベンチマークを使用すると、Qwen3 および比較可能な GPT-OSS バリアントの詳細なスコアが得られますが、これらは現時点では直接の並列スコア取得のために公開されて整理されていません。

Qwen3:30b と GPT-OSS:20b の速度比較

私のハードウェア(VRAM 16GB)では、4000 コンテキストウィンドウで Qwen3:30b と GPT-OSS:20b を実行しており、以下のようになります:

  • qwen3:30b-a3b => 45.68 tokens/s
  • gpt-oss:20b => 129.52 tokens/s

比較のため、qwen3:14b と gpt-oss:120b もテストしました。

  • qwen3:14b => 60.12 tokens/s
  • gpt-oss:120b => 12.87 tokens/s

より長いコンテキストウィンドウでは速度が低下し、qwen3:30b-a3b の場合はおそらく大幅に低下します。 これはあくまで私の PC での結果です。 技術的な詳細は冗長出力(verbose output)と割り当てられたメモリから取得し、以下の通りです。試してみるコマンド:

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • ollama ps を表示して 4K コンテキストでのメモリ割り当てを確認

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Qwen3:30b バリアント

qwen3:30b モデルには、qwen3:30b、qwen3:30b-instruct、qwen3:30b-thinking の 3 つのバリアントが利用可能です。

主な違いと推奨事項

  • qwen3:30b-instruct は、ユーザーの指示、明確さ、自然な対話の優先される会話に最適です。
  • qwen3:30b は一般的な基盤モデルで、多様なタスクにおいて指示追従とツール使用の両方が重要なら適しています。
  • qwen3:30b-thinking は、深い推論、数学、コーディングが主な焦点の場合に輝きます。論理・数学的厳密さを測るタスクでは他のモデルを上回りますが、クリエイティブライティングやカジュアルな会話では必ずしも優れているとは限りません。

直接的なベンチマーク比較

モデル 推論 (AIME25) コーディング (LiveCodeBench) 一般知識 (MMLU Redux) 速度とコンテキスト 理想的使用ケース
qwen3:30b 70.9 57.4 89.5 256K tokens; Fast 一般言語/エージェント/多言語
qwen3:30b-instruct N/A (30b に近いと予測) N/A 30b と同様 256K tokens 指示追従、アライメント
qwen3:30b-thinking 85.0 66.0 91.4 256K tokens 数学、コード、推論、長文書

より多くのベンチマーク、ハードウェアの選択、パフォーマンスチューニングについては、当社の LLM パフォーマンス:ベンチマーク、ボトルネックと最適化ハブを確認してください。

関連リンク

購読する

システム、インフラ、AIエンジニアリングの新記事をお届けします。