비교: Qwen3:30b와 GPT-OSS:20b

두 모델의 속도, 파라미터 및 성능 비교

Page content

다음은 Qwen3:30b와 GPT-OSS:20b 비교 내용입니다. 지시 따름 능력(instruction following)과 성능 파라미터, 사양 및 속도에 초점을 맞추었습니다.

처리량(throughput), 지연 시간(latency), VRAM, 다양한 런타임과 하드웨어에서의 벤치마크에 대한 자세한 내용은 LLM 성능: 벤치마크, 병목 현상 및 최적화를 참조하세요.

7 llamas

새로운 Qwen 라인업(벌칙(penalties) 및 사고(thinking) 모드와 코딩 프reset 등)에 대한 에이전트 루프(agent-loop) 지향적인 샘플링 기본값을 설정할 때는 Qwen 및 Gemma를 위한 에이전틱 추론 파라미터를 대조하여 확인하십시오.

아키텍처 및 파라미터

기능 Qwen3:30b-instruct GPT-OSS:20b
총 파라미터 수 305억개 (30.5 billion) 210억개 (21 billion)
활성화된 파라미터 수 약 33억개 (~3.3 billion) 약 36억개 (~3.6 billion)
레이어 수 48 24
레이어당 MoE 전문가 수 128개 (토큰당 8개 활성) 32개 (토큰당 4개 활성)
어텐션 메커니즘 Grouped Query Attention (32Q /4KV) Grouped Multi-Query Attention (64Q /8KV)
컨텍스트 윈도우 네이티브 32,768; 확장 시 최대 262,144 128,000 토큰
토크나이저 BPE 기반, 어휘 크기 151,936 GPT 기반, 어휘 크기 약 20만(≈ 200k)

지시 따름 능력 (Instruction Following)

  • Qwen3:30b-instruct는 강력한 인간 선호도 정렬(human preference alignment)과 함께 지시 따름 능력 최적화되어 있습니다. 창작 글쓰기, 역할극, 다중 턴 대화, 다국어 지시 따름에서 뛰어난 성능을 발휘합니다. 이 버전은 사용자 지시에 부합하는 더 자연스럽고 제어 가능하며 매력적인 답변을 제공하도록 특별하게 파인튜닝되었습니다.
  • GPT-OSS:20b는 지시 따름을 지원하지만, 뉘앙스 있는 지시 튜닝 측면에서는 일반적으로 Qwen3:30b-instruct보다 약간 뒤처지는 것으로 평가됩니다. 유사한 함수 호출(function calling), 구조화된 출력, 추론 모드를 제공하지만, 대화적 정렬과 창의적 대화에서는 열세일 수 있습니다.

성능 및 효율성

  • Qwen3:30b-instruct는 수학 추론, 코딩, 복잡한 논리 작업, 119개 언어 및 방언을 포함하는 다국어 시나리오에서 뛰어난 성능을 보입니다. ‘사고(thinking)’ 모드는 강화된 추론을 허용하지만 더 높은 메모리 비용이 발생합니다.
  • GPT-OSS:20b는 OpenAI의 o3-mini 모델과匹敌하는 성능을 달성합니다. 레이어 수는 적지만 레이어당 전문가(experts)가 넓고, 소비자 하드웨어에서 효율적인 추론을 위한 네이티브 MXFP4 양자화를 사용하며, 더 낮은 메모리 요구 사항(~16GB vs Qwen3보다 높음)을 갖추고 있습니다.
  • GPT-OSS는 약 33% 더 높은 메모리 효율성과 특정 하드웨어 설정, 특히 소비자용 GPU에서 더 빠른 속도를 제공하지만, Qwen3는 특히 복잡한 사용 사례에서 더 나은 정렬과 추론 깊이를 제공합니다.
  • Qwen3는 GPT-OSS의 128,000 토큰에 비해 더 긴 확장 컨텍스트 길이 옵션(최대 262,144 토큰)을 제공하여, 매우 긴 컨텍스트 이해가 필요한 작업에 이점을 줍니다.

사용 권장 사항

  • 우수한 지시 따름 능력, 창의적 생성, 다국어 지원, 복잡한 추론이 필요한 사용 사례에는 Qwen3:30b-instruct를 선택하세요.
  • 메모리 효율성, 소비자 하드웨어에서의 추론 속도, 적은 파라미터 수로 경쟁력 있는 베이스라인 성능이 우선시된다면 GPT-OSS:20b를 선택하세요.

이 비교는 Qwen3:30b-instruct가 고급 지시 튜닝을 갖춘 더 깊고 강력한 모델임을 강조하는 반면, GPT-OSS:20b는 표준 벤치마크에서 경쟁력 있는 성능을 갖춘 더 컴팩트하고 효율적인 대안을 제공한다고 보여줍니다.

지시 따름 능력과 주요 성능 파라미터(MMLU, LMEval, HumanEval)를 중심으로 Qwen3:30b-instruct와 GPT-OSS:20b를 직접 비교하는 벤치마크 점수는 검색 결과에서 직접 확인되지는 않습니다. 그러나 기존에 발표된 다국어 및 다중 작업 벤치마크 보고서에 기반할 때:

MMLU (Massive Multitask Language Understanding)

상세한 내용을 찾기는 어렵지만, 다음과 같은 사실만 확인할 수 있습니다:

  • Qwen3 시리즈 모델, 특히 30B 스케일 이상은 57개의 다양한 도메인에서 매우 경쟁력 있는 지식 이해 및 추론 능력을 나타내는, 일반적으로 89%를 초과하는 MMLU 점수를 보입니다.
  • GPT-OSS:20b도 MMLU 벤치마크에서 좋은 성능을 보이지만, 더 적은 파라미터 수와 지시 파인튜닝 강조가 덜하기 때문에 더 큰 Qwen 모델보다 점수가 낮은 경우가 많습니다.

LMEval (Language Model Evaluation Toolkit)

현재로서는 많은 세부 정보가 없습니다:

  • Qwen3 모델은 LMEval 내에서 추론 및 코드 관련 작업에서 상당한 개선을 보여주며, 논리, 수학 추론 및 일반 능력에서 향상된 점수를 기록합니다.
  • GPT-OSS:20b는 LMEval에서 견고한 베이스라인 성능을 제공하지만, 고급 추론과 지시 따름 하위 작업에서는 일반적으로 Qwen3:30b-instruct보다 뒤처집니다.

HumanEval (Code Generation Benchmark)

많은 데이터는 없으며, 단순히 다음과 같습니다:

  • Qwen3:30b-instruct는 HumanEval-XL과 같은 다국어 코드 생성 벤치마크에서 강력한 성능을 보이며, 20개 이상의 프로그래밍 언어를 지원하고 우수한 교차 언어(cross-lingual) 코드 생성 정확도를 제공합니다.
  • GPT-OSS:20b는 경쟁력이 있지만, 다국어 학습이 덜 광범위하기 때문에 HumanEval 벤치마크에서, 특히 다국어 및 다중 언어 프로그래밍 컨텍스트에서 Qwen3:30b-instruct보다 약간 낮은 성능을 보입니다.

요약 테이블 (문헌에서의 근사적인 추이):

벤치마크 Qwen3:30b-instruct GPT-OSS:20b 비고
MMLU 정확도 ~89-91% ~80-85% Qwen3가 광범위한 지식과 추론에서 더 강력함
LMEval 점수 높음, 고급 추론 및 코드 중간, 베이스라인 추론 Qwen3가 수학 및 논리에서 뛰어난 성능
HumanEval 높은 다국어 코드 생성 성능 중간 Qwen3가 교차 언어 코드 생성에서 더 우수함

정확한 벤치마크 번호가 필요하다면, 최근 연구 논문에 언급된 P-MMEval과 HumanEval-XL과 같은 전문 다국어 대규모 벤치마크가 Qwen3 및 유사한 GPT-OSS 변종을 포함한 모델의 상세 점수를 제공하지만, 현재로서는 이러한 점수를 직접 나란히 비교하여 가져오기 위해 공개적으로 정돈되어 있지는 않습니다.

Qwen3:30b와 GPT-OSS:20b 속도 비교

제 하드웨어(16GB VRAM)에서는 4000 컨텍스트 윈도우로 Qwen3:30b와 GPT-OSS:20b를 실행하고 있으며, 다음과 같은 성능을 보이고 있습니다:

  • qwen3:30b-a3b => 45.68 토큰/초
  • gpt-oss:20b => 129.52 토큰/초

비교를 위해 qwen3:14b와 gpt-oss:120b도 테스트했습니다.

  • qwen3:14b => 60.12 토큰/초
  • gpt-oss:120b => 12.87 토큰/초

더 긴 컨텍스트 윈도우에서는 속도가 느려지며, qwen3:30b-a3b의 경우 훨씬 더 느려질 것입니다. 이것 역시 제 PC에서의 결과입니다. 상세 기술 사항은 상세 출력(verbose output)에서 가져왔으며, 할당된 메모리는 다음과 같고, 시도해볼 수 있는 명령어는:

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • 4K 컨텍스트에서 메모리 할당을 보여주는 ollama ps

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Qwen3:30b 변종들

qwen3:30b 모델에는 세 가지 변종이 있습니다: qwen3:30b, qwen3:30b-instruct, qwen3:30b-thinking.

주요 차이점 및 권장 사항

  • qwen3:30b-instruct는 사용자 지시, 명확성, 자연스러운 대화가 우선시되는 대화에 가장 적합합니다.
  • qwen3:30b는 일반적인 기반 모델로, 다양한 작업에서 지시 따름 능력과 도구 사용이 모두 중요할 때 적합합니다.
  • qwen3:30b-thinking는 깊은 추론, 수학, 코딩이 주요 초점일 때 뛰어난 성능을 보입니다. 논리/수학적 엄밀성을 측정하는 작업에서 다른 모델보다 우수한 성능을 보이지만, 창작 글쓰기나 가벼운 대화에는 반드시 더 나쁜 것은 아닙니다.

직접 벤치마크 비교

모델 추론 (AIME25) 코딩 (LiveCodeBench) 일반 지식 (MMLU Redux) 속도 및 컨텍스트 이상적인 사용 사례
qwen3:30b 70.9 57.4 89.5 256K 토큰; 빠름 일반 언어/에이전트/다국어
qwen3:30b-instruct N/A (30b와 유사하게 예정) N/A 30b와 동일 256K 토큰 지시 따름, 정렬
qwen3:30b-thinking 85.0 66.0 91.4 256K 토큰 수학, 코드, 추론, 긴 문서

더 많은 벤치마크, 하드웨어 선택, 성능 튜닝에 대해서는 LLM 성능: 벤치마크, 병목 현상 및 최적화 허브를 확인하세요.

유용한 링크

구독하기

시스템, 인프라, AI 엔지니어링에 관한 새 글을 받아보세요.