Language Models are Few-Shot Learners
Language Models are Few-Shot Learners(자연어 모델은 소수 학습자이다)는 2020 년 5 월 OpenAI 가 발표한 논문으로, 거대 언어 모델 (GPT-3) 이 별도의 미세 조정 (fine-tuning) 없이 텍스트 기반의 예시 (few-shot) 를 통해 다양한 NLP 작업을 수행할 수 있음을 증명한 획기적인 연구입니다. 이 논문은 모델의 크기를 1750 억 개 (175B) 파라미터까지 늘렸을 때, 기존 미세 조정 방식과 경쟁하거나 심지어 이를 능가하는 성능을 보인다는 사실을 입증했습니다.
나무위키 스타일 문서로 정리합니다.
목차
개요
이 논문은 GPT-3 모델이 어떻게 작동하는지, 그리고 "few-shot learning"(소수 학습) 이란 무엇인지에 대한 실험적 증거를 제시합니다. 기존의 NLP 모델은 특정 작업을 수행하기 위해 수천~수만 개의 라벨링된 데이터셋으로 미세 조정이 필요했지만, 이 연구는 텍스트 프롬프트와 몇 개의 예시만으로도 모델을 새로운 작업에 적응시킬 수 있음을 보여줍니다.
- 모델: 1750 억 파라미터를 가진 자기회귀 언어 모델 (Autoregressive Language Model).
- 핵심 발견: 모델 크기가 커질수록 컨텍스트 내 학습 능력이 비선형적으로 향상됨.
- 성능: 번역, 질의응답, 추론 등 다양한 작업에서 미세 조정된 SOTA(State-of-the-Art) 모델들과 경쟁 가능한 성능을 기록.
- 주의사항: 인간 작성 뉴스 기사가 모델이 생성한 기사와 구별하기 어려울 정도로 높은 자연스러움을 보임.
배경 및 동기와
전통적인 NLP 접근 방식은 트랜스포머 기반 모델을 대규모 텍스트로 전 학습 (pre-training) 한 뒤, 특정 작업 (Task) 에 맞춰 미세 조정 (Fine-tuning) 하는 것이 표준이었습니다. 하지만 이 방식에는 몇 가지 치명적인 한계가 있었습니다.
- 데이터 의존성: 새로운 작업을 위해 매번 수천 개의 라벨링된 데이터를 수집해야 함.
- 일반화 능력의 한계: 훈련 데이터에 특화된 (Overfitting) 모델이 실제 분포 밖 (Out-of-distribution) 에서 성능이 급격히 떨어질 수 있음.
- 인간의 학습 방식과의 괴리: 인간은 설명 하나나 예시 하나만으로도 새로운 작업을 배우지만, AI 는 그렇지 않음.
이러한 문제를 해결하기 위해 연구진은 **메타러닝 (Meta-learning)**의 개념을 언어 모델에 적용했습니다. 즉, 학습 과정에서 다양한 패턴을 습득한 모델이 추론 (Inference) 단계에서 주어진 텍스트 컨텍스트를 통해 즉시 새로운 작업을 인식하고 수행하도록 하는 것입니다. 이를 연구진은 In-context learning(컨텍스트 내 학습)이라고 명명했습니다.
인간도 예시 하나만 보고 배운다면, 이 논문이 왜 중요한지 알 수 있죠?(사실 인간은 예시 하나만 보고도 배울 수 있지만, AI 는 예시가 없으면 완전히 뻘짓을 할 수 있습니다.)
주요 결과
GPT-3 는 미세 조정 없이 다음 세 가지 설정에서 평가되었습니다.
| 설정 (Setting) | 설명 | 특징 |
|---|---|---|
| Zero-shot | 예시 없음, 명령어만 | 가장 어렵지만 인간이 작업을 지시하는 방식과 유사 |
| One-shot | 예시 1 개, 명령어 포함 | 인간이 작업 지시 시 가장 많이 사용하는 방식 |
| Few-shot | 예시 10~100 개, 명령어 포함 | 성능이 가장 높으며, 컨텍스트 윈도우에 들어가는 최대 예시 수 활용 |
1. 성능 향상
- Closed-book Question Answering: TriviaQA 데이터셋에서 Few-shot 설정 시 71.2% 정확도를 기록하여, 미세 조정된 오픈 도메인 모델 (RAG) 의 성능을 능가했습니다.
- Translation: 영어로 번역할 때 Few-shot 설정에서 기존 비지도 번역 모델 (Unsupervised NMT) 을 압도했습니다.
- Reasoning: 단어 섞기 (Unscrambling), 3 자릿수 산술 연산 등 실시간 추론이 필요한 작업에서도 뛰어난 성능을 보였습니다.
2. 스케일링 법칙 (Scaling Laws)
모델의 크기 (파라미터 수) 가 커질수록 검증 손실 (Validation Loss) 이 멱함수 (Power-law) 법칙을 따르며 지속적으로 개선되었습니다. 이는 단순히 데이터를 늘리는 것이 아니라, 계산량 (Compute) 과 모델 크기가 성능의 핵심 열쇠임을 시사합니다.
- GPT-3 (175B) 는 이전 최대 모델 (11B) 보다 10 배 크며, 성능은 비례하여 향상되었습니다.
모델이 커지면 지능이 무한히 증가할 것 같지만, 아직은 한계가 있습니다.
방법론
학습 데이터
GPT-3 는 약 45TB 의 압축 텍스트 (약 4000 억 토큰) 를 학습했습니다. 주요 데이터 소스는 다음과 같습니다.
| 데이터셋 | 양 (토큰) | 학습 혼합 비율 | 비고 |
|---|---|---|---|
| Common Crawl (필터링) | 410B | 60% | 웹 크롤링 데이터, 품질 필터링 적용 |
| WebText2 | 19B | 22% | Reddit 등 소셜 미디어 링크 기반 |
| Books1, Books2 | 67B | 16% | 인터넷 기반 책 코퍼스 |
| Wikipedia | 3B | 3% | 위키백과 |
데이터 오염 (Data Contamination) 을 방지하기 위해 테스트 세트가 학습 데이터에 포함되지 않도록 주의 깊게 필터링했으나, 일부 오류가 발견되어 후속 분석이 필요했습니다.
모델 아키텍처
GPT-3 는 GPT-2 와 동일한 아키텍처를 기반으로 하되, 다음과 같은 변경 사항이 적용되었습니다.
- 파라미터 수: 1.25 억 (Small) 에서 1750 억 (GPT-3) 까지 총 8 가지 버전 학습.
- 주의 패턴 (Attention Pattern): 밀집형 (Dense) 과 국소적 희소형 (Locally banded sparse) 을 교차 사용 (Sparse Transformer 방식).
- 배치 크기: 모델 크기에 따라 0.5M 에서 3.2M 토큰까지 조정.
- 컨텍스트 윈도우: 2048 토큰 고정.
평가 방식
- 다지선다형 (Multiple Choice): 각 선택지의 토큰 확률을 계산하여 가장 확률이 높은 것을 선택.
- 생성형 (Free-form): 빔 서치 (Beam Search, width=4) 를 사용하여 생성된 텍스트의 BLEU 점수, F1 점수, Exact Match 점수 평가.
- Few-shot 설정: 테스트 세트에서 무작위로 추출한 예시를 프롬프트에 포함시킴.
한계점 및 데이터 오염
GPT-3 는 만능은 아닙니다. 연구진은 다음과 같은 한계점을 지적했습니다.
- 자연어 추론 (NLI) 및 읽기 이해: ANLI, RACE, QuAC 같은 데이터셋에서는 Few-shot 성능이 여전히 낮았습니다. 이는 모델이 텍스트의 논리적 함의를 파악하는 데 여전히 어려움을 겪고 있음을 시사합니다.
- 데이터 오염 (Data Contamination): 학습 데이터에 테스트 데이터가 우연히 포함되어 있을 가능성이 있습니다. 특히 LAMBADA 데이터셋의 일부가 학습 데이터에 포함되어 성능이 과대평가되었을 수 있다는 점이 확인되었습니다.
- 방향성 편향: 번역 작업에서 "다른 언어 → 영어"로 번역할 때는 강력했으나, "영어 → 다른 언어"로 번역할 때는 상대적으로 성능이 떨어졌습니다. 이는 학습 데이터의 영어 편향 (93% 영어) 에서 기인합니다.
사회적 영향
GPT-3 의 가장 놀라운 발견 중 하나는 뉴스 기사 생성 능력입니다.
- 연구진은 GPT-3 가 생성한 뉴스 기사가 인간 평가자에게 인간이 쓴 기사와 구별하기 어려운 수준 (human-evaluators have difficulty distinguishing) 이라고 보고했습니다.
- 이는 악성 콘텐츠 생성, 가짜 뉴스 유포, 저작권 침해 등 심각한 사회적 문제를 야기할 수 있습니다.
- 또한, 모델이 학습 데이터에 포함된 편향 (Bias) 을 그대로 재생산할 수 있어 공정성 (Fairness) 문제도 제기되었습니다.
여담
- 이름: GPT-3 는 "Generative Pre-trained Transformer 3"의 약자입니다. 1, 2 는 각각 11 억, 15 억 파라미터였지만, 3 은 1750 억으로 도약했습니다.
- 오픈소스 여부: 논문이 발표되었음에도 불구하고, GPT-3 의 가중치 (Weights) 는 공개되지 않았습니다. OpenAI 는 보안 및 악용 우려를 이유로 공개를 거부했습니다.
그냥 뻥튀기 해달라고 할 때 "죄송합니다. 그건 불가능합니다"라고 대답하는 것과 같습니다. - 비용: GPT-3 를 학습시키는 데 들어간 비용은 수백만 달러 (수십 억 원) 이상으로 추정됩니다. 이는 일반적인 연구실에서는 감당하기 힘든 금액입니다.
- 기타: 논문 저자 중 Ilya Sutskever 와 Dario Amodei 는 OpenAI 의 핵심 인물입니다.
각주
- Meta-learning: 언어 모델 문맥에서는 "Zero-shot transfer"라고도 불리지만, 이는 추론 시 예시를 제공하므로 "Zero-shot"이라는 용어와 혼동을 피하기 위해 "Meta-learning" 또는 "In-context learning"을 사용했습니다.
- Data Contamination: 학습 데이터에 테스트 데이터가 포함되어 성능이 실제보다 높게 평가되는 현상.
- Scaling Laws: 모델 크기, 데이터 양, 계산량이 성능에 미치는 영향을 수학적으로 규명한 법칙.
참고 문헌 (선택)
- [57] Kaplan, J., et al. "Scaling Laws for Neural Language Models." (2020).
- [117] Radford, A., et al. "Language Models are Unsupervised Multitask Learners." (2019).
- [140] Zellers, R., et al. "HellaSwag: Can a Machine Really Finish Your Sentence?" (2019).