LLaMA: Open and Efficient Foundation Language Models
한 줄 요약: "비밀 데이터? 필요 없습니다. 공개된 데이터만 1.4조 토큰으로 갈아넣어 GPT-3 을 이기고, 코드는 다 공개했습니다. (물론 상업적 사용은 금지지만요.)"
- 원제: LLaMA: Open and Efficient Foundation Language Models
- 저자: Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurélien Rodriguez, Armand Joulin, Édouard Grave, Guillaume Lample (Meta AI)
- 발표: arXiv, 2023-02
- 링크: arXiv:2302.13971, GitHub
- 관련 문서: BERT: Pre-training of Deep Bidirectional Transformers for, Language Models are Few-Shot Learners
Meta AI 에서 공개한 LLaMA(Large Language Model Meta AI) 시리즈는 "공개 데이터만으로 최상위 성능을 낼 수 있다"는 것을 증명하기 위해 등장한 모델들입니다. 기존 대형 언어 모델 (LLM) 들이 접근 불가능한 사내 데이터 (예: "Books-2TB" 같은 블랙박스 데이터) 에 의존하던 것과 달리, LLaMA 는 위키백과, CommonCrawl, GitHub 등 전부 공개된 데이터만으로 훈련했습니다.
그 결과, 130 억 파라미터 (13B) 모델이 1,750 억 파라미터 (175B) 가량의 GPT-3 을 대부분 벤치마크에서 이겼고, 650 억 파라미터 (65B) 모델은 Chinchilla-70B 나 PaLM-540B 와 경쟁할 만한 성능을 냈습니다. Language Models are Few-Shot Learners 논문에서 "모델을 키우면 무조건性能好"이라는 상식이 깨진 이후, BERT 시대의 "더 많은 데이터, 더 작은 모델" 전략 (Chinchilla Scaling Law) 을 정면으로 입증한 문서입니다.
1. 개요
1.1. 배경: "더 큰 모델이 무조건 좋은가?"
과거에는 "파라미터를 늘리면 성능이 오른다"는 것이 불문율이었습니다. GPT-3(175B) 이나 PaLM(540B) 이 등장했을 때, 사람들은 "아, 이제 GPU 1,000 대 없으면 LLM 못 만드네"라고 생각했습니다. 하지만 Hoffmann et al. (2022) 의 Chinchilla Scaling Law 논문은 "계산량 (Compute) 을 고정했을 때, 모델을 더 작게 만들고 데이터 양을 더 늘리는 것이 더 효율적"이라고 증명했습니다. Language Models are Few-Shot Learners 이후의 이 흐름을 LLaMA 가 실제 구현해낸 셈입니다.
하지만 Hoffmann 의 연구는 추론 (Inference) 비용을 고려하지 않았습니다. 훈련은 비싸도, 추론이 빠르고 저렴해야 상용화 가능합니다. LLaMA 는 "추론 속도가 빠른 작은 모델"에 집중했습니다. 7B~65B 사이의 모델들은 단일 GPU 에서 돌릴 수 있어서, 연구자들이 직접 실험해볼 수 있게 된 것입니다. BERT 때처럼 "열린 연구"를 지향한다는 점이 가장 큰 특징입니다.
[그림 1] 훈련 손실 (Training Loss) 곡선. 7B, 13B, 33B, 65B 모델이 1.0T~1.4T 토큰을 학습하면서 손실이 꾸준히 감소하는 모습. Language Models are Few-Shot Learners 의 확장성 논리를 시각적으로 증명한다.
1.2. LLaMA 의 핵심 전략
LLaMA 의 핵심은 세 가지로 요약할 수 있습니다.
- 데이터의 질과 양: 공개 데이터만 사용하되, 양을 1.4조 토큰 (1.4T tokens) 까지 늘렸습니다. Language Models are Few-Shot Learners 에서 말한 "데이터 양이 중요"하다는 점을 극단적으로 적용했습니다.
- 아키텍처 최적화: Transformer 의 기본 구조를 유지하되, 훈련 안정성과 효율성을 높이기 위해 RMSNorm, SwiGLU, RoPE 등의 기법을 적용했습니다.
- 오픈 소스: 모든 모델 가중치를 연구 커뮤니티에 공개했습니다. (물론 상업적 사용은 제한적이지만, 연구 목적으로는 대박입니다.)
2. 상세 내용
2.1. 데이터셋: "공개된 것만 다 먹기"
LLaMA 는 기존 LLM 들이 쓰지 않았던 공개 데이터 소스들을 모았습니다. 총 1.4조 토큰을 학습시켰는데, 그 구성은 다음과 같습니다.
2.1.1. 데이터 믹스 구성
| 데이터 소스 | 비율 | 특징 | 비고 |
|---|---|---|---|
| CommonCrawl | 67% | 웹 크롤링 데이터 | 2017~2020 년 버전 5 개를 사용. CCNet 파이프라인으로 전처리. |
| C4 (Colossal Clean Crawled Corpus) | 15% | Google 의 공개 데이터 | 문장 수, 문장 부호 등으로 품질 필터링. |
| GitHub | 4.5% | 오픈소스 코드 | Apache, BSD, MIT 라이선스만 허용. |
| Wikipedia | 4.5% | 위키백과 | 2022 년 6~8 월 분, 20 개 국어 (라틴/키릴 문자). |
| Books (Gutenberg, Books3) | 4.5% | 전자책 | 저작권 만료된 책과 ThePile 의 Books3 섹션. |
| ArXiv | 2.5% | 학술 논문 | LaTeX 파일에서 수식과 본문 추출. |
| Stack Exchange | 2.0% | Q&A 사이트 | 컴퓨터 과학, 화학 등 전문 분야 질문/답변. |
[표 1] LLaMA 의 전처리 데이터 구성. Language Models are Few-Shot Learners 의 "데이터 양이 승부처"라는 주장을 1.4T 토큰으로 증명.
CommonCrawl 의 경우, 단순히 크롤링만 한 게 아니라 품질 필터링을 매우 철저히 했습니다. 위키백과 인용 페이지만 골라내는 선형 분류기를 훈련시켜서, "참고문헌"으로 쓰인 페이지만 남겼습니다. GitHub 데이터는 라이선스 필터링을 하고, boilerplate(헤더, 주석 등) 를 정규식으로 제거했습니다. BERT 시절보다 훨씬 더 깨끗한 데이터를 만들었습니다.
2.1.2. 토크나이저 (Tokenizer)
데이터를 토큰화할 때는 Byte-Pair Encoding (BPE) 알고리즘을 사용했습니다. SentencePiece 라이브러리를 빌려 썼습니다.
- 숫자 처리: 모든 숫자를 개별 digit 로 분리합니다. (예: "2023" → "2", "0", "2", "3")
- 알 수 없는 문자: UTF-8 바이트 단위로 분해합니다.
이렇게 처리된 전체 데이터는 약 1.4조 토큰입니다. 위키백과와 책 데이터는 2 에폭 (2 번 반복 학습) 했지만, 나머지 데이터는 1 에폭만 사용했습니다. Language Models are Few-Shot Learners 의 "데이터 양이 중요하다"는 교훈을 토큰 단위로 적용한 것입니다.
2.2. 아키텍처: "변경된 Transformer"
LLaMA 는 기본 Transformer 구조를 따르지만, 몇 가지 핵심적인 개선을 가했습니다. BERT 나 GPT 시리즈의 변형이라고 보면 됩니다.
2.2.1. Pre-normalization (RMSNorm)
기존 Transformer 는 각 서브레이어의 출력을 정규화했습니다. 하지만 LLaMA 는 입력을 정규화합니다. 여기에 RMSNorm이라는 함수를 썼는데, 이는 Zhang & Sennrich (2019) 에서 제안된 것입니다.
- 이유: 훈련 안정성을 높이기 위함입니다.
- 효과: Gradient 가 폭발하거나 vanishing 되는 것을 막아줍니다. Language Models are Few-Shot Learners 의 대규모 훈련에서 필수적입니다.
2.2.2. SwiGLU 활성화 함수
기존 ReLU 대신 SwiGLU를 사용했습니다. Shazeer (2020) 가 제안한 기법으로, PaLM 에서도 사용되었습니다.
- 구조:
SwiGLU(x) = Swish(xW) ⊗ (xV) - 차원: PaLM 은
4d를 썼지만, LLaMA 는2/3 * 4d를 썼습니다. - 이유: 성능 향상이 확실합니다. BERT 이후의 아키텍처 진화 중 하나입니다.
2.2.3. Rotary Embeddings (RoPE)
기존의 절대 위치 임베딩 (Absolute Positional Embeddings) 을 제거하고, **회전 위치 임베딩 (RoPE)**을 각 레이어에 추가했습니다. Su et al. (2021) 이 제안한 기법으로, GPT-Neo 에서도 사용되었습니다.
- 이유: 시퀀스 길이가 길어졌을 때 일반화 성능이 좋습니다.
- 효과: 모델이 "여기서부터가 끝"이라는 개념을 더 잘 이해합니다.
2.2.4. 모델 크기별 파라미터
| 모델 | 파라미터 | 차원 (d) | 헤드 수 | 레이어 수 | 학습률 | 배치 크기 | 토큰 수 |
|---|---|---|---|---|---|---|---|
| LLaMA-7B | 6.7B | 4096 | 32 | 32 | 3.0e-4 | 4M | 1.0T |
| LLaMA-13B | 13.0B | 5120 | 40 | 40 | 3.0e-4 | 4M | 1.0T |
| LLaMA-33B | 32.5B | 6656 | 52 | 60 | 1.5e-4 | 4M | 1.4T |
| LLaMA-65B | 65.2B | 8192 | 64 | 80 | 1.5e-4 | 4M | 1.4T |
[표 2] 모델별 아키텍처 및 하이퍼파라미터. Language Models are Few-Shot Learners 의 "더 큰 모델"과 "더 많은 데이터" 전략이 어떻게 조합되었는지 보여줌.
2.3. 최적화 및 효율성
2.3.1. 옵티마이저 (Optimizer)
AdamW 옵티마이저를 사용했습니다.
- $\beta_1 = 0.9, \beta_2 = 0.95$
- 학습률 스케줄: Cosine schedule (최종 학습률은 최대값의 10%)
- Weight Decay: 0.1
- Gradient Clipping: 1.0
2.3.2. 훈련 속도 최적화
65B 모델을 2048 개 A100 GPU 에서 훈련할 때, 초당 380 토큰을 처리했습니다. 전체 1.4T 토큰을 학습하는 데 약 21 일이 걸렸습니다.
- 효율화 기법 1: Causal Multi-head Attention 을
xformers라이브러리의 효율적인 구현으로 변경했습니다. (Rabe & Staats, 2021; Dao et al., 2022) - 효율화 기법 2: 역전파 시 활성화 값을 재계산 (Checkpointing) 하는 양을 줄였습니다.
- 효율화 기법 3: 모델 병렬 (Model Parallelism) 과 시퀀스 병렬 (Sequence Parallelism) 을 사용하여 메모리 사용량을 줄였습니다.
- 효율화 기법 4: GPU 간 통신 (all_reduce) 과 계산을 겹쳐서 (Overlap) 시간을 아꼈습니다.
[그림 2] 훈련 중 성능 변화. 질문 답변 및 상식 추론 벤치마크에서 성능이 훈련 손실 (Perplexity) 과 비례하여 꾸준히 상승하는 모습. Language Models are Few-Shot Learners 의 "스케일링" 가설을 다시 한번 증명.
3. 주요 결과
3.1. 상식 추론 (Common Sense Reasoning)
8 개 벤치마크 (BoolQ, PIQA, SIQA, HellaSwag, WinoGrande, ARC-e/c, OpenBookQA) 에서 평가했습니다.
- LLaMA-65B: Chinchilla-70B 를 BoolQ 를 제외한 모든 벤치마크에서 이겼습니다. PaLM-540B 도 BoolQ 와 WinoGrande 를 제외하고는 이겼습니다.
- LLaMA-13B: GPT-3(175B) 보다 10 배 작으면서, 대부분의 벤치마크에서 더 높은 점수를 받았습니다.
[표 3] 제로샷 (Zero-shot) 상식 추론 성능. LLaMA-65B 가 Chinchilla-70B 를 제치고, LLaMA-13B 가 GPT-3(175B) 을 압도. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 승리를 가져옴.
3.2. 폐쇄형 질문 답변 (Closed-book QA)
Natural Questions 와 TriviaQA 에서 평가했습니다. 모델이 외부 문서를 보지 않고 답해야 합니다.
- LLaMA-65B: 제로샷 및 퓨샷 (Few-shot) 설정에서 최상위 성능을 기록했습니다.
- LLaMA-13B: GPT-3 과 Chinchilla 와 경쟁할 만한 성능을 냈습니다. 단일 V100 GPU 에서 추론이 가능합니다.
[표 4] NaturalQuestions 정확도. LLaMA-13B 가 13B 파라미터임에도 GPT-3(175B) 과 비교 가능. BERT 이후의 "작은 모델, 큰 데이터" 트렌드.
3.3. 독해 이해 (Reading Comprehension)
RACE 벤치마크 (중고등학생 영어 독해 문제) 에서 평가했습니다.
- LLaMA-65B: PaLM-540B 와 경쟁 가능.
- LLaMA-13B: GPT-3 보다 몇 퍼센트 포인트 더 높음.
3.4. 수학적 추론 (Mathematical Reasoning)
MATH (고등 수학 문제) 와 GSM8k (중등 수학 문제) 에서 평가했습니다.
- 중요 포인트: LLaMA 는 수학적 데이터로 파인튜닝을 하지 않았습니다. (PaLM 과 Minerva 는 수학적 데이터로 파인튜닝을 함)
- 결과: LLaMA-65B가 파인튜닝된 Minerva-62B를 GSM8k 에서 이겼습니다. Language Models are Few-Shot Learners 의 "데이터 양이 중요하다"는 주장이 여기서도 빛을 발했습니다.
[표 7] 수학적 추론 성능. LLaMA-65B 가 파인튜닝되지 않은 상태에서 Minerva-62B 를 제압. Language Models are Few-Shot Learners 의 "데이터 양" 전략의 승리.
3.5. 코드 생성 (Code Generation)
HumanEval 과 MBPP 벤치마크에서 평가했습니다.
- LLaMA-13B: 파인튜닝되지 않은 LaMDA-137B보다 높습니다.
- LLaMA-65B: 파인튜닝된 PaLM-62B보다도 높습니다.
- 통계:
pass@1(한 번에 정답을 내는 확률) 과pass@100(100 번 시도 중 정답을 내는 확률) 모두에서 우수한 결과를 기록했습니다.
[표 8] 코드 생성 성능. LLaMA-65B 가 파인튜닝된 PaLM-62B 를 제압. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 코드 생성에도 적용됨.
3.6. 대규모 다중 작업 언어 이해 (MMLU)
인문학, 과학, 사회과학 등 57 개 과목의 객관식 문제를 평가했습니다.
- LLaMA-65B: Chinchilla-70B 와 PaLM-540B 에서는 약간 뒤처집니다 (약 2~3% 포인트).
- 이유: LLaMA 는 책과 학술지 데이터 (ArXiv, Books3) 를 177GB 정도만 썼는데, Chinchilla/PaLM 은 2TB 를 썼습니다. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 이 부분에서는 한계가 있음을 보여줍니다.
3.7. 훈련 중 성능 변화
훈련을 진행하면서 벤치마크 점수가 꾸준히 상승했습니다. SIQA 와 WinoGrande 를 제외하고는 훈련 손실 (Perplexity) 과 성능이 잘 비례합니다. SIQA 는 점수 변동이 커서 벤치마크 자체가 신뢰할 수 없다는 주장이 나옵니다.
4. 지시어 파인튜닝 (Instruction Finetuning)
기본 LLaMA 모델도 지시를 따르지만, 약간의 지시 데이터 (Instruction Data) 로 파인튜닝을 하면 성능이 급격히 오릅니다.
- LLaMA-I: 65B 모델을 지시 데이터로 파인튜닝한 버전.
- 성능: MMLU 에서 **68.9%**를 기록했습니다.
- 비교: OPT-IML, Flan-PaLM 등 중간 크기 모델들보다는 높지만, GPT-3.5 (code-davinci-002) 의 77.4%보다는 낮습니다.
[표 10] 지시어 파인튜닝 결과. LLaMA-I 가 중간 크기 모델들 중에서는 최상위. Language Models are Few-Shot Learners 의 "파인튜닝" 효과 재확인.
5. 편향, 독성, 허위 정보
5.1. 독성 (Toxicity)
RealToxicityPrompts 벤치마크에서 평가했습니다.
- 결과: 모델이 커질수록 독성이 증가합니다. 특히 "존중하는 프롬프트" (Respectful prompts) 에서 더 두드러집니다.
- 비교: Chinchilla 와 비슷한 수준이지만, Gopher (더 큰 모델) 는 Chinchilla 보다 독성이 낮게 측정되어 모델 패밀리 내에서는 상관관계가 있음을 시사합니다.
5.2. 편향 (Bias)
CrowS-Pairs 벤치마크에서 평가했습니다.
- 결과: 평균 편향 점수는 GPT-3 과 OPT-175B 보다 약간 낮습니다.
- 특이점: 종교 카테고리에서 편향이 특히 높습니다 (+10%). 그다음으로 나이, 성별 편향이 큽니다.
- 원인: CommonCrawl 데이터에서 기인한 것으로 보입니다.
5.3. 성별 편향 (WinoGender)
성별 대명사 (his/her/their) 를 사용하여 문맥을 해석하는 능력입니다.
- 결과: "their/them/someone" (성별 중립) 를 사용할 때는 정확도가 높지만, "his/him"이나 "her/she"를 사용할 때는 정확도가 떨어집니다.
- 원인: 직업의 성별 편향 (예: 간호사 = 여자, 의사 = 남자) 을 학습한 것으로 보입니다. "gotcha" (예상과 다른) 케이스에서 실수가 더 많습니다.
5.4. 진실성 (TruthfulQA)
허위 정보를 생성하는 경향을 평가했습니다.
- 결과: GPT-3 보다 낫지만, 여전히 낮은 비율 (약 50% 수준) 입니다. 모델이 헛소리를 할 확률이 여전히 높습니다.
6. 탄소 발자국 (Carbon Footprint)
6.1. 훈련 비용
- LLaMA-7B: 14 톤 CO2eq
- LLaMA-13B: 23 톤 CO2eq
- LLaMA-33B: 90 톤 CO2eq
- LLaMA-65B: 173 톤 CO2eq
[표 15] 탄소 발자국 비교. OPT-175B (137 톤) 나 BLOOM-175B (183 톤) 보다 훨씬 적습니다. Language Models are Few-Shot Learners 의 "효율성" 주장이 탄소 배출에서도 증명됨.
- 전체 개발 비용: 2,638 MWh 전력 사용, 총 1,015 톤 CO2eq 배출.
- 의의: 작은 모델이 공개되면, 다른 연구자들이 훈련할 때 탄소 배출을 줄일 수 있습니다.
7. 관련 연구 및 한계
7.1. 관련 연구
- BERT: Bidirectional Transformer 의 시작.
- Language Models are Few-Shot Learners: 스케일링 법칙의 시작.
- Provided proper attribution is provided, Google hereby grants permission to reproduce the tables and figures in this paper solely for use in journalistic or scholarly works.: 데이터 사용 및 저작권에 대한 논의 (참고).
7.2. 한계
- 데이터의 한계: 공개 데이터만 사용하다 보니, 책과 학술지 데이터 양이 부족하여 MMLU 에서 Chinchilla/PaLM 에 밀렸습니다.
- 편향: 공개 데이터의 편향을 그대로 학습했습니다.
- 상용화 제한: 연구 목적으로만 공개되었습니다. (상업적 사용은 Meta 의 라이선스 정책 참조)
8. 여담
8.1. 이름의 유래
LLaMA 는 "Large Language Model Meta AI"의 약자입니다. 하지만 Meta 내부에서는 "Llama"라는 이름이 "알파카"와 비슷하게 발음되어, "알파카"를 연상시키는 유머가 있었습니다. Language Models are Few-Shot Learners 에서 "Language Models"가 핵심이니까, "Meta AI"를 붙여서 "LLaMA"라고 짓는 게 어색하지 않았을까요?
8.2. "1.4T 토큰"의 비밀
1.4 조 토큰은 얼마나 많은 걸까요? 위키백과 전체 텍스트가 약 100 억 토큰이라고 하면, LLaMA 는 위키백과 1,400 개 분량을 읽은 셈입니다. BERT 가 3,300 만 단어를 읽은 것과 비교하면, LLaMA 는 그 40 배 이상을 읽은 것입니다. Language Models are Few-Shot Learners 의 "데이터 양"이 얼마나 중요한지 보여주는 수치입니다.
8.3. "GPT-3 을 이긴 13B 모델"의 충격
GPT-3(175B) 을 이긴 13B 모델이 등장했을 때, 커뮤니티는 "뭐? 10 배나 작은 모델이 이길 수 있어?"라고 놀랐습니다. Language Models are Few-Shot Learners 의 "스케일링 법칙"이 실제로 적용된 사례입니다. "파라미터를 늘리는 것"보다 "데이터를 늘리는 것"이 더 중요하다는 것을 증명했습니다.
8.4. "상용화 금지" 논란
LLaMA 모델은 연구 목적으로만 공개되었습니다. 하지만 "연구 목적"의 정의가 모호해서, 많은 기업들이 "우리는 연구 중이에요"라고 말하면서 LLaMA 를 상용화했습니다. Meta 는 나중에 라이선스를 변경하여 상용화를 제한했습니다. Language Models are Few-Shot Learners 의 "오픈 소스" 정신이 어떻게 변질되었는지를 보여주는 사례입니다.
8.5. "코드 생성"의 신기루
LLaMA-65B 가 파인튜닝 없이 파인튜닝된 PaLM-62B 를 이겼다는 점은 놀랍습니다. Language Models are Few-Shot Learners 의 "데이터 양"이 코드 생성에도 영향을 미친다는 것을 보여줍니다. 하지만 "파인튜닝"을 하면 더 좋아질 수 있다는 점은 BERT 의 "파인튜닝" 개념과 같습니다.
8.6. "탄소 발자국"의 역설
LLaMA 는 탄소 배출을 줄이기 위해 설계되었습니다. 하지만 "오픈 소스"로 공개되면서, 많은 사람들이 LLaMA 를 훈련하고 파인튜닝하는 과정에서 탄소 배출이 오히려 증가했습니다. Language Models are Few-Shot Learners 의 "오픈 소스" 정신이 어떻게 환경 문제에 영향을 미치는지를 보여주는 아이러니한 사례입니다.
8.7. "편향"의 해결책
LLaMA 는 편향을 줄이기 위해 노력했지만, 완전히 해결하지는 못했습니다. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 편향을 줄이는 데는 한계가 있음을 보여줍니다. "데이터의 질"이 더 중요할 수 있습니다.
8.8. "미래의 LLaMA"
Meta 는 LLaMA-65B 를 공개했지만, 더 큰 모델 (LLaMA-2, LLaMA-3 등) 을 계속 공개할 예정입니다. Language Models are Few-Shot Learners 의 "스케일링 법칙"이 계속 적용될 것입니다. "더 큰 데이터, 더 작은 모델" 전략이 계속 유효할지 주목됩니다.
8.9. "연구 커뮤니티"의 기여
LLaMA 가 공개되면서, 연구 커뮤니티는 LLaMA 를 기반으로 한 다양한 파생 모델 (Vicuna, Alpaca, etc.) 을 만들었습니다. Language Models are Few-Shot Learners 의 "오픈 소스" 정신이 어떻게 혁신을 이끌고 있는지를 보여주는 사례입니다.
8.10. "Meta AI"의 전략
Meta 는 LLaMA 를 공개함으로써, AI 연구 커뮤니티의 중심에 서려고 했습니다. Language Models are Few-Shot Learners 의 "오픈 소스" 전략이 Meta 의 경쟁력 강화에 어떻게 기여했는지를 보여주는 사례입니다.
9. 참고 문헌 및 외부 링크
- 원문: LLaMA: Open and Efficient Foundation Language Models (arXiv:2302.13971)
- 코드/모델: GitHub - facebookresearch/llama
- 관련 논문:
- Chinchilla Scaling Law: Hoffmann et al., 2022.
- RMSNorm: Zhang & Sennrich, 2019.
- SwiGLU: Shazeer, 2020.
- RoPE: Su et al., 2021.
한 줄 요약: "GPT-3 이 175B 파라미터로 세상을 지배하던 시대, LLaMA 는 13B 파라미터로 '데이터 양'이 승부처임을 증명했습니다. 그리고 코드는 다 공개했습니다."
[그림 1] LLaMA 의 훈련 손실 곡선. 7B
65B 모델이 1.0T1.4T 토큰을 학습하면서 성능이 꾸준히 상승하는 모습. Language Models are Few-Shot Learners 의 확장성 논리를 시각적으로 증명.
[표 3] LLaMA-65B 가 Chinchilla-70B 를 제치고, LLaMA-13B 가 GPT-3(175B) 을 압도. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 승리를 가져옴.
[표 7] LLaMA-65B 가 파인튜닝되지 않은 상태에서 Minerva-62B 를 제압. Language Models are Few-Shot Learners 의 "데이터 양" 전략의 승리.
[표 8] LLaMA-65B 가 파인튜닝된 PaLM-62B 를 제압. Language Models are Few-Shot Learners 의 "데이터 양" 전략이 코드 생성에도 적용됨.
[표 15] 탄소 발자국 비교. OPT-175B (137 톤) 나 BLOOM-175B (183 톤) 보다 훨씬 적습니다. Language Models are Few-Shot Learners 의 "효율성" 주장이 탄소 배출에서도 증명됨.
[^1]: Hoffmann et al., 2022. Chinchilla Scaling Law. [^2]: Zhang & Sennrich, 2019. RMSNorm. [^3]: Shazeer, 2020. SwiGLU. [^4]: Su et al., 2021. RoPE. [^5]: Brown et al., 2020. GPT-3. [^6]: Chowdhery et al., 2022. PaLM. [^7]: Rae et al., 2021. Gopher. [^8]: Zhang et al., 2022. OPT. [^9]: Devlin et al., 2018. BERT. [^10]: Gao et al., 2021. The Pile. [^11]: Raffel et al., 2020. C4. [^12]: Wenzek et al.