LLMの学習データを整理——事前学習・SFT・RLHF・DPO・RLVRの違いとは
LLMの学習データを整理——事前学習・SFT・RLHF・DPO・RLVRの違いとは
| 項目 | 内容 |
|---|---|
| ジャンル | その他IT |
| 日付 | 2026-06-07 |
| 元記事 | Zenn |
要約
大規模言語モデルの学習フェーズごとに必要なデータ形式の違いを体系的に整理した記事が公開され、エンジニアコミュニティで好評を博している。事前学習(Pre-training)では大量の生テキスト、SFT(Supervised Fine-Tuning)では指示・応答のペアデータ、RLHF・DPO では人間によるランキング付きデータ、RLVR(Reinforcement Learning with Verifiable Rewards)では答えが検証可能な問題セットが必要とされる。各手法の目的と限界、データ品質がモデル能力に与える影響も丁寧に解説されており、LLM開発の全体像を理解する上で実践的な参考資料となっている。生成AI活用が進む中で、ファインチューニングやアライメント手法の選択は企業のAI導入戦略にも直結する。