Trilha de aprendizagem
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- 07.01Por que modelos base não são assistentes→
- 07.02Supervised fine-tuning e dados de instruções→
- 07.03LoRA, QLoRA e PEFT→
- 07.04Reward models e dados de preferência humana→
- 07.05RLHF com PPO→
- 07.06DPO: sem o reward model→
- 07.07ORPO, KTO, SimPO e o zoológico do alinhamento→
- 07.08GRPO e RL com rewards verificáveis→
- 07.09Modelos de reasoning: test-time compute e CoT longo→
- 07.10Constitutional AI e RLAIF→
- 07.11Distillation: modelos pequenos jogando acima do peso→