Trilha de aprendizagem

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

07

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

  1. 07.01Por que modelos base não são assistentes
  2. 07.02Supervised fine-tuning e dados de instruções
  3. 07.03LoRA, QLoRA e PEFT
  4. 07.04Reward models e dados de preferência humana
  5. 07.05RLHF com PPO
  6. 07.06DPO: sem o reward model
  7. 07.07ORPO, KTO, SimPO e o zoológico do alinhamento
  8. 07.08GRPO e RL com rewards verificáveis
  9. 07.09Modelos de reasoning: test-time compute e CoT longo
  10. 07.10Constitutional AI e RLAIF
  11. 07.11Distillation: modelos pequenos jogando acima do peso