Trilha de aprendizagem
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- 06.01Objetivos: causal LM, MLM, span corruption e FIM→
- 06.02Dados: origem, filtragem, deduplicação e decontamination→
- 06.03Treinando seu próprio tokenizer→
- 06.04Scaling laws I: Kaplan→
- 06.05Scaling laws II: Chinchilla e compute-optimality→
- 06.06Scaling laws III: inference-aware e over-training→
- 06.07Data parallelism, ZeRO e FSDP→
- 06.08Tensor, pipeline e sequence parallelism→
- 06.09Mixed precision: fp16, bf16 e fp8→
- 06.10Gradient checkpointing e matemática de memória→
- 06.11Learning-rate schedules e warmup→
- 06.12Quando o treinamento falha: spikes, divergence e NaNs→
- 06.13Quanto custa um pretraining real→