Currículo

Trilhas de aprendizagem

Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.

01

Orientação e fundamentos

Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.

Abrir trilha
  1. 01.01O que é, de verdade, um modelo de linguagem?
  2. 01.02Uma história em 60 segundos: de n-grams à era do GPT-5
  3. 01.03A probabilidade de que você realmente precisa
  4. 01.04Vetores, matrizes e produtos escalares
  5. 01.05Multiplicação de matrizes como transformação
  6. 01.06Derivadas e gradientes, geometricamente
  7. 01.07Python, NumPy e PyTorch em 20 minutos
  8. 01.08Como ler um paper de ML
02

Do texto aos tensores

Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.

Abrir trilha
  1. 02.01Por que computadores não sabem ler
  2. 02.02Tokenização I: caracteres, palavras e subwords
  3. 02.03Tokenização II: BPE, passo a passo
  4. 02.04Tokenização III: SentencePiece, byte-level e o impacto da contagem
  5. 02.05Embeddings: significado como geometria
  6. 02.06word2vec, GloVe e o truque das analogias
  7. 02.07Entropia, perplexidade e o que significa 'bom'
03

Fundamentos de redes neurais

Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.

Abrir trilha
  1. 03.01O perceptron
  2. 03.02Perceptrons multicamadas e não linearidade
  3. 03.03Funções de activation: ReLU, GELU e SwiGLU
  4. 03.04Funções de loss e cross-entropy
  5. 03.05Backpropagation, visualizado
  6. 03.06Gradient descent e a paisagem da loss
  7. 03.07Optimizers: SGD → Momentum → Adam → AdamW
  8. 03.08Inicialização, normalização e residuals
  9. 03.09Overfitting, regularização e a bitter lesson
04

Modelos de sequência

Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.

Abrir trilha
  1. 04.01Modelando sequências: a configuração
  2. 04.02RNNs e o vanishing gradient
  3. 04.03LSTM e GRU: gates que lembram
  4. 04.04Seq2seq, encoder-decoder e o bottleneck
  5. 04.05Bahdanau attention: a ideia que mudou tudo
05

O Transformer

Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.

Abrir trilha
  1. 05.01Attention Is All You Need em contexto
  2. 05.02Self-attention desde os primeiros princípios: Q, K e V
  3. 05.03Scaled dot-product attention e a raiz de d_k
  4. 05.04Causal masking e por que a ordem importa
  5. 05.05Multi-head attention
  6. 05.06Positional encoding I: sinusoidal e aprendido
  7. 05.07Positional encoding II: RoPE
  8. 05.08Positional encoding III: ALiBi e relative bias
  9. 05.09O bloco feed-forward e onde o conhecimento vive
  10. 05.10Residuals, pre-norm versus post-norm
  11. 05.11O bloco completo, montado
  12. 05.12Encoder-only, decoder-only, encoder–decoder
  13. 05.13Construa um GPT do zero, com anotações
  14. 05.14Lendo pesos reais: a aparência de um modelo treinado
06

Pretraining em Escala

Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.

Abrir trilha
  1. 06.01Objetivos: causal LM, MLM, span corruption e FIM
  2. 06.02Dados: origem, filtragem, deduplicação e decontamination
  3. 06.03Treinando seu próprio tokenizer
  4. 06.04Scaling laws I: Kaplan
  5. 06.05Scaling laws II: Chinchilla e compute-optimality
  6. 06.06Scaling laws III: inference-aware e over-training
  7. 06.07Data parallelism, ZeRO e FSDP
  8. 06.08Tensor, pipeline e sequence parallelism
  9. 06.09Mixed precision: fp16, bf16 e fp8
  10. 06.10Gradient checkpointing e matemática de memória
  11. 06.11Learning-rate schedules e warmup
  12. 06.12Quando o treinamento falha: spikes, divergence e NaNs
  13. 06.13Quanto custa um pretraining real
07

Pós-treinamento e alinhamento

Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.

Abrir trilha
  1. 07.01Por que modelos base não são assistentes
  2. 07.02Supervised fine-tuning e dados de instruções
  3. 07.03LoRA, QLoRA e PEFT
  4. 07.04Reward models e dados de preferência humana
  5. 07.05RLHF com PPO
  6. 07.06DPO: sem o reward model
  7. 07.07ORPO, KTO, SimPO e o zoológico do alinhamento
  8. 07.08GRPO e RL com rewards verificáveis
  9. 07.09Modelos de reasoning: test-time compute e CoT longo
  10. 07.10Constitutional AI e RLAIF
  11. 07.11Distillation: modelos pequenos jogando acima do peso
08

Inferência e eficiência

Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.

Abrir trilha
  1. 08.01O que realmente acontece quando você aperta enviar
  2. 08.02O KV cache
  3. 08.03Prefill e decode: duas máquinas diferentes
  4. 08.04Sampling: temperature, top-k, top-p e min-p
  5. 08.05Beam search, speculative decoding e Medusa
  6. 08.06MQA, GQA e MLA
  7. 08.07FlashAttention e IO-awareness
  8. 08.08PagedAttention e continuous batching
  9. 08.09Quantização I: int8, int4 e fundamentos
  10. 08.10Quantização II: GPTQ, AWQ, GGUF e QAT
  11. 08.11Serving stacks: vLLM, SGLang e TensorRT-LLM
  12. 08.12Executando modelos localmente