Currículo
Trilhas de aprendizagem
Um caminho conectado dos primeiros princípios aos sistemas modernos de modelos de linguagem.
Orientação e fundamentos
Construa um modelo mental preciso dos modelos de linguagem e da matemática necessária para tudo o que vem depois.
- 01.01O que é, de verdade, um modelo de linguagem?→
- 01.02Uma história em 60 segundos: de n-grams à era do GPT-5→
- 01.03A probabilidade de que você realmente precisa→
- 01.04Vetores, matrizes e produtos escalares→
- 01.05Multiplicação de matrizes como transformação→
- 01.06Derivadas e gradientes, geometricamente→
- 01.07Python, NumPy e PyTorch em 20 minutos→
- 01.08Como ler um paper de ML→
Do texto aos tensores
Veja como o texto se transforma em tokens, vetores e estruturas numéricas que uma rede neural consegue processar.
- 02.01Por que computadores não sabem ler→
- 02.02Tokenização I: caracteres, palavras e subwords→
- 02.03Tokenização II: BPE, passo a passo→
- 02.04Tokenização III: SentencePiece, byte-level e o impacto da contagem→
- 02.05Embeddings: significado como geometria→
- 02.06word2vec, GloVe e o truque das analogias→
- 02.07Entropia, perplexidade e o que significa 'bom'→
Fundamentos de redes neurais
Aprenda como redes neurais representam funções, medem erros, propagam gradientes e melhoram por otimização.
- 03.01O perceptron→
- 03.02Perceptrons multicamadas e não linearidade→
- 03.03Funções de activation: ReLU, GELU e SwiGLU→
- 03.04Funções de loss e cross-entropy→
- 03.05Backpropagation, visualizado→
- 03.06Gradient descent e a paisagem da loss→
- 03.07Optimizers: SGD → Momentum → Adam → AdamW→
- 03.08Inicialização, normalização e residuals→
- 03.09Overfitting, regularização e a bitter lesson→
Modelos de sequência
Percorra o caminho do estado recorrente aos modelos encoder-decoder e à attention, ancestrais imediatos do Transformer.
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- 05.01Attention Is All You Need em contexto→
- 05.02Self-attention desde os primeiros princípios: Q, K e V→
- 05.03Scaled dot-product attention e a raiz de d_k→
- 05.04Causal masking e por que a ordem importa→
- 05.05Multi-head attention→
- 05.06Positional encoding I: sinusoidal e aprendido→
- 05.07Positional encoding II: RoPE→
- 05.08Positional encoding III: ALiBi e relative bias→
- 05.09O bloco feed-forward e onde o conhecimento vive→
- 05.10Residuals, pre-norm versus post-norm→
- 05.11O bloco completo, montado→
- 05.12Encoder-only, decoder-only, encoder–decoder→
- 05.13Construa um GPT do zero, com anotações→
- 05.14Lendo pesos reais: a aparência de um modelo treinado→
Pretraining em Escala
Projete os objetivos, os dados, a otimização, o paralelismo e o modelo de custos de um treinamento sério de um modelo de linguagem.
- 06.01Objetivos: causal LM, MLM, span corruption e FIM→
- 06.02Dados: origem, filtragem, deduplicação e decontamination→
- 06.03Treinando seu próprio tokenizer→
- 06.04Scaling laws I: Kaplan→
- 06.05Scaling laws II: Chinchilla e compute-optimality→
- 06.06Scaling laws III: inference-aware e over-training→
- 06.07Data parallelism, ZeRO e FSDP→
- 06.08Tensor, pipeline e sequence parallelism→
- 06.09Mixed precision: fp16, bf16 e fp8→
- 06.10Gradient checkpointing e matemática de memória→
- 06.11Learning-rate schedules e warmup→
- 06.12Quando o treinamento falha: spikes, divergence e NaNs→
- 06.13Quanto custa um pretraining real→
Pós-treinamento e alinhamento
Transforme preditores pré-treinados em assistentes úteis por meio de instruction tuning, preferências humanas, reinforcement learning e destilação.
- 07.01Por que modelos base não são assistentes→
- 07.02Supervised fine-tuning e dados de instruções→
- 07.03LoRA, QLoRA e PEFT→
- 07.04Reward models e dados de preferência humana→
- 07.05RLHF com PPO→
- 07.06DPO: sem o reward model→
- 07.07ORPO, KTO, SimPO e o zoológico do alinhamento→
- 07.08GRPO e RL com rewards verificáveis→
- 07.09Modelos de reasoning: test-time compute e CoT longo→
- 07.10Constitutional AI e RLAIF→
- 07.11Distillation: modelos pequenos jogando acima do peso→
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- 08.01O que realmente acontece quando você aperta enviar→
- 08.02O KV cache→
- 08.03Prefill e decode: duas máquinas diferentes→
- 08.04Sampling: temperature, top-k, top-p e min-p→
- 08.05Beam search, speculative decoding e Medusa→
- 08.06MQA, GQA e MLA→
- 08.07FlashAttention e IO-awareness→
- 08.08PagedAttention e continuous batching→
- 08.09Quantização I: int8, int4 e fundamentos→
- 08.10Quantização II: GPTQ, AWQ, GGUF e QAT→
- 08.11Serving stacks: vLLM, SGLang e TensorRT-LLM→
- 08.12Executando modelos localmente→