Trilha de aprendizagem
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
O Transformer
Monte a arquitetura por trás dos LLMs modernos, começando por self-attention e suas operações de query, key e value.
- 05.01Attention Is All You Need em contexto→
- 05.02Self-attention desde os primeiros princípios: Q, K e V→
- 05.03Scaled dot-product attention e a raiz de d_k→
- 05.04Causal masking e por que a ordem importa→
- 05.05Multi-head attention→
- 05.06Positional encoding I: sinusoidal e aprendido→
- 05.07Positional encoding II: RoPE→
- 05.08Positional encoding III: ALiBi e relative bias→
- 05.09O bloco feed-forward e onde o conhecimento vive→
- 05.10Residuals, pre-norm versus post-norm→
- 05.11O bloco completo, montado→
- 05.12Encoder-only, decoder-only, encoder–decoder→
- 05.13Construa um GPT do zero, com anotações→
- 05.14Lendo pesos reais: a aparência de um modelo treinado→