Trilha de aprendizagem

Inferência e eficiência

Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.

08

Inferência e eficiência

Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.

  1. 08.01O que realmente acontece quando você aperta enviar
  2. 08.02O KV cache
  3. 08.03Prefill e decode: duas máquinas diferentes
  4. 08.04Sampling: temperature, top-k, top-p e min-p
  5. 08.05Beam search, speculative decoding e Medusa
  6. 08.06MQA, GQA e MLA
  7. 08.07FlashAttention e IO-awareness
  8. 08.08PagedAttention e continuous batching
  9. 08.09Quantização I: int8, int4 e fundamentos
  10. 08.10Quantização II: GPTQ, AWQ, GGUF e QAT
  11. 08.11Serving stacks: vLLM, SGLang e TensorRT-LLM
  12. 08.12Executando modelos localmente