Trilha de aprendizagem
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
Inferência e eficiência
Entenda como modelos treinados geram texto e como escolhas de decoding equilibram diversidade, coerência, latência e custo.
- 08.01O que realmente acontece quando você aperta enviar→
- 08.02O KV cache→
- 08.03Prefill e decode: duas máquinas diferentes→
- 08.04Sampling: temperature, top-k, top-p e min-p→
- 08.05Beam search, speculative decoding e Medusa→
- 08.06MQA, GQA e MLA→
- 08.07FlashAttention e IO-awareness→
- 08.08PagedAttention e continuous batching→
- 08.09Quantização I: int8, int4 e fundamentos→
- 08.10Quantização II: GPTQ, AWQ, GGUF e QAT→
- 08.11Serving stacks: vLLM, SGLang e TensorRT-LLM→
- 08.12Executando modelos localmente→