Speculative Decoding em Produção: Como Acelerar Inferência de LLMs em 2-3x Sem Trocar de Modelo
Um modelo de 70 bilhões de parâmetros gera texto um token por vez, e cada token exige uma passada completa pelos pesos do modelo. A GPU fica subutilizada. Speculative decoding usa um modelo rascunho pequeno para propor múltiplos tokens que o modelo grande verifica em paralelo, entregando 2-3x de speedup com qualidade matematicamente idêntica. Este guia decompõe o algoritmo original de Leviathan et al. (2023), compara EAGLE-3, Medusa e n-gram, mostra benchmarks reais de produção no vLLM e TensorRT-LLM, e explica por que essa técnica deixou de ser otimização experimental para virar padrão de deploy em 2026.


































