Desarrollo de Software
SGLang: control fino sobre la ejecución de LLM
SGLang añade un DSL en Python para controlar la generación de LLM con decoding restringido, branching paralelo y RadixAttention, la estructura que indexa el caché KV en un trie radix para reutilizar prefijos compartidos entre peticiones. Cuando ese patrón existe, los speedups frente a vLLM llegan hasta 5 veces; sin él, la ventaja se diluye.