Llama 3: el nuevo estándar abierto de Meta
Índice de contenidos
Llama 3 es la familia de modelos abiertos que Meta lanzó el 18 de abril de 2024 en 8.000 y 70.000 millones de parámetros, entrenada con 15 billones de tokens. El 70B superó a Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana de Meta, y su licencia permite uso comercial gratuito hasta 700 millones de usuarios activos al mes.
Meta liberó Llama 3 el 18 de abril de 2024 en dos tamaños: 8B y 70B, ambos con variantes Instruct para chat. Se entrenó sobre más de 15 billones de tokens (7,5 veces más que Llama 2), con un tokenizer de 128k de vocabulario y Grouped Query Attention en ambos tamaños. Para mí es el lanzamiento en el que un modelo abierto empezó a competir de verdad con los frontier cerrados en tareas del día a día, no solo en la ficha técnica.
Puntos clave
-
15T tokens de entrenamiento frente a 2T de Llama 2: la escala de datos es la diferencia más visible en razonamiento y siguimiento de instrucciones.
-
GQA en 8B y 70B: inferencia más eficiente sin sacrificar calidad.
-
Llama 3 70B quedó por delante de Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana que Meta publicó junto al lanzamiento (1.800 prompts, 12 categorías de uso).
-
Llama 3 8B supera a Llama 2 13B en casi todos los benchmarks con la mitad de parámetros.
-
La Llama 3 Community License permite uso comercial hasta 700M MAU sin coste adicional.
Diferencias clave frente a Llama 2
Los cambios arquitectónicos son sutiles pero el impacto es sustancial:
-
15T tokens de entrenamiento frente a 2T: 7,5x más datos.
-
Contexto inicial de 8k tokens (extendido a 128k en Llama 3.1).
-
Tokenizer mejorado con 128k de vocabulario frente a 32k: tokenización más eficiente, especialmente en idiomas no ingleses.
-
GQA (Grouped Query Attention) en ambos tamaños: mejor ratio calidad/coste de inferencia.
-
Mejor instruction tuning: SFT + DPO + RLHF, con menos verbosidad y mejor adherencia a instrucciones.
Benchmarks
| Benchmark | Llama 3 8B Instruct | Llama 3 70B Instruct |
|---|---|---|
| MMLU (5-shot) | 68,4 | 82,0 |
| GPQA (0-shot) | 34,2 | 39,5 |
| HumanEval (0-shot) | 62,2 | 81,7 |
| GSM-8K (8-shot, CoT) | 79,6 | 93,0 |
| MATH (4-shot, CoT) | 30,0 | 50,4 |
Estas son las cifras que publicó Meta en la model card oficial de Llama 3[1]. Ojo con un matiz: Meta no publicó una tabla con cifras exactas de MMLU o HumanEval frente a Claude Sonnet. Su comparación abierta con modelos cerrados fue vía evaluación humana, no vía estos benchmarks académicos. Como resume el propio blog de lanzamiento: "Preference rankings by human annotators based on this evaluation set highlight the strong performance of our 70B instruction-following model compared to competing models of comparable size in real-world scenarios" (Meta AI, abril de 2024[2]).
Llama 3 8B, por su parte, supera a Llama 2 13B en casi todo con la mitad de parámetros.
Hardware requerido
| Versión | FP16 | INT8 | INT4 (GGUF) |
|---|---|---|---|
| Llama 3 8B | 16 GB | 9 GB | 5 GB |
| Llama 3 70B | 140 GB | 75 GB | 40 GB |
El 8B en Q4 cabe en Apple Silicon de 16 GB. El 70B Q4 requiere una A100 80 GB o dos A100 40 GB. Para inferencia en producción a throughput serio, vLLM es el estándar, con tensor parallelism para el 70B. Si el caso de uso reutiliza el mismo prefijo entre peticiones, merece la pena mirar SGLang en su lugar.
Despliegue típico
# Con Ollama (lo más simple)
ollama run llama3:8b
ollama run llama3:70b
# Con vLLM para producción
python -m vllm.entrypoints.openai.api_server
--model meta-llama/Meta-Llama-3-70B-Instruct
--tensor-parallel-size 4
--gpu-memory-utilization 0.9
Para quien no quiere self-host, Groq sirve Llama 3 8B a más de 800 tokens por segundo según pruebas independientes (VentureBeat[3]); Together.ai y AWS Bedrock cubren el 70B en modo enterprise.
Licencia
La Llama 3 Community License permite uso comercial hasta 700M MAU con obligación de mostrar "Built with Meta Llama 3". Por encima de 700M, se requiere solicitar una licencia especial a Meta (términos completos[4]). Para la gran mayoría de organizaciones, la licencia es suficientemente permisiva para despliegues de producción.
Fine-tuning
Llama 3 8B es fine-tunable con recursos manejables:
-
QLoRA en A100 24 GB: viable.
-
LoRA fine-tune: practicable en la mayoría de entornos enterprise.
-
Fine-tune completo del 8B: requiere 4x A100 80 GB.
-
Fine-tune del 70B: H100 cluster, presupuesto serio.
Para casos empresariales con dominio específico (legal, médico, técnico), un LoRA fine-tune del 8B sobre datos curados supera a un 70B base en las tareas de ese dominio. Ver también frameworks de evaluación para retrieval para medir la calidad tras el fine-tune.
Dónde sobresale y dónde no
Puntos fuertes:
-
Code generation: HumanEval 62% (8B) y 82% (70B).
-
Razonamiento matemático: GSM8K 79-93% según tamaño.
-
Siguiendo instrucciones: gana a Llama 2 en adherencia y tono.
Puntos débiles relativos:
-
Multilingüe: aceptable en español y francés, pero Mistral y Qwen siguen siendo superiores.
-
Long context: 8k base (resuelto con Llama 3.1 128k).
-
Multimodal: solo texto en la release inicial (resuelto con Llama 3.2).
Preguntas frecuentes
¿Llama 3 es gratis para uso comercial?
Sí, hasta 700 millones de usuarios activos al mes bajo la Llama 3 Community License, con la única obligación de mostrar "Built with Meta Llama 3". Por encima de ese umbral hace falta solicitar una licencia especial a Meta.
¿Qué versión de Llama 3 elijo, 8B o 70B?
El 8B para self-hosting modesto (cabe en una GPU de 16 GB en Q4) y casos donde el coste por token manda. El 70B cuando el razonamiento y el código importan más que el coste, ya que se acerca a modelos cerrados en la evaluación humana de Meta.
¿Llama 3 soporta contexto largo?
No en el lanzamiento inicial: 8k tokens de contexto. Si el caso de uso necesita más, la opción es esperar a Llama 3.1 (128k) o mirar otro modelo mientras tanto.
Conclusión
Llama 3 es un salto real sobre Llama 2 y marca el estándar abierto de referencia. El 8B es la opción por defecto para self-hosting modesto; el 70B compite con frontier cerrados en evaluación humana. Combinado con un ecosistema masivo de fine-tunes, variantes cuantizadas y tooling, es la elección segura para equipos que van en serio con LLMs abiertos. Para multilingüe extremo o contexto largo, Mixtral o Gemini siguen siendo preferibles; para el resto, Llama 3 es el default sensato.
Versión en inglés de este artículo: Llama 3: Meta’s New Open Standard.