Llama 3: el nuevo estándar abierto de Meta
Índice de contenidos
Actualizado: 2026-07-07
Llama 3 es la familia de modelos abiertos que Meta lanzó el 18 de abril de 2024 en 8.000 y 70.000 millones de parámetros, entrenada con 15 billones de tokens. El 70B superó a Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana de Meta, y su licencia permite uso comercial gratuito hasta 700 millones de usuarios activos al mes.
Meta liberó Llama 3 el 18 de abril de 2024 en dos tamaños: 8B y 70B, ambos con variantes Instruct para chat. Se entrenó sobre más de 15 billones de tokens (7,5 veces más que Llama 2), con un tokenizer de 128k de vocabulario y Grouped Query Attention en ambos tamaños. Para mí es el lanzamiento en el que un modelo abierto empezó a competir de verdad con los frontier cerrados en tareas del día a día, no solo en la ficha técnica.
Puntos clave
-
15T tokens de entrenamiento frente a 2T de Llama 2: la escala de datos es la diferencia más visible en razonamiento y siguimiento de instrucciones.
-
GQA en 8B y 70B: inferencia más eficiente sin sacrificar calidad.
-
Llama 3 70B quedó por delante de Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana que Meta publicó junto al lanzamiento (1.800 prompts, 12 categorías de uso).
-
Llama 3 8B supera a Llama 2 13B en casi todos los benchmarks con la mitad de parámetros.
-
La Llama 3 Community License permite uso comercial hasta 700M MAU sin coste adicional.
Diferencias clave frente a Llama 2
Los cambios arquitectónicos son sutiles pero el impacto es sustancial:
-
15T tokens de entrenamiento frente a 2T: 7,5x más datos.
-
Contexto inicial de 8k tokens (extendido a 128k en Llama 3.1).
-
Tokenizer mejorado con 128k de vocabulario frente a 32k: tokenización más eficiente, especialmente en idiomas no ingleses.
-
GQA (Grouped Query Attention) en ambos tamaños: mejor ratio calidad/coste de inferencia.
-
Instruction tuning significativamente mejor: SFT + DPO + RLHF, con menos verbosidad y mejor adherencia a instrucciones.
Benchmarks
| Benchmark | Llama 3 8B Instruct | Llama 3 70B Instruct |
|---|---|---|
| MMLU (5-shot) | 68,4 | 82,0 |
| GPQA (0-shot) | 34,2 | 39,5 |
| HumanEval (0-shot) | 62,2 | 81,7 |
| GSM-8K (8-shot, CoT) | 79,6 | 93,0 |
| MATH (4-shot, CoT) | 30,0 | 50,4 |
Estas son las cifras que publicó Meta en la model card oficial de Llama 3[1]. Ojo con un matiz que se pierde en muchos resúmenes: Meta no publicó una tabla con cifras exactas de MMLU o HumanEval frente a Claude Sonnet; su comparación abierta con modelos cerrados fue vía evaluación humana, no vía estos benchmarks académicos. Como resume el propio blog de lanzamiento: "Preference rankings by human annotators based on this evaluation set highlight the strong performance of our 70B instruction-following model compared to competing models of comparable size in real-world scenarios" (Meta AI, abril de 2024[2]). Llama 3 8B, por su parte, supera a Llama 2 13B en casi todo con la mitad de parámetros.
Hardware requerido
| Versión | FP16 | INT8 | INT4 (GGUF) |
|---|---|---|---|
| Llama 3 8B | 16 GB | 9 GB | 5 GB |
| Llama 3 70B | 140 GB | 75 GB | 40 GB |
El 8B en Q4 cabe en Apple Silicon de 16 GB. El 70B Q4 requiere una A100 80 GB o dos A100 40 GB. Para inferencia en producción a throughput serio, vLLM es el estándar, con tensor parallelism para el 70B; si el caso de uso tiene muchos prefijos compartidos entre peticiones, merece la pena mirar SGLang en su lugar.
Despliegue típico
# Con Ollama (lo más simple)
ollama run llama3:8b
ollama run llama3:70b
# Con vLLM para producción
python -m vllm.entrypoints.openai.api_server
--model meta-llama/Meta-Llama-3-70B-Instruct
--tensor-parallel-size 4
--gpu-memory-utilization 0.9
Para quien no quiere self-host, Groq sirve Llama 3 8B a más de 800 tokens por segundo según pruebas independientes (VentureBeat[3]); Together.ai y AWS Bedrock cubren el 70B en modo enterprise.
Licencia
La Llama 3 Community License permite uso comercial hasta 700M MAU con obligación de mostrar "Built with Meta Llama 3". Por encima de 700M, se requiere solicitar una licencia especial a Meta (términos completos[4]). Para la gran mayoría de organizaciones, la licencia es suficientemente permisiva para despliegues de producción.
Fine-tuning
Llama 3 8B es fine-tunable con recursos manejables:
-
QLoRA en A100 24 GB: viable.
-
LoRA fine-tune: practicable en la mayoría de entornos enterprise.
-
Fine-tune completo del 8B: requiere 4x A100 80 GB.
-
Fine-tune del 70B: H100 cluster, presupuesto serio.
Para casos empresariales con dominio específico (legal, médico, técnico), un LoRA fine-tune del 8B sobre datos curados supera con frecuencia a un 70B base. Ver también frameworks de evaluación para retrieval para medir la calidad tras el fine-tune.
Dónde sobresale y dónde no
Puntos fuertes:
-
Code generation: HumanEval 62% (8B) y 82% (70B).
-
Razonamiento matemático: GSM8K 79-93% según tamaño.
-
Siguiendo instrucciones: notablemente mejor que Llama 2 en adherencia y tono.
Puntos débiles relativos:
-
Multilingüe: aceptable en español y francés, pero Mistral y Qwen siguen siendo superiores.
-
Long context: 8k base (resuelto con Llama 3.1 128k).
-
Multimodal: solo texto en la release inicial (resuelto con Llama 3.2).
Preguntas frecuentes
¿Llama 3 es gratis para uso comercial?
Sí, hasta 700 millones de usuarios activos al mes bajo la Llama 3 Community License, con la única obligación de mostrar "Built with Meta Llama 3". Por encima de ese umbral hace falta solicitar una licencia especial a Meta.
¿Qué versión de Llama 3 elijo, 8B o 70B?
El 8B para self-hosting modesto (cabe en una GPU de 16 GB en Q4) y casos donde el coste por token manda. El 70B cuando el razonamiento y el código importan más que el coste, ya que se acerca a modelos cerrados en la evaluación humana de Meta.
¿Llama 3 soporta contexto largo?
No en el lanzamiento inicial: 8k tokens de contexto. Si el caso de uso necesita más, la opción es esperar a Llama 3.1 (128k) o mirar otro modelo mientras tanto.
Conclusión
Llama 3 es un salto real sobre Llama 2 y marca el estándar abierto de referencia. El 8B es la opción por defecto para self-hosting modesto; el 70B compite con frontier cerrados en la mayoría de tareas. Combinado con un ecosistema masivo de fine-tunes, variantes cuantizadas y tooling, es la elección segura para equipos que van en serio con LLMs abiertos. Para multilingüe extremo o contexto muy largo, Mixtral o Gemini siguen siendo preferibles; para el resto, Llama 3 es el default sensato.
Versión en inglés de este artículo: Llama 3: Meta’s New Open Standard.