Actualizado: 2026-07-07

Meta liberó Llama 3 el 18 de abril de 2024 en dos tamaños: 8B y 70B, ambos con variantes Instruct para chat. Se entrenó sobre más de 15 billones de tokens (7,5 veces más que Llama 2), con un tokenizer de 128k de vocabulario y Grouped Query Attention en ambos tamaños. Para mí es el lanzamiento en el que un modelo abierto empezó a competir de verdad con los frontier cerrados en tareas del día a día, no solo en la ficha técnica.

Puntos clave

  • 15T tokens de entrenamiento frente a 2T de Llama 2: la escala de datos es la diferencia más visible en razonamiento y siguimiento de instrucciones.

  • GQA en 8B y 70B: inferencia más eficiente sin sacrificar calidad.

  • Llama 3 70B quedó por delante de Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana que Meta publicó junto al lanzamiento (1.800 prompts, 12 categorías de uso).

  • Llama 3 8B supera a Llama 2 13B en casi todos los benchmarks con la mitad de parámetros.

  • La Llama 3 Community License permite uso comercial hasta 700M MAU sin coste adicional.

Diferencias clave frente a Llama 2

Los cambios arquitectónicos son sutiles pero el impacto es sustancial:

  • 15T tokens de entrenamiento frente a 2T: 7,5x más datos.

  • Contexto inicial de 8k tokens (extendido a 128k en Llama 3.1).

  • Tokenizer mejorado con 128k de vocabulario frente a 32k: tokenización más eficiente, especialmente en idiomas no ingleses.

  • GQA (Grouped Query Attention) en ambos tamaños: mejor ratio calidad/coste de inferencia.

  • Instruction tuning significativamente mejor: SFT + DPO + RLHF, con menos verbosidad y mejor adherencia a instrucciones.

Benchmarks

Benchmark Llama 3 8B Instruct Llama 3 70B Instruct
MMLU (5-shot) 68,4 82,0
GPQA (0-shot) 34,2 39,5
HumanEval (0-shot) 62,2 81,7
GSM-8K (8-shot, CoT) 79,6 93,0
MATH (4-shot, CoT) 30,0 50,4

Estas son las cifras que publicó Meta en la model card oficial de Llama 3[1]. Ojo con un matiz que se pierde en muchos resúmenes: Meta no publicó una tabla con cifras exactas de MMLU o HumanEval frente a Claude Sonnet; su comparación abierta con modelos cerrados fue vía evaluación humana, no vía estos benchmarks académicos. Como resume el propio blog de lanzamiento: "Preference rankings by human annotators based on this evaluation set highlight the strong performance of our 70B instruction-following model compared to competing models of comparable size in real-world scenarios" (Meta AI, abril de 2024[2]). Llama 3 8B, por su parte, supera a Llama 2 13B en casi todo con la mitad de parámetros.

Hardware requerido

Versión FP16 INT8 INT4 (GGUF)
Llama 3 8B 16 GB 9 GB 5 GB
Llama 3 70B 140 GB 75 GB 40 GB

El 8B en Q4 cabe en Apple Silicon de 16 GB. El 70B Q4 requiere una A100 80 GB o dos A100 40 GB. Para inferencia en producción a throughput serio, vLLM es el estándar, con tensor parallelism para el 70B; si el caso de uso tiene muchos prefijos compartidos entre peticiones, merece la pena mirar SGLang en su lugar.

Despliegue típico

# Con Ollama (lo más simple)
ollama run llama3:8b
ollama run llama3:70b

# Con vLLM para producción
python -m vllm.entrypoints.openai.api_server 
  --model meta-llama/Meta-Llama-3-70B-Instruct 
  --tensor-parallel-size 4 
  --gpu-memory-utilization 0.9

Para quien no quiere self-host, Groq sirve Llama 3 8B a más de 800 tokens por segundo según pruebas independientes (VentureBeat[3]); Together.ai y AWS Bedrock cubren el 70B en modo enterprise.

Licencia

La Llama 3 Community License permite uso comercial hasta 700M MAU con obligación de mostrar "Built with Meta Llama 3". Por encima de 700M, se requiere solicitar una licencia especial a Meta (términos completos[4]). Para la gran mayoría de organizaciones, la licencia es suficientemente permisiva para despliegues de producción.

Fine-tuning

Llama 3 8B es fine-tunable con recursos manejables:

  • QLoRA en A100 24 GB: viable.

  • LoRA fine-tune: practicable en la mayoría de entornos enterprise.

  • Fine-tune completo del 8B: requiere 4x A100 80 GB.

  • Fine-tune del 70B: H100 cluster, presupuesto serio.

Para casos empresariales con dominio específico (legal, médico, técnico), un LoRA fine-tune del 8B sobre datos curados supera con frecuencia a un 70B base. Ver también frameworks de evaluación para retrieval para medir la calidad tras el fine-tune.

Dónde sobresale y dónde no

Puntos fuertes:

  • Code generation: HumanEval 62% (8B) y 82% (70B).

  • Razonamiento matemático: GSM8K 79-93% según tamaño.

  • Siguiendo instrucciones: notablemente mejor que Llama 2 en adherencia y tono.

Puntos débiles relativos:

  • Multilingüe: aceptable en español y francés, pero Mistral y Qwen siguen siendo superiores.

  • Long context: 8k base (resuelto con Llama 3.1 128k).

  • Multimodal: solo texto en la release inicial (resuelto con Llama 3.2).

Preguntas frecuentes

¿Llama 3 es gratis para uso comercial?

Sí, hasta 700 millones de usuarios activos al mes bajo la Llama 3 Community License, con la única obligación de mostrar "Built with Meta Llama 3". Por encima de ese umbral hace falta solicitar una licencia especial a Meta.

¿Qué versión de Llama 3 elijo, 8B o 70B?

El 8B para self-hosting modesto (cabe en una GPU de 16 GB en Q4) y casos donde el coste por token manda. El 70B cuando el razonamiento y el código importan más que el coste, ya que se acerca a modelos cerrados en la evaluación humana de Meta.

¿Llama 3 soporta contexto largo?

No en el lanzamiento inicial: 8k tokens de contexto. Si el caso de uso necesita más, la opción es esperar a Llama 3.1 (128k) o mirar otro modelo mientras tanto.

Conclusión

Llama 3 es un salto real sobre Llama 2 y marca el estándar abierto de referencia. El 8B es la opción por defecto para self-hosting modesto; el 70B compite con frontier cerrados en la mayoría de tareas. Combinado con un ecosistema masivo de fine-tunes, variantes cuantizadas y tooling, es la elección segura para equipos que van en serio con LLMs abiertos. Para multilingüe extremo o contexto muy largo, Mixtral o Gemini siguen siendo preferibles; para el resto, Llama 3 es el default sensato.

Versión en inglés de este artículo: Llama 3: Meta’s New Open Standard.

Fuentes

  1. model card oficial de Llama 3
  2. Meta AI, abril de 2024
  3. VentureBeat
  4. términos completos