Actualizado: 2026-07-07

Llama 3.1 405B, lanzado por Meta el 23 de julio de 2024[1], es el primer modelo de pesos abiertos que compite en serio con GPT-4o y Claude 3.5 Sonnet en benchmarks de razonamiento y código. 405 mil millones de parámetros, 128k tokens de contexto (frente a los 8k de Llama 3), entrenado sobre más de 15 billones de tokens con más de 16.000 GPU H100. Para equipos que buscaban una alternativa abierta al frontier comercial, es el momento más relevante hasta la fecha.

Puntos clave

  • Llama 3.1 405B cierra el gap open-vs-closed en benchmarks de razonamiento, código y MMLU.

  • El mismo lanzamiento refresca Llama 3.1 8B y 70B con 128k de contexto y mejoras de calidad.

  • El hardware para self-hosting es prohibitivo para la mayoría: ~220 GB VRAM en Q4, que requiere múltiples H100 o un M2 Ultra con 192 GB.

  • Para equipos sin capacidad de self-hosting, Together.ai, Fireworks y Groq ofrecen acceso por token a precios razonables.

  • La distillation (usar 405B para generar datos de entrenamiento para 8B y 70B) es la razón más estratégica por la que Meta lo liberó.

Qué cambia respecto a Llama 3 70B

Aspecto Llama 3.1 405B Llama 3.1 70B
Parámetros 405B 70B
Contexto 128k 128k
MMLU (0-shot CoT) 88,6 86,0
HumanEval 89,0 80,5
Coste hosted (Together/Fireworks) ~$3-3,5/1M ~$0,9/1M
Self-hosting VRAM (Q4) ~220 GB ~40 GB

Llama 3.1 405B es 5,8x más grande que el 70B, con un coste de inferencia proporcional. Para la mayoría de use cases empresariales (RAG, chat asistente, generación creativa estándar), el 70B sigue siendo más pragmático. El 405B justifica cuando la tarea está en la frontera de razonamiento complejo. Los datos de parámetros y benchmarks son los publicados por Meta en el model card de Llama 3.1[2]; los de precio por token, los que recoge llm-stats.com para cada proveedor hosted[3].

Benchmarks frente al frontier cerrado

Benchmark Llama 3.1 405B GPT-4o Claude 3.5 Sonnet
MMLU (0-shot CoT) 88,6 88,7 88,3
HumanEval 89,0 90,2 92,0
MATH (0-shot CoT) 73,8 76,6 71,1

Los números son equivalentes en la mayoría de benchmarks: la diferencia entre los tres modelos en MMLU es de menos de medio punto. Para muchas tareas de producción, el 405B es indistinguible de GPT-4o. La diferencia está en algunas tareas de código muy específicas, donde Claude 3.5 Sonnet gana con claridad, y en razonamiento matemático, donde GPT-4o lidera. Estas cifras de GPT-4o y Claude 3.5 Sonnet son las que publica el model card addendum de Claude 3.5 Sonnet de Anthropic[4], que cita a su vez el conjunto de evaluación simple-evals de OpenAI para la cifra de GPT-4o.

Hardware para self-hosting

Los requisitos son los que hacen inviable el self-hosting para la mayoría:

  • FP16 (precisión completa): ~810 GB de VRAM.

  • INT8: ~405 GB.

  • INT4 (GGUF): ~220 GB.

Implicaciones prácticas:

  • 2-4 × H100 80 GB con tensor parallelism para Q4.

  • Apple M2 Ultra con 192 GB de memoria unificada: cabe en Q4, a 8-10 tokens/s (para exploración, no producción).

  • Inviable en consumer hardware.

Para self-hosting de Llama 3.1 70B Q4, que también recibió el upgrade de 128k contexto, los requisitos son ~40 GB: manejables con un Mac Studio M2 Ultra de 192 GB. Ver cómo instalar Ollama en Mac para el flujo local.

Opciones de acceso sin self-hosting

Si no puedes desplegar el 405B internamente:

  • Together.ai: pago por token, ~$3,5/1M tokens.

  • Fireworks: precio algo menor (~$3/1M) y buena latencia.

  • Groq: hardware LPU dedicado, con el throughput más alto del sector para modelos abiertos según las mediciones independientes de Artificial Analysis[5].

  • AWS Bedrock: nivel empresarial, integra con IAM y VPC.

  • Vertex AI (Google): disponible con controles de compliance.

Para cargas bajas o medias (menos de 10.000 consultas al día), el hosted por token es más económico. Para cargas altas en producción, el coste de GPU propia empieza a amortizarse.

Casos de uso donde 405B justifica

  • Razonamiento complejo en la frontera: tareas que 70B no resuelve satisfactoriamente.

  • Agentes multi-step sofisticados: donde la calidad de cada paso afecta la cadena.

  • Distillation: usar 405B para generar datos de entrenamiento que mejoren 8B y 70B. Esta es probablemente la razón estratégica más importante del lanzamiento.

  • Compliance con self-hosted frontier: organizaciones con requisitos de air-gap o privacidad estricta que necesitan calidad frontier.

Distillation: el efecto multiplicador

El lanzamiento de 405B abrió una puerta que la comunidad aprovechó rápidamente: usar el 405B como modelo "profesor" para generar datos de entrenamiento que mejoran los modelos pequeños. Ya existen fine-tunes del 8B entrenados con datos generados por el 405B que superan la calidad del 8B base en dominios específicos. Esta dinámica, modelos grandes liberados que mejoran el ecosistema de modelos pequeños, es parte del valor estratégico para Meta. La propia licencia de Llama 3.1 permite explícitamente usar las salidas del modelo para mejorar otros modelos[1], el cambio legal que habilita esta práctica a escala.

Limitaciones

  • Coste de inferencia: ~10x frente a 70B. Justificar con el caso de uso.

  • Latencia: procesar 128k tokens con el 405B tarda más de un minuto.

  • Licencia: Community license con restricciones para servicios con más de 700M de usuarios activos mensuales.

  • Multimodalidad: solo texto (Llama 3.2 añadió visión posteriormente).

Conclusión

Llama 3.1 405B marca el momento en que los modelos de pesos abiertos alcanzaron la frontera del frontier comercial. Para organizaciones con capacidad de serving propio o que usan providers hosted, es una alternativa real frente a GPT-4o. Para la mayoría de equipos, Llama 3.1 70B sigue siendo más pragmático: mejor coste, menor latencia, hardware asequible. La importancia histórica del 405B supera su adopción práctica inmediata: demostró que la idea de que "solo los modelos cerrados son frontier" dejó de ser cierta. Integrado con pipelines RAG maduros, incluyendo reranking, es una alternativa seria para organizaciones con requisitos de privacidad o soberanía de datos.

Lee también la versión en inglés: Llama 3.1 405B: When Open Catches Up With Closed Top-Tier.

Fuentes

  1. lanzado por Meta el 23 de julio de 2024
  2. los publicados por Meta en el model card de Llama 3.1
  3. los que recoge llm-stats.com para cada proveedor hosted
  4. el model card addendum de Claude 3.5 Sonnet de Anthropic
  5. Artificial Analysis