Llama 3.1 405B: cuando lo abierto alcanza al top cerrado
Índice de contenidos
- Puntos clave
- Qué cambia respecto a Llama 3 70B
- Benchmarks frente al frontier cerrado
- Hardware para self-hosting
- Opciones de acceso sin self-hosting
- Casos de uso donde 405B justifica
- Distillation: el efecto multiplicador
- Limitaciones
- Conclusión
- Preguntas frecuentes
- ¿Cuánta VRAM necesito para ejecutar Llama 3.1 405B en mi propio hardware?
- ¿Merece la pena el 405B frente a Llama 3.1 70B para mi caso de uso?
- ¿Cómo uso Llama 3.1 405B sin hacer self-hosting y qué cuesta?
- Fuentes
Meta lanzó Llama 3.1 405B el 23 de julio de 2024: 405 000 millones de parámetros, 128k tokens de contexto y benchmarks equivalentes a GPT-4o y Claude 3.5 Sonnet. El self-hosting exige unos 220 GB de VRAM en Q4; Together.ai, Fireworks y Groq lo ofrecen por token.
Llama 3.1 405B, lanzado por Meta el 23 de julio de 2024[1], es el primer modelo de pesos abiertos que compite en serio con GPT-4o y Claude 3.5 Sonnet en benchmarks de razonamiento y código. 405 mil millones de parámetros, 128k tokens de contexto (frente a los 8k de Llama 3), entrenado sobre más de 15 billones de tokens con más de 16.000 GPU H100. Para equipos que buscaban una alternativa abierta al frontier comercial, es el momento más relevante hasta la fecha.
Puntos clave
-
Llama 3.1 405B cierra el gap open-vs-closed en benchmarks de razonamiento, código y MMLU.
-
El mismo lanzamiento refresca Llama 3.1 8B y 70B con 128k de contexto y mejoras de calidad.
-
El hardware para self-hosting es prohibitivo para la mayoría: ~220 GB VRAM en Q4, que requiere múltiples H100 o un M2 Ultra con 192 GB.
-
Para equipos sin capacidad de self-hosting, Together.ai, Fireworks y Groq ofrecen acceso por token a precios razonables.
-
La distillation (usar 405B para generar datos de entrenamiento para 8B y 70B) es la razón más estratégica por la que Meta lo liberó.
Qué cambia respecto a Llama 3 70B
| Aspecto | Llama 3.1 405B | Llama 3.1 70B |
|---|---|---|
| Parámetros | 405B | 70B |
| Contexto | 128k | 128k |
| MMLU (0-shot CoT) | 88,6 | 86,0 |
| HumanEval | 89,0 | 80,5 |
| Coste hosted (Together/Fireworks) | ~$3-3,5/1M | ~$0,9/1M |
| Self-hosting VRAM (Q4) | ~220 GB | ~40 GB |
Llama 3.1 405B es 5,8x más grande que el 70B, con un coste de inferencia proporcional. Para la mayoría de use cases empresariales (RAG, chat asistente, generación creativa estándar), el 70B sigue siendo más pragmático. El 405B justifica cuando la tarea está en la frontera de razonamiento complejo. Los datos de parámetros y benchmarks son los publicados por Meta en el model card de Llama 3.1[2]; los de precio por token, los que recoge llm-stats.com para cada proveedor hosted[3].
Benchmarks frente al frontier cerrado
| Benchmark | Llama 3.1 405B | GPT-4o | Claude 3.5 Sonnet |
|---|---|---|---|
| MMLU (0-shot CoT) | 88,6 | 88,7 | 88,3 |
| HumanEval | 89,0 | 90,2 | 92,0 |
| MATH (0-shot CoT) | 73,8 | 76,6 | 71,1 |
Los números son equivalentes en la mayoría de benchmarks: la diferencia entre los tres modelos en MMLU es de menos de medio punto. Para muchas tareas de producción, el 405B es indistinguible de GPT-4o. La diferencia está en algunas tareas de código muy específicas, donde Claude 3.5 Sonnet gana con claridad, y en razonamiento matemático, donde GPT-4o lidera. Estas cifras de GPT-4o y Claude 3.5 Sonnet son las que publica el model card addendum de Claude 3.5 Sonnet de Anthropic[4], que cita a su vez el conjunto de evaluación simple-evals de OpenAI para la cifra de GPT-4o.
Hardware para self-hosting
Los requisitos son los que hacen inviable el self-hosting para la mayoría:
-
FP16 (precisión completa): ~810 GB de VRAM.
-
INT8: ~405 GB.
-
INT4 (GGUF): ~220 GB.
Implicaciones prácticas:
-
2-4 × H100 80 GB con tensor parallelism para Q4.
-
Apple M2 Ultra con 192 GB de memoria unificada: cabe en Q4, a 8-10 tokens/s (para exploración, no producción).
-
Inviable en consumer hardware.
Para self-hosting de Llama 3.1 70B Q4, que también recibió el upgrade de 128k contexto, los requisitos son ~40 GB: manejables con un Mac Studio M2 Ultra de 192 GB. Ver cómo instalar Ollama en Mac para el flujo local.
Opciones de acceso sin self-hosting
Si no puedes desplegar el 405B internamente:
-
Together.ai: pago por token, ~$3,5/1M tokens.
-
Fireworks: precio algo menor (~$3/1M) y buena latencia.
-
Groq: hardware LPU dedicado, con el throughput más alto del sector para modelos abiertos según las mediciones independientes de Artificial Analysis[5].
-
AWS Bedrock: nivel empresarial, integra con IAM y VPC.
-
Vertex AI (Google): disponible con controles de compliance.
Para cargas bajas o medias (menos de 10.000 consultas al día), el hosted por token es más económico. Para cargas altas en producción, el coste de GPU propia empieza a amortizarse.
Casos de uso donde 405B justifica
-
Razonamiento complejo en la frontera: tareas que 70B no resuelve satisfactoriamente.
-
Agentes multi-step sofisticados: donde la calidad de cada paso afecta la cadena.
-
Distillation: usar 405B para generar datos de entrenamiento que mejoren 8B y 70B. Esta es probablemente la razón estratégica más importante del lanzamiento.
-
Compliance con self-hosted frontier: organizaciones con requisitos de air-gap o privacidad estricta que necesitan calidad frontier.
Distillation: el efecto multiplicador
El lanzamiento de 405B abrió una puerta que la comunidad aprovechó rápidamente: usar el 405B como modelo "profesor" para generar datos de entrenamiento que mejoran los modelos pequeños. Ya existen fine-tunes del 8B entrenados con datos generados por el 405B que superan la calidad del 8B base en dominios específicos. Esta dinámica, modelos grandes liberados que mejoran el ecosistema de modelos pequeños, es parte del valor estratégico para Meta. La propia licencia de Llama 3.1 permite explícitamente usar las salidas del modelo para mejorar otros modelos[1], el cambio legal que habilita esta práctica a escala.
Limitaciones
-
Coste de inferencia: ~10x frente a 70B. Justificar con el caso de uso.
-
Latencia: procesar 128k tokens con el 405B tarda más de un minuto.
-
Licencia: Community license con restricciones para servicios con más de 700M de usuarios activos mensuales.
-
Multimodalidad: solo texto (Llama 3.2 añadió visión posteriormente).
Conclusión
Llama 3.1 405B marca el momento en que los modelos de pesos abiertos alcanzaron la frontera del frontier comercial. Para organizaciones con capacidad de serving propio o que usan providers hosted, es una alternativa real frente a GPT-4o. Para la mayoría de equipos, Llama 3.1 70B sigue siendo más pragmático: mejor coste, menor latencia, hardware asequible. La importancia histórica del 405B supera su adopción práctica inmediata: demostró que la idea de que "solo los modelos cerrados son frontier" dejó de ser cierta. Integrado con pipelines RAG maduros, incluyendo reranking, es una alternativa seria para organizaciones con requisitos de privacidad o soberanía de datos.
Lee también la versión en inglés: Llama 3.1 405B: When Open Catches Up With Closed Top-Tier.
Fuentes:
- Meta AI: Introducing Llama 3.1[1]
- Hugging Face: model card de Meta-Llama-3.1-405B-Instruct[2]
- Anthropic: Claude 3.5 Sonnet Model Card Addendum (PDF)[4]
- llm-stats.com: precios y specs de Llama 3.1 405B Instruct[3]
- Artificial Analysis: Llama 3.1 405B, rendimiento y precio[5]
Preguntas frecuentes
¿Cuánta VRAM necesito para ejecutar Llama 3.1 405B en mi propio hardware?
Unos 810 GB en FP16, unos 405 GB en INT8 y unos 220 GB en INT4 (GGUF). En la práctica eso significa 2-4 GPUs H100 de 80 GB con tensor parallelism para Q4, o un Apple M2 Ultra con 192 GB de memoria unificada, que lo ejecuta en Q4 a 8-10 tokens/s, válido para exploración pero no para producción. En hardware de consumo es inviable; el 70B en Q4 necesita unos 40 GB.
¿Merece la pena el 405B frente a Llama 3.1 70B para mi caso de uso?
Para la mayoría de usos empresariales (RAG, chat asistente, generación creativa estándar) el 70B sigue siendo más pragmático: el 405B es 5,8x más grande, cuesta unas 10 veces más en inferencia y tarda más de un minuto en procesar 128k tokens. El 405B se justifica en razonamiento complejo que el 70B no resuelve, agentes multi-step sofisticados, distillation para mejorar 8B y 70B, o compliance con frontier self-hosted.
¿Cómo uso Llama 3.1 405B sin hacer self-hosting y qué cuesta?
Por token en proveedores hosted: Together.ai a ~$3,5 por millón de tokens, Fireworks algo más barato (~$3/1M) con buena latencia, Groq con hardware LPU y el mayor throughput del sector para modelos abiertos, además de AWS Bedrock (IAM y VPC) y Vertex AI con controles de compliance. Con menos de 10.000 consultas al día el hosted sale más económico; en cargas altas la GPU propia empieza a amortizarse.