Meta publicó Llama 3.2 con modelos de 1B y 3B parámetros cuantizados a 4 bits para ejecutarse en dispositivos con recursos limitados. El 3B ocupa 2 GB y alcanza 30-60 tokens por segundo en un portátil con M2. No compite con GPT-4: cubre clasificación, extracción estructurada y conversación guiada sin depender de APIs externas.
Meta lanzó Llama 3.1 405B el 23 de julio de 2024: 405 000 millones de parámetros, 128k tokens de contexto y benchmarks equivalentes a GPT-4o y Claude 3.5 Sonnet. El self-hosting exige unos 220 GB de VRAM en Q4; Together.ai, Fireworks y Groq lo ofrecen por token.
Llama 3 es la familia de modelos abiertos que Meta lanzó el 18 de abril de 2024 en 8.000 y 70.000 millones de parámetros, entrenada con 15 billones de tokens. El 70B superó a Claude Sonnet, Mistral Medium y GPT-3.5 en la evaluación humana de Meta, y su licencia permite uso comercial gratuito hasta 700 millones de usuarios activos al mes.
Meta publicó LLaMA 2 el 18 de julio de 2023 con licencia comercial libre de royalties, en tres tamaños (7B, 13B, 70B parámetros). El modelo 70B iguala o supera a GPT-3.5 en benchmarks estándar. Para el 99,9 % de las organizaciones la licencia permite descargar, modificar y ejecutar el modelo en producción con privacidad total.
5 min2964,6
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).