Cerebras-GPT es una familia de 7 modelos de lenguaje open-source, de 111 millones a 13.000 millones de parámetros, entrenados por Cerebras Systems en sus procesadores CS-2 con arquitectura GPT-3 estándar. Publicados en Hugging Face y GitHub bajo licencia Apache 2.0, sirven para fine-tuning, investigación e inferencia local, aunque solo entienden inglés.
La transferencia de aprendizaje permite reutilizar un modelo ya entrenado en un conjunto de datos masivo, como ImageNet o un corpus de texto extenso, para resolver una tarea nueva con muchos menos datos propios y horas de cómputo. Funciona mediante fine-tuning, extracción de características o prompts, y rinde mejor cuanto más se parecen el dominio de origen y el de destino.
6 min4394,1
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).