Categorías

Inteligencia Artificial

nomic-embed-text: embeddings abiertos competitivos

nomic-embed-text-v1.5 de Nomic AI es un modelo de embeddings con pesos, código y datos de entrenamiento publicados en Apache 2.0: 137 millones de parámetros, hasta 8192 tokens de contexto y un MTEB de 62.4 puntos, casi igual al 62.3 de text-embedding-3-small de OpenAI, con 768 dimensiones en lugar de 1536.

Inteligencia Artificial

text-embedding-3 de OpenAI: qué cambia respecto al anterior

OpenAI liberó text-embedding-3 el 25 de enero de 2024 en dos variantes: small y large. Mejora la calidad MTEB frente a ada-002, añade dimensiones variables (truncar sin reentrenar) y baja el precio en small. Migrar compensa en la mayoría de RAG serios, pero conviene medir el recall real con tu propio corpus antes de reindexar todo.

Arquitectura

pgvector en 2024: índices HNSW y escalado real

pgvector maduró en 2023-2024 con el tipo de índice HNSW y la construcción paralela que llegó en la versión 0.6. Para los proyectos que ya operan PostgreSQL, ya no hace falta una base vectorial dedicada en la mayoría de los casos: esta guía explica cuándo basta, cómo configurar el índice y dónde empieza a quedarse corto.

Inteligencia Artificial

Cohere Embed v3: multilingüe y orientado a empresa

Cohere Embed v3 es un modelo de embeddings que distingue queries de documentos con el parámetro input_type y valora la calidad intrínseca del texto, con soporte multilingüe para más de 100 idiomas en 1024 dimensiones. Cuesta 0,10 dólares por millón de tokens, frente a 0,02 de OpenAI, y rinde mejor en RAG multilingüe.