El Model Context Protocol, propuesto por Anthropic a finales de 2024 y adoptado durante 2025-2026 por Anthropic, OpenAI, Google y la comunidad open source, ya tiene patrones operativos probados: separar servidores genéricos de los propios, políticas explícitas por herramienta, credenciales fuera del modelo, composición con prefijos y tests de contrato. Este es el estado del arte en 2026.
Tras meses de rumores, OpenAI publicó GPT-5 a principios de agosto. Las primeras semanas de uso real dejan una imagen menos espectacular que el marketing y más útil que lo que muchos esperaban. Vale la pena separar lo nuevo de lo incremental.
o3-mini, la primera versión pública de la serie de razonamiento o3 de OpenAI, mejora de forma clara la lógica, las matemáticas y el código complejo frente a GPT-4o, aunque tarda más en responder y sigue alucinando datos. Este análisis, basado en semanas de uso real, explica dónde compensa usarlo y dónde no.
OpenAI lanzó o1-preview el 12 de septiembre de 2024: el primer modelo que razona internamente antes de responder. En lugar de generar tokens directamente, o1 dedica una fase de pensamiento oculto a explorar el problema, alcanzando un 83% en AIME frente al 13% de GPT-4o. El coste adicional se justifica en problemas complejos; para tareas cotidianas, GPT-4o sigue siendo más eficiente.
Swarm es el framework experimental de OpenAI para orquestar sistemas multi-agente. Publicado en octubre de 2024 con una advertencia explícita de no usar en producción, reduce toda la coordinación a dos conceptos: agentes e handoffs. En menos de 500 líneas de Python demuestra que el enrutamiento puede emerger del propio modelo sin grafos ni planificadores externos.
La Assistants API de OpenAI ofrece threads persistentes, ejecución de código en sandbox y búsqueda documental gestionada, pero OpenAI la retira por completo el 26 de agosto de 2026 en favor de la Responses API. Analizamos cuándo compensaba frente a Chat Completions con infraestructura propia y qué hacer si tu proyecto todavía depende de ella.
GPT-4 Turbo, lanzado en noviembre de 2023, amplió el contexto de GPT-4 a 128.000 tokens y redujo el precio de entrada 3 veces, hasta 10 dólares por millón de tokens. GPT-4o lo supera en precio, velocidad y calidad de respuesta, pero Turbo sigue siendo válido en apps productivas estables, contratos con versión fija y pruebas deterministas que dependen de su comportamiento concreto.
GPT-4o es el modelo de OpenAI presentado el 13 de mayo de 2024 que funde texto, imagen y audio en un único modelo nativo, sin pipelines separados. Ofrece latencia de conversación de unos 320 milisegundos, mejor comprensión multimodal y un precio un 50% inferior al de GPT-4 Turbo.
nomic-embed-text-v1.5 de Nomic AI es un modelo de embeddings con pesos, código y datos de entrenamiento publicados en Apache 2.0: 137 millones de parámetros, hasta 8192 tokens de contexto y un MTEB de 62.4 puntos, casi igual al 62.3 de text-embedding-3-small de OpenAI, con 768 dimensiones en lugar de 1536.
Cuando una aplicación habla con dos o más proveedores de LLM, antes o después aparece un proxy entre medias. LiteLLM propone uno concreto, y esta es la lectura honesta de qué gana y qué cuesta.
OpenAI liberó text-embedding-3 el 25 de enero de 2024 en dos variantes: small y large. Mejora la calidad MTEB frente a ada-002, añade dimensiones variables (truncar sin reentrenar) y baja el precio en small. Migrar compensa en la mayoría de RAG serios, pero conviene medir el recall real con tu propio corpus antes de reindexar todo.
LangChain es un framework Python que unifica la construcción de aplicaciones con LLM: prompt templates, retrievers sobre bases vectoriales, agentes con function calling y memoria conversacional. Aporta valor real en prototipos rápidos y sistemas con varios modelos, pero en producción de un caso único bien definido el código directo suele ser más mantenible.
Un embedding de texto es un vector numérico que codifica el significado de una palabra o frase, de forma que fragmentos semánticamente parecidos generan vectores cercanos por distancia coseno. Los modelos más usados en producción son OpenAI ada-002, Sentence Transformers y BGE, y sirven sobre todo para búsqueda semántica, sistemas RAG y clasificación de texto sin entrenar un clasificador.
Function calling en OpenAI formaliza la comunicación entre el LLM y el código externo mediante JSON Schema declarativo: el modelo devuelve datos estructurados en lugar de texto libre. Introducido en junio de 2023 con GPT-3.5-turbo y GPT-4, es el estándar para agentes, extracción de datos y APIs conversacionales.
Cinco meses después de su lanzamiento, GPT-4 destaca en razonamiento encadenado, escritura técnica y código de mediana complejidad, pero sigue fallando en aritmética, información posterior a su corte de datos y consistencia entre conversaciones. Claude 2 gana en contexto largo; LLaMA 2, en coste y privacidad.
Los plugins de ChatGPT permiten que el modelo invoque servicios externos mediante una especificación OpenAPI. A tres meses de su lanzamiento, el ecosistema suma unos 500 plugins con un patrón claro: funcionan bien para consulta de datos en vivo y exposición de APIs internas, pero presentan fricciones en orquestación múltiple y transacciones con dinero real.
Code Interpreter extiende ChatGPT Plus con un intérprete Python en sandbox aislado: ejecuta el código en el acto, lee los ficheros que subes (CSV, Excel, PDF, imágenes, ZIPs) y devuelve resultados y gráficos dentro del chat. La sesión es efímera y sin internet, pero notablemente eficaz para análisis exploratorio ad-hoc sin arrancar un notebook.
ChatGPT 4 combina procesamiento del lenguaje natural avanzado con aprendizaje profundo para ofrecer conversaciones más naturales, coherentes y personalizadas que sus predecesores. Entiende la intención y el contexto acumulado de cada conversación, identifica múltiples intenciones en un mismo turno y reduce los escalados a agentes humanos, aunque sigue exigiendo supervisión y diseño cuidadoso.
GitHub Copilot es un asistente de programación basado en IA que sugiere código mientras escribes, integrado en VS Code, JetBrains y Neovim. Acelera tareas repetitivas y la exploración de APIs, pero genera código plausible con errores reales: los estudios documentan vulnerabilidades de seguridad en buena parte de sus sugerencias, así que toda propuesta necesita revisión humana.
6 min229
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).