ThinkingBox es un sandbox de Microsoft, con licencia MIT, que ejecuta un agente contra herramientas MCP con estado y lo juzga por los efectos que deja en el sistema, no por lo que dice haber hecho. Su banco de pruebas mide 507 tareas de negocio repitiendo cada una veinte veces.
La búsqueda agéntica consiste en que el modelo planifique sus propias consultas contra el repositorio con grep, listados de ficheros y el servidor de lenguaje, en vez de consultar un índice de embeddings creado de antemano. Claude Code y Cline trabajan así por diseño, pero Cursor y Devin Desktop siguen indexando, y su documentación lo explica.
Agent Lightning es el marco de Microsoft Research que entrena por refuerzo el modelo de un agente ya escrito. El agente apunta su cliente de OpenAI al proxy de Agent Lightning en lugar del modelo, y el proxy graba peticiones, respuestas y recompensas mientras el agente conserva sus herramientas y su flujo de control.
La revisión 2026-07-28 convierte MCP en un protocolo sin estado. Desaparecen el intercambio initialize y la cabecera Mcp-Session-Id, y la versión de protocolo y las capacidades del cliente viajan dentro del campo _meta de cada petición. A cambio, Roots, Sampling y Logging quedan deprecados con doce meses de margen.
Qwen3-VL 8B en Q4_K_M son 4,68 GiB de pesos más 1,08 GiB de torre de visión, y su cache KV cuesta 144 KiB por token. Con 8.192 tokens de contexto la suma ronda los 7 GiB y cabe de sobra en 16 GB; con los 256K nativos pediría 36 GiB solo de cache y no cabe en ninguna tarjeta de consumo.
El Apple Watch Ultra 3 no ejecuta Siri AI por su cuenta. El modelo se ejecuta en el iPhone emparejado con Apple Intelligence y en Private Cloud Compute, y Apple no lanza Siri AI en la Unión Europea por su conflicto con la DMA. En España el reloj se queda con Workout Buddy, la Siri clásica del dispositivo y las alertas de salud.
Agosto de 2026 dejó una decena de modelos con pesos realmente descargables, y también varios nombres que solo existen como API alojada. Los que cambian lo que cabe en un equipo propio son Muse Glimmer 30B y Qwen3.8-27B, ambos con licencia Apache 2.0, más Ling-3.0-tiny para máquinas pequeñas.
Gemma 4 llega en cinco tamaños con licencia Apache 2.0. Cuantizados a 4 bits, los pesos van de 2,9 GB en el E2B a 17,5 GB en el 31B según la tabla de Google, así que la variante la decide tu memoria. Y la ventana de 256K suma otros 10 GiB de caché.
Muse Code es el agente de terminal que Meta Superintelligence Labs publicó en beta el 5 de agosto de 2026. Funciona con Muse Spark 1.2, coordina subagentes persistentes, anota cada llamada y cada edición en un registro local de eventos, y se instala con una sola orden en macOS y en Linux.
Entre el 1 de junio y el 28 de agosto de 2026 se publicaron 81 versiones de Claude Code, de la 2.1.160 a la 2.1.251, con 149 novedades. Las cuatro que cambian cómo se trabaja son Claude Opus 5 por defecto, la mensajería entre sesiones, los entornos autoalojados y el enmascarado de credenciales en el sandbox.
oMLX es un servidor de inferencia local para Mac con Apple Silicon que envuelve el framework MLX de Apple en un proceso web y lo expone con las API de OpenAI y de Anthropic. Añade lotes continuos, caché KV en disco y varios modelos en memoria a la vez, gobernados desde la barra de menús.
FreeToken es un motor de inferencia de código abierto, publicado por investigadores de UC Berkeley y UT Austin en agosto de 2026, que reparte los expertos de un modelo MoE entre GPU, CPU y memoria del sistema según el ancho de banda real de cada máquina. Permite servir modelos de 35B a 753B parámetros en hardware de consumo.
OpenRouter es una pasarela alojada que reúne más de 400 modelos de IA de más de 70 proveedores tras una única API compatible con OpenAI. Cambias la URL base, usas una sola clave y un único saldo, y ganas enrutado automático, reserva ante fallos y precios sin recargo por token. Frente a un proxy propio como LiteLLM, no administras nada.
browser-use es una biblioteca de Python de código abierto que deja a un agente de IA manejar un navegador como lo harías tú: abre páginas, lee el DOM, hace clic y rellena formularios. Nació sobre Playwright y en 2025 pasó a hablar directamente el protocolo CDP de Chrome para ganar velocidad. Esta guía explica cómo funciona y cuándo usarla.
Firecrawl es una API de código abierto que convierte cualquier página web en Markdown limpio y listo para un modelo de lenguaje. Con endpoints de scrape y crawl y extracción estructurada a JSON, da a tu agente de IA datos web fiables. Esta guía cubre sus formatos, cómo alojarlo con Docker y cuándo compensa frente a un scraper propio.
Composio conecta tu agente de IA con más de mil aplicaciones (GitHub, Slack, Gmail, Notion) mediante herramientas preautenticadas y autenticación OAuth gestionada. En lugar de escribir cada integración a mano, pides las herramientas por su nombre y el agente actúa en nombre de cada usuario. Esta guía explica qué es, cómo gestiona la autenticación y cómo conectarlo a tu framework de agentes.
Dify es una plataforma de código abierto para crear aplicaciones y agentes de IA, con un lienzo visual de flujos, gestión de prompts, base de conocimiento RAG y capas de LLMOps. Puedes autoalojarla entera con Docker Compose sobre Postgres, Redis y una base de datos vectorial. Esta guía explica cómo desplegarla y cuándo conviene frente a Flowise y Langflow.
Flowise es una herramienta de código abierto que te deja construir agentes de IA arrastrando nodos en un lienzo visual, sin escribir apenas código. Está construida sobre LangChain.js y puedes autoalojarla entera con un solo contenedor Docker. Esta guía explica cómo desplegarla, la diferencia entre chatflows y AgentFlow v2, y cómo se compara con Langflow y Dify.
Langflow es una herramienta de código abierto para construir agentes y flujos de IA arrastrando bloques en un lienzo visual, sin escribir apenas código. Puedes autoalojarla con Docker, conectar modelos, herramientas y bases de datos vectoriales, y publicar cada flujo como API o como servidor MCP. Esta guía explica cómo desplegarla y crear tu primer agente.
Un servidor MCP propio expone tus datos y funciones a cualquier asistente de IA mediante el Model Context Protocol. Con el SDK oficial de Python y su clase FastMCP escribes un servidor en unas veinte líneas: defines herramientas, recursos y prompts como funciones anotadas con tipos, y lo conectas a Claude, Cline o Goose por stdio o HTTP.
La ejecución duradera hace que un agente de IA sobreviva a caídas, reinicios y límites de la API sin perder su progreso. Temporal aplica este modelo: tu lógica vive en un workflow que se reanuda justo donde quedó, y cada llamada al modelo o a una herramienta corre como una actividad que se reintenta sola.
Desplegar un agente de IA en producción consiste en convertir tu script local en un servicio contenedorizado, con estado externo, observabilidad y secretos gestionados. En esta guía empaquetas un agente dentro de una imagen Docker mínima, expones un endpoint HTTP con FastAPI y añades comprobaciones de salud, reintentos y límites de tasa para que aguante tráfico real.
E2B es una infraestructura de código abierto que ejecuta el código que genera tu agente dentro de microVM de Firecracker aisladas, cada una con su propio kernel de Linux. Arranca en unos 150 ms, expone un intérprete con estado desde su SDK de Python y puedes autoalojarla con Terraform. Esta guía explica por qué un agente necesita un sandbox y cómo usar E2B.
El prompt caching guarda el prefijo estable de tu prompt (instrucciones, documentos, herramientas) para no reprocesarlo en cada llamada. Anthropic y Gemini descuentan hasta un 90% esos tokens; en OpenAI el descuento es del 50% en los modelos clásicos y sube al 90% en GPT-5.6. Esta guía explica cada proveedor, cómo estructurar el prompt y cómo cachear en tu propia máquina con vLLM.
promptfoo es una herramienta de código abierto para probar y evaluar prompts, agentes y sistemas RAG con configuraciones declarativas en YAML. Compara modelos como GPT, Claude o Gemini en una tabla, puntúa las respuestas con aserciones automáticas y añade red teaming con más de cincuenta tipos de vulnerabilidad. Se integra en tu CI y OpenAI la compró en marzo de 2026.
DeepEval es el framework de código abierto para evaluar sistemas de IA como si escribieras pruebas con Pytest: defines casos, eliges métricas respaldadas por investigación (G-Eval, fidelidad, corrección de herramientas) y obtienes una puntuación de 0 a 1 que aprueba o suspende cada respuesta, tanto en tu máquina como en integración continua.
Helicone es una plataforma open source de observabilidad para LLM que integras cambiando una sola línea: la URL base de tu cliente. Registra coste, latencia y tokens de cada llamada, añade caché y limitación de tasa, y puedes autoalojarla con Docker. Es Apache-2.0 y suma casi 6.000 estrellas en GitHub, aunque desde marzo de 2026 está en modo mantenimiento.
Langfuse es una plataforma de código abierto para observar, depurar y evaluar aplicaciones y agentes de IA. Puedes autoalojarla con Docker Compose sobre Postgres, ClickHouse, Redis y almacenamiento S3, y su SDK de Python, construido sobre OpenTelemetry, captura trazas, spans y generaciones con su coste y su latencia. Esta guía explica cómo desplegarla e instrumentar un agente.
DSPy es un framework de Python de Stanford que trata las llamadas a un LLM como código: defines firmas con entradas y salidas tipadas, eliges un módulo como la cadena de pensamiento y dejas que un optimizador escriba los prompts por ti a partir de ejemplos y una métrica. Así compilas programas en vez de ajustar prompts a mano.
Outlines es una biblioteca de Python que aplica generación restringida: obliga al modelo a producir una salida que se ajusta a un esquema JSON, una expresión regular o una gramática, con garantía por construcción y no estadística. Funciona con vLLM, Transformers, Ollama y llama.cpp, y su motor escrito en Rust apenas añade sobrecarga por token.
Instructor es la biblioteca de Python más usada para obtener salidas estructuradas y fiables de un modelo de lenguaje: defines el resultado que esperas como un modelo Pydantic, Instructor parchea el cliente para que el modelo lo respete y reintenta solo, con el error de validación incluido, hasta devolver un objeto válido y ya tipado.
No todos los modelos abiertos llaman a herramientas igual de bien: la familia Qwen3, los Hermes de Nous, Llama 3.1 y Mistral destacan porque se entrenaron para ello. Para elegir, mira el Berkeley Function-Calling Leaderboard, comprueba que exista un parser para su plantilla y ajústalo a la VRAM de tu GPU.
El function calling permite que un modelo que ejecutas con Ollama en tu propia máquina pida a tu código que llame a una función (consultar el clima, buscar en una base de datos) y use el resultado para responder. Desde julio de 2024 Ollama soporta herramientas; en 2026 modelos como qwen3 o llama3.3 lo hacen con fiabilidad razonable.
Qwen-Agent es el framework oficial del equipo Qwen para dar herramientas a sus modelos: function calling, un interprete de código en sandbox, RAG y MCP. Va por la version 0.0.34, publicada en febrero de 2026, suma unas 16.800 estrellas en GitHub y contiene la implementacion canonica del tool calling de Qwen3, tanto en la nube como en tu propia maquina.
Hermes 4 es la familia de modelos open-weight que Nous Research publicó en agosto de 2025, con variantes de 14B, 70B y 405B parámetros. Su gran novedad es el razonamiento híbrido: un mismo modelo responde directo o delibera con etiquetas think antes de contestar, y conserva el formato de herramientas de Hermes.
Hermes 3 es la familia de modelos open-weight de Nous Research, afinada sobre Llama 3.1 en tamaños de 8B, 70B y 405B. Su punto fuerte es el uso de herramientas mediante llamadas a funciones en formato JSON. Puedes ejecutarlo en tu propia máquina con Ollama o vLLM y darle capacidades agénticas sin depender de una API de pago.
Haystack es un framework de Python de deepset, con licencia Apache 2.0, para construir aplicaciones de IA como pipelines de componentes conectados: recuperadores, generadores y routers. Desde la reescritura de la versión 2.0 admite ciclos, lo que permite añadir un componente Agent que llama a herramientas en bucle. Sirve tanto para RAG como para agentes en producción.
Agno, el framework de Python antes conocido como Phidata, construye agentes de IA con un objetivo claro: rendimiento. Crea cada agente en unos dos microsegundos y ocupa unos 3,75 KiB de memoria, así que escala a miles de agentes concurrentes. Ofrece agentes, equipos y flujos de trabajo, más de veinte proveedores de modelos y el tiempo de ejecución AgentOS.
Mastra es un framework open-source de TypeScript para construir agentes y aplicaciones de IA con un solo paquete: agentes, herramientas, workflows, memoria, RAG y evaluaciones. Lo creó el equipo detrás de Gatsby, alcanzó la versión 1.0 en enero de 2026 y conecta con más de 40 proveedores de modelos desde una única interfaz.
Semantic Kernel es el kit de código abierto de Microsoft para integrar modelos de IA en C#, Python y Java mediante un kernel que orquesta plugins y funciones. En 2026 su relevo es Microsoft Agent Framework, el sucesor que fusiona Semantic Kernel y AutoGen; Semantic Kernel sigue con soporte al menos un año más.
LlamaIndex es un framework de Python centrado en conectar tus datos con un modelo de lenguaje. Desde su módulo AgentWorkflow puedes construir agentes que razonan y llaman a herramientas: FunctionAgent para modelos con function calling y ReActAgent para cualquier modelo. Esta guía muestra cómo convertir un flujo RAG en un agente que actúa sobre tus documentos.
Google ADK (Agent Development Kit) es el framework de código abierto de Google para construir, evaluar y desplegar agentes de IA. Es code-first, funciona con Gemini y con otros modelos vía LiteLLM, y ofrece agentes de flujo, herramientas y memoria. Su versión 2.5.0 llegó en julio de 2026 y despliega directamente en Vertex AI.
smolagents es la biblioteca de agentes de Hugging Face: en menos de mil líneas de código te deja crear un agente que razona escribiendo Python en lugar de rellenar JSON. Su CodeAgent ejecuta esas acciones como código, da alrededor de un 30% menos de pasos que el tool calling clásico y funciona con cualquier modelo, local o de API.
Pydantic AI es el framework de agentes del equipo de Pydantic: construyes agentes en Python donde cada salida del modelo se valida contra un tipo que tú defines. Declaras la respuesta esperada como un modelo Pydantic y el agente garantiza esa estructura, con inyección de dependencias, herramientas y soporte para más de veinte proveedores de modelos.
El OpenAI Agents SDK es un framework de Python ligero para construir agentes y flujos multiagente con pocas primitivas: agentes, herramientas, traspasos (handoffs), barreras de seguridad, sesiones y trazado integrado. Es la evolución lista para producción de Swarm, funciona con la API de OpenAI y con más de 100 LLMs.
Continue es un asistente de código open source para VS Code y JetBrains que reúne chat, autocompletado, edición en línea y un modo agente en un solo panel. Con licencia Apache 2.0, funciona con más de cien modelos, incluidos los que ejecutas de forma local con Ollama, así que tú eliges el modelo y conservas el control de tu código.
Windsurf es el editor de código agéntico creado por Codeium: un fork de VS Code cuyo agente lee tu proyecto, planifica y edita varios archivos con tu aprobación. En julio de 2025 lo compró Cognition, la empresa de Devin, y el 2 de junio de 2026 pasó a llamarse Devin Desktop; su agente Cascade llegó a su fin de vida el 1 de julio de 2026 y lo sustituyó Devin Local.
Gemini CLI es el agente de código de Google para la terminal: open source, con un contexto de un millón de tokens y el modelo Gemini 3. Desde el 18 de junio de 2026 su capa gratuita para particulares se trasladó a Antigravity CLI, pero la herramienta sigue funcionando con una clave de API de AI Studio o una licencia de empresa.
9 min4
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).