Categorías

Categorías Jacar — explora los temas Un cohete cuyos ojos siguen el cursor.
Inteligencia Artificial

Goose: el agente de código de Block

Goose es un agente de IA de código abierto creado en Block que se ejecuta en tu propia máquina como app de escritorio, CLI y API. Lee y escribe archivos, ejecuta comandos y pruebas, y funciona con más de quince proveedores de modelos y con extensiones MCP. Es gratuito, con licencia Apache 2.0, y solo pagas el uso del modelo.

Inteligencia Artificial

OpenHands: un agente autónomo de código

OpenHands, antes OpenDevin, es una plataforma de código abierto que resuelve tareas de programación de principio a fin: recibe un encargo, abre un contenedor sandbox y edita archivos, ejecuta comandos y navega la web hasta terminar. Se ejecuta con Docker en tu propio equipo y funciona con el modelo que elijas.

Inteligencia Artificial

El Codex CLI de OpenAI

El Codex CLI es el agente de código de OpenAI que trabaja dentro de tu terminal: le describes una tarea, lee tu repositorio, propone los cambios y ejecuta comandos dentro de un sandbox que tú controlas. Es open source, se instala con npm y funciona con tu cuenta de ChatGPT o con una clave de API.

Inteligencia Artificial

Cómo usar Roo Code

Roo Code es una extensión de código abierto para VS Code, nacida como fork de Cline, que convierte el editor en un equipo de agentes con modos especializados (Code, Architect, Debug, Ask y Orchestrator). El proyecto se archivó en mayo de 2026 en la versión 3.54.0, pero su continuación comunitaria ZooCode mantiene vivas las mismas funciones.

Inteligencia Artificial

Cómo usar Cline en VS Code

Cline es una extensión de VS Code que convierte tu editor en un agente de código autónomo: lee tu proyecto, planifica los cambios en el modo Plan y los ejecuta en el modo Act, mostrando cada edición como un diff que tú apruebas. Es open source y funciona con tu propia clave de API o con modelos locales.

Inteligencia Artificial

Patrones de sistemas multiagente

Un sistema multiagente reparte una tarea entre varios agentes especializados coordinados por un patrón de diseño. Los tres más habituales son orquestador-trabajadores, en el que un agente líder delega en subagentes paralelos; el jerárquico, con equipos de equipos; y el de red, donde cualquier agente cede el control a otro mediante un traspaso.

Inteligencia Artificial

Plan-and-Execute frente a ReAct

ReAct y plan-and-execute son los dos patrones de control de un agente de IA. ReAct decide un paso cada vez, razonando y actuando en bucle; plan-and-execute traza primero un plan completo y luego lo ejecuta paso a paso. El primero se adapta mejor a lo imprevisto; el segundo gasta menos llamadas y planifica tareas largas con más orden.

Inteligencia Artificial

Ingeniería de contexto para agentes

La ingeniería de contexto es el arte de decidir qué información entra en la ventana de un modelo en cada paso de un agente. Frente a la ingeniería de prompts, gestiona todo el conjunto de tokens: instrucciones, herramientas, memoria e historial. Su meta es el conjunto más pequeño de tokens de alta señal que logre la tarea.

Inteligencia Artificial

Human-in-the-loop en agentes de IA

El human-in-the-loop es el patrón que mantiene a una persona en el bucle de decisión de un agente de IA: el agente se detiene en un punto de aprobación antes de una acción irreversible, espera tu confirmación y reanuda con el estado intacto. Frameworks como LangGraph y el Agents SDK de OpenAI lo implementan con interrupciones y aprobación de herramientas.

Inteligencia Artificial

Memoria en agentes de IA: corto y largo plazo

La memoria es lo que permite a un agente de IA recordar más allá de una sola conversación. La memoria de trabajo es su ventana de contexto, efímera y limitada; la memoria a largo plazo guarda hechos, experiencias y procedimientos en un almacén externo, casi siempre una base de datos vectorial, y los recupera cuando hacen falta.

Inteligencia Artificial

El patrón de reflexión en agentes de IA

El patrón de reflexión hace que un agente critique su propia salida y la reescriba antes de darla por buena. Un modelo genera, otro paso evalúa y señala fallos, y un tercero corrige, en un bucle de una o dos rondas. Mejora la calidad en tareas con criterios claros, pero cada ciclo añade llamadas al modelo, tokens y latencia.

Inteligencia Artificial

Planificación y descomposición de tareas en agentes

La planificación permite a un agente de IA resolver tareas largas: en lugar de improvisar paso a paso, primero descompone el objetivo en una lista de subtareas ordenadas y luego las ejecuta. El patrón planificador-ejecutor separa el pensamiento de la acción, reduce el número de llamadas al modelo y permite replanificar cuando algo falla a mitad del trabajo.

Inteligencia Artificial

El bucle agéntico y el patrón ReAct

El patrón ReAct (Reason + Act) organiza un agente como un bucle de tres pasos que se repite: razonar sobre qué hacer, ejecutar una acción con una herramienta y observar el resultado. Presentado por Yao y sus colegas en 2022, entrelaza el razonamiento y la acción para que el modelo planifique, consulte fuentes externas y corrija sus errores sobre la marcha.

Inteligencia Artificial

¿Qué es un agente de IA?

Un agente de IA es un programa que usa un modelo de lenguaje como cerebro para decidir por sí mismo qué pasos dar hacia un objetivo: razona, llama a herramientas externas, observa el resultado y repite ese bucle hasta terminar. A diferencia de un chatbot, no se limita a responder, sino que actúa.

Inteligencia Artificial

Dropout y su interpretación matemática

El dropout es una técnica de regularización que desactiva neuronas al azar durante el entrenamiento, con probabilidad de retención p, y divide las activaciones supervivientes entre p para conservar su escala. En inferencia la red completa actúa sin apagar nada. Matemáticamente equivale a promediar un ensemble enorme de subredes que comparten pesos.

Inteligencia Artificial

La normalización de capa (layer normalization) y sus variantes

La normalización de capa estabiliza el entrenamiento normalizando cada ejemplo por separado, con la media y la desviación típica de sus propias activaciones. A diferencia de la normalización por lotes, no depende del tamaño del lote, y por eso los transformers la adoptaron. RMSNorm es su variante más ligera y extendida hoy.

Inteligencia Artificial

La normalización por lotes (batch normalization)

La normalización por lotes (batch normalization) es una técnica que normaliza las activaciones de cada capa usando la media y la varianza del minilote, y después las reescala con dos parámetros aprendibles, gamma y beta. Introducida en 2015, permite tasas de aprendizaje más altas, acelera el entrenamiento y estabiliza las redes profundas.

Inteligencia Artificial

Inicialización de pesos, Xavier/Glorot y He

La inicialización de pesos fija la escala de los valores iniciales de la matriz W antes de entrenar. Xavier/Glorot, de 2010, reparte la varianza entre entradas y salidas y sirve para sigmoide y tanh; He, de 2015, la duplica para ReLU, que anula la mitad de las activaciones. Elegir mal frena o rompe el aprendizaje.

Inteligencia Artificial

Métodos de segundo orden, Newton y sus aproximaciones

Los métodos de segundo orden usan la hessiana, la matriz de segundas derivadas de la pérdida, para orientar mejor cada paso que el gradiente solo. El método de Newton actualiza los pesos restando la inversa de la hessiana por el gradiente, pero invertirla es demasiado costoso en redes grandes, así que se recurre a aproximaciones cuasi-Newton.

Inteligencia Artificial

Programación de la tasa de aprendizaje (schedules y warmup)

La programación de la tasa de aprendizaje cambia el valor de η a lo largo del entrenamiento en lugar de dejarlo fijo. Empieza con un calentamiento que sube η desde casi cero, mantiene un pico y después la reduce con decaimiento por pasos, exponencial o coseno para converger más rápido y con menos oscilación.

Inteligencia Artificial

AdaGrad y RMSProp, tasas de aprendizaje adaptativas

AdaGrad y RMSProp son optimizadores que dan a cada peso su propia tasa de aprendizaje. AdaGrad acumula el cuadrado de todos los gradientes y divide el paso por su raíz, lo que la apaga con el tiempo. RMSProp lo corrige con una media móvil que olvida el pasado con un factor de 0,9.

Inteligencia Artificial

El gradiente acelerado de Nesterov (NAG)

El gradiente acelerado de Nesterov mejora el momentum clásico calculando el gradiente en un punto adelantado, el que la inercia va a alcanzar, en lugar del punto actual. Ese paso de anticipación corrige la trayectoria antes de pasarse y logra una convergencia O(1/k²) en problemas convexos suaves, la más rápida posible para un método de primer orden.

Inteligencia Artificial

El momentum en el descenso de gradiente

El momentum es una mejora del descenso de gradiente que acumula una velocidad a partir de los gradientes anteriores en lugar de mirar solo el actual. Con un coeficiente β cercano a 0,9, esa inercia suaviza el zigzag del SGD puro, atraviesa los valles alargados y hace que el entrenamiento converja bastante más rápido.

Inteligencia Artificial

Mínimos locales, puntos de silla y la superficie de pérdida

En redes neuronales grandes la superficie de pérdida casi nunca atrapa al entrenamiento en un mínimo local malo. El obstáculo real son los puntos de silla, mucho más abundantes en alta dimensión. Este artículo explica mínimos locales frente a globales, por qué el descenso de gradiente estocástico los esquiva y qué papel juega la convexidad.

Inteligencia Artificial

Gradientes de una capa densa, matrices y jacobianos

En una capa densa con z igual a Wx más b, la matriz jacobiana de la salida respecto a la entrada es la propia matriz de pesos W. De ahí salen las dos reglas del entrenamiento: el gradiente respecto a los pesos vale delta por x transpuesta, y el gradiente respecto a la entrada vale W transpuesta por delta.

Inteligencia Artificial

El grafo computacional y la diferenciación automática

Un grafo computacional representa una función como una red de operaciones elementales. La diferenciación automática recorre ese grafo para calcular derivadas exactas: el modo inverso, base de la retropropagación, obtiene el gradiente de todos los pesos en una sola pasada hacia atrás. Es el mecanismo que hace posible entrenar redes con miles de millones de parámetros.

Inteligencia Artificial

Retropropagación, la intuición detrás del aprendizaje

La retropropagación reparte la culpa del error entre todos los pesos de una red neuronal. Propaga hacia atrás una señal de error capa por capa, multiplicando por las derivadas locales, y así obtiene el gradiente de cada peso en una sola pasada. Esa idea, publicada en 1986, es la que hace posible entrenar redes profundas.

Inteligencia Artificial

Descenso de gradiente por lotes, estocástico y mini-batch

El descenso de gradiente por lotes usa todos los datos en cada paso, el estocástico usa una sola muestra y el mini-batch escoge un grupo intermedio, casi siempre de 32 a 256 ejemplos. Esta guía compara las tres variantes, su coste, su ruido y por qué el mini-batch se ha convertido en el estándar del entrenamiento.

Inteligencia Artificial

El descenso de gradiente (gradient descent)

El descenso de gradiente es el algoritmo que entrena casi todas las redes neuronales. Calcula la pendiente de la función de pérdida respecto a cada peso y da un paso pequeño en la dirección contraria, controlado por la tasa de aprendizaje, hasta acercarse a un mínimo donde el error deja de bajar.

Inteligencia Artificial

La regularización L1 y L2 (weight decay) en la pérdida

La regularización L1 y L2 añade a la función de pérdida un término que penaliza los pesos grandes. La L2, o weight decay, encoge los pesos de forma suave hacia cero; la L1 los lleva exactamente a cero y produce modelos dispersos. Ambas reducen el sobreajuste y mejoran la capacidad de generalización de una red neuronal.

Inteligencia Artificial

Entropía, entropía cruzada y divergencia KL

La entropía mide la incertidumbre media de una distribución en bits, la entropía cruzada mide el coste de codificar los datos reales con un modelo equivocado y la divergencia KL es la diferencia entre ambas. Por eso minimizar la entropía cruzada al entrenar equivale a minimizar la divergencia KL frente a las etiquetas.

Inteligencia Artificial

La entropía cruzada categórica (categorical cross-entropy)

La entropía cruzada categórica es la función de pérdida estándar para clasificar en varias clases mutuamente excluyentes. Compara la distribución que predice la red, normalmente tras una softmax, con la etiqueta real codificada en formato one-hot, y penaliza con fuerza asignar poca probabilidad a la clase correcta.

Inteligencia Artificial

La entropía cruzada binaria (binary cross-entropy)

La entropía cruzada binaria es la función de pérdida estándar para clasificar entre dos clases. Compara la probabilidad que devuelve la sigmoide con la etiqueta real, 0 o 1, y castiga con fuerza los fallos seguros. Su fórmula nace de la máxima verosimilitud y su derivada se combina con la sigmoide en un gradiente muy simple.

Inteligencia Artificial

El error absoluto medio (MAE) y la pérdida de Huber

El error absoluto medio (MAE) promedia el valor absoluto de la diferencia entre predicción y realidad, así que un valor atípico pesa lo justo y no dispara la pérdida. La pérdida de Huber combina esa robustez con la suavidad del error cuadrático medio mediante un parámetro delta que decide dónde cambia de comportamiento.

Inteligencia Artificial

Qué es una función de pérdida y una función de coste

Una función de pérdida mide cuánto se equivoca una red neuronal en un solo ejemplo, comparando su predicción con el valor correcto. La función de coste promedia esa pérdida sobre todo el conjunto de datos. Ese número único es el que el entrenamiento intenta reducir paso a paso con el descenso de gradiente.

Inteligencia Artificial

Propagación hacia delante en una red multicapa

La propagación hacia delante es el proceso por el que una red neuronal transforma la entrada en una predicción, capa por capa. En cada capa multiplica el vector de entradas por una matriz de pesos, suma un sesgo y aplica una función de activación, de modo que la salida de una capa alimenta a la siguiente hasta el resultado final.

Inteligencia Artificial

El problema del gradiente explosivo

El gradiente explosivo ocurre cuando la norma del gradiente crece sin control al retropropagar el error, sobre todo en redes profundas y recurrentes con pesos grandes. El entrenamiento se desestabiliza y la pérdida se vuelve NaN. El recorte de gradiente, junto con una buena inicialización y normalización, es la solución estándar.

Inteligencia Artificial

El problema del gradiente que se desvanece

El gradiente que se desvanece aparece cuando la señal de error se encoge al retropropagarse por muchas capas. Las funciones sigmoide y tangente hiperbólica tienen derivadas pequeñas, y su producto tiende a cero, así que las primeras capas apenas aprenden. ReLU, una buena inicialización y la normalización resuelven el problema.

Inteligencia Artificial

Cómo elegir una función de activación (comparativa)

Elegir una función de activación es sencillo con una regla base: usa ReLU en las capas ocultas, GELU o SiLU en transformers y reserva la salida para softmax en clasificación multiclase, sigmoide en problemas binarios y una activación lineal en regresión. Esta comparativa reúne fórmulas, rangos y casos de uso.

Inteligencia Artificial

La función de activación Mish

La función Mish se define como mish(x) = x·tanh(softplus(x)). Es suave, no monótona y se autorregulariza, propiedades que le permiten superar a Swish y a ReLU en muchas pruebas. El detector de objetos YOLOv4 la adoptó en su columna vertebral como activación por defecto.

Inteligencia Artificial

La función de activación Softplus

La función Softplus se define como softplus(x) = ln(1 + eˣ): una aproximación suave y siempre positiva de ReLU cuya derivada es exactamente la sigmoide. Es derivable en todo su dominio, evita el vértice anguloso de ReLU y su salida nunca llega a cero del todo.

Inteligencia Artificial

La función SELU y las redes autonormalizadas

La función SELU (Scaled Exponential Linear Unit) se define como SELU(x) igual a lambda por ELU(x), con lambda cercano a 1,0507 y alfa cercano a 1,6733. Esas dos constantes hacen que las activaciones converjan solas hacia media cero y varianza uno capa tras capa, y crean redes profundas que se normalizan a sí mismas sin batch normalization.

Inteligencia Artificial

La función de activación ELU (Exponential Linear Unit)

La función ELU (Exponential Linear Unit) devuelve x cuando la entrada es positiva y α(eˣ−1) cuando es negativa. Al permitir valores negativos suaves, acerca a cero la media de las activaciones, acelera la convergencia frente a ReLU y evita las neuronas muertas gracias a un gradiente que nunca se anula del todo.

Inteligencia Artificial

La función de activación Swish (SiLU)

La función Swish, también llamada SiLU, multiplica la entrada por su sigmoide: swish(x) = x·σ(x). Es suave, no monótona y se autorregula, por lo que suele superar a ReLU en redes profundas. Modelos como LLaMA y EfficientNet la usan como activación por defecto.