GPT-4o: multimodalidad nativa de OpenAI
Índice de contenidos
- Puntos clave
- Qué es diferente
- Precio y velocidad
- Benchmarks
- Casos de uso desbloqueados
- La API en tiempo real
- Limitaciones del audio en tiempo real
- GPT-4o frente a GPT-4 Turbo
- Conclusión
- Preguntas frecuentes
- ¿Cuánto cuesta GPT-4o comparado con GPT-4 Turbo?
- ¿Merece la pena seguir usando GPT-4 Turbo en lugar de GPT-4o?
- ¿Qué limitaciones tiene el modo audio de GPT-4o?
- Fuentes
GPT-4o es el modelo de OpenAI presentado el 13 de mayo de 2024 que funde texto, imagen y audio en un único modelo nativo, sin pipelines separados. Ofrece latencia de conversación de unos 320 milisegundos, mejor comprensión multimodal y un precio un 50% inferior al de GPT-4 Turbo.
GPT-4o ("o" = omni) fue presentado por OpenAI el 13 de mayo de 2024. Lo nuevo no es que GPT-4 pueda procesar imagen y audio (eso ya existía vía APIs separadas), sino que un único modelo nativo procesa texto, imagen y audio de entrada y salida. El resultado: latencia de conversación humana (~320 ms), mejor comprensión multimodal y un precio un 50% inferior a GPT-4 Turbo.
Puntos clave
-
Las tres modalidades (texto, visión, audio) están fusionadas en el mismo modelo base: el modelo oye tono, emoción e interrupciones, no solo palabras transcritas.
-
~50% más barato que GPT-4 Turbo: $5/1M tokens de entrada frente a $10.
-
Latencia de ~320 ms en modo audio: conversación verdaderamente natural.
-
HumanEval 90%: el mejor resultado en coding entre los modelos disponibles en mayo de 2024.
-
La Realtime API WebSocket bidireccional abre aplicaciones voice-first que antes requerían pipelines complejos.
Qué es diferente
Los tres modalidades están ahora fusionadas en el mismo modelo base:
-
Texto: calidad comparable o ligeramente superior a GPT-4 Turbo.
-
Visión: análisis de imágenes más integrado que GPT-4V; OCR avanzado, análisis de diagramas, comprensión de screenshots para automatización de UI.
-
Audio: entrada (transcripción + comprensión emocional) y salida (síntesis) nativas. El modelo capta tono, emoción e interrupciones.
-
Video: frames de video como inputs para análisis de screen recordings o content moderation.
La diferencia frente al pipeline "Whisper → GPT-4 → TTS" es latencia y preservación de información: el pipeline anterior perdía el tono de voz, la emoción y las pausas. GPT-4o los procesa directamente.
Precio y velocidad
| Modelo | Input | Output | First token |
|---|---|---|---|
| GPT-4 Turbo | $10/1M | $30/1M | ~1000 ms |
| GPT-4o | $5/1M | $15/1M | ~500 ms |
| GPT-4o mini | $0,15/1M | $0,60/1M | ~300 ms |
Para apps de chat en tiempo real, la diferencia de latencia es perceptible por el usuario final.
Benchmarks
| Benchmark | GPT-4o | GPT-4 Turbo | Claude 3 Opus |
|---|---|---|---|
| MMLU | 88,7 | 86,4 | 86,8 |
| HumanEval | 90,2 | 85,4 | 84,9 |
| GSM8K | 95,8 | 92,0 | 95,0 |
GPT-4o destaca especialmente en coding (HumanEval 90%) y en tareas multilingüe.
Casos de uso desbloqueados
Lo que GPT-4o hace práctico donde antes hacía falta un pipeline complejo:
-
Voice assistants con latencia conversacional real: customer service por voz, tutores interactivos.
-
Accesibilidad: interfaces por voz para personas con limitaciones visuales o motoras.
-
Traducción simultánea en reuniones con preservación de tono.
-
Comprensión de documentos complejos: formularios, facturas, planos técnicos con una sola llamada API.
-
Automatización de UI: describir screenshots para pipelines de testing o soporte.
La API en tiempo real
La novedad más impactante tras el lanzamiento: la Realtime API permite una conexión WebSocket bidireccional con streaming de audio. El cliente puede interrumpir, el servidor detecta la interrupción y ajusta la respuesta. Latencia real de 320 ms.
# Conexión WebSocket bidireccional
# Stream de audio in → comprensión + razonamiento → stream audio out
# El modelo detecta interrupciones y ajusta en tiempo real
Esto abre patrones que antes eran impracticables: bots telefónicos de soporte, interfaces de voz para IoT, tutoriales interactivos con feedback instantáneo. La complejidad de integración (WebSocket + streaming de audio) es real, pero el resultado es cualitativamente diferente a cualquier pipeline previo. Ver también Llama 3.2 y el cómputo en el edge para alternativas self-hosted en casos donde la privacidad impide usar la API de OpenAI.
Limitaciones del audio en tiempo real
Con honestidad:
-
El ancho de banda de audio en modelos actuales es ~24 kHz: calidad suficiente para voz pero no para audio de alta fidelidad.
-
Tool use + audio en la misma llamada es más complejo que en modo texto.
-
Alucinaciones en visión: OCR de baja calidad o texto confuso en imágenes genera errores con más frecuencia que en texto puro.
-
El contexto es de 128k tokens, igual que GPT-4 Turbo: menor que Claude 3 Opus o Gemini 1.5.
-
El coste de audio puede acumularse rápido: ~$0,06/min de entrada, ~$0,24/min de salida.
GPT-4o frente a GPT-4 Turbo
Después de semanas de uso en producción:
-
Calidad de texto: GPT-4o equivalente o ligeramente superior a Turbo.
-
Razonamiento complejo en edge cases: Turbo ocasionalmente mejor.
-
Latencia: GPT-4o gana claramente.
-
Coste: GPT-4o gana claramente.
-
Multimodal: GPT-4o gana claramente.
Default para nuevas aplicaciones: GPT-4o. Razón para seguir con Turbo: razonamiento específico en casos donde lo hayas comprobado empíricamente.
Conclusión
GPT-4o es el punto de partida para evaluar qué se puede construir ahora con LLMs multimodales. La fusión de modalidades en un único modelo cambia la economía de las aplicaciones que dependen de voz o visión: ya no hace falta orquestar tres servicios distintos para conseguir una conversación natural. La Realtime API para voz es el diferencial más real para aplicaciones voice-first.
Los modelos frontier avanzan rápido: Claude 3.5 Sonnet respondió al mes siguiente, y meses después GPT-5 fusionó GPT-4o y o3 en un único modelo adaptativo. Aun así, GPT-4o sigue siendo un salto genuino en precio, calidad y modalidad para cualquiera que construya sobre la API de OpenAI hoy.
Si prefieres leer este artículo en inglés: GPT-4o: OpenAI’s Native Multimodality.
Fuentes:
- OpenAI: Hello GPT-4o[1]
- TechCrunch: OpenAI debuts GPT-4o ‘omni’ model now powering ChatGPT[2]
- Wikipedia: GPT-4o[3]
- CNN Business: OpenAI unveils newest AI model, GPT-4o[4]
Preguntas frecuentes
¿Cuánto cuesta GPT-4o comparado con GPT-4 Turbo?
La mitad en texto: 5 $ por millón de tokens de entrada y 15 $ de salida, frente a 10 $ y 30 $ de GPT-4 Turbo. GPT-4o mini baja a 0,15 $ y 0,60 $ por millón. El audio se factura aparte y se acumula rápido, unos 0,06 $ por minuto de entrada y 0,24 $ por minuto de salida. El primer token llega en unos 500 ms frente a los ~1000 ms de Turbo.
¿Merece la pena seguir usando GPT-4 Turbo en lugar de GPT-4o?
Solo en casos concretos: después de semanas de uso en producción, GPT-4o iguala o supera ligeramente a Turbo en calidad de texto, y gana con claridad en latencia, coste y multimodalidad. Es el default para nuevas aplicaciones. Turbo ocasionalmente rinde mejor en razonamiento complejo en edge cases; mantenerlo solo tiene sentido donde lo hayas comprobado empíricamente. Ambos comparten la ventana de contexto de 128k tokens.
¿Qué limitaciones tiene el modo audio de GPT-4o?
El ancho de banda de audio es de unos 24 kHz, suficiente para voz pero no para alta fidelidad. Combinar tool use y audio en la misma llamada es más complejo que en modo texto, y el coste de audio se acumula rápido. La Realtime API funciona por WebSocket bidireccional con streaming de audio y latencia real de 320 ms, con detección de interrupciones, pero la integración exige manejar WebSocket y streaming.