Categorías

Inteligencia Artificial

Gemini 2.5: escalado de contexto y multimodalidad

Google publicó Gemini 2.5 Pro en vista previa en marzo y la versión general llegó en junio. El salto respecto a Gemini 2.0 no está solo en puntuaciones sino en dos frentes prácticos: ventana de contexto utilizable en serio y multimodalidad que deja de ser demostración para convertirse en herramienta.

Inteligencia Artificial

GPT-4o: multimodalidad nativa de OpenAI

GPT-4o es el modelo de OpenAI presentado el 13 de mayo de 2024 que funde texto, imagen y audio en un único modelo nativo, sin pipelines separados. Ofrece latencia de conversación de unos 320 milisegundos, mejor comprensión multimodal y un precio un 50% inferior al de GPT-4 Turbo.