OpenAI revela ultrarrápido: GPT-5.6 Sol puede ahora alcanzar 750 tokens por segundo

OpenAI presenta Ultrafast: GPT-5.6 Sol puede alcanzar 750 tokens por segundo

OpenAI ya no solo busca hacer que sus modelos sean más inteligentes: ahora la empresa quiere reducir drásticamente el tiempo entre una pregunta y su ejecución. Con Ultrafast, GPT-5.6 Sol puede funcionar hasta 14 veces más rápido que el procesamiento estándar y generar hasta 750 tokens por segundo, con una disponibilidad inicial limitada a través de la API.

Ultrafast quiere eliminar el compromiso entre velocidad e inteligencia

Presentado el 13 de agosto de 2026, Ultrafast constituye una nueva clase de servicio para GPT-5.6 Sol, el modelo de alta gama de la familia GPT-5.6. OpenAI anuncia rendimientos de hasta 14 veces la velocidad del modo estándar, generando hasta 750 tokens por segundo.

La infraestructura se basa en Cerebras, especialista en sistemas de cálculo diseñados para inteligencia artificial y socio de OpenAI en cargas de inferencia de muy baja latencia.

Detrás de estas cifras hay un cambio más estratégico de lo que parece. Hasta ahora, los desarrolladores que necesitaban una respuesta casi instantánea a menudo tenían que aceptar un compromiso: elegir un modelo más ligero y rápido, a costa de sacrificar parte de sus capacidades de razonamiento. Con Ultrafast, OpenAI busca precisamente reducir esta oposición entre inteligencia y reactividad.

El objetivo no es simplemente hacer que el texto aparezca más rápido en la pantalla. Se trata de obtener un modelo de vanguardia lo suficientemente reactivo para intervenir directamente en procesos donde cada segundo cuenta.

Hasta 750 tokens por segundo gracias a Cerebras

La cifra más notable es, sin duda, la de 750 tokens generados por segundo. OpenAI explica que Cerebras proporciona la infraestructura necesaria para ejecutar GPT-5.6 Sol con una latencia especialmente baja.

A esta velocidad, el comportamiento de un modelo cambia significativamente desde el punto de vista del usuario. Una tarea que requiere cientos o miles de tokens puede producir resultados casi de inmediato, acercando la IA generativa a un verdadero sistema interactivo en lugar de ser una herramienta que se consulta y para la cual hay que esperar una respuesta.

Esto es especialmente importante para los agentes de IA. Su funcionamiento rara vez se basa en una sola generación: pueden consultar datos, llamar a varias herramientas, analizar resultados intermedios y luego volver a comenzar. En este tipo de arquitectura, unos pocos segundos ahorrados en cada etapa pueden reducir drásticamente el tiempo total de ejecución.

OpenAI ya había indicado al presentar GPT-5.6 Sol que quería ofrecer su modelo en la infraestructura de Cerebras con tasas de hasta 750 tokens por segundo. Ultrafast formaliza ahora este enfoque en forma de una nueva oferta dedicada.

https://www.youtube.com/watch?v=WCwT4gWpHmI

Soporte al cliente, finanzas, comercio: OpenAI apunta a usos donde la espera puede ser costosa

OpenAI no presenta Ultrafast como un simple acelerador para chatbots. La empresa está probando esta nueva clase de servicio en varias categorías de tareas profesionales donde la latencia puede afectar directamente la eficiencia de un producto o equipo.

En la gestión de incidentes de TI, por ejemplo, GPT-5.6 Sol puede analizar registros de aplicaciones, trazas técnicas, modificaciones de código recientes o conversaciones entre ingenieros para identificar más rápidamente el origen probable de una falla y ayudar en la preparación de un arreglo.

Las finanzas y la seguridad son otro campo natural. Un modelo lo suficientemente rápido puede analizar señales de mercado o examinar transacciones mientras la situación aún está evolucionando, en lugar de hacerlo una vez que el evento ha terminado. OpenAI también menciona el soporte al cliente y las interfaces vocales, donde una respuesta compleja puede necesitar a veces varios sistemas mientras se mantiene el ritmo natural de una conversación.

En el comercio electrónico, la misma lógica puede servir para consultar un inventario, personalizar una recomendación o resolver un problema durante el proceso de pago antes de que el cliente abandone la compra. Finalmente, OpenAI desea aprovechar esta velocidad en la investigación experimental para acortar los ciclos entre hipótesis, experimentación y análisis de los resultados.

El hilo conductor es claro: Ultrafast está dirigido a entornos donde la inteligencia del modelo no es suficiente si su respuesta llega demasiado tarde.

OpenAI ya está probando Ultrafast en sus propios equipos

La compañía también está utilizando esta infraestructura internamente. Durante un incidente técnico, los ingenieros pueden analizar rápidamente registros y trazas, sintetizar conversaciones relevantes, determinar las próximas verificaciones a realizar y preparar o validar una solución. Sin embargo, OpenAI enfatiza un punto: la decisión final y el despliegue siguen siendo responsabilidad de los ingenieros.

La empresa también está experimentando con Ultrafast en sus actividades de investigación. El modelo puede buscar información en diferentes fuentes de conocimiento, consultar datos y luego reunir y sintetizar resultados de herramientas conectadas. Según OpenAI, algunos ciclos experimentales que anteriormente se realizaban durante la noche ahora pueden acercarse a un funcionamiento interactivo, permitiendo múltiples iteraciones en un mismo día.

Esta podría ser la parte más interesante de la promesa de Ultrafast. Acelerar una respuesta aislada mejora la experiencia del usuario. Acortar un ciclo completo de observación, razonamiento, acción y nuevo análisis puede cambiar la forma en que los equipos trabajan con la IA.

Después de la carrera por los modelos, la batalla de la inferencia

Durante varios años, la industria de la inteligencia artificial se centró principalmente en la calidad de los modelos: más parámetros, mejores capacidades de razonamiento, ventanas de contexto más grandes y agentes capaces de utilizar herramientas.

Ultrafast ilustra otra etapa de esta competencia: la infraestructura de inferencia.

A medida que las capacidades de los modelos avanzan, la velocidad a la que pueden ser ejecutados se vuelve igualmente una ventaja estratégica. Para ciertas aplicaciones, pasar de decenas de tokens por segundo a cientos no solo representa una mejora en la comodidad. Puede permitir el diseño de productos que anteriormente habrían parecido demasiado lentos para ser realmente utilizables.

La elección de Cerebras también es reveladora. OpenAI no se basa únicamente en los avances del modelo en sí: la empresa busca optimizar toda la cadena que transforma una solicitud en respuesta, desde el software hasta el hardware de inferencia. OpenAI describe Ultrafast como un nuevo paso en su asociación con Cerebras en torno a la inferencia de muy baja latencia.

Esta evolución podría gradualmente desplazar la competencia entre plataformas de IA. La pregunta ya no sería solo «¿qué modelo es el más inteligente?», sino también qué infraestructura es capaz de proporcionar esta inteligencia lo suficientemente rápido para que sea realmente interactiva.

Una disponibilidad aún muy limitada

Por el momento, Ultrafast sigue siendo una tecnología en fase de despliegue controlado. GPT-5.6 Sol con el modo Ultrafast se ofrece en una vista previa limitada a un grupo seleccionado de clientes, a través del ecosistema API de OpenAI. La empresa explica que desea aumentar gradualmente el acceso a medida que sus capacidades de infraestructura progresan y ofrece a las empresas interesadas la posibilidad de registrarse para recibir noticias sobre próximas disponibilidades.

OpenAI ya está probando el servicio con empresas especializadas en desarrollo, comercio, investigación financiera y soporte para medir las situaciones en las que este aumento de velocidad aporta más valor en un entorno real.

Por lo tanto, Ultrafast sigue siendo más una demostración de dirección que un nuevo estándar accesible para todos. Pero el mensaje de OpenAI ya es claro: después de enseñar a los modelos a razonar más, la industria debe ahora aprender a hacer que razonen lo suficientemente rápido como para seguir el ritmo humano.

Y si las mejoras de rendimiento se generalizan, la próxima ruptura en la IA podría no venir solo de un modelo más inteligente, sino de una inteligencia que casi no obliga al usuario a esperar.


Scroll al inicio