OpenAI y Cerebras acaban de anunciar Ultrafast Mode, la capa de inferencia que convierte a GPT-5.6 Sol Ultrafast en el modelo frontera más rápido disponible en una API, con hasta 750 tokens de salida por segundo. El anuncio, publicado el 13 de agosto de 2026, marca la primera vez que un laboratorio frontera ofrece su modelo insignia a esa velocidad dentro de su propia infraestructura.
Hasta ahora, trabajar con modelos grandes obligaba a elegir entre inteligencia y velocidad. Ultrafast promete borrar esa disyuntiva para las tareas donde cada segundo cuenta: incidentes de producción, respuesta a ciberataques o agentes que ya no obligan a cambiar de pestaña mientras esperan una respuesta.
TL;DR
- Cerebras y OpenAI presentaron Ultrafast Mode el 13 de agosto de 2026, primero disponible en la API de OpenAI.- GPT-5.6 Sol en modo Ultrafast alcanza hasta 750 tokens de salida por segundo sin perder calidad.- Es 11 veces más rápido que Fable 5 y 5 veces más rápido que Opus 4.8 en modo Fast, según Artificial Analysis.- En Humanity's Last Exam (2.500 preguntas), Ultrafast respondió todo en 11 horas y 11 minutos.- Fable 5 necesitó 78 horas y 27 minutos para el mismo examen, casi 7 veces más lento.- En GDP-Val, Ultrafast logró 5,6x de aceleración de punta a punta sin perder calidad.- El acceso es en vista previa limitada, con expansión gradual según crezca la capacidad.- La velocidad viene del Wafer-Scale Engine de Cerebras: 44 GB de SRAM por chip, sin HBM externa.
Qué pasó: Cerebras acelera a GPT-5.6 Sol Ultrafast
El anuncio salió del blog oficial de Cerebras, firmado por Joyce Er, bajo el título Accelerating GPT-5.6 Sol Ultrafast with OpenAI. Ahí explican que Ultrafast Mode es un nuevo nivel de servicio que se lanza primero dentro de la API de OpenAI y corre sobre hardware de Cerebras. Por ahora el acceso está limitado a un grupo selecto de clientes, con expansión gradual a medida que crece la capacidad instalada.
El número que resume todo es 750 tokens de salida por segundo. Según datos reportados por Artificial Analysis, GPT-5.6 Sol en modo Ultrafast corre 11 veces más rápido que Claude Fable 5 y 5 veces más rápido que Claude Opus 4.8 en su modo Fast. La comparación no es contra un modelo cualquiera: Fable 5 y Opus 4.8 son, hoy, dos de los modelos de razonamiento más usados para tareas complejas de código y análisis.
Para probar que la velocidad no venía a costa de la inteligencia, Cerebras corrió el examen Humanity's Last Exam (HLE) con GPT-5.6 Sol en Ultrafast. HLE reúne 2.500 preguntas de nivel doctorado en química, economía, literatura y otras disciplinas, pensadas para que ningún modelo actual las resuelva todas con facilidad. Ultrafast respondió las 2.500 preguntas en 11 horas y 11 minutos usando Codex con razonamiento xhigh. Claude Fable 5, con Claude Code y el mismo nivel de razonamiento, tardó 78 horas y 27 minutos, más de tres días de cómputo continuo, para llegar a una precisión comparable.
Dicho de otro modo: un trabajo que le tomaría a Fable 5 un fin de semana entero, Ultrafast lo termina en una jornada laboral, con precisión equivalente y casi siete veces más rápido.
Contexto e historia
Cerebras no es un nombre nuevo en esto. La empresa lleva años apostando por una arquitectura distinta a la de las GPU tradicionales: en vez de chips pequeños conectados por una red externa, fabrica un único chip del tamaño de una oblea de silicio completa (wafer-scale), pensado desde cero para mover datos de IA sin cuellos de botella. Ese enfoque ya lo venía usando para ofrecer inferencia rápida de modelos abiertos como Llama y, más recientemente, modelos de código.
Lo nuevo de este anuncio es la asociación directa con OpenAI para acelerar un modelo frontera cerrado dentro de la propia infraestructura de OpenAI. Hasta ahora, la velocidad de inferencia extrema (cientos de tokens por segundo) solía reservarse a modelos abiertos de tamaño medio, corridos por proveedores especializados como Groq o el propio Cerebras Cloud. Meter esa misma velocidad detrás de un modelo frontera cerrado, con la calidad de razonamiento de GPT-5.6 Sol, es un salto distinto.
El anuncio se apoya en dos declaraciones dentro del propio post de Cerebras. Rohan Varma, de producto en OpenAI, lo resume como una forma de que la IA se mantenga al ritmo de cómo pensás, programás y colaborás. Jeffrey Wang, investigador de OpenAI, cuenta que tareas que antes tardaban un par de minutos ahora terminan antes de que tenga oportunidad de cambiar de tarea, lo que en la práctica elimina el costo de cambiar de contexto entre sesiones paralelas de agentes.
El wafer de Cerebras guarda 44 GB de SRAM sin salir del chip.
Detalles técnicos y rendimiento
La razón técnica detrás de la velocidad está en cómo Cerebras resuelve el problema de mover datos. En una GPU convencional, generar cada token obliga a traer los pesos del modelo desde la memoria HBM, fuera del chip, hacia el chip de cómputo, una y otra vez, token tras token. Cuanto más grande el modelo, más pesado ese viaje de ida y vuelta: el cuello de botella no es cuánto puede calcular el chip, sino cuánto tarda en alimentarlo de datos.
Cerebras ataca el problema desde el diseño físico del chip: empaqueta 44 GB de SRAM directamente en cada wafer, la memoria más rápida que existe en un chip, y mantiene ahí los pesos del modelo sin moverlos. Los tokens fluyen a través de las capas del modelo, distribuidas (pipelined) entre wafers, sin la interrupción constante de ir a buscar pesos afuera. Este diseño escala razonablemente bien a medida que los modelos crecen, lo que según Cerebras deja una ventaja de velocidad que se mantiene en futuros modelos frontera.
flowchart TD
A["Pesos del modelo"] --> B{"Arquitectura"}
B --> C["GPU: HBM externa"]
B --> D["Cerebras: SRAM en el wafer"]
C --> E["Transferencia repetida por token"]
D --> F["Pesos residen on-chip"]
E --> G["Cuello de botella de ancho de banda"]
F --> H["Tokens fluyen sin interrupcion"]
Modelo / modoVelocidad reportadaComparación con UltrafastGPT-5.6 Sol (Ultrafast, Cerebras)hasta 750 tokens/s de salidalínea baseClaude Opus 4.8 (modo Fast)no publicada por Anthropic5x más lento, según Artificial AnalysisClaude Fable 5no publicada por Anthropic11x más lento, según Artificial Analysis
En GDP-Val, un benchmark que mide tareas de trabajo de conocimiento con valor económico real (informes legales, modelos financieros, reportes de ingeniería), Ultrafast entregó una aceleración de 5,6x de punta a punta comparado con GPT-5.6 Sol en modo estándar, sin degradar la calidad de las respuestas. Esa medición la hizo Cerebras el 31 de julio de 2026, usando GPT-5.6 Sol y GPT-5.6 Sol Ultrafast con razonamiento medio dentro de Codex.
💭 Clave: la ganancia no es solo velocidad bruta: GDP-Val mide tareas con valor económico real, donde el cuello de botella histórico era literalmente esperar a que el modelo terminara de escribir.
Para confirmar si tu cuenta ya tiene acceso, el chequeo más simple es listar los modelos habilitados:
curl https://api.openai.com/v1/models \
-H "Authorization: Bearer $OPENAI_API_KEY" \
| grep -i "ultrafast"
Este comando lista los modelos habilitados en tu cuenta; si tenés acceso a la vista previa de Ultrafast vas a ver un identificador de modelo con el sufijo ultrafast. Mientras el acceso siga limitado, la ausencia de ese identificador es la forma más simple de confirmar que tu cuenta todavía no fue habilitada.
Cómo empezar a probarlo
Ultrafast Mode todavía es una vista previa limitada, así que el primer paso real es pedir acceso desde la página de Cerebras o esperar a que OpenAI lo habilite en tu cuenta. Mientras tanto, podés dejar el código listo para el día que se active, usando el mismo SDK que ya usás para GPT-5.6 Sol en modo estándar.
Instalar el SDK oficial de OpenAI es igual en Windows, macOS y Linux, porque corre sobre pip o npm:
# Windows (PowerShell), macOS y Linux
pip install --upgrade openai
# alternativa con Node.js, misma instruccion en los tres sistemas
npm install openai
Con el SDK instalado, el patrón de llamada no cambia: seguís usando responses.create, solo apuntando al identificador de modelo que OpenAI asigne a la variante Ultrafast cuando la habilite en tu cuenta. Un ejemplo realista, midiendo tokens por segundo del lado del cliente:
import time
from openai import OpenAI
client = OpenAI() # lee OPENAI_API_KEY del entorno
inicio = time.perf_counter()
respuesta = client.responses.create(
model="gpt-5.6-sol-ultrafast", # nombre sujeto a cambios en preview
input="Resumi en 5 puntos el ultimo incidente de produccion.",
reasoning={"effort": "medium"},
)
duracion = time.perf_counter() - inicio
tokens_salida = respuesta.usage.output_tokens
print(f"{tokens_salida / duracion:.1f} tokens/segundo")
Ese último print es la forma más directa de confirmar en tu propia cuenta si estás corriendo sobre Ultrafast o sobre el modo estándar: si el número ronda las decenas de tokens por segundo, seguís en Standard; si se acerca a los cientos, ya estás en Ultrafast.
Impacto y análisis
La aplicación más citada en el propio anuncio es la respuesta a incidentes: equipos que operan servicios web pueden usar Ultrafast para encontrar la causa raíz de una caída y desplegar un fix antes de perder minutos valiosos contra su SLA. Lo mismo aplica, con más urgencia todavía, a equipos de seguridad que necesitan detectar y contener a un atacante activo antes de que el daño escale.
La velocidad de inferencia importa más cuando el reloj corre en contra.
Pero el cambio más interesante no es la velocidad en sí, sino lo que habilita: agentes que dejan de obligar al usuario a cambiar de tarea. Si un agente tarda minutos en responder, el usuario abre otra pestaña, pierde el hilo y vuelve más tarde a revisar el resultado. Si el agente responde en segundos, se puede trabajar con él sin perder el foco. Eso es justo lo que describe Jeffrey Wang de OpenAI en el anuncio: tareas que antes exigían esperar ahora terminan antes de que haya tiempo de cambiar de contexto.
⚠️ Ojo: Ultrafast no reemplaza al modo estándar para todo. Cerebras es explícito en que conviene reservar Ultrafast para trabajo en la ruta crítica y seguir usando procesamiento Standard para paralelizar tareas comunes, donde la latencia individual importa menos que el costo total.
Ese matiz es clave: no toda tarea necesita 750 tokens por segundo. Correr cientos de resúmenes en lote, indexar documentos o clasificar tickets son trabajos donde el rendimiento total del lote importa más que la latencia de una sola respuesta, y ahí el modo estándar sigue siendo la opción más eficiente en costo.
Qué sigue
Por ahora Ultrafast Mode es una vista previa limitada: Cerebras dice que el acceso se irá expandiendo a medida que crezca la capacidad de sus wafers instalados, sin dar todavía una fecha de disponibilidad general. Tampoco se conoce el precio por token de este nivel de servicio, algo lógico tratándose de una capacidad de cómputo más cara de producir que la inferencia estándar.
Lo que sí queda claro es la dirección: si esta arquitectura wafer-scale mantiene la ventaja de velocidad a medida que los modelos crecen, como sostiene Cerebras, la pregunta para el resto de la industria (Nvidia, Groq, AMD) deja de ser solo cuánta inteligencia cabe en un chip, y pasa a ser cuántos tokens por segundo puede sostener sin perderla.
Probalo vos: pedí acceso a la vista previa en la página oficial del anuncio de Cerebras y dejá listo el snippet de arriba para el día que se active en tu cuenta.
📖 Resumen en Telegram: Ver resumen
Preguntas frecuentes
¿Qué es Ultrafast Mode?
Es un nuevo nivel de servicio de inferencia para GPT-5.6 Sol, lanzado primero dentro de la API de OpenAI y operado sobre el hardware Wafer-Scale Engine de Cerebras. Permite generar hasta 750 tokens de salida por segundo sin sacrificar calidad.
¿En qué se diferencia de GPT-5.6 Sol en modo estándar?
El modelo es el mismo; lo que cambia es la infraestructura de inferencia. Ultrafast corre sobre chips de Cerebras en vez de GPU, priorizando la latencia mínima por respuesta sobre el costo total de procesar lotes grandes.
¿Puedo usar Ultrafast Mode hoy?
Solo si formás parte del grupo selecto de clientes en vista previa. Cerebras y OpenAI planean ampliar el acceso de forma gradual a medida que crece la capacidad instalada, sin fecha de disponibilidad general confirmada.
¿Qué es Humanity's Last Exam?
Es un examen de 2.500 preguntas de nivel doctorado en disciplinas como química, economía y literatura, diseñado para medir qué tan cerca están los modelos de IA del límite del conocimiento humano verificable.
¿Cerebras compite directamente con las GPU de Nvidia?
No exactamente en el mismo terreno: Nvidia domina el entrenamiento y la inferencia general con GPU, mientras Cerebras se especializa en inferencia de baja latencia con su chip wafer-scale, apostando a workloads donde la velocidad por respuesta es crítica.
¿Qué tipo de tareas se benefician más de Ultrafast?
Las que están en la ruta crítica de un problema: diagnóstico de caídas en producción, respuesta a incidentes de seguridad y agentes que necesitan trabajar en tiempo real sin que el usuario tenga que cambiar de tarea mientras espera.
Referencias
- Cerebras: Accelerating GPT-5.6 Sol Ultrafast with OpenAI: el anuncio oficial con las cifras de HLE, GDP-Val y la arquitectura Wafer-Scale Engine.- Artificial Analysis: benchmark independiente citado por Cerebras para comparar la velocidad de salida entre modelos.- OpenAI API Docs: documentación oficial del SDK y los endpoints usados en los ejemplos de este artículo.- Wikipedia: Wafer-scale integration: contexto técnico sobre el enfoque de fabricación de chip único a escala de oblea.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)