¿Qué es el Test-Time Compute?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Actualizado en julio de 2026
El test-time compute, también llamado inference-time compute, es la computación adicional que un modelo dedica a razonar un problema después de recibir una consulta, en lugar de basarse únicamente en lo que quedó fijado durante el entrenamiento. En vez de responder de forma instantánea, el modelo genera pasos de razonamiento intermedios, prueba varios enfoques y revisa su propio trabajo, gastando más cómputo por consulta para elevar la precisión en problemas difíciles.
Durante la mayor parte de la historia de los large language models, obtener una respuesta más inteligente significaba entrenar un modelo más grande. El test-time compute rompió ese supuesto. Ahora un modelo puede volverse notablemente más inteligente en una pregunta específica solo con dársele más tiempo y más cómputo para trabajarla, sin cambiar un solo parámetro entrenado.
De Modelos Más Grandes a un Pensamiento Más Largo
Durante años, el progreso de la IA siguió un patrón simple: agregar más parámetros, más datos de entrenamiento, más cómputo de entrenamiento, y el modelo mejora. Esto es el train-time scaling, y definió el campo desde los primeros modelos GPT hasta los lanzamientos de frontera de mediados de la década de 2020. Cada avance provenía de una corrida de entrenamiento más grande y más costosa, y el modelo resultante respondía luego cada consulta en aproximadamente el mismo tiempo, sin importar cuán difícil fuera la pregunta.
El o1 de OpenAI, lanzado en septiembre de 2024, rompió ese patrón. En lugar de escalar el modelo, o1 escaló cuánto tiempo se le permitía "pensar" antes de responder, generando una cadena interna de razonamiento que el modelo recorre antes de comprometerse con una respuesta final. Los resultados dejaron claro que el tiempo de pensamiento era una palanca propia, separada del tamaño del modelo.
Según el informe Stanford AI Index 2025, o1 obtuvo 74.4% en un examen de clasificación para la Olimpiada Internacional de Matemáticas, frente al 9.3% de GPT-4o, en las mismas preguntas. El intercambio también fue real: el informe señala que o1 es casi seis veces más costoso y 30 veces más lento que GPT-4o. Ese intercambio, más precisión a cambio de más costo y más tiempo, es toda la premisa del test-time compute.
Cómo "Pensar Más Tiempo" Mejora Realmente las Respuestas
Un large language model estándar genera su respuesta token por token, en una sola pasada hacia adelante, sin ningún mecanismo para detenerse, reconsiderar o verificar su propia lógica antes de completar la respuesta. Por eso puede afirmar una respuesta incorrecta con la misma fluidez confiada que una correcta.

Los reasoning models construidos para el test-time compute agregan tres cosas que un modelo estándar no hace por defecto:
Trazas de razonamiento extendidas. El modelo genera una larga secuencia interna de pasos intermedios, resolviendo subproblemas, verificando restricciones y narrando su propia lógica antes de producir una respuesta final. Este es el mecanismo detrás del razonamiento chain-of-thought, escalado y a menudo ejecutado fuera de lo que ve el usuario.
Muestreo y selección. En lugar de generar una sola respuesta, el modelo puede generar varias soluciones candidatas y elegir la mejor, ya sea mediante voto mayoritario (la respuesta en la que coincide la mayoría de los candidatos) o mediante una función de puntuación aprendida que clasifica los candidatos según su probable corrección.
Autoverificación. El modelo revisa su propio razonamiento contra las restricciones del problema y puede retroceder para intentar un enfoque distinto cuando un paso no se sostiene, de forma parecida a como una persona revisa dos veces su trabajo antes de entregarlo.
Los propios resultados de OpenAI en el examen de matemáticas AIME 2024 muestran cuánto vale cada una de estas palancas por sí sola. Según las notas de lanzamiento de OpenAI para o1, el modelo promedió 74% de precisión con una sola muestra por problema, subió a 83% al usar consenso entre 64 muestras, y alcanzó 93% al reclasificar 1,000 muestras con una función de puntuación aprendida, todo usando exactamente el mismo modelo subyacente. GPT-4o, sin razonamiento en tiempo de prueba, resolvió solo el 12% de los mismos problemas. Nada cambió en los parámetros del modelo entre esos tres puntajes. Solo cambió la cantidad de test-time compute.
La Nueva Ley de Escalado
Antes de 2024, "ley de escalado" significaba una sola cosa en IA: el desempeño como función del cómputo de entrenamiento, los parámetros del modelo y los datos de entrenamiento. El test-time compute agregó un segundo eje. Un artículo de 2024 de investigadores de UC Berkeley y Google DeepMind, Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters, formalizó esto: asignar el test-time compute de manera "óptima en cómputo", ajustando el esfuerzo de razonamiento a la dificultad del prompt específico en lugar de gastar una cantidad fija en cada consulta, mejoró la eficiencia en más de 4 veces frente a una referencia ingenua de muestreo best-of-N. En una comparación equiparada por FLOPs, el artículo encontró que el test-time compute permitió que un modelo más pequeño superara a uno 14 veces más grande.
Ese hallazgo replantea la disyuntiva de construir versus comprar para los laboratorios de frontera y, en consecuencia, para las empresas que compran sus modelos. Un laboratorio con un presupuesto de cómputo fijo ahora tiene dos lugares donde gastarlo: una corrida de entrenamiento más grande y costosa que mejora cada respuesta futura en un margen pequeño, o un sistema de razonamiento que permite que un modelo existente dedique más cómputo a las consultas específicas que lo necesitan.
El intercambio no desaparece a mayor escala, solo se vuelve más visible. El modelo o3 de OpenAI, evaluado en el benchmark ARC-AGI-Pub, muestra la curva directamente: una configuración de alta eficiencia obtuvo 75.7% en la evaluación semiprivada a un costo de cómputo de $26 por tarea, mientras que una configuración de baja eficiencia, usando aproximadamente 172 veces más cómputo, obtuvo 87.5% a $4,560 por tarea. Doce puntos más de precisión cuestan más de 170 veces el cómputo. Esa es la forma del test-time scaling en la práctica: ganancias reales, a un precio que sube pronunciadamente por cada punto adicional.
Test-Time Compute vs. Train-Time Compute
| Dimensión | Train-Time Compute | Test-Time Compute |
|---|---|---|
| Cuándo ocurre | Una vez, durante el desarrollo del modelo, antes de la implementación | Cada vez que el modelo responde una consulta, en producción |
| Qué cambia | Los parámetros del modelo (los pesos) | Nada en el modelo, solo cuánto esfuerzo de razonamiento se dedica a una consulta |
| Forma del costo | Grande, adelantado, gasto tipo proyecto | Por consulta, basado en uso, escala con el volumen y con qué tan "difícil" se trate una pregunta |
| Qué se obtiene | Un modelo generalmente más capaz, para cada consulta futura | Una mejor respuesta a esta consulta específica, con mayor latencia y costo solo para esa consulta |
| Palancas principales | Más parámetros, más datos de entrenamiento, corridas de entrenamiento más largas | Cadenas de razonamiento más largas, más candidatos muestreados, pasadas de autoverificación |
| Modo de falla si se sobregasta | Un modelo costoso que sigue siendo mediocre si la receta estuvo mal | Una respuesta lenta y costosa a una pregunta que no necesitaba razonamiento profundo |
Ambos ejes siguen siendo leyes de escalado en el sentido técnico: el desempeño mejora como una función razonablemente predecible del cómputo gastado. La diferencia está en cuándo se paga y qué se obtiene por ello. El train-time compute es una inversión única en el propio modelo. El test-time compute es una decisión por consulta que una empresa, o la aplicación que llama al modelo, tiene que tomar cada vez.
Costo y Latencia: las Disyuntivas
El test-time compute no es gratuito, y esto se nota en dos lugares a la vez: el dinero y el tiempo.

Latencia. Un modelo estándar responde en una fracción de segundo o en unos pocos segundos. Un reasoning model que recorre una cadena de razonamiento extendida puede tardar desde varios segundos hasta varios minutos, dependiendo de cuánto razonamiento interno genere antes de producir una respuesta visible. Para los casos de uso interactivos, esa diferencia lo es todo: un agente de soporte que espera 20 segundos en lugar de 2 por una respuesta buscará una alternativa, o dejará de usar la herramienta. Vea latencia para entender cómo el tiempo de respuesta determina si una función realmente se adopta.
Costo. Los tokens de razonamiento tampoco son gratuitos, y la mayoría de ellos son invisibles. Según Artificial Analysis, el o3 de OpenAI tiene un precio de $2.00 por millón de tokens de entrada y $8.00 por millón de tokens de salida, y los tokens de razonamiento interno, los que se generan durante el proceso de "pensamiento" del modelo, se facturan como tokens de salida aunque el usuario nunca los vea en la respuesta. Una respuesta visible corta puede apoyarse en una traza de razonamiento mucho más grande y facturada. Ese es un perfil de costo estructuralmente distinto al de un modelo estándar, donde la cantidad de tokens que se ve es cercana a la cantidad de tokens que se paga.
La consecuencia práctica es que el test-time compute convierte "cuánto debería pensar el modelo sobre esto" en una decisión de control de costos, no solo de calidad. Las técnicas de inference optimization, como limitar la longitud del razonamiento, enrutar las consultas fáciles a un modelo rápido y escalar solo las difíciles a un reasoning model, y almacenar en caché las consultas repetidas, se vuelven más valiosas una vez que una parte significativa de las consultas conlleva una factura de tokens de razonamiento variable y a veces grande.
Implicaciones de Negocio: Cuándo Tiene Sentido el Precio de los Reasoning Models
No toda función de IA necesita test-time compute, y tratar cada consulta como si lo necesitara es la forma más rápida de convertir un piloto prometedor en uno costoso. La decisión se reduce a una pregunta bastante simple: ¿qué tan costosa es una respuesta incorrecta, comparada con qué tan costosa es una respuesta lenta o cara?

Use un modelo estándar y rápido cuando: la tarea es de alto volumen, la respuesta es obviamente correcta o fácil de verificar, y la velocidad importa para la persona que espera. Las respuestas de FAQ para clientes, la clasificación básica, la generación de contenido en primer borrador y la extracción rutinaria de datos encajan en este patrón. Ejecutar cada una de estas tareas a través de un reasoning model gasta presupuesto en una precisión que la tarea no necesitaba.
Reserve el test-time compute para: el análisis de varios pasos donde un error es costoso de detectar después del hecho, las tareas con un espacio de soluciones amplio donde el modelo se beneficia de explorar alternativas, y cualquier flujo de trabajo donde una persona actuará sobre el resultado sin volver a derivarlo de forma independiente, como el modelado financiero, el análisis de contratos o la depuración técnica. Estos son los casos en los que vale la pena pagar la disyuntiva de "seis veces más costoso, 30 veces más lento" del Stanford AI Index.
La implicación de presupuesto para un líder que patrocina trabajo de IA: el costo por consulta de una función basada en un reasoning model no es un número fijo como solía serlo con los modelos estándar. Varía según qué tan difícil resulte ser cada consulta individual, ya que el propio modelo decide cuánto necesita razonar. Eso hace que el monitoreo de uso y la lógica de enrutamiento, enviando solo las consultas que necesitan razonamiento profundo al modelo costoso, formen parte del plan de control de costos desde el primer día, no una ocurrencia tardía una vez que llega la factura. Los AI agents que encadenan múltiples llamadas al modelo agravan esto aún más, ya que un flujo de trabajo de agente de varios pasos puede invocar el razonamiento en tiempo de prueba varias veces en una sola tarea.
Datos Clave
- o1 de OpenAI obtuvo 74.4% en un examen de clasificación para la Olimpiada Internacional de Matemáticas, frente al 9.3% de GPT-4o, pero o1 es casi seis veces más costoso y 30 veces más lento que GPT-4o, según el informe Stanford AI Index 2025.
- En los exámenes de matemáticas AIME 2024, o1 promedió 74% de precisión con una sola muestra por problema, 83% con consenso entre 64 muestras, y 93% al reclasificar 1,000 muestras, frente a 12% de GPT-4o en los mismos problemas, según las notas oficiales de lanzamiento de o1 de OpenAI.
- Una estrategia de escalado de test-time compute óptima en cómputo puede mejorar la eficiencia en más de 4 veces frente a una referencia ingenua best-of-N, y en comparaciones equiparadas por FLOPs, el test-time compute permitió que un modelo más pequeño superara a uno 14 veces más grande, según el artículo de Berkeley y DeepMind Scaling LLM Test-Time Compute Optimally.
- En el benchmark ARC-AGI-Pub, una configuración de alta eficiencia del o3 de OpenAI obtuvo 75.7% a $26 por tarea, mientras que una configuración de baja eficiencia obtuvo 87.5% a $4,560 por tarea, usando aproximadamente 172 veces más cómputo para una ganancia de precisión de 12 puntos, según los resultados oficiales de ARC Prize.
- El o3 de OpenAI tiene un precio de $2.00 por millón de tokens de entrada y $8.00 por millón de tokens de salida, y los tokens de razonamiento interno se facturan como tokens de salida aunque nunca aparezcan en la respuesta visible, según Artificial Analysis.
Conceptos de IA Relacionados
- Reasoning Models - La categoría de modelos construida específicamente para usar test-time compute
- Inference - La fase de producción más amplia de la que el test-time compute es una forma de costo variable
- Chain-of-Thought - La técnica de razonamiento paso a paso que el test-time compute escala
- Large Language Models - La categoría base de modelos que los reasoning models extienden
- Inference Optimization - Técnicas para controlar el costo y la latencia en la inferencia
- Latency - Por qué el tiempo de pensamiento adicional en el test-time compute afecta la adopción
- AI Agents - Sistemas de varios pasos donde el costo del razonamiento en tiempo de prueba puede acumularse
- Foundation Models - Los modelos base sobre los que se construye la capacidad de razonamiento
Recursos Externos
- Stanford AI Index 2025, Technical Performance - Datos de benchmark independientes sobre la precisión, el costo y la latencia de o1 frente a GPT-4o
- OpenAI: Learning to Reason with LLMs - Notas de lanzamiento y datos de benchmark propios de OpenAI para o1
- Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters - El artículo de Berkeley/DeepMind que formaliza el test-time compute como una ley de escalado
- ARC Prize: o3 ARC-AGI-Pub Results - Datos oficiales de costo por tarea entre configuraciones de cómputo
Preguntas Frecuentes sobre el Test-Time Compute
¿Qué es el test-time compute?
El test-time compute, también llamado inference-time compute, es la computación adicional que un modelo dedica a razonar un problema cuando recibe una consulta, en lugar de basarse únicamente en lo aprendido durante el entrenamiento. Incluye generar cadenas de razonamiento extendidas, muestrear varias respuestas candidatas y autoverificarse antes de responder.
¿En qué se diferencia el test-time compute del cómputo de entrenamiento?
El cómputo de entrenamiento se gasta una vez, antes de la implementación, para fijar los parámetros del modelo. El test-time compute se gasta cada vez que el modelo responde una consulta, y no cambia el modelo en absoluto, cambia cuánto esfuerzo de razonamiento se dedica a esa respuesta específica.
¿Por qué o1 de OpenAI convirtió al test-time compute en un tema tan importante?
o1, lanzado en septiembre de 2024, demostró que darle a un modelo más tiempo para razonar en la inferencia podía producir grandes ganancias de precisión en problemas difíciles sin ningún cambio en el tamaño del modelo o el entrenamiento. Según el informe Stanford AI Index 2025, obtuvo 74.4% en un examen de clasificación para la Olimpiada Internacional de Matemáticas frente al 9.3% de GPT-4o, a aproximadamente seis veces el costo y 30 veces la latencia.
¿Más test-time compute siempre significa una mejor respuesta?
Mejora la precisión en problemas que se benefician del razonamiento de varios pasos, pero las ganancias se reducen a medida que aumenta el cómputo. Los resultados de o3 de OpenAI en ARC-AGI-Pub muestran una ganancia de precisión de 12 puntos por aproximadamente 172 veces más cómputo entre las configuraciones eficiente y de alto cómputo. En tareas simples y bien definidas, el razonamiento adicional a menudo agrega costo y latencia sin una mejora de precisión significativa.
¿Cómo afecta el test-time compute a los costos de la API?
Los reasoning models facturan los tokens internos de "pensamiento" como tokens de salida, aunque esos tokens nunca aparezcan en la respuesta visible. Eso significa que la misma respuesta visible puede llevar una factura de tokens mucho mayor que la de un modelo estándar, y el costo total varía según la consulta, ya que el modelo decide cuánto necesita razonar.
¿Qué tareas se benefician más del test-time compute?
El análisis de varios pasos, las tareas con un espacio de soluciones amplio y los flujos de trabajo donde una respuesta incorrecta es costosa de detectar más tarde, como el modelado financiero, el análisis de contratos o la depuración técnica, son los que más se benefician. Las tareas de alto volumen y bajo riesgo, como las respuestas de FAQ o la clasificación básica, generalmente no lo necesitan.
¿Es el test-time compute lo mismo que el chain-of-thought prompting?
Están relacionados, pero no son idénticos. El chain-of-thought es la técnica de generar razonamiento paso a paso antes de una respuesta. El test-time compute es la categoría más amplia que incluye el chain-of-thought además de otras técnicas como muestrear varios candidatos y la autoverificación, todas aplicadas en el momento de la inferencia.
¿El test-time scaling reemplazará el entrenamiento de modelos más grandes?
No, son complementarios, no un reemplazo el uno del otro. Investigaciones como el artículo Scaling LLM Test-Time Compute Optimally muestran que el test-time compute puede permitir que un modelo más pequeño iguale o supere a uno mucho más grande en tareas específicas, pero los laboratorios de frontera siguen invirtiendo tanto en corridas de entrenamiento más grandes como en un mejor razonamiento en tiempo de prueba, ya que cada uno aporta algo distinto.
Parte de la Colección de Términos de IA. Última actualización: 2026-07-16

Co-Founder, Rework.com
On this page
- De Modelos Más Grandes a un Pensamiento Más Largo
- Cómo "Pensar Más Tiempo" Mejora Realmente las Respuestas
- La Nueva Ley de Escalado
- Test-Time Compute vs. Train-Time Compute
- Costo y Latencia: las Disyuntivas
- Implicaciones de Negocio: Cuándo Tiene Sentido el Precio de los Reasoning Models
- Datos Clave
- Conceptos de IA Relacionados
- Recursos Externos