Entrada 101
Economía de la Inferencia: Cómo el Cambio de Entrenamiento a Inferencia lo Cambia Todo
La industria de la IA está pasando de una fase dominada por el entrenamiento (donde el mayor gasto va a entrenar nuevos modelos) a una fase dominada por la inferencia (donde el mayor gasto va a ejecutar modelos para usuarios a gran escala). Este cambio transforma fundamentalmente el perfil de demanda de semiconductores: el entrenamiento favorece GPUs masivas con máximo cómputo y ancho de banda de memoria, mientras que la inferencia favorece la eficiencia, el rendimiento por vatio y el costo por consulta. Las empresas que ganan la fase de entrenamiento (NVIDIA) pueden no ser las mismas que dominen la inferencia. Los ASIC personalizados (Google TPU, AWS Trainium), las arquitecturas optimizadas para inferencia (Groq, Cerebras) y los chips de inferencia en el borde (edge) (Qualcomm, MediaTek) ganan relevancia.
Traducido automáticamente del original en inglés. Leer el original en inglés →
Entrenamiento vs. Inferencia: Economías Diferentes
El entrenamiento es un costo fijo: se entrena un modelo una vez (o se reentrena periódicamente) usando clústeres masivos de GPU. La economía favorece la potencia de cómputo bruta — quien tenga más FLOPs gana. Este es el dominio de NVIDIA: A100, H100, B200 están todas optimizadas para el rendimiento de entrenamiento.
La inferencia es un costo variable: cada consulta de usuario, cada llamada a la API, cada acción de un agente requiere cómputo de inferencia. A medida que la adopción de la IA escala, el volumen de inferencia crece exponencialmente mientras el entrenamiento se mantiene relativamente plano. La economía cambia de "máximo cómputo" a "mínimo costo por consulta" y "máximo rendimiento por vatio".
Esta distinción importa enormemente para los inversores. En un mundo dominado por el entrenamiento, se compra NVIDIA y la cadena de suministro de NVIDIA. En un mundo dominado por la inferencia, el panorama competitivo se fragmenta y la cadena de valor se desplaza.
Quién se Beneficia del Cambio hacia la Inferencia
Los ASIC personalizados ganan participación porque los hyperscalers (Google, Amazon, Microsoft) pueden diseñar chips optimizados para sus cargas de trabajo de inferencia específicas a un costo por consulta menor que las GPUs de propósito general. El TPU v5 de Google, el Trainium2 de AWS y el MTIA de Meta están todos enfocados en inferencia.
NVIDIA se adapta lanzando configuraciones optimizadas para inferencia (L40S, H100 NVL) e impulsando fosos de software (TensorRT-LLM, Triton). NVIDIA no perderá la inferencia por completo — pero su cuota de mercado será menor que en entrenamiento.
La inferencia en el borde (edge) se vuelve relevante a medida que los modelos se reducen lo suficiente para ejecutarse en el dispositivo. Qualcomm, MediaTek y el silicio personalizado de Apple se benefician de ejecutar IA localmente en lugar de en la nube.
Qué Significa Esto para el Functional Index
Closelook rastrea la proporción entrenamiento-inferencia a través de la capa Compute del Functional Index. A medida que la inferencia domina, el peso de las empresas de ASIC personalizados y enfocadas en inferencia aumenta en relación con las apuestas de GPU pura. El índice se adapta para reflejar este cambio estructural.