La inferencia de IA toma el relevo: el hardware se adapta al uso intensivo de modelos
Desde aproximadamente 2020, el ecosistema de la inteligencia artificial ha concentrado sus esfuerzos en el entrenamiento de modelos de lenguaje grandes (LLM) cada vez más sofisticados. Un ejemplo de esta progresión es el salto de GPT-3 de OpenAI, que en 2020 lograba una precisión del 43.9% en un popular índice de conocimiento y razonamiento, a GPT-4o en 2024, que alcanzó un 88.7%, equiparando el rendimiento de expertos humanos.
No obstante, la conversación actual en el ámbito de la IA se ha desplazado hacia la inferencia: la aplicación de estos modelos entrenados para generar texto, código o imágenes. Este giro, que se ha vuelto prominente alrededor de 2026, según un análisis de IEEE Spectrum, es impulsado por la creciente utilidad de los LLM, la emergencia de modelos de razonamiento que ejecutan inferencia múltiples veces, y el auge de la IA agentiva, que opera de forma autónoma y continua.
La inferencia, aunque distinta computacionalmente del entrenamiento, presenta sus propios desafíos. Su naturaleza autorregresiva implica que la generación de cada nuevo token depende de los anteriores, requiriendo un acceso constante a los pesos del modelo y al contexto acumulado. Esto crea un cuello de botella significativo, especialmente en la fase de decodificación, donde el modelo genera su respuesta token a token. Durante esta etapa, las unidades de procesamiento gráfico (GPU), como las Nvidia H100, pueden permanecer inactivas entre el 50% y el 80% del tiempo, esperando datos de memoria.
En respuesta a esta demanda, la industria explora diversas estrategias para optimizar el hardware. Compañías como d-Matrix y Majestic Labs se enfocan en la memoria. d-Matrix, con su acelerador Raptor, busca reducir la distancia entre cómputo y memoria apilando el acelerador de IA directamente sobre un dado DRAM. Por su parte, Majestic Labs mejora la interfaz de memoria para permitir conexiones más largas, utilizando DRAM estándar para soportar hasta 128 terabytes de memoria en un único rack, frente a los aproximadamente 20 TB de HBM3E del sistema GB300 NVL72 de Nvidia. La propia memoria de alto ancho de banda (HBM), con su versión HBM4 en producción, también busca duplicar el ancho de banda y la capacidad de memoria por pila, esperándose su integración en la GPU Vera Rubin de Nvidia en la segunda mitad de 2026.
Grandes actores como Nvidia y Amazon Web Services (AWS) adoptan un enfoque de sistemas híbridos. Nvidia, tras adquirir talento y propiedad intelectual de Groq en 2025, presentó en la GTC 2026 la unidad de procesamiento de lenguaje (LPU) Nvidia Groq 3. Esta LPU, diseñada con 500 megabytes de SRAM directamente en el chip, ofrece siete veces el ancho de banda de memoria de una GPU estándar, permitiendo a Nvidia combinar sus GPU Vera Rubin para la fase de prefill con la LPU Groq para la decodificación. AWS ha colaborado con Cerebras para integrar sus aceleradores Trainium con el Wafer-Scale Engine 3 (WSE-3) de Cerebras, un chip a escala de oblea con 44 gigabytes de SRAM en el mismo silicio. Esta configuración permite a AWS emplear Trainium para prefill y Cerebras para la decodificación, alcanzando velocidades notables; un WSE-3 de Cerebras ha sido utilizado por OpenAI para impulsar GPT-5.3-Codex-Spark, que supera los 1.000 tokens por segundo, en contraste con los 50 a 125 tokens por segundo del despliegue estándar de GPT-5.4.
Más allá del hardware, la optimización de software juega un papel crucial. Técnicas como la cuantificación permiten reducir la precisión numérica de los modelos (por ejemplo, a 4 bits) para ahorrar memoria y aumentar la eficiencia, con formatos como NVFP4 de Nvidia y el MXFP4, desarrollado con AMD, Intel y Qualcomm. Startups como Tensordyne exploran sistemas numéricos logarítmicos en su chip Napier para mejorar la eficiencia energética, mientras Etched diseña aceleradores que traducen directamente la arquitectura Transformer a silicio, logrando rendimientos excepcionales de hasta 500.000 tokens por segundo con Llama 70B de Meta en su chip Sohu, si bien a costa de la flexibilidad.
La diversidad de enfoques subraya una comprensión común: la necesidad de un sistema integral que combine distintos tipos de chips. La demanda de inferencia de IA se percibe como insaciable, con proyecciones de un crecimiento continuo, similar a la evolución diversificada de la unidad central de procesamiento (CPU) a lo largo de décadas.
Datos clave
| Rendimiento LLM (GPT-3 2020) | 43.9% de precisión |
|---|---|
| Rendimiento LLM (GPT-4o 2024) | 88.7% de precisión |
| Inactividad de GPU en inferencia (Nvidia H100) | 50-80% |
| Capacidad de memoria de rack (Majestic Labs) | 128 TB |
| Capacidad de memoria de rack (Nvidia GB300 NVL72) | ~20 TB |
| Ancho de banda de memoria LPU (Nvidia Groq 3) | 7 veces superior |
| Velocidad de inferencia (GPT-5.3-Codex-Spark con Cerebras WSE-3) | >1.000 tokens/segundo |
| Velocidad de inferencia (GPT-5.4 estándar) | 50-125 tokens/segundo |
| Velocidad de inferencia (Etched Sohu con Llama 70B) | 500.000 tokens/segundo |
Fuente original: IEEE Spectrum







