La era de la inferencia

Durante años, todo el mundo de la IA ha estado muy concentrado en entrenar modelos cada vez mejores y más grandes, pero hace unos meses Nvidia anunció una nueva línea de chips expresamente diseñados para manejar el otro lado de los modelos IA, o sea la inferencia.

El entrenamiento y la inferencia son tareas que tienen diferentes requerimientos. Mientras que el entrenamiento se realiza con enormes cantidades de datos simultáneamente pudiendo llevar mucho tiempo, incluso semanas, la inferencia debe responder a la necesidad del usuario en cuanto llega, lo que significa que la velocidad es un factor primordial.

Para responder a ese reto, existen diferentes empresas que han utilizado distintos criterios para aumentar la velocidad. Entre ellas, a finales de 2025, Nvidia seleccionó a “Groq” y algo menos de tres meses después, presentó su “Nvidia Groq 3LPU”.

El sistema empleado se basa en un concepto ya utilizado con anterioridad por otros en aplicaciones de supercomputación, y consistente en disponer una arquitectura IT interna que mejore el proceso por aproximación física de las memorias a las unidades de procesamiento (ver “Los rankings de supercomputación”). En este caso no sólo se aproximan las memorias a las unidades de procesamiento, sino que se intercalan entre ellas.

Para ello, en lugar de usar memorias de elevado ancho de banda (HBM) situadas en las proximidades de las GPUs la compañía ha optado por memorias estáticas de acceso random (SRAM) integradas en el propio procesador, con lo que se agiliza el flujo de datos a través del chip.

Este diseño simplificado y el uso de SRAM permiten un flujo de datos extraordinariamente rápido pudiendo alcanzar los niveles requeridos de latencia en aplicaciones de inferencia.

Pero Nvidia no es la única compañía trabajando en este terreno. El pasado mes de marzo AWS anunció el despliegue, en sus centros de datos, de un nuevo tipo de sistema para inferencia que, a diferencia del de Nvidia, separa el trabajo en dos funciones, la primera denominada “prefill” procesando la instrucción y la segunda, denominada “decode”, generando el resultado.

Seguiremos atentos a la evolución de esta carrera.

Ref. IEEE