InfiniBand: del SDR al XDR
Treinta años de una tecnología que casi nadie explica, y la decisión de arquitectura que le impone a usted
- InfiniBand no es 'una red más rápida'. Es una red en la que la tarjeta conversa con la memoria del otro nodo sin pasar por el sistema operativo, y es eso, no la velocidad, lo que cambia el resultado.
- La escalera de generaciones se duplica en cada salto: SDR 8 Gb/s hasta XDR 800 Gb/s por puerto (x4). El nombre de la generación (EDR, HDR, NDR, XDR) determina conector, cable y alcance.
- '1,6 Tb/s' casi nunca significa un puerto de 1,6 Tb/s. Entender esa diferencia evita el error de especificación más común del mercado.
- El cable es una decisión económica, no un detalle: cobre (DAC) hasta pocos metros, óptico activo (AOC) hasta decenas, transceptor y fibra para el resto.
- Cada generación acorta el alcance del cobre. Cuanto más rápido el clúster, antes se vuelve óptico, y eso cambia el costo por puerto antes de que usted compre la primera GPU.
- La pregunta correcta no es 'InfiniBand o Ethernet'. Es 'cuánto de mi carga es comunicación colectiva entre GPU'.
La pregunta de negocio
Usted va a aprobar un clúster de varios cientos de miles de dólares y, en algún momento de la planilla, aparece una línea llamada “interconexión” que cuesta entre el 15% y el 25% del total. Alguien va a decir que ahí se puede ahorrar.
Esa es una de las pocas líneas del presupuesto donde ahorrar destruye el activo entero. Este texto explica por qué, sin exigir que usted sea ingeniero de redes.
Lo que InfiniBand realmente hace
El problema que resuelve
En una red convencional, cuando un servidor envía datos a otro, los datos suben del disco o de la memoria hasta el sistema operativo, se copian a un área de trabajo del núcleo, se empaquetan, se entregan a la tarjeta de red, y el camino inverso ocurre del otro lado. Cada una de esas etapas cuesta tiempo y, peor, cuesta procesador, el mismo procesador que debería estar coordinando su cálculo.
Cuando el trabajo es una simulación o un entrenamiento distribuido, ese ciclo se repite millones de veces. Lo que era un detalle se vuelve el cuello de botella.
InfiniBand fue diseñado, desde el inicio, para eliminar ese camino. La tarjeta de red, llamada HCA (Host Channel Adapter), recibe permiso para leer y escribir directamente en la memoria del servidor remoto. El sistema operativo autoriza una vez, al comienzo, y después se aparta. Se llama RDMA (Remote Direct Memory Access): acceso directo a la memoria remota.
Dos consecuencias prácticas:
- La latencia se desploma, porque el camino es físicamente más corto.
- El procesador queda libre, porque la transferencia ocurre sin él. En una máquina con ocho GPU, eso significa que la CPU sigue alimentando las GPU en vez de gestionar paquetes.
Por qué esto importa más en IA que en cualquier otra carga
Entrenar un modelo grande en varias GPU exige que, en cada paso, todas las GPU intercambien y combinen sus resultados parciales. Es una operación colectiva: nadie avanza mientras el último no termine.
El efecto es implacable. Si las GPU pasan el 30% del tiempo esperando la red, usted compró un clúster y está usando el 70% de él, permanentemente, durante todos los años de vida del activo. Es lo mismo que pagar por ocho GPU y recibir cinco y media.
InfiniBand ataca esto por dos frentes: reduce el tiempo de cada intercambio y, en las generaciones recientes, ejecuta parte de la combinación dentro del propio conmutador, tecnología que NVIDIA llama SHARP. En vez de que todos los datos viajen hasta un nodo, se sumen y vuelvan, la suma ocurre en el camino.
Las tres garantías estructurales
Tres características, presentes desde la concepción, separan a InfiniBand de una red de oficina adaptada:
Red sin pérdida. En Ethernet clásico, si se congestiona, se descarta el paquete y se retransmite. InfiniBand usa control de flujo por crédito: el emisor solo transmite cuando el receptor ya garantizó espacio. El paquete no se descarta porque nunca se envía sin destino garantizado. En una operación colectiva, una sola retransmisión atrasa al grupo entero.
Gestión centralizada. Un componente llamado Subnet Manager ve la topología entera, calcula las rutas y las distribuye. La red es planificada, no descubierta, lo que vuelve el comportamiento previsible bajo carga.
Enrutamiento adaptativo. Cuando un camino se congestiona, el tráfico se desvía en tiempo real, sin esperar a que la capa de aplicación lo perciba.
Tabla canónica · Las generaciones InfiniBand
Cada generación duplica la tasa por lane. El ancho de enlace más común en clúster es x4, cuatro lanes agrupados en un puerto. Por eso “NDR” significa 400 Gb/s en la práctica, aunque el lane individual sea de 100 Gb/s.
| Generación | Año aprox. | Por lane | Codificación | Puerto x4 | Conector típico |
|---|---|---|---|---|---|
| SDR Single Data Rate | 2001 | 2,5 Gb/s | 8b/10b | 8 Gb/s útiles | CX4 |
| DDR Double | 2005 | 5 Gb/s | 8b/10b | 16 Gb/s útiles | CX4 · QSFP |
| QDR Quad | 2008 | 10 Gb/s | 8b/10b | 32 Gb/s útiles | QSFP |
| FDR Fourteen | 2011 | 14,0625 Gb/s | 64b/66b | ~54,5 Gb/s útiles (56 nominales) | QSFP+ |
| EDR Enhanced | 2014 | 25,78125 Gb/s | 64b/66b | 100 Gb/s | QSFP28 |
| HDR High | 2018–2020 | 50 Gb/s (PAM4) | 64b/66b | 200 Gb/s | QSFP56 |
| NDR Next | 2021–2022 | 100 Gb/s (PAM4) | n/d | 400 Gb/s | OSFP · QSFP112 |
| XDR eXtreme | 2024–2025 | 200 Gb/s (PAM4) | n/d | 800 Gb/s | OSFP224 |
| GDR · hoja de ruta | n/d | 400 Gb/s | n/d | 1,6 Tb/s | OSFP-XD |
Arraste para o lado para ver a tabela inteira.
Dos lecturas que la tabla esconde y que valen dinero:
La codificación no es un detalle. Hasta QDR, de cada 10 bits transmitidos, 2 eran sobrecarga de sincronismo, el 20% del enlace. Por eso QDR, anunciado como “40 Gb/s”, entrega 32. A partir de FDR, la codificación 64b/66b baja la sobrecarga a cerca del 3%. Si usted compara equipo antiguo con nuevo por el número del folleto, está comparando magnitudes diferentes.
PAM4 cambia la física. Hasta EDR, la señal era binaria: alta o baja. De HDR en adelante, cada símbolo carga cuatro niveles, dos bits por símbolo. Se duplica la tasa sin duplicar la frecuencia, pero los niveles quedan más próximos y la tolerancia al ruido cae. Consecuencia directa: corrección de error obligatoria (que agrega latencia) y menor alcance de cobre. La física es la razón por la cual su clúster nuevo necesita más fibra que el antiguo.
Latencia típica de punta a punta en NDR: [DATA TBC], a completar con medición propia o documentación NVIDIA citada; no publicar número de fabricante sin atribución.
El ecosistema que corre sobre InfiniBand
InfiniBand raramente aparece solo en la conversación. Estos son los nombres que usted va a oír y lo que significa cada uno:
| Término | Qué es | Por qué le importa a usted |
|---|---|---|
| RDMA / verbs | La interfaz de programación del acceso directo a la memoria remota | Es el cimiento. Todo lo demás depende de ella |
| GPUDirect RDMA | La GPU de un nodo escribe en la GPU de otro sin pasar por la memoria del sistema | Elimina dos copias del camino crítico del entrenamiento |
| GPUDirect Storage | La GPU lee del almacenamiento sin escala en la memoria del sistema | Decisivo cuando el cuello de botella es alimentar datos, no calcular |
| NVMe-oF NVMe over Fabrics | El protocolo de disco NVMe transportado por la red | Un disco en otro rack se comporta casi como local. Es la base del almacenamiento desagregado |
| SHARP | Agregación ejecutada dentro del conmutador | Reduce el tiempo de las operaciones colectivas, el cuello de botella del entrenamiento distribuido |
| MPI / UCX | La capa que usa la aplicación científica | Prácticamente todo código de HPC habla MPI; UCX hace el puente con el hardware |
| Subnet Manager (OpenSM, UFM) | El cerebro que calcula y distribuye las rutas | Sin él la red no levanta. Quien opera necesita saberlo |
| IPoIB | IP tradicional encapsulado sobre InfiniBand | Compatibilidad para herramientas heredadas. No lo use para el camino de alto rendimiento |
Arraste para o lado para ver a tabela inteira.
“NVMe over InfiniBand” es el nombre informal de la combinación NVMe-oF sobre RDMA sobre InfiniBand.
Las interfaces y los cables
Conectores
El conector cambia con la generación porque la física cambia. La regla práctica: QSFP fue la familia dominante de QDR a HDR; OSFP, mayor y con disipación térmica muy superior, se volvió necesaria en NDR; OSFP-XD es la respuesta para 1,6 Tb/s.
Un detalle que genera confusión real: en NDR, un cage OSFP de conmutador frecuentemente alberga dos puertos de 400 Gb/s. Un conmutador con 32 cages OSFP ofrece 64 puertos de 400 Gb/s. Contar cages en vez de puertos lleva a subdimensionar el conmutador a la mitad.
Los tres medios
| Medio | Alcance típico | Latencia | Costo relativo | Potencia | Cuándo usar |
|---|---|---|---|---|---|
| DAC · cobre pasivo | metros (se acorta en cada generación) | menor | bajo | ~cero | Dentro del rack, GPU a conmutador |
| ACC / AEC · cobre activo | extiende el alcance del cobre | baja | medio | baja | Rack adyacente, cuando DAC no alcanza |
| AOC · óptico activo | decenas de metros | baja | medio-alto | media | Entre racks, cableado flexible |
| Transceptor + fibra | centenas de metros a kilómetros | baja | alto (par de módulos) | mayor | Backbone, entre salas, campus |
Arraste para o lado para ver a tabela inteira.
La tendencia que decide el proyecto: en cada generación, el alcance útil del cobre se encoge. Lo que se resolvía con cobre barato en EDR exige cobre activo en HDR y óptica en NDR. El costo de interconexión por puerto sube más rápido que la tasa de transmisión, y eso necesita entrar en el presupuesto antes de la compra, no después.
En las variantes ópticas, el sufijo dice el alcance: SR corto en fibra multimodo, DR alrededor de medio kilómetro, FR algunos kilómetros, LR decenas.
La matemática que decide
Considere un clúster de 32 nodos con 8 GPU cada uno, 256 GPU, con costo de adquisición de GPU del orden de US$ 8M, número ilustrativo, sustitúyalo por el suyo.
Escenario A, ahorrar en la red. La interconexión se dimensiona por debajo de lo necesario. Las GPU quedan ociosas el 25% del tiempo esperando comunicación. Ahorro en la compra: digamos US$ 400K.
Escenario B, red dimensionada. La ociosidad cae al 8%.
La cuenta que importa:
- Diferencia de aprovechamiento: 17 puntos porcentuales sobre un activo de US$ 8M.
- Valor de GPU efectivamente perdido en el Escenario A: US$ 1,36M de capacidad que usted compró y no usa.
- A lo largo de 4 años de vida útil, el clúster subdimensionado entrega el trabajo de un clúster significativamente menor, mientras consume la misma energía, ocupa el mismo espacio y cuesta el mismo contrato de soporte.
Los US$ 400K ahorrados costaron US$ 1,36M de capacidad instalada. Y, a diferencia de casi todo error de especificación, este es irreversible sin cambiar el cableado y los adaptadores, es decir, sin detener el clúster.
Hay un segundo efecto, menos visible e igualmente caro: un clúster con mala comunicación no escala. Agregar nodos mejora poco, porque el costo de coordinación crece más rápido que la capacidad. Usted pierde no solo desempeño hoy, sino la opción de crecer mañana.
Este es el razonamiento detrás del principio de arquitectura que ARETE aplica: especificar la interconexión para la frontera, no para la carga de hoy. La red es el subsistema de vida más larga del clúster y el de cambio más caro. Los nodos de cálculo serán sustituidos dos o tres veces; el cableado estructurado, casi nunca.
Errores de especificación más comunes
1 · Confundir tasa nominal con tasa útil. “QDR 40 Gb/s” entrega 32. Es codificación 8b/10b, no marketing engañoso, pero quien compara generaciones por el folleto compara magnitudes diferentes.
2 · Leer “1,6 Tb/s” como un puerto de 1,6 Tb/s. En la abrumadora mayoría de los casos, el número se refiere a un módulo de puerto doble (2 × 800 Gb/s), a una capacidad agregada, o a la hoja de ruta futura (GDR). Pregunte siempre: ¿esto es por puerto, por cage, o agregado? La respuesta cambia el dimensionamiento del conmutador.
3 · Contar cages OSFP como si fueran puertos. En NDR, un cage comúnmente sirve dos puertos de 400 Gb/s. Errar aquí subdimensiona el conmutador en un 50%.
4 · Planificar cobre donde la generación ya exige óptica. El alcance del cobre se encoge en cada salto. Un layout de sala heredado de la generación anterior, reaprovechado sin revisión, se transforma en compra de emergencia de transceptores, en el peor momento, con el peor precio.
5 · Tratar la red como componente y no como cadena. Un adaptador rápido detrás de un conmutador subdimensionado entrega el desempeño del conmutador. Un conmutador excelente detrás de un cableado inadecuado entrega el desempeño del cable. La red es una cadena en serie: el resultado es el del eslabón más débil, y el eslabón más débil raramente es el componente que aparece en la propuesta.
Fuentes
- InfiniBand Architecture Specification infinibandta.org ↗ verificado el 19/07/2026
- InfiniBand Roadmap infinibandta.org ↗ verificado el 19/07/2026
- OSFP Multi-Source Agreement osfpmsa.org ↗ verificado el 19/07/2026
- NVIDIA Networking Documentation docs.nvidia.com ↗ verificado el 19/07/2026
- TOP500 · Interconnect Family Statistics top500.org ↗ verificado el 19/07/2026
Los valores específicos por producto deben verificarse en la documentación del fabricante correspondiente a la fecha de especificación. Este documento no sustituye la hoja de datos del equipo.