Pasillo de centro de datos en luz azul, con racks de conmutadores y haces ordenados de cables ópticos amarillos y cables de cobre negros
HN · nivel fundamento

InfiniBand: del SDR al XDR

Treinta años de una tecnología que casi nadie explica, y la decisión de arquitectura que le impone a usted

actualizado el 22/08/2026 · versión v1.2 · revisión prevista 22/02/2027
Respuesta en 60 segundos
  • InfiniBand no es 'una red más rápida'. Es una red en la que la tarjeta conversa con la memoria del otro nodo sin pasar por el sistema operativo, y es eso, no la velocidad, lo que cambia el resultado.
  • La escalera de generaciones se duplica en cada salto: SDR 8 Gb/s hasta XDR 800 Gb/s por puerto (x4). El nombre de la generación (EDR, HDR, NDR, XDR) determina conector, cable y alcance.
  • '1,6 Tb/s' casi nunca significa un puerto de 1,6 Tb/s. Entender esa diferencia evita el error de especificación más común del mercado.
  • El cable es una decisión económica, no un detalle: cobre (DAC) hasta pocos metros, óptico activo (AOC) hasta decenas, transceptor y fibra para el resto.
  • Cada generación acorta el alcance del cobre. Cuanto más rápido el clúster, antes se vuelve óptico, y eso cambia el costo por puerto antes de que usted compre la primera GPU.
  • La pregunta correcta no es 'InfiniBand o Ethernet'. Es 'cuánto de mi carga es comunicación colectiva entre GPU'.

La pregunta de negocio

Usted va a aprobar un clúster de varios cientos de miles de dólares y, en algún momento de la planilla, aparece una línea llamada “interconexión” que cuesta entre el 15% y el 25% del total. Alguien va a decir que ahí se puede ahorrar.

Esa es una de las pocas líneas del presupuesto donde ahorrar destruye el activo entero. Este texto explica por qué, sin exigir que usted sea ingeniero de redes.

Lo que InfiniBand realmente hace

El problema que resuelve

En una red convencional, cuando un servidor envía datos a otro, los datos suben del disco o de la memoria hasta el sistema operativo, se copian a un área de trabajo del núcleo, se empaquetan, se entregan a la tarjeta de red, y el camino inverso ocurre del otro lado. Cada una de esas etapas cuesta tiempo y, peor, cuesta procesador, el mismo procesador que debería estar coordinando su cálculo.

Cuando el trabajo es una simulación o un entrenamiento distribuido, ese ciclo se repite millones de veces. Lo que era un detalle se vuelve el cuello de botella.

InfiniBand fue diseñado, desde el inicio, para eliminar ese camino. La tarjeta de red, llamada HCA (Host Channel Adapter), recibe permiso para leer y escribir directamente en la memoria del servidor remoto. El sistema operativo autoriza una vez, al comienzo, y después se aparta. Se llama RDMA (Remote Direct Memory Access): acceso directo a la memoria remota.

Dos consecuencias prácticas:

  • La latencia se desploma, porque el camino es físicamente más corto.
  • El procesador queda libre, porque la transferencia ocurre sin él. En una máquina con ocho GPU, eso significa que la CPU sigue alimentando las GPU en vez de gestionar paquetes.

Por qué esto importa más en IA que en cualquier otra carga

Entrenar un modelo grande en varias GPU exige que, en cada paso, todas las GPU intercambien y combinen sus resultados parciales. Es una operación colectiva: nadie avanza mientras el último no termine.

El efecto es implacable. Si las GPU pasan el 30% del tiempo esperando la red, usted compró un clúster y está usando el 70% de él, permanentemente, durante todos los años de vida del activo. Es lo mismo que pagar por ocho GPU y recibir cinco y media.

InfiniBand ataca esto por dos frentes: reduce el tiempo de cada intercambio y, en las generaciones recientes, ejecuta parte de la combinación dentro del propio conmutador, tecnología que NVIDIA llama SHARP. En vez de que todos los datos viajen hasta un nodo, se sumen y vuelvan, la suma ocurre en el camino.

Las tres garantías estructurales

Tres características, presentes desde la concepción, separan a InfiniBand de una red de oficina adaptada:

Red sin pérdida. En Ethernet clásico, si se congestiona, se descarta el paquete y se retransmite. InfiniBand usa control de flujo por crédito: el emisor solo transmite cuando el receptor ya garantizó espacio. El paquete no se descarta porque nunca se envía sin destino garantizado. En una operación colectiva, una sola retransmisión atrasa al grupo entero.

Gestión centralizada. Un componente llamado Subnet Manager ve la topología entera, calcula las rutas y las distribuye. La red es planificada, no descubierta, lo que vuelve el comportamiento previsible bajo carga.

Enrutamiento adaptativo. Cuando un camino se congestiona, el tráfico se desvía en tiempo real, sin esperar a que la capa de aplicación lo perciba.

Tabla canónica · Las generaciones InfiniBand

Cada generación duplica la tasa por lane. El ancho de enlace más común en clúster es x4, cuatro lanes agrupados en un puerto. Por eso “NDR” significa 400 Gb/s en la práctica, aunque el lane individual sea de 100 Gb/s.

GeneraciónAño aprox.Por laneCodificaciónPuerto x4Conector típico
SDR Single Data Rate20012,5 Gb/s8b/10b8 Gb/s útilesCX4
DDR Double20055 Gb/s8b/10b16 Gb/s útilesCX4 · QSFP
QDR Quad200810 Gb/s8b/10b32 Gb/s útilesQSFP
FDR Fourteen201114,0625 Gb/s64b/66b~54,5 Gb/s útiles (56 nominales)QSFP+
EDR Enhanced201425,78125 Gb/s64b/66b100 Gb/sQSFP28
HDR High2018–202050 Gb/s (PAM4)64b/66b200 Gb/sQSFP56
NDR Next2021–2022100 Gb/s (PAM4)n/d400 Gb/sOSFP · QSFP112
XDR eXtreme2024–2025200 Gb/s (PAM4)n/d800 Gb/sOSFP224
GDR · hoja de rutan/d400 Gb/sn/d1,6 Tb/sOSFP-XD

Arraste para o lado para ver a tabela inteira.

Dos lecturas que la tabla esconde y que valen dinero:

La codificación no es un detalle. Hasta QDR, de cada 10 bits transmitidos, 2 eran sobrecarga de sincronismo, el 20% del enlace. Por eso QDR, anunciado como “40 Gb/s”, entrega 32. A partir de FDR, la codificación 64b/66b baja la sobrecarga a cerca del 3%. Si usted compara equipo antiguo con nuevo por el número del folleto, está comparando magnitudes diferentes.

PAM4 cambia la física. Hasta EDR, la señal era binaria: alta o baja. De HDR en adelante, cada símbolo carga cuatro niveles, dos bits por símbolo. Se duplica la tasa sin duplicar la frecuencia, pero los niveles quedan más próximos y la tolerancia al ruido cae. Consecuencia directa: corrección de error obligatoria (que agrega latencia) y menor alcance de cobre. La física es la razón por la cual su clúster nuevo necesita más fibra que el antiguo.

Latencia típica de punta a punta en NDR: [DATA TBC], a completar con medición propia o documentación NVIDIA citada; no publicar número de fabricante sin atribución.

El ecosistema que corre sobre InfiniBand

InfiniBand raramente aparece solo en la conversación. Estos son los nombres que usted va a oír y lo que significa cada uno:

TérminoQué esPor qué le importa a usted
RDMA / verbsLa interfaz de programación del acceso directo a la memoria remotaEs el cimiento. Todo lo demás depende de ella
GPUDirect RDMALa GPU de un nodo escribe en la GPU de otro sin pasar por la memoria del sistemaElimina dos copias del camino crítico del entrenamiento
GPUDirect StorageLa GPU lee del almacenamiento sin escala en la memoria del sistemaDecisivo cuando el cuello de botella es alimentar datos, no calcular
NVMe-oF NVMe over FabricsEl protocolo de disco NVMe transportado por la redUn disco en otro rack se comporta casi como local. Es la base del almacenamiento desagregado
SHARPAgregación ejecutada dentro del conmutadorReduce el tiempo de las operaciones colectivas, el cuello de botella del entrenamiento distribuido
MPI / UCXLa capa que usa la aplicación científicaPrácticamente todo código de HPC habla MPI; UCX hace el puente con el hardware
Subnet Manager (OpenSM, UFM)El cerebro que calcula y distribuye las rutasSin él la red no levanta. Quien opera necesita saberlo
IPoIBIP tradicional encapsulado sobre InfiniBandCompatibilidad para herramientas heredadas. No lo use para el camino de alto rendimiento

Arraste para o lado para ver a tabela inteira.

“NVMe over InfiniBand” es el nombre informal de la combinación NVMe-oF sobre RDMA sobre InfiniBand.

Las interfaces y los cables

Conectores

El conector cambia con la generación porque la física cambia. La regla práctica: QSFP fue la familia dominante de QDR a HDR; OSFP, mayor y con disipación térmica muy superior, se volvió necesaria en NDR; OSFP-XD es la respuesta para 1,6 Tb/s.

Nueve conectores lado a lado, del CX4 al OSFP-XD, en orden creciente de tamaño y de tasa por puerto
La física obliga al formato a cambiar. Del CX4 de los primeros años al OSFP-XD de 1,6 Tb/s, cada salto de generación pidió más lanes y más área de disipación. Por eso el conector del clúster nuevo no entra en el conmutador antiguo.

Un detalle que genera confusión real: en NDR, un cage OSFP de conmutador frecuentemente alberga dos puertos de 400 Gb/s. Un conmutador con 32 cages OSFP ofrece 64 puertos de 400 Gb/s. Contar cages en vez de puertos lleva a subdimensionar el conmutador a la mitad.

Comparación frontal entre un QSFP de fila única con cuatro lanes y un OSFP de fila doble con ocho lanes, y abajo un cable de derivación que divide 800G en dos enlaces de 400G
El cage OSFP tiene dos bancos de 400G. Esa fila doble es lo que permite a un cage servir dos puertos, y es exactamente por eso que contar cages en vez de puertos subdimensiona el conmutador a la mitad.

Los tres medios

Cuatro medios de interconexión lado a lado: cobre pasivo, cobre activo, óptico activo y transceptor con fibra
Los cuatro medios en el orden en que crece el alcance, y el costo por puerto acompaña. Elegir entre ellos es una decisión económica antes que técnica.
MedioAlcance típicoLatenciaCosto relativoPotenciaCuándo usar
DAC · cobre pasivometros (se acorta en cada generación)menorbajo~ceroDentro del rack, GPU a conmutador
ACC / AEC · cobre activoextiende el alcance del cobrebajamediobajaRack adyacente, cuando DAC no alcanza
AOC · óptico activodecenas de metrosbajamedio-altomediaEntre racks, cableado flexible
Transceptor + fibracentenas de metros a kilómetrosbajaalto (par de módulos)mayorBackbone, entre salas, campus

Arraste para o lado para ver a tabela inteira.

La tendencia que decide el proyecto: en cada generación, el alcance útil del cobre se encoge. Lo que se resolvía con cobre barato en EDR exige cobre activo en HDR y óptica en NDR. El costo de interconexión por puerto sube más rápido que la tasa de transmisión, y eso necesita entrar en el presupuesto antes de la compra, no después.

En las variantes ópticas, el sufijo dice el alcance: SR corto en fibra multimodo, DR alrededor de medio kilómetro, FR algunos kilómetros, LR decenas.

Diagrama de un Quantum-2 QM9700 con 32 cages OSFP twin-port: diez cages ocupados, cada uno por un cable splitter que se abre en dos legs de 400G NDR, llegando a veinte puertos numerados de un nodo B300, un nodo H200, un nodo de almacenamiento y un H200 NVL
El mismo conmutador, cable a cable. Diez cages ocupados y diez cables producen veinte enlaces, porque todo cable es splitter: cage, cable y enlace dan tres números diferentes, y la propuesta debe decir cuál está cotizando. El grupo en oro es el del B300, cuyos puertos ConnectX-8 son capaces de 800G XDR y operan aquí a 400G, porque la retrocompatibilidad vive en el silicio de las dos puntas y este conmutador es NDR.

La matemática que decide

Considere un clúster de 32 nodos con 8 GPU cada uno, 256 GPU, con costo de adquisición de GPU del orden de US$ 8M, número ilustrativo, sustitúyalo por el suyo.

Escenario A, ahorrar en la red. La interconexión se dimensiona por debajo de lo necesario. Las GPU quedan ociosas el 25% del tiempo esperando comunicación. Ahorro en la compra: digamos US$ 400K.

Escenario B, red dimensionada. La ociosidad cae al 8%.

La cuenta que importa:

  • Diferencia de aprovechamiento: 17 puntos porcentuales sobre un activo de US$ 8M.
  • Valor de GPU efectivamente perdido en el Escenario A: US$ 1,36M de capacidad que usted compró y no usa.
  • A lo largo de 4 años de vida útil, el clúster subdimensionado entrega el trabajo de un clúster significativamente menor, mientras consume la misma energía, ocupa el mismo espacio y cuesta el mismo contrato de soporte.

Los US$ 400K ahorrados costaron US$ 1,36M de capacidad instalada. Y, a diferencia de casi todo error de especificación, este es irreversible sin cambiar el cableado y los adaptadores, es decir, sin detener el clúster.

Hay un segundo efecto, menos visible e igualmente caro: un clúster con mala comunicación no escala. Agregar nodos mejora poco, porque el costo de coordinación crece más rápido que la capacidad. Usted pierde no solo desempeño hoy, sino la opción de crecer mañana.

Este es el razonamiento detrás del principio de arquitectura que ARETE aplica: especificar la interconexión para la frontera, no para la carga de hoy. La red es el subsistema de vida más larga del clúster y el de cambio más caro. Los nodos de cálculo serán sustituidos dos o tres veces; el cableado estructurado, casi nunca.

Errores de especificación más comunes

1 · Confundir tasa nominal con tasa útil. “QDR 40 Gb/s” entrega 32. Es codificación 8b/10b, no marketing engañoso, pero quien compara generaciones por el folleto compara magnitudes diferentes.

2 · Leer “1,6 Tb/s” como un puerto de 1,6 Tb/s. En la abrumadora mayoría de los casos, el número se refiere a un módulo de puerto doble (2 × 800 Gb/s), a una capacidad agregada, o a la hoja de ruta futura (GDR). Pregunte siempre: ¿esto es por puerto, por cage, o agregado? La respuesta cambia el dimensionamiento del conmutador.

3 · Contar cages OSFP como si fueran puertos. En NDR, un cage comúnmente sirve dos puertos de 400 Gb/s. Errar aquí subdimensiona el conmutador en un 50%.

4 · Planificar cobre donde la generación ya exige óptica. El alcance del cobre se encoge en cada salto. Un layout de sala heredado de la generación anterior, reaprovechado sin revisión, se transforma en compra de emergencia de transceptores, en el peor momento, con el peor precio.

5 · Tratar la red como componente y no como cadena. Un adaptador rápido detrás de un conmutador subdimensionado entrega el desempeño del conmutador. Un conmutador excelente detrás de un cableado inadecuado entrega el desempeño del cable. La red es una cadena en serie: el resultado es el del eslabón más débil, y el eslabón más débil raramente es el componente que aparece en la propuesta.

REFERENCIAS

Fuentes

  1. InfiniBand Architecture Specification InfiniBand Trade Association (IBTA) norma infinibandta.org ↗ verificado el 19/07/2026
  2. InfiniBand Roadmap InfiniBand Trade Association (IBTA) norma infinibandta.org ↗ verificado el 19/07/2026
  3. OSFP Multi-Source Agreement OSFP MSA norma osfpmsa.org ↗ verificado el 19/07/2026
  4. NVIDIA Networking Documentation NVIDIA fabricante docs.nvidia.com ↗ verificado el 19/07/2026
  5. TOP500 · Interconnect Family Statistics TOP500.org académica top500.org ↗ verificado el 19/07/2026

Los valores específicos por producto deben verificarse en la documentación del fabricante correspondiente a la fecha de especificación. Este documento no sustituye la hoja de datos del equipo.