Astratto
Con il rapido progresso dell’intelligenza artificiale (AI), le reti tradizionali dei data center si trovano ad affrontare sfide importanti quando trasportano il traffico AI. L'utilizzo elevato della larghezza di banda e un numero ridotto di flussi Elephant possono rendere inefficace il tradizionale bilanciamento del carico per-flusso, con conseguente congestione e perdita di pacchetti che aumentano significativamente i tempi di addestramento del modello AI e di completamento del lavoro. Questo white paper esamina una tecnologia di routing intelligente e dinamica che combina la consapevolezza in tempo reale- con un processo decisionale-intelligente. Utilizza la misurazione della qualità del percorso-, la sincronizzazione degli attributi-estesi BGP, il multipath a costi-ponderati dinamici (WCMP), la rimozione-del percorso anomala e
Bilanciamento automatico del carico (ALB) a livello di flowlet- per migliorare la pianificazione del traffico negli ambienti AI. Il progetto utilizza inoltre la virtualizzazione per fornire isolamento multi-tenant e offre scenari applicativi e indicazioni di pianificazione per reti di data center AI efficienti, stabili e intelligenti.
Introduzione: Evoluzione della rete nell'intelligenza artificiale Epoca
Perché le reti tradizionali hanno difficoltà con l’intelligenza artificiale Traffico
Nelle reti di data center tradizionali, un gran numero di piccoli flussi consente il bilanciamento del carico per-flusso per ottenere una distribuzione accettabile ed evitare la congestione anche senza la consapevolezza-in tempo reale delle condizioni della rete. Il traffico AI è molto diverso: l’utilizzo della larghezza di banda è estremamente elevato e il traffico è spesso dominato solo da pochi flussi di elefanti. Le collisioni di hash possono quindi posizionare più flussi di grandi dimensioni sullo stesso percorso mentre altri percorsi rimangono sottoutilizzati. Una volta che si verifica la perdita di pacchetti, il tempo di completamento dell’intero carico di lavoro AI può aumentare in modo significativo. Per questo motivo, il settore si concentra sempre più su algoritmi di bilanciamento del carico-ottimizzati per i tessuti AI in modo che il traffico venga distribuito in modo più uniforme su più percorsi .

Figura 1. Confronto tra il traffico a flusso-elefante AI e il traffico a flusso-tradizionale tradizionale.
Combinare consapevolezza dinamica e processo decisionale-intelligente
Il routing intelligente dinamico è una tecnologia di bilanciamento del carico-basata sulla consapevolezza. Utilizza la qualità del percorso rilevata dagli interruttori nella struttura per regolare la selezione del percorso locale e supporta il bilanciamento del carico ponderato dinamicamente. Basata su BGP, la tecnologia definisce un nuovo attributo di comunità-esteso.
Per valutare la qualità del percorso vengono utilizzate misurazioni multi-dimensionali e ad alta-precisione e il risultato viene propagato tramite BGP per guidare il successivo inoltro del traffico. Ciò migliora la distribuzione del carico su tutta la rete-e riduce i tempi di risposta delle applicazioni [1].

Figura 2. Flusso di lavoro dinamico di consapevolezza, decisione ed esecuzione.
Tecnologie principali: pianificazione intelligente del traffico
Gli approcci tradizionali al bilanciamento del carico della rete-includono:
- ECMP per-flusso: l'approccio più comune, basato su un hash di cinque-tuple. Funziona bene quando ci sono molti flussi e preserva l'ordine dei pacchetti, ma le collisioni di hash possono produrre uno scarso bilanciamento quando i conteggi dei flussi sono bassi, come nell'addestramento dell'IA [1].
- Bilanciamento basato sul flusso-: dipende dalla corretta configurazione del divario tra il flusso-. Una configurazione accurata è difficile quando la latenza a livello del percorso globale-è sconosciuta [1].
- ECMP per-pacchetto: fornisce un eccellente equilibrio teorico ma può creare un ampio riordino dei pacchetti presso il destinatario [1].
L'approccio di routing intelligente e dinamico utilizzato dagli switch RoCE XingRongyuan CX-serie N (basati su SONiC-) combina il bilanciamento basato su ECMP per-flusso e Flowlet-. Introduce il WCMP dinamico (Weighted Cost Multipath) e l'ALB (Auto Load Balancing) basato su Flowlet-[1].
Misurazione della qualità del percorso
Il sistema valuta la qualità del percorso di rete utilizzando fattori che incidono fortemente sui tessuti dei cluster AI, tra cui l'utilizzo della larghezza di banda, l'utilizzo delle code e la latenza di inoltro.
Contatori statistici
La larghezza di banda e l'utilizzo della coda vengono misurati tramite contatori hardware ASIC con una precisione a livello di cento-millisecondi. L'ASIC registra i contatori di port{2}}inoltro e coda-inoltro in tempo reale. Il piano di controllo SONiC legge i contatori attraverso l'interfaccia SAI con una precisione inferiore al-secondo e li archivia in Redis. Il processo di controllo del routing- valuta la qualità dell'interfaccia utilizzando questi contatori e pubblicizza il risultato tramite BGP. Per limitare il-carico del piano di controllo, gli annunci vengono attualmente inviati a intervalli di secondo-livello, con una media ponderata applicata a più campioni; i campioni più recenti ricevono un peso maggiore.
Telemetria in-banda
La misurazione del ritardo-di inoltro si basa su INT (In-band Network Telemetry) e può raggiungere una precisione a livello di nanosecondi-. HDC (High Delay Capture) cattura i pacchetti che presentano un'elevata latenza all'interno dell'ASIC. Quando un pacchetto supera una soglia di ritardo definita dall'utente-, lo switch invia i primi 150 byte del pacchetto originale insieme ai metadati, inclusa la porta di ingresso, la porta di uscita e la latenza, a un raccoglitore. In questo progetto, la CPU funge da raccoglitore e analizzatore HDC, consentendo misurazioni del ritardo di inoltro ad alta precisione--e una valutazione più accurata della qualità del percorso-.

Figura 3. Propagazione della qualità del percorso-e installazione WCMP.
La tecnologia utilizza un nuovo attributo della comunità estesa-BGP, la comunità estesa della larghezza di banda del percorso, per indicare la qualità aggregata di un percorso verso una destinazione. Il byte di ordine-alto del campo di tipo-esteso è 0x00 e il byte di ordine-basso è 0x05. Nel campo del valore, il sottocampo dell'amministratore globale rappresenta il numero AS. La qualità del percorso è codificata in quattro byte utilizzando il formato a virgola mobile IEEE- ed espressa in GB/s .
Quando NIC1 comunica con NIC2, NIC2 pubblicizza innanzitutto il proprio indirizzo IP su Leaf2. Leaf2 pubblicizza l'indirizzo alla Spine insieme al valore di qualità del collegamento-verso NIC2 moltiplicato per il peso del downlink Leaf2. Il Dorso aggiunge la propria qualità di collegamento ponderata e passa il valore accumulato a Foglia1. Leaf1 riassume la qualità del percorso e installa i percorsi che guidano l'inoltro. In un tessuto Leaf-Spine a due livelli, le porte sono classificate come uplink Leaf, downlink Leaf e porte Spine, con coefficienti di calcolo configurabili per ciascuna classe.
WCMP dinamico
Il bilanciamento del carico distribuisce il traffico su più collegamenti. Negli ambienti AI, questo è essenziale per costruire una struttura Ethernet senza perdite con perdita di pacchetti, latenza e degrado del throughput minimi. ECMP è il meccanismo convenzionale nei data center. WCMP estende l'ECMP mediante la distribuzione
traffico proporzionale tra i collegamenti. Nel routing intelligente dinamico, i pesi WCMP vengono adeguati in tempo reale in base alla qualità del percorso. Ad esempio, se esistono due percorsi tra NIC1 e NIC2, il sistema potrebbe calcolare un rapporto 3:7. Man mano che il traffico cambia, le informazioni aggiornate sulla qualità del percorso- vengono propagate tramite BGP a ogni switch Leaf, dove vengono generati percorsi WCMP dinamici per guidare l'inoltro.
Rimozione del percorso anomalo
Quando la qualità aggregata di un percorso scende al di sotto di una soglia concordata, il percorso viene considerato inutilizzabile per il carico di lavoro AI e viene rimosso dall'inoltro. I restanti percorsi continuano a trasportare il traffico attraverso il WCMP dinamico. Una volta che il percorso ritorna alla normalità, viene ripristinato. Sebbene ciò possa lasciare temporaneamente una parte della capacità inutilizzata, impedisce congestioni e perdite di pacchetti più gravi [1].
Bilanciamento del carico intelligente (ALB)
ALB fornisce la distribuzione del carico basata su Flowlet-. L'ASIC misura il carico e la latenza su diverse porte in tempo reale e indirizza ciascun Flowlet al collegamento con carico inferiore o ritardo inferiore. Ciò aggiunge una pianificazione-granulare più precisa al tradizionale ECMP. ALB supporta anche il failover delle porte e ridistribuisce automaticamente il traffico quando un collegamento in uscita fallisce [1].
Virtualizzazione
Le reti front-end spesso necessitano di supporto multi-tenant in modo che diverse risorse GPU possano essere allocate a utenti diversi. La soluzione utilizza VRF (Virtual Routing and Forwarding) per isolare i tenant, con un VRF assegnato a ciascun utente. Le sottoreti correlate alla GPU-vengono inserite nel VRF dell'utente e gli ACL PRE nell'ASIC classificano il traffico in entrata in modo che il traffico di ciascun utente venga inoltrato solo all'interno del VRF corrispondente [1].
Scenari applicativi
1.Come il WCMP dinamico assorbe i picchi di traffico
Per una struttura con porte GPU da 256 x 400 G, è possibile progettare un'architettura Clos a due-tier con un rapporto di convergenza downlink 1:1-a-uplink per mantenere un throughput elevato, una larghezza di banda elevata e una capacità simmetrica. I modelli di prodotto idonei includono XingRongyuan CX864E-N o CX732Q-N [1]. Con l'ECMP convenzionale, un piccolo numero di flussi di elefanti IA può eseguire l'hash sulla stessa spina dorsale, causando congestione dell'uplink o perdita di pacchetti. Il WCMP dinamico regola continuamente la distribuzione del traffico in base alla qualità del percorso in tempo reale-, riducendo i picchi di traffico ed evitando la congestione [1].
2.Flowlet-Bilanciamento del carico a livello
Nella stessa struttura GPU da 256 x 400 G, non tutti i dispositivi o carichi di lavoro sono serviti al meglio da WCMP dinamico. Lo switch può selezionare dinamicamente l'ALB basato su Flowlet-. ALB misura il carico e la latenza dei collegamenti nel gruppo ECMP e invia Flowlet ai collegamenti con utilizzo o ritardo inferiori. Se un'interfaccia si sovraccarica o il ritardo di inoltro aumenta, l'ASIC evita automaticamente tale uscita finché le condizioni non tornano alla normalità [1].
Pianificazione e progettazione di reti AI
I servizi di intelligenza artificiale generalmente comprendono tre fasi: raccolta e preelaborazione dei dati, addestramento del modello e inferenza dell'intelligenza artificiale. Ogni fase impone requisiti diversi alla rete.
1.Raccolta e preelaborazione dei dati
Una rete globale di raccolta dati e pre-elaborazione di formazione- deve fornire risorse di larghezza di banda e IP pubblici su larga scala ed elastiche in modo che enormi set di dati grezzi possano essere raccolti in modo efficiente dall'Internet globale. La progettazione deve garantire una trasmissione sicura e stabile, migliorando al tempo stesso l'aggregazione dei dati e le prestazioni di preelaborazione [2].
1.1 Segmentazione VPC
La progettazione VPC per la raccolta dati basata sul cloud- deve seguire i principi di-privilegio minimo, isolamento a più livelli, controllo di sicurezza e scalabilità elastica. È possibile utilizzare più VPC o più sottoreti all'interno di un singolo VPC [2].
- Segmento per fase del servizio: distribuisci la raccolta dei dati, la preelaborazione, l'archiviazione, l'addestramento e l'inferenza in sottoreti o VPC separati. Posizionare i punti di ingresso della raccolta in un VPC DMZ o in una sottorete pubblica; posizionare i dati temporanei e di preelaborazione in un VPC di elaborazione dedicato; colloca i dati grezzi sensibili e la formazione sull'AI in un VPC ad alta-sicurezza senza accesso pubblico diretto.
- Isola per livello di sicurezza: crea VPC o sottoreti ad alta-, media- e bassa-sicurezza e utilizza gruppi di sicurezza, ACL di rete e connettività privata per controllare il traffico tra-VPC e tra-sottoreti.
- Isola per tenant o progetto: assegna VPC separati a tenant o progetti diversi per isolare risorse, reti e dati.
1.2 Rete di uscita della raccolta dati
Gateway NAT: utilizza un pool di EIP e SNAT tramite un gateway NAT, consentendo ai programmi di raccolta di accedere a Internet da indirizzi IP pubblici selezionati casualmente.
Proxy auto-costruito: distribuisci server proxy che mantengono le mappature tra i processi di raccolta e gli indirizzi IP pubblici e distribuiscono una singola richiesta di raccolta su più proxy.
Fornitore di servizi IP: connettiti a un fornitore di servizi IP sulla rete privata cloud per costi inferiori, sicurezza controllata e qualità stabile [2].
1.3 Aggregazione e preelaborazione dei dati tra-regioni
Seleziona la regione OSS in base al-piano cluster di preelaborazione e crea un VPC-di aggregazione dei dati nella stessa regione. Crea un router di transito (TR) in ciascuna regione, connetti i VPC locali e interconnetti i TR in modo che i VPC di raccolta regionali possano accedere direttamente all'OSS centrale. Servizi come PAI-iTAG, MaxCompute e Flink possono quindi eseguire l'etichettatura e la preelaborazione dei dati nella regione OSS [2].
2. Rete di formazione modello
La rete di addestramento del modello- è strettamente integrata con la rete di raccolta e preelaborazione per formare un tessuto globale che collega data center cloud, nodi edge e IDC on-premise.
L'interconnessione ad alta-velocità fornisce bassa-latenza e elevato-throughput di movimento dei dati, mentre la larghezza di banda, le policy di sicurezza, i controlli di accesso e il ripristino di emergenza devono essere progettati end-to-end [2].
- Pool di calcolo in-regione tra-cluster: un router di transito connette più VPC all'interno della stessa regione. Gli ENI server si connettono agli switch VPC e possono essere configurati per il throughput e l'RDMA richiesti.
- Pool di calcolo tra-cloud: circuiti dedicati collegano un IDC o un altro cloud a un VPC della stessa-regione. I VBR Alibaba Cloud si connettono al livello 3 al dispositivo peer, con BGP, BFD e failover rapido per una rapida convergenza.
Pool di calcolo globale: i collegamenti tra-regioni tra TR vengono forniti in base al traffico di picco tra-regioni, con QoS tra-regioni facoltativo per creare un pool di calcolo unificato tra le regioni [2].
3. Rete di servizi-di inferenza globale
Una rete di inferenza globale seleziona i modelli di distribuzione in base alle risorse e ai servizi cloud disponibili in ciascuna regione e fornisce una distribuzione e un accesso efficienti ai servizi [2].
- Distribuzione di modello o agente: utilizza la distribuzione MaaS di Model Studio, la distribuzione PAI-EAS o Function Compute PaaS oppure la distribuzione IaaS sull'infrastruttura bare-metal EGS, ACK, ACS o Lingjun all'interno del VPC del cliente.
- Distribuzione del servizio: crea un VPC di distribuzione-di inferenza e connetti reti private utilizzando peering VPC, VPC di servizi cloud associati-o PrivateLink. Distribuisci ALB o ALB avanzato come punto di accesso e richieste proxy a diversi modelli o agenti.
- Accesso al servizio: gli utenti Internet locali possono accedere direttamente all'ALB avanzato; gli utenti remoti possono utilizzare Global Accelerator (GA); gli utenti aziendali interni o esterni di Alibaba Cloud possono connettersi privatamente tramite PrivateLink.
Conclusione e prospettive
Questo white paper spiega le sfide affrontate dalle reti IDC nell'era dell'intelligenza artificiale e come il routing intelligente e dinamico può affrontarle. Consapevolezza dinamica, processo decisionale intelligente,-virtualizzazione WCMP, ALB e VRF migliorano l'efficienza del-bilanciamento del carico, riducono la congestione e la perdita di pacchetti e accelerano l'addestramento e l'inferenza dell'AI. La sezione di pianificazione enfatizza la segmentazione VPC, la progettazione della raccolta-in uscita, l'aggregazione e la preelaborazione tra-regioni, l'addestramento del modello e la distribuzione dell'inferenza globale. Con la continua evoluzione dell’intelligenza artificiale, le reti dei data center dovranno far fronte a requisiti più severi. Il routing intelligente e dinamico continuerà a migliorare per l’intelligenza artificiale all’avanguardia, l’apprendimento federato e altri scenari complessi. Le future reti IDC porranno maggiore enfasi sulla-convergenza delle reti di calcolo, sull'efficienza energetica e sulle operazioni automatizzate, creando una base più intelligente, efficiente e affidabile per l'economia digitale.
Riferimenti
Documento di origine tecnico-fornito dall'utente.
Libro bianco sulla rete AI di Alibaba Cloud. Accesso il 27 maggio 2026.
https://help.aliyun.com/zh/cloud-network-ben-architettonato-design/alibaba-cloud-ai-network-white-paper

