Mi az a mesterséges intelligencia által létrehozott adatközpont?

Mi az a mesterséges intelligencia által működtetett adatközpont? [Videó és kvíz]

Rövid válasz: Egy mesterséges intelligencia adatközpont egy nagy sűrűségű telephely, ahol az energiaellátás, a hűtés, a hálózat és a tárolás a modellek betanítása és kiszolgálása körül forog, nem pedig egy extra GPU-kkal felszerelt szerverszoba körül. A chipek kapják a hírnevet; az épület dönti el, hogy működnek-e. Ha a képek nem tudnak elhagyni, akkor egy kis cellát kell utólagosan beépíteni; a legtöbb csapatnak bérelnie kell.

Főbb tanulságok:

Chipek vs. építés: Az energiaellátás, a hűtés, a szövet és a tárolás dönti el, hogy a gyorsítók működnek-e.

Helyek, nem paloták: Két állványt kell utólagosan beszerelni, ha az adatok nem tudnak kimenni; ne vegyen egyetemi kampuszt.

Átlag vs. medián: Nyolc futtatás után a medián hid újraindul; a 18 órás átlagot használja.

Visszaélés elleni védelem: Ne adjon meg PUE-értéket két állványra egy vegyes csarnokban.

Szemléltető eredmények: Nyolc menet egy kis pályát jelent, nem pedig 50%-os termelési megtakarítást.

Cikkek, amiket esetleg ezután érdemes elolvasnod:

🔗 Megbízható a mesterséges intelligencia? Videó és kvíz
Fedezd fel a mesterséges intelligencia megbízhatóságát egy lebilincselő videó és interaktív kvíz segítségével.

🔗 Hogyan használjuk a mesterséges intelligenciát a mindennapi életben?
Fedezd fel a gyakorlati módszereket, amelyekkel a mesterséges intelligencia leegyszerűsítheti a mindennapi feladatokat és rutinokat.

🔗 Hogyan használjuk a mesterséges intelligenciát a munkahelyen?
Ismerje meg a mesterséges intelligencia használatának gyakorlati módjait az intelligensebb munkahelyi termelékenység érdekében.

🔗 Képes-e a mesterséges intelligencia önállóan gondolkodni?
Értsd meg, hogy a mesterséges intelligencia valóban képes-e önállóan gondolkodni vagy érvelni.

Miben különbözik egy „normál” adatközponttól?

A hagyományos csarnokok vegyes munkaterhelésekre és számos apró szolgáltatás üzemidejére optimalizálnak. Természetesen fontos a redundancia, és a PUE, mint koncepció – az épület által egy watt számítási teljesítmény leadásához elégetett extra energia. Általában nem minden folyosót egy hordozható fűtőtelepként viselkedő rack köré terveznek.

A mesterséges intelligencia által működtetett oldalak felborítják az arányokat. A sűrűség megnő. A hálózat olyan szövetté válik, amely nélkül a betanítási feladat nem tud működni. A tárhelynek mozgásban kell tartania az ellenőrzőpontokat, vagy a gyorsítókat tétlenül kell tartania, mint a versenylovakat a dugóban.

Kulturális különbség is van. A vállalati műveletek a jegyekben és a változási ablakokban gondolkodnak. Az MI-műveletek a feladatsorokban és abban a rosszullétben gondolkodnak, amikor egy csomópont hosszú távon későn leáll. Azt hiszem, mindkettőt nevezhetjük "adatközpontoknak", mert azok. A címke csak a vízvezetéket rejti.

Típus Mire épült Kiemelkedő hardver Teljesítmény / hűtési karakterisztika Kinek illik Miért létezik
Hagyományos vállalati adatközpont Vegyes IT: adatbázisok, virtuális gépek, e-mail, fájlok CPU-k, hagyományos szerverek, ismerős tárolók Levegővezérelt; mérsékelt sűrűség; a PUE mint beszédtémát képvisel Mindennapi rendszereket futtató vállalatok Tartsd naprakészen az üzleti alkalmazásokat
AI képzési klaszter Hosszú, szorosan összekapcsolt képzési feladatok Sűrű gyorsítóállványok; GPU-összeköttetések Nagy sűrűségű; folyadékhűtéses vagy [hátsó ajtós hőcserélők](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laborok és modellépítők, akik sorban állnak a munkájukért Fejezd be a futást anélkül, hogy kifogynál a zsetonokból
AI következtetési lehetőség Modell kiszolgálása; valós idejű és kötegelt válaszok Gyorsítók; terheléselosztók, amelyek számítanak Még mindig forró, csak... kevésbé teátrális; késleltetés a nyers sűrűség felett Termékek, amelyekre most kell választ adni Helyezze a modellt a felhasználó közelébe
Hibrid AI csarnok Képzés és szolgálat egy fedél alatt; nos – valahogy így Vegyes úszómedencék; bekerített medencék; közös úszómedence Két hűsítő személyiség egy gépházban; kínossá válik Csapatok, amelyek nem engedhetnek meg maguknak két kampuszt A tőke véges; az élet rendezetlen

Nem erkölcsi rangsor. Különböző gépek, ugyanaz a családnév.

GPU-k, gyorsítók és az energiát felemésztő rack

Ha egy hagyományos emelt padlózaton sétálsz, a polcok máris udvariasnak tűnnek. Ha egy mesterséges intelligencia által vezérelt sorban sétálsz, úgy néznek ki, mintha le akarnák nyelni az egész épületet.

A kiemelkedő hardver nem egy okos CPU. Hanem a gyorsítótálca: GPU-k vagy más MI-chipek, szerverekbe csomagolva, majd rackekbe, végül sorokba, amelyek egy nagy sávszélességű hálózatot osztanak meg. A GPU összekapcsolja az összefűző chipeket valami olyasmivé, ami egyetlen óriási gyorsítónak tűnhet; a klaszterhálózat ugyanezt a trükköt valósítja meg sorszinten. A párhuzamos betanítás csak akkor működik, ha ezek a kapcsolatok vastagok és kiszámíthatóak maradnak. Ha ezt elveszíted, a "klasztered" egy rakás drága munkaállomássá válik, amelyek egy irányítószámot osztanak meg.

A chipeket a teljesítmény követi. Nem egy vaskos irodai PDU. Megawattnyi informatikai terhelés, ha egy csarnok megtelik - nem fogok számot kitalálni. A rackenkénti sűrűség a cselekmény csavarja. Kevesebb rack. Mindegyik egy kis kemence. A korlátozó tényező gyakran az alállomás, nem a GPU-k kívánságlistája. Tudod, hogy van ez: a beszerzés több gyorsítót akar; a szolgáltató hosszú beszélgetést és egy nagyon nagy csekket.

Egy kissé ostoba metaforával nem tudok szabadulni: a gyomrunk egy éhes állat. Tenyészthetsz egy gyorsabbat. Etetned kell, és el kell pusztítanod a hőséget. Ha bármelyiket kihagyod, egy nagyon drága papírnehezékké válik.

Energia, hő és hűtési problémák

Villany be. Hő ki. Ez az egész vallás.

A nagy sűrűségű rackek olyan módon vezetik le a hőt, amire a levegőnek soha nem volt szüksége. Erősebben lehet nyomni a levegőt – hátsó ajtós hőcserélők, melegebb folyosók, okos tárolás –, és ez egy bizonyos pontig működik. Aztán megjelenik a folyadék:

  • Közvetlenül a chipre irányuló hűtés

  • Hűtőfolyadék-hurkok, amelyek vegyi üzemre emlékeztető hatást keltenek a gépházban

  • Néhány tervbe való belemerülés, ami még mindig megdöbbenti azokat, akik szerint a víznek és a pincéreknek nem szabadna egy mondatban osztozniuk

Mindez nem elbűvölő. Ez mind a termék, mert egy gázpedálért, ami fojt, már fizettél, és nem tudod teljesen kihasználni.

A PUE továbbra is számít. Ez egy arány, nem személyiség. Az üzemeltetők üldözik, mert minden ventilátorokra és szivattyúkra fordított watt egy olyan watt, ami nem a GPU-hoz került. Nem fogok "tipikus" adatot idézni; az éghajlat és a határok meghúzásának módja mozgatja ezt, és az álpontosság rosszabb, mint a semmi. A víz is szerepet játszik a történetben. Néhány növény kortyol. Néhány nyel. A párologtató hűtés hatékony, amíg a folyó vagy egy aszály politikává nem teszi.

Hálózatépítés: miért fontos az anyag ugyanolyan fontos, mint a chipek

Az emberek lefényképezik a GPU-kat. A kapcsolókat is le kellene fotózni.

A betanítás egy beszélgetés. Több ezer gyorsító cseréli ki a gradienseket, paramétereket, egy modell szilánkjait szoros szinkronban. Ha a hálózat rázkódik, az egész feladat a leglassabb ugrásra vár. Ezért a mesterséges intelligencia csarnokok a nagy sávszélességű hálózatépítésre, az alacsony késleltetésre és az olyan topológiákra összpontosítanak, amelyek nem mennek ketté, ha egy kapcsolat meghibásodik. InfiniBand-szerű hálózatok, Ethernet ugyanabban a szerepben, GPU-összeköttetések a dobozon belül, kábelezés, amelynek elsőre is megfelelőnek kell lennie.

A következtetés egy másik téma. A modell kiszolgálása a farok késleltetéssel foglalkozik - a lassú válasszal, nem az átlagosval. A kötegelt és a valós idejű megközelítés megosztja a személyiséget. Egy betanító klaszter nagyszámú, kollektív, mindenki által irányított mozgást. Egy kiszolgáló flotta sok kisebb kérést és elszigeteltséget akar, forgalmi dugó nélkül a terheléselosztónál.

A hiányosság, amíg itt vagyok: az emberek a hálózatot vízvezetéknek, a forgácsot pedig az étteremnek tekintik. Ebben az épületben a vízvezeték az étterem. Ha ezt kihagyod, veszel egy konyhát, ami nem tud házhozszállítást fogadni.

Betanítás vs. következtetés: két épület, néha szó szerint

A betanítás egy kampány. Összeállítasz egy klasztert, adatokat adsz neki, lelkiismeretesen ellenőrzőpontokat állítasz be, órákon vagy heteken át futtatod, és imádkozol, hogy a hálózat eseménytelen maradjon. Kötegelt erőforrásokkal teli, sávszélesség-igényes, csendes türelmes - amíg egy meghibásodott csomópont ki nem akad a futásból. Egyetlen elhalt gyorsító egy szorosan összekapcsolt feladatban leállíthatja az egész kórust.

A következtetés egy kirakat. A már betanított modellek most kérdésekre válaszolnak, képeket osztályoznak, szöveget generálnak. A késleltetés számít. Egy kicsit régebbi gyorsító az ügyfél közelében egy kontinensnyire lehagyhat egy elbűvölőt.

Tehát kapsz egy felet. A képzőközpontok a teljesítményt, a területet és a sűrűséget hajszolják. A következtetési helyek a késleltetést és a jelenlétet hajszolják. Hibrid csarnokok is léteznek, mert a tőke nem végtelen. Nos – nem mindig két épület. Néha egy csarnok bársonykötéllel és két hűtőhurokkal.

Itt jönnek létre a kolokáció, a hiperskálázható kampuszok és a helyszíni elágazás is. A hiperskálázódók olyan méretekben építkeznek, hogy úgy tűnjön, mintha mi, többiek bútorokat rendeznénk el. A kolók sűrűséget értékesítenek rackenként. A helyszíni megoldások akkor is jelen vannak, amikor az adatok nem tudnak kimenni.

Tárolási áteresztőképesség, ellenőrzőpontok és éhes chipek

Senki sem teszi rá a párhuzamos fájlrendszert a brosúra borítójára.

A betanítási adatoknak elég gyorsan kell megérkezniük ahhoz, hogy a GPU-k ne tapsoljanak. Az ellenőrzőpontoknak be kell következniük, hogy egy összeomlás ne dobjon el egy hetet. A modell súlyainak be kell töltődniük, mielőtt egy kiszolgáló replika éles lenne. A tárhely áteresztőképessége – nem csak a kapacitás – a csendes szűk keresztmetszet. Egy vagyont költhetsz gyorsítókra, és kiéheztetheted őket egy virtuális gépekhez tervezett udvarias tömbbel.

A minta ismerős: egy csillogó klaszter, egy feladatsor, és egy nyers számlaként visszatekintő I/O várakozás. A számítási klaszterezés az adatútvonal klaszterezése nélkül a nagyon drága tétlenség tizedét eredményezi. Tartsd meg a chipeket etetve, vagy ismerd el, hogy vettél egy szobrot.

Szoftver, vezénylés és a visszataszító műveleti réteg

A hardver a híresség. Az ütemezők végzik a munkát.

Egy mesterséges intelligencia által vezérelt adatközpont haszontalan, ha a feladatok nem találják a GPU-kat, ha két csapat nem tud ökölharc nélkül megosztani egy klasztert, ha egy sikertelen rangsorolást nem lehet pótolni, ha a firmware lassított felvételben sodródik, amíg a hálózat összeomlik. Vezénylés, megfigyelhetőség, teljesítménykorlátozás - a visszataszító műveleti réteg, innen tudod, hogy számít.

Van egy gyenge pontom ezzel a réteggel. És amikor egy rosszul konfigurált hálózati kártya egy teljes délutánon át hűtési problémát okoz... azt a nehezebb úton kell megtapasztalni.

Amikor egy csomópont futás közben meghal

Egy csomópont leáll. A változásablakok továbbra is ütköznek olyan betanítási futtatásokkal, amelyek nem törődnek a naptáraddal. Csoportosan ütemezed a nagy feladatokat, elkülöníted a következtetési készleteket, runbookokat írsz a "lassan futó feladat" típusú hibákhoz, amíg úgy nem tűnnek, mintha "halott lenne". A redundancia továbbra is számít - energiaellátás, hűtés, elérési utak, tárhely -, de a hibamód kevésbé rendezett, mint a régi, kilences üzemidő-dia. Következtetés: replika, a beteg csomópont lemerítése, folyamatos válaszadás. A betanítás ellenőrzőpontokat akar, nem optimizmust.

Helyszín, víz, hálózat és szomszédok

Nem a kilátásért ejted le egy ilyet egy házikó mellé.

A hálózati csatlakozás gyakran a valódi telephely-kiválasztási folyamat. A földterület könnyebb egy alállomáshoz és egy olyan közműhöz képest, amelynek más ügyfelei is vannak. A hűtésre használt víz, ha használjuk, szomszédi problémává válik, amint az esőzés erősödik. Zaj. Vizuális tömeg. Hő a határkerítésnél. A tervezőbizottságok abban a pillanatban véleményt nyilvánítanak a "felhőről", hogy annak mezőre és folyóra van szüksége.

A késleltetés az ellenkező irányba húz. A következtetés szereti a felhasználók és az összeköttetések közelében lenni. A képzés elrejtőzhet az olcsóbb energiapiacokon és a hűvösebb éghajlaton. Az iparág úgy beszél, mintha létezne egyetlen tökéletes helyszín. Nincs. Van egy kompromisszum egy sajtóközleménnyel.

Maradék hő és a hívatlan kemence

A brosúrák imádják ezt a részt. Csövezd a hulladékhőt otthonokba, medencékbe, üvegházakba; ez egy szép mondat. Néha a kerületi körfolyamat valódi. Néha a kampusz rossz helyen van, és a hő akkor is a levegőbe kerül. Szkeptikus vagyok a brosúrás verzióval kapcsolatban; nem vagyok szkeptikus a fizikával kapcsolatban.

Kinek van szüksége rá (és kinek kellene bérelnie)?

A legtöbb embernek nem kell birtokolnia egy ilyen csarnokot.

A nyers lista:

  • Hiperskálázók, mivel a termék a flotta

  • Laboratóriumok, amikor a várakozási idő a szűk keresztmetszet, vagy az adatok nem tudnak elhagyni

  • Egy bank, kórházcsoport, kormány vagy gyártó, amely titkos adatkészlettel rendelkezik - helyszíni vagy privát kolokalizációval -, lehet racionális, még akkor is, ha az csak egy álca

Mindenki másnak bérelnie kellene. AI-kompatibilis sűrűségű kolokáció. Felhőalapú foglalás. Menedzselt klaszter. A gyorsítókat anélkül kapod meg, hogy erőmű-üzemeltetővé válnál. A romantika elhalványul, amikor valaki először megkérdezi, ki van ügyeletesen a hűtőkörben hajnali 3-kor.

Van egyfajta büszkeség, bevallom. A klaszter birtoklása olyan, mintha a jóslás eszközeit birtokolnám. Aztán megérkezik a villanyszámla, és a büszkeség leül.

Mire való az épület

Szóval, mi is az a mesterséges intelligencia adatközpont? Egy specializált, nagy sűrűségű kampusz, ahol a gyorsítók, az energiaellátás, a hűtés, a hálózat és a tárolás a képzési és kiszolgálási modellek köré szerveződik – nem általános célú informatikai rendszer egy GPU-val a sarokban. Úgy néz ki, mint egy raktár. Úgy viselkedik, mint egy erőmű, amely matematikai műveleteket végez.

Ha semmi másra nem emlékszel: a chipek szerezték meg a hírnevet; az alállomás, a hűtőközeg és a hálózat dönti el, hogy azok a chipek jó ötletek voltak-e. A képzés és a következtetés osztozhat egy tetőn; mégis más modort akarnak. A legtöbb szervezetnek bérelnie kellene. Néhánynak építenie. A szomszédok mindkét esetben észreveszik.

A felhőnek mindig is volt épülete. Manapság az épületnek véleménye is van.

Valós példa: Egy kétállványos oktatócella, ahol a képek nem tudnak távozni

Forgatókönyv

A Tomos az infrastruktúra vezetője a Kestrel Precisionnél, egy 400 fős nyugat-midlandi gyártónál. Már van egy kis helyszíni csarnokuk: ERP, fájlmegosztás, virtuális gépek, az a vegyes környezet, amivel ez a cikk kezdődött. Léghűtés. Hagyományos Ethernet. Egy SAN, ami tökéletesen alkalmas irodai lemezek számára.

A gépi látásért felelős csapatnak gyári állóképeken kell betanítania egy vizsgálati modellt. A felvételek nem hagyhatják el a telephelyet. Egy olyan folyamatot mutatnak be, amelyet a vállalat nem fog felhőalapú lemezre tenni, még egy privát lemezre sem. A beszerzési megoldás négy kettős gyorsítójú szerver és egy „MI adatközpontunk” című dia. A szerverek két meglévő rackbe kerülnek, mert van hely, és a hely korlátozottnak tűnt.

Nem az. Két héten belül a GPU-k működése megszűnik, majd csendben lelassul. A feladatok elkezdenek mozogni, amikor egy ellenőrzőpont eléri a SAN-t. Egy csomópont tizenegy órában leáll, és a futtatás egyszerűen... elmúlik. Tomos nem mulasztotta el beszerezni a chipeket. Vett egy rakás drága munkaállomást, amelyek ugyanazt az irányítószámot használják. Az épület még mindig egy vállalati csarnok volt.

Nincs szükségük kampuszra, új alállomásra vagy folyóra. Egy kis cellára van szükségük, amely úgy viselkedik, mint egy miniatűr mesterséges intelligencia adatközpont: energiát biztosít, amelyet a rackek ténylegesen tárolni tudnak, hőt, amely a chipek megsütése nélkül távozik, egy hálózatot, amelyről a betanítási feladat beszélni tud, tárolót, amely képes ellenőrzőpontot fogadni, és egy runbookot arra az esetre, ha egy csomópont leáll. Mivel a képek nem tudnak távozni, egy 40 percre lévő kolóketrec bérlése nem a megoldás. Két rack utólagos felszerelése viszont igen.

Amire a sejtnek szüksége van

  • Egy mért energiaköltségvetés azon a sorban, a PDU-kból, nem a GPU kívánságlistájából. Ha a szabad kapacitás nem tudja ellátni a négy szervert betanítási terhelés mellett, akkor a beszélgetés itt megáll, és sűrűbb kollektorozást néznek, nem csodát

  • A levegő hűtéséről soha nem volt szó ekkora sűrűségnél: hátsó ajtós hőcserélőkről, ha a csarnok elbírja őket, vagy egy kis folyadékhurokról, ha azt is elbírja. Ha egyik sem, akkor a szerverek nem mennek be

  • Egy dedikált nagy sávszélességű hálózat a négy csomópont között, nem az irodai Ethernet. Ha a szállítónak csak egy 10 Gb-os kapcsolója van a katalógusában, az nem klaszter

  • Helyi gyorstároló az ellenőrzőpontokhoz és a betanító szegmensekhez, nem a virtuális gép SAN-ja

  • Egy ütemező, egy ellenőrzőpont-intervallum és egy írott újraindítási útvonal. A hardver a híresség. Ez a réteg a feladat

  • Egy bekerített következtetési doboz a gyártósorhoz, elkülönítve a betanító csevegéstől, mert a kiszolgálás a farok késleltetését és elszigeteltségét igényli, nem pedig egy kollektívát

  • Engedély a tápellátás, a GPU-órák, a szabályozási események és a munkafolyamatok faliórájának naplózására. Ha ezeket nem tudják ellenőrizni, lefényképezik a GPU-kat, és nem veszik észre a kapcsolókat

Példa utasítás

Tomos ezt fogalmazza meg a létesítményismertetőben, közérthető nyelven:

Ne nevezzük ezt MI-campusnak. Építsünk egy két rackes oktatócellát a meglévő csarnokban négy kettős gyorsítójú szerver számára. A gyári lemezképek a helyszínen maradnak. A siker lényege: a négy csomópont egy 12 korszakos ellenőrzési-képzési receptet teljesít hőfojtás nélkül, percek alatt írnak egy ellenőrzőpontot, nem tíz percek alatt, és onnan folytatják, amikor szándékosan leállítunk egy rangot. A hűtésnek a GPU-kat a betanítási órájukon kell tartania. A hálózatépítésnek egy olyan szövetnek kell lennie, amelyet a négy doboz közösen használ, nem pedig egy útvonalnak az irodai veremen keresztül. A tárolóknak kell táplálniuk a chipeket. Ha a hátsó ajtón lévő hőcserélők nem férnek el, szóljunk, és álljunk meg. Ne adjunk meg PUE-t két rackre egy vegyes csarnokban. Az a szám a színház lenne.

Aztán ezt belefoglalja magába a képzési munkába:

30 percenként ellenőrzőpont a helyi gyorsmedencéhez. Ha egy rangsor meghal, az utolsó teljes ellenőrzőponttól kell újrakezdeni. Ne várj a SAN-on. Ne folytasd az edzést, amíg az órák leestek a hőtől. Naplózd és állj meg, hogy lássuk a leállást.

Egy jó óra így néz ki: mind a nyolc GPU a tanulóórán, az ellenőrzőpont-fájl a helyén van, a job még mindig zárolt állapotban van. Egy rossz óra így néz ki: a ventilátorok teljes hangerőn járnak, az órák lejárnak, a 2%-os ellenőrzőpont tíz perc után íródik ki, és valaki az irodában azt mondja, hogy "a klaszter működik". A bekapcsolt állapot nem tanulás.

Hogyan teszteljük

A tesztet az utólagos beszerelés előtt írják meg, ami a lényege annak, hogy nem bíznak egy demóban.

  • Ugyanaz a 12 korszakos recept, ugyanaz a 120 000 ellenőrző lepárlás, nyolc futtatás

  • Az időzítés falióra-szerű a kész recepthez képest, beleértve az újraindításokat is, a feladat beküldésétől a 12-es epoch utolsó ellenőrzőpontjáig mérve

  • Hőátadás: A GPU órajelei a futás során a betanítási célon maradnak. A szabályozási esemény sikertelen, még akkor is, ha a feladat végül befejeződik

  • Tárolási átadás: ellenőrzőpont írási ideje, medián és legrosszabb, a munkanaplóból

  • Átadás a szöveten: a munka nem áll kollektív várakozási állapotban, amíg egy rangsor egészséges. Ha nem látják ezt a várakozási időt, a műszerezés nincs befejezve

  • A nyolc futtatásból kettőnél a rangsorolás szándékosan megszakad egy fix lépésben, hogy teszteljék az újraindítási útvonalat

  • A következtetés egy különálló, 200 képes teszt a gyártósortól a bekerített tálalódobozig. A betanítás sikeressége nem számít a tálalás sikerességének

  • 15 perces mintákban rögzítik a PDU-k rackteljesítményét, így senkinek sem kell megawattot feltalálnia

Elfogadás a cella „MI-kész” hívásra: 8 receptből 8 befejeződik; 8-ból 0 mutat hőfojtást; mindkét leállított futás folytatódik; az ellenőrzőpontok perceken belül megmaradnak. Ha ezt elmulasztják, akkor is van egy szerverszobájuk menő grafikus kártyákkal.

Eredmény

Szemléltető eredmény, egy kitalált nyolc menetes tesztből, nem egy publikált Kestrel-adat.

Feltételezések: négy kettős gyorsítós szerver két rackben; egy ellenőrző modell; 120 000 állókép; nyolc futtatás egy fix 12 epochás recepttel; a falióra újraindításokat tartalmaz a recept befejéséig; a szabályozás a betanító óra naplózott lemaradását jelenti; az ellenőrzőpont ideje az írás, nem a kívánság; a rack teljesítménye a PDU mintákból származik, nem pedig a campus PUE-jából.

Az utólagos átalakítás előtt az irodai Etherneten és a virtuális gép SAN-on lévő hagyományos léghűtéses rackekben lévő GPU-k:

  • 8 futásból 5 elsőre sikerült. Az öt közül az átlagos falióra-idő: 14 óra

  • 8-ból 3-nak újra kellett kezdenie a 11 óra körüli leállás után (kettőnek egy csomópont leállt ellenőrzőpont miatti leállása után, egynek pedig egy SAN-t feltöltő ellenőrzőpont után). Azonnali újrapróbálkozás, nincs éjszakai várakozás az órában: 11 óra elvesztegetés plusz egy 14 órás második próbálkozás, vagyis 25 óra a recept elkészültéig ezen a három kísérleten

  • A receptek átlagos elkészítési ideje mind a nyolc esetében, az újraindításokkal együtt: 18 óra. (Öt 14-kor, három 25-kor. Mind a nyolc mediánja továbbra is 14, ami elrejtené az újraindításokat. Ezért az átlag az alapvonal itt.)

  • Hőmérséklet-szabályozás 8 futtatásból 7-szer jelentkezett. Átlagos idő csökkentett órajelen: 3 óra 14 órás kísérlet során

  • Ellenőrzőpont írási ideje: átlagosan 22 perc

  • A rangvesztés nem volt olyan teszt, aminek megfelelhettek volna. Nem volt gyakorlati terveik. A két véletlen haláleset volt a lényeg

  • A két rackszekrény csúcsterhelése betanítás közben: körülbelül 18 kW. A sor rendelkezett a wattokkal. Hűtése vagy a szövet nem volt meg benne

Miután a két rackszekrényen hátsó ajtós hőcserélőket szereltek fel, dedikált hálózatot alakítottak ki a négy csomópont között, létrehoztak egy kis NVMe-készletet az ellenőrzőpontoknak, 30 perces ellenőrzőpont-kezelést és egy újraindítási runbookot:

  • 8-ból 8 elsőre sikerült. Falióra átlagos ideje: 9 óra

  • Termikus fojtószelep: 0/8

  • Ellenőrzőponton írás: átlagosan 90 másodperc. A sorozat legrosszabbja: 3 perc

  • A két szándékos, 30 perces ellenőrzőpontról folytatódott a két szándékos futás. A két menetnél plusz idő volt: mindegyiknél körülbelül 40 perc, a diagnózist is beleértve, tehát a kettő közel 9 óra 40 percet vett igénybe. A nyolc lejátszott kör átlaga 9 óra

  • A csúcs IT terhelés továbbra is körülbelül 18 kW. Ugyanazok a chipek. Az épület viselkedése eltérő

Ebben a mintában a receptek átlagos elkészítési ideje 18 óráról 9 órára, azaz 9 órára esett vissza, ami nyolc futtatás során összesen 72 órát jelent. Az elsőre elkészült mennyiség 5/8-ról 8/8-ra csökkent. A gyorsított fogyasztás 7/8-ról 0/8-ra csökkent. Ez az utolsó szám mutatja meg, hogy gyorsítókat vagy papírnehezékeket vásároltak-e. Nem fogják az időbeli változást 50%-os termelésmegtakarításnak nevezni. Nyolc futtatás egy kis, könnyű készlet.

Ezek az adatok egy példabecslés, amely a megadott teszten, egy kis mintán, egy modellen és egy vegyes csarnokon alapul. Nem PUE-értéket, nem campus megawattot jelentenek, és nem bizonyítják, hogy a Kestrelnek gyakorlóhelyet kellene építenie egy területen. A naplók áttekintése a 9 órán belül történt; ezt nem rejtették el. A 18 kW-os adat egy kerekített PDU-érték, nem közüzemi számla. Nem alakították át a 72 órát költséggé, mert a gyár kevert villamosenergia-árama hamis üzleti tervet eredményezett volna.

A szervaellenőrzés különálló és kisebb volt: 200 soros kép a bekerített pályán, mindezt a helyszínen. Ez következtetés, nem betanítás. A kettő összekeverése a hibrid csarnok miniatűr hibája lett volna.

Mi romolhat el

  • A beszerzési részleg négy szervert folyton „mesterséges intelligencia adatközpontnak” nevez. A címke elrejti a vízvezetéket, a következő beszerzés pedig további GPU-kat jelent ugyanarra a betegfolyosóra

  • A hátsó ajtón cserélők bemennek, és senki sem helyezi üzembe a vízoldalt. A rajongók még mindig kiabálnak. Az órák még mindig ütnek

  • A hálózat egyetlen kapcsolóból áll, tartalék útvonal nélkül. Egyetlen meghibásodott kapcsolat, és a „klaszter” ismét négy munkaállomásból áll

  • Az ellenőrzőpontok a SAN-on maradnak, mivel az NVMe készlet a „második fázisban” volt. A második fázis nem érkezik meg a következő halott csomópont előtt

  • Egy vegyes csarnok két állványára adnak PUE-értéket. Az éghajlat, a határvonal és az ERP-sor többi része ezt az arányt jelmezként kezeli

  • A képzés és a kiszolgálás közös szerepet játszik. Az ellenőrzőpontok elárasztásakor a gyártósor várakozni kényszerül. A késleltetés a termék, nem a sűrűség

  • Egy csomópont leáll, és valaki üzemidő-jegyként kezeli azt ellenőrzőpont-újraindítás helyett. A vállalati és a mesterséges intelligencia műveletek egy teljes délutánon át elbeszélnek egymás mellett

  • Bérelhettek volna egy ketrecet, de a képek nem tudnak kimozdulni. Ha elfelejtik ezt a korlátozást, akkor egy felhőalapú beszélgetésbe keverednek, amit majd ki kell bontaniuk

Gyakorlati elvitel

Egy MI adatközpont ebben az alakban nem raktár és nem is GPU-számla. Ez az a cella, amely lehetővé teszi a gyorsítók számára a működés befejezését: a tárolható energia, a távozó hő, egy szerkezet, egy ellenőrzőpont, és valaki, aki a rangsor végén marad. A Kestrelnek nem volt szüksége kampusra. Két állványra, hogy abbahagyják a színlelést. A legtöbb csapatnak ezt a viselkedést kellene kibérelnie. Néhánynak, titkos adatkészlettel és egy hőt elviselő csarnokkal, cellát kellene építenie, és visszautasítania a csúszdát.

GYIK

Mi az a mesterséges intelligencia által létrehozott adatközpont?

Egy nagy sűrűségű számítási helyszín, ahol az energiaellátás, a hűtés, a hálózatkezelés és a tárolás a párhuzamos betanítás és a modellek kiszolgálása köré épül, nem pedig az általános célú szerverek rendezett sorai köré. Úgy tervezték, hogy hatalmas számú gyorsító képes legyen modelleket betanítani és kiszolgálni anélkül, hogy a rendszer összeolvadna, leállna a hálózaton, vagy a lemezen várakozna. Egy átlagos vállalati csarnok egy vegyes környék. ​​Egy mesterséges intelligencia csarnok egy monokultúra, amelynek értékegysége a gyorsító, például a GPU-k vagy a TPU-stílusú chipek. Úgy néz ki, mint egy raktár, és úgy viselkedik, mint egy matematikai feladatokat végző erőmű.

Miben különbözik egy mesterséges intelligenciával működő adatközpont egy hagyományos adatközponttól?

A hagyományos csarnokok a vegyes munkaterhelésekre és a sok apró szolgáltatás üzemidejére optimalizálnak. A mesterséges intelligencia által vezérelt webhelyek megfordítják az arányokat: a sűrűség növekszik, a hálózat olyan szövetté válik, amely nélkül a betanítási feladat nem sántikálhat, a tárolónak pedig mozgásban kell tartania az ellenőrzőpontokat, vagy a gyorsítókat tétlenül kell tartania. A vállalati műveletek a jegyekben és a változási ablakokban gondolkodnak. A mesterséges intelligencia műveletek a feladatsorokban és abban a rossz érzésben gondolkodnak, amikor egy csomópont hosszú távon későn leáll. Mindkettőt továbbra is adatközpontnak nevezhetnénk. A címke csak a vízvezetéket rejti.

Miért használnak annyi energiát a mesterséges intelligenciával működő adatközpontok?

A kiemelkedő hardver nem egy okos CPU. Hanem a gyorsítótálca: GPU-k vagy más MI-chipek, szerverekbe csomagolva, majd rackekbe, majd sorokba, amelyek egy nagy sávszélességű szövetet osztanak meg. A rackenkénti sűrűség a cselekmény csavarja: kevesebb rack, mindegyik egy kis kemence. Megawattnyi IT-terhelés jelenik meg, amint egy csarnok megtelik, bár egy tipikus számadat kitalálása nem éri meg. A korlátozó tényező gyakran az alállomás, nem pedig a GPU-k kívánságlistája.

Hogyan hűtik a mesterséges intelligenciával működő adatközpontokat?

A nagy sűrűségű rackek olyan módon adják le a hőt, amire a levegőnek soha nem igazán volt szüksége. A hátsó ajtós hőcserélőkkel, a melegebb folyosókkal és az okos tárolással erősebben lehet nyomni a levegőt. Aztán megjelenik a folyadék: közvetlenül a chipre irányuló hűtés, a hűtőfolyadék-hurkok és néhány tervben beépített hűtés. Egy fojtógyorsítóért már fizettünk, és nem tudjuk teljes mértékben kihasználni. A PUE továbbra is számít, mert minden egyes, a ventilátorokra és szivattyúkra fordított watt egy olyan watt, ami nem a GPU-hoz került. A víz is szerepet játszik a történetben: egyes üzemek kortyolnak, mások nyelnek.

Miért olyan fontos a hálózatépítés, mint a GPU-k?

A betanítás egy párbeszéd: több ezer gyorsító cserél szoros szinkronban gradienseket, paramétereket és egy modell szilánkjait. Ha a hálózat ingadozik, az egész feladat a leglassabb ugrásra vár. Ezért a mesterséges intelligencia csarnokok a nagy sávszélességű hálózatépítésre, az alacsony késleltetésre, az InfiniBand-szerű hálózatokra vagy az Ethernetre koncentrálnak ugyanabban a szerepkörben, és olyan topológiákra, amelyek nem hajlanak ketté, ha egy kapcsolat meghibásodik. A következtetés a farok késleltetésére, a sok kisebb kérésre és az izolációra összpontosít. Ebben az épületben a vízvezeték az étterem.

Mire használják az AI adatközpontokat: betanításra vagy következtetésre?

A betanítás egy kampány: állíts össze egy klasztert, töltsd fel adatokkal, szenteld be az ellenőrzőpontokat, és futtasd órákon vagy hetekig. A következtetés egy kirakat: a már betanított modellek most válaszolnak, a késleltetés számít. A képzőközpontok a hatalmat, a területet és a sűrűséget hajszolják. A következtetési helyszínek a késleltetést és a jelenlétet hajszolják. A hibrid csarnokok azért léteznek, mert a tőke nem végtelen, néha egy csarnok két hűtőhurokkal. Egy kicsit régebbi gyorsító az ügyfél közelében leverhet egy elbűvölőt egy kontinensnyire.

Miért fontos a tárolás egy mesterséges intelligenciával működő adatközpontban?

A betanítási adatoknak elég gyorsan kell megérkezniük ahhoz, hogy a GPU-k ne tapsoljanak. Az ellenőrzőpontoknak be kell következniük, hogy egy összeomlás ne dobjon el egy hetet. A modell súlyainak be kell töltődniük, mielőtt egy kiszolgáló replika éles lenne. A tárhely átviteli sebessége, nem csak a kapacitás, a csendes szűk keresztmetszet. Egy vagyont költhetsz gyorsítókra, és kiéheztetheted őket egy virtuális gépekhez tervezett udvarias tömbbel.

Mi történik, ha egy csomópont futás közben megsérül?

Egyetlen leállt gyorsítórendszer egy szorosan összekapcsolt betanítási feladatban megakaszthatja az egész folyamatot. A betanítás ellenőrzőpontokat igényel, nem optimizmust. A következtetés lemeríti a beteg csomópontot, egy replikát hagy válaszolni, és élőben marad. A változásablakok továbbra is ütköznek olyan betanítási futtatásokkal, amelyek nem törődnek a naptáraddal. A redundancia továbbra is fontos az energiaellátás, a hűtés, az elérési utak és a tárhely szempontjából, de a hibamód kevésbé rendezett, mint a régi kilences üzemidő-dia.

Milyen hatással van egy mesterséges intelligencia által vezérelt adatközpont a hálózatra, a vízre és a szomszédokra?

A hálózati csatlakozás gyakran a valódi telephely-kiválasztási folyamat. A földterület könnyebb egy alállomáshoz és egy olyan közműhöz képest, amelynek más ügyfelei is vannak. A hűtésre használt víz, ha használjuk, szomszédi problémává válik, amint az esőzés durva, a zajjal, a vizuális terheléssel és a határkerítésnél fellépő hőséggel együtt. A képzés elrejtőzhet olcsóbb energiapiacokon és hűvösebb éghajlaton. A következtetés szereti a felhasználók közelében lenni. Nincs egyetlen tökéletes telephely. Van egy kompromisszum egy sajtóközleménnyel.

Saját tulajdonú AI adatközponttal kell rendelkeznem, vagy béreljek?

A legtöbb embernek nincs szüksége arra, hogy birtokolja ezeket a csarnokokat. A hiperskálázók azért építenek, mert a termék maga a flotta. A laboratóriumok akkor építenek, amikor a várakozási idő a szűk keresztmetszet, vagy az adatok nem tudnak távozni. Egy bank, kórház, kormányzat vagy gyártó, amely titkos adatkészlettel rendelkezik, racionálissá teheti a helyszíni vagy egy privát kolokációt. Mindenki másnak bérelnie kell: mesterséges intelligenciával felszerelt kolokációt, felhőfoglalást vagy menedzselt klasztert. A gyorsítókat anélkül kapja meg, hogy erőmű-üzemeltetővé válna.

Referenciák

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. A Zöld Háló - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Uptime Intézet - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Clouddocs.cloud.google.com

Találd meg a legújabb mesterséges intelligenciát a hivatalos AI Assistant áruházban

Rólunk

Kvíz
1. A cikk szerint mi az a mesterséges intelligencia által vezérelt adatközpont?

2. A „helyszínek, nem paloták” verzióban mit tegyen egy olyan csapat, mint Kestrel, amikor a gyári képek nem hagyhatják el a helyszínt?

3. Miért a 18 órás átlagot, és miért nem a 14 órás mediánt használja a cikk az utólagos átalakítás előtti alapértékként?

4. Mi változott a két rackes utólagos beépítés után a szemléltető nyolc menetes tesztben?

5. Mit mond a cikk a PUE idézéséről erre a két rackből álló cellára?


Vissza a bloghoz