HPC in rendering strežniki — GPU zmogljivost za simulacije in vizualizacijo
Konfiguracija, optimizirana za treniranje nevronskih mrež, je za simulacije in rendering pogosto slaba — in praviloma predraga — izbira. Odločilna razlika ni v skupni zmogljivosti, ampak v natančnosti izračuna, količini pomnilnika in povezavi med vozlišči.
Simulacije, računalniško podprto inženirstvo, znanstveni izračuni in profesionalni rendering imajo vsak svoje zahteve. Vse te obremenitve pogosto poimenujemo z isto besedo, kar pri nakupu vodi v napačne primerjave.
V čem se HPC razlikuje od AI?
Glavna razlika je natančnost izračuna. AI obremenitve večinoma tečejo v nižji natančnosti, ker to zadostuje in je hitreje. Znanstvene simulacije pogosto zahtevajo dvojno natančnost (FP64), pri kateri se razredi kartic dramatično razlikujejo — kartica, ki je vrhunska za AI, je lahko pri FP64 razočaranje.
NVIDIA za H200 SXM navaja 34 TFLOPS FP64 (67 TFLOPS s tenzorskimi jedri). Za L40S FP64 sploh ni naveden — v specifikaciji so samo FP32 in nižje natančnosti.
To ni podrobnost iz specifikacij, ampak razlika med sistemom, ki vašo simulacijo požene, in sistemom, ki je ne. Če vaša koda zahteva FP64, je to prva specifikacija, ki jo preverite — ne skupna zmogljivost v teraflopih, ki jo navaja marketinško gradivo.
Kako ugotovim, ali moja koda potrebuje FP64?
Preverite dokumentacijo solverja ali povprašajte razvijalca kode. Marsikateri inženirski paket ima način z mešano natančnostjo, ki je bistveno hitrejši in zniža zahteve po strojni opremi. Odgovor na to eno vprašanje pogosto premakne priporočeno konfiguracijo za cel razred navzdol — in s tem proračun.
Kaj odloča pri renderingu — moč ali pomnilnik?
Pri renderingu je pogosto pomembnejša količina pomnilnika kot čista računska moč. Kompleksna scena s teksturami mora v celoti iti v pomnilnik GPU; kar vanj ne gre, izris upočasni ali prekine. Enako pomembna je podpora programske opreme — preverite, katere kartice vaš renderer dejansko podpira.
Ta preveritev je hitra in prihrani drage napake: podprt seznam je pogosto ožji od tistega, kar bi glede na specifikacije pričakovali.
Kdaj postane omrežje pomembnejše od kartic?
Takoj ko obremenitev teče čez več vozlišč, ki si med seboj izmenjujejo podatke v vsakem koraku. Takrat zmogljivost gruče določa povezava med strežniki, ne vsota kartic v njih. Prav ta del proračuna stranke najpogosteje spregledajo, dokler gruča ne teče počasneje od pričakovanj.
V modelu skupnih letnih stroškov lastništva za velik podatkovni center za umetno inteligenco pade 60 % na strežnike, 16 % na objekt in 14 % na omrežno infrastrukturo — omrežje je torej primerljiva postavka s stavbo samo.
Ta delež velja za velik podatkovni center in ga ni mogoče neposredno prenesti na eno gručo v podjetju. Pokaže pa velikostni red: omrežje ni postavka, ki bi jo bilo mogoče dodati na koncu iz ostanka proračuna.
Odločitev med InfiniBandom in Ethernetom zato ni podrobnost pri enem strežniku, ampak izbira, ki vpliva na izkoristek celotne gruče. Smiselno jo je sprejeti hkrati z izbiro vozlišč, ne za njimi.
Ali obstoječa soba zmore takšen sistem?
Pogosto ne brez posegov. Sodobni GPU sistemi presežejo povprečno gostoto police že z enim strežnikom, zato prostor običajno postavi mejo prej kot proračun. Pravi vrstni red je: najprej ugotoviti, kaj infrastruktura zmore, in šele nato izbirati opremo.
Povprečna gostota moči na polico v podatkovnih centrih je okoli 9 kW, več kot 80 % upravljavcev pa nima nobene police nad 30 kW.
ASHRAE priporoča vstopno temperaturo zraka med 18 in 27 °C; širše dopustno območje za razred A1 je 15–32 °C, a je namenjeno robnim pogojem, ne stalnemu obratovanju.
Druga številka je pomembnejša, kot se zdi. Kupljena zmogljivost, ki je hlajenje ne zmore odvesti, ni na voljo — ob previsoki vstopni temperaturi se grafični procesorji dušijo in znižajo takt. Sistem tako ustreza specifikaciji na papirju, v praksi pa dosega manj. Podroben kontrolni seznam za napajanje in hlajenje je na svoji strani.
Ali potrebujete lasten sistem?
Če je vaša obremenitev občasna, je najem računske moči v oblaku pogosto cenejši. Lasten sistem se začne izplačati pri stalni, predvidljivi obremenitvi ali kadar podatki zaradi zaupnosti ne smejo zapustiti vaše infrastrukture. To je izračun, ki ga je vredno narediti pred nakupom.
Pošteno povedano: pri delu strank je odgovor na to vprašanje najem in ne nakup. Če v vašem primeru izračun pokaže to, vam bom to tudi povedal.
Kaj je dobavljivo v vašem željenem dobavnem roku?
Dobavni roki za sisteme tega razreda nihajo prehitro, da bi jih bilo smiselno objavljati — številka, ki ne drži, je slabša od nobene. Preverim jih za vaš konkreten primer ob povpraševanju.
Pogosto obstaja več poti do enakega rezultata. Druga konfiguracija, drug dobavitelj ali drugačna razporeditev istih komponent lahko skrajša čakanje za mesece, ne da bi se odrekli zmogljivosti. To je del dela, ki ga opravim pred ponudbo.
Niste prepričani, kaj potrebujete?
Opišite delovno obremenitev in povem vam, kaj je smiselno — tudi če je odgovor, da nakup ni prava pot.
Brezplačen posvet