AI strežniki — kako izbrati pravo konfiguracijo
Prva odločitev je, ali gradite sistem za treniranje ali za inferenco. Pri treniranju štejeta količina pomnilnika GPU in hitrost povezave med karticami. Pri inferenci nizka zakasnitev in prepustnost — pogosto je boljša rešitev več manj zmogljivih kartic namesto ene vrhunske. Vse ostalo izhaja iz te razlike.
Napačna izbira pomeni bodisi plačilo za zmogljivost, ki je ne boste uporabili, bodisi sistem, ki bo v šestih mesecih premajhen.
Treniranje ali inferenca — katero potrebujem?
Če model prilagajate svojim podatkom, potrebujete treniranje: veliko pomnilnika na kartico in hitro medsebojno povezavo. Če model samo poganjate v produkciji, potrebujete inferenco: nizko zakasnitev in veliko vzporednih zahtev. Za enak proračun pri inferenci pogosto dobite več od več cenejših kartic kot od ene vrhunske.
Treniranje zahteva čim več pomnilnika GPU in čim hitrejšo povezavo med grafičnimi procesorji. Model, ki se ne prilega v pomnilnik, se mora deliti med več GPU-jev, kar pomeni, da postane hitrost medsebojne povezave ozko grlo. Tu se splača vlagati v manj, a močnejših GPU-jev z veliko pomnilnika.
Inferenca je drugačna zgodba. Model je fiksen in pogosto manjši, zahteva pa nizko zakasnitev in veliko vzporednih zahtev. Tu je pogosto bolj smiselno uporabiti več cenejših GPU-jev kot en vrhunski — za enak proračun dobite več prepustnosti.
Katera konfiguracija ustreza kateri obremenitvi?
Spodnja tabela je izhodišče, ne recept. Namenoma navaja razrede in ne konkretnih modelov — ti se menjajo hitreje, kot je smiselno vzdrževati stran. Vaša dejanska obremenitev lahko premakne priporočilo za eno vrstico gor ali dol.
| Obremenitev | Razred kartice | Št. GPU | Povezava | Hlajenje |
|---|---|---|---|---|
| Strojni vid, prediktivno vzdrževanje, klasični ML | Profesionalna delovna kartica | 1–2 | PCIe | Zračno, obstoječa soba |
| Inferenca manjših in srednjih modelov v produkciji | Podatkovni center, inferenčni razred | 2–4 | PCIe | Zračno, preveri rezervo |
| Prilagajanje (fine-tuning) obstoječih modelov | Podatkovni center, veliko VRAM | 2–4 | NVLink zaželen | Zračno na meji |
| Treniranje velikih modelov od začetka | Namenska platforma (HGX/SXM) | 8+ | NVLink nujen | Namensko, pogosto tekočinsko |
| Znanstvene simulacije z dvojno natančnostjo | Podatkovni center s FP64 | Odvisno od kode | Odvisno od vozlišč | Zračno do namensko |
Koliko pomnilnika GPU dejansko potrebujem?
Pri treniranju v pomnilnik ne gre le model, ampak tudi gradienti in stanja optimizatorja — skupaj večkratnik velikosti modela samega. Inferenca potrebuje manj, a ne zanemarljivo: pri dolgih kontekstih in več hkratnih zahtevah predpomnilnik KV hitro preraste sam model. Zato je pomnilnik kartice trda meja v obeh primerih — kar vanj ne gre, je treba razdeliti med več kartic, in takrat začne o hitrosti odločati povezava med njimi.
Zato je pomnilnik GPU največji posamezen dejavnik cene in hkrati prva specifikacija, ki jo je vredno določiti. Šele ko veste, koliko pomnilnika potrebujete, ima smisel primerjati kartice med seboj. Konkretne številke po velikostih modelov so v ločenem vodniku.
Ali lahko sistem sploh postavim v obstoječo sobo?
Pogosto ne brez posegov, in to je najpogostejši razlog, da načrtovana konfiguracija ne pride v produkcijo. Uptime Institute za leto 2025 navaja povprečno gostoto okoli 9 kW na polico, NVIDIA pa za DGX B300 največjo porabo 14,5 kW. En sam 8-GPU sistem torej občutno presega povprečno polico. Napajanje in hlajenje je treba preveriti pred izbiro opreme, ne po njej.
Povprečna gostota moči na polico v podatkovnih centrih je okoli 9 kW, več kot 80 % upravljavcev pa nima nobene police nad 30 kW.
NVIDIA za DGX B300 z osmimi pospeševalniki Blackwell Ultra navaja največjo porabo 14,5 kW v ohišju višine 10U. Napajanje je izvedeno z dvanajstimi napajalniki po 3,2 kW v redundanci N+N — šest jih nosi obremenitev, šest je rezerve za primer izpada ene napajalne veje.
Ti dve številki je vredno postaviti eno ob drugo: povprečna polica zmore okoli 9 kW, en sam sodoben 8-GPU sistem pa do 14,5 kW. Že en strežnik torej preseže povprečno polico za polovico — in to pojasni, zakaj se projekti pogosteje ustavijo pri infrastrukturi kot pri strojni opremi.
Sodobna polica najvišjega razreda s 72 pospeševalniki je zasnovana za 120 kW in obvezno tekočinsko hlajenje — proti povprečju okoli 9 kW to ni razlika v odstotkih, ampak v razredu.
Zgornji razred ni cilj za večino podjetij in ga tu navajam le zato, ker dobro pokaže smer: gostota moči na polico raste hitreje, kot se obnavljajo strežniške sobe. Prav zato je smiselno začeti pri tem, kaj vaš prostor zmore danes, in šele nato izbirati opremo. Podroben kontrolni seznam za napajanje in hlajenje je na svoji strani.
Zakaj hlajenje odloča o dejanski zmogljivosti?
Ko vstopna temperatura zraka preseže priporočeno območje, se grafični procesorji začnejo dušiti in znižajo takt. Če hlajenje ne zmore odvesti toplote, sistem ne dosega tega, za kar ste plačali — in nikjer na ponudbi to ne piše.
ASHRAE priporoča vstopno temperaturo zraka med 18 in 27 °C; širše dopustno območje za razred A1 je 15–32 °C, a je namenjeno robnim pogojem, ne stalnemu obratovanju.
Zato pri načrtovanju ne zadostuje vprašanje „ali imamo dovolj kW“. Prav tako pomembno je, ali je toploto mogoče odvesti pri temperaturi, pri kateri oprema deluje s polno hitrostjo.
Kdaj je najmočnejša kartica napačna izbira?
Kadar je obremenitev manjša od tega, kar kartica zmore. Pri strojnem vidu, prediktivnem vzdrževanju, optimizaciji procesov in manjših modelih v inferenci pogosto zadostujejo profesionalne delovne kartice.
Preden se odločite za vrhunsko konfiguracijo, se splača oceniti, kaj vaša delovna obremenitev dejansko zahteva.
Kaj je sploh dobavljivo v vašem željenem dobavnem roku?
Pospeševalniki najvišjega razreda niso na voljo kot samostojne kartice, ampak le kot del namenskih platform. Izbira zato ni „katera kartica“, ampak „katera platforma“ — kar hkrati spremeni ceno, dobavni rok in zahteve prostora. Dobavljivost je zato del specifikacije, ne podrobnost, ki jo uredimo na koncu.
Dobavnih rokov na tej strani namenoma ne navajam v številkah. Nihajo prehitro, da bi bil zapisan podatek še točen takrat, ko ga berete — objavljena številka, ki ne drži, pa je slabša od nobene.
Namesto tega rok preverim za vaš konkreten primer ob povpraševanju. Pogosto obstaja več poti do enakega rezultata: druga konfiguracija, drug dobavitelj ali drugačna razporeditev istih komponent lahko skrajša čakanje za mesece, ne da bi se odrekli zmogljivosti. To je del dela, ki ga opravim pred ponudbo — in eden od razlogov, zakaj se posvet izplača.
Kaj bom potreboval čez 18 mesecev?
Najpogostejša napaka pri prvem nakupu je konfiguracija, ki natanko ustreza trenutnemu modelu. Modeli rastejo, ekipe rastejo, primeri uporabe se širijo. Pri izbiri je zato vredno pogledati, koliko prostih rež, napajalne rezerve in hladilne kapacitete ostane po prvi postavitvi.
Nadgradnja obstoječega sistema je skoraj vedno cenejša od zamenjave — a le, če je bila rezerva predvidena ob nakupu.
Kdaj se splača posvetovati
Če še niste prepričani, ali potrebujete sistem za treniranje ali za inferenco — ali koliko pomnilnika dejansko zahteva vaš primer uporabe — je to točka, kjer se posvet izplača. Prav tako, kadar imate rok in potrebujete konfiguracijo, ki je dejansko dobavljiva, ali kadar želite preveriti, ali je za vaš primer mogoče doseči enak rezultat ceneje. Napaka pri teh odločitvah je desettisoče evrov, ne stotine.
Niste prepričani, kaj potrebujete?
Opišite delovno obremenitev in povem vam, kaj je smiselno — tudi če je odgovor, da nakup ni prava pot.
Brezplačen posvet