GPU STREŽNIKI
Vodnik

Koliko pomnilnika GPU (VRAM) potrebujem?

Za inferenco potrebujete približno 2 GB pomnilnika na milijardo parametrov pri natančnosti FP16, plus rezervo za predpomnilnik KV — pri kratkih kontekstih okoli petine, pri dolgih bistveno več. Za polno treniranje potrebujete približno 16 GB na milijardo parametrov — torej okoli štirikrat več. Spodaj sta obe številki razdelani po velikostih modelov.

To je najpogostejše vprašanje pri izbiri GPU strežnika in hkrati tisto, pri katerem je napaka najdražja: kartica s premalo pomnilnika ne bo počasnejša, ampak modela sploh ne bo pognala.

Koliko VRAM potrebujem za inferenco?

Vzemite število parametrov, ga pomnožite z bajti na parameter glede na natančnost (FP16 = 2, INT8 = 1, 4-bit = 0,5) in dodajte rezervo za predpomnilnik KV in dodatno porabo. Pri kratkih kontekstih zadostuje okoli 20 %, pri dolgih kontekstih in več hkratnih zahtevah pa je lahko bistveno več. Kvantizacija je pri inferenci najhitrejši način, da se model prilega na cenejšo kartico.

Velikost modelaFP16 / BF16INT84-bit
7 mrd. parametrov~17 GB~8 GB~4 GB
13 mrd. parametrov~31 GB~16 GB~8 GB
32 mrd. parametrov~77 GB~38 GB~19 GB
70 mrd. parametrov~168 GB~84 GB~42 GB

Številke so zaokrožene in vključujejo približno 20 % pribitka. Predpomnilnik KV raste z dolžino pogovora, zato pri dolgih kontekstih računajte na več.

Koliko VRAM potrebujem za treniranje?

Približno 16 GB na milijardo parametrov, kar je štirikrat več kot pri inferenci. Razlog ni velikost modela, ampak to, da je treba poleg uteži hraniti še gradiente in dve stanji optimizatorja. K temu se med samim treniranjem prištejejo še aktivacije, zato je to spodnja meja, ne končna številka.

Pri treniranju z optimizatorjem Adam v mešani natančnosti gre za vsak parameter modela 16 bajtov: 2 za uteži FP16, 2 za gradiente FP16, 4 za glavne uteži FP32 in 8 za dve stanji optimizatorja. Prav zato treniranje zahteva približno štirikrat več pomnilnika kot inferenca.

Vir: Rajbhandari et al., ZeRO: Memory Optimizations Toward Training Trillion Parameter Models, SC20, 2020
Velikost modelaStanja modela (Adam, mešana natančnost)Praktična posledica
7 mrd. parametrov~112 GBVeč kartic z NVLink
13 mrd. parametrov~208 GBVeč kartic z NVLink
32 mrd. parametrov~512 GBNamenska platforma ali LoRA
70 mrd. parametrov~1120 GBNamenska platforma ali LoRA

Ali tabela vključuje vse, kar porabi pomnilnik?

Ne. Pri treniranju so izpuščene aktivacije, ki so odvisne od velikosti serije in dolžine konteksta in lahko zahtevo občutno povečajo. Pri inferenci je predpomnilnik KV upoštevan približno, raste pa z dolžino pogovora. Tabela je zato izhodišče za oceno, ne nadomestilo za meritev na vaši dejanski obremenitvi.

Pošteno povedano: če je vaša ocena blizu meje razpoložljivega pomnilnika, je edini zanesljiv odgovor test. Ocena, ki pokaže 78 GB na kartici z 80 GB, v praksi ne bo delovala.

Ali lahko model poženem na kartici z manj pomnilnika?

Pri inferenci pogosto da, s kvantizacijo: INT8 prepolovi zahtevo, 4-bitna jo zmanjša na četrtino, za marsikatero rabo pa je izguba kakovosti sprejemljiva. Pri treniranju enak učinek dosežejo metode, kot sta LoRA in QLoRA, ki posodabljajo le majhen del parametrov, s čimer odpade večina stanj optimizatorja.

Prav zato je vredno vprašanje o pomnilniku zastaviti pred izbiro kartice. Odgovor „potrebujemo najmočnejšo kartico“ se po tem izračunu pogosto spremeni.

Kaj se zgodi, če model ne gre v pomnilnik ene kartice?

Model je treba razdeliti med več kartic, s čimer postane hitrost povezave med njimi ozko grlo. Takrat NVLink proti navadnemu PCIe ni več podrobnost, ampak odloča o dejanski zmogljivosti. To je tudi točka, kjer se cena konfiguracije skokovito poveča.

Ko za model pomnilnik ene kartice ne zadostuje, postane hitrost povezave med karticami ozko grlo in cena konfiguracije skokovito naraste. Meja med „gre v eno kartico“ in „ne gre“ je zato ekonomsko pomembnejša od razlike med modeli kartic.

Je bolje kupiti eno večjo kartico ali več manjših?

Če mora model teči kot celota, šteje pomnilnik na eni kartici — dve kartici s po 24 GB nista enakovredni eni z 48 GB. Če gre za več neodvisnih zahtev pri inferenci, je več manjših kartic za enak denar pogosto boljša izbira.

Preverimo vašo oceno

Pošljite velikost modela in način uporabe — povem vam, ali je ocena realna in katera konfiguracija jo pokrije.

Brezplačen posvet
Odgovorim osebno, v enem delovnem dnevu