Az AI-piac az elmúlt években jelentős átalakuláson ment keresztül. Kezdve ott, hogy amíg régebben a munkafolyamatok nagy része tréningspecifikus volt, addig manapság inkább a gépi tanulás következtetés szakasza került előtérbe. Utóbbinak azért van jelentősége, mert amíg a tréningre kifejezetten jók a GPU-k, addig a következtetésre már nem annyira. Ezzel a problémával szembesült mostanra az Intel, az AMD és az NVIDIA is, és erre reagálva megpróbáltak olyan megoldásokat kitalálni, amellyel a tréningre szabott dizájnjaik új lendületet kapnak.
Az NVIDIA például a Groq fejlesztéseit implementálta a saját rendszereibe, az AMD a Cerebras partnereként reagál a változásokra, míg az Intel a SambaNova hardverportfólióját igyekszik beépíteni. Látható, hogy az a terület, ami a három nagynak nem igazán megy, a kisebbeknek viszonylag könnyű célpont, mert célirányosan úgy tervezték a fejlesztéseiket, hogy itt erősek legyenek.
Hirdetés
Persze a SambaNova, a Cerebras és a Groq nem olyan rendszerek, amelyek alapvetően mindenre jók. A Groq többek között a gépi tanulás következtetés szakaszát csinálja relatíve gyorsan és hatékonyan, de máshova kifejezetten gyenge. A SambaNova ezzel szemben nem fókuszál arra, hogy a leggyorsabb legyen, mégis a kiszámíthatósága nagy előny, miközben a Cerebras technikailag elképesztően erős, elképesztően jó eredményeket mutat fel, csak éppen a termék gyártása drága, így ez az irány a legköltségesebb.
Látható tehát, hogy amíg azt mondjuk, hogy az Intel, az AMD, az NVIDIA, a Groq, a SambaNova és a Cerebras megoldása is alkalmas a gépi tanulás következtetés szakaszára, addig a részletekbe nem megyünk bele, pedig itt van a fejlesztések közötti nagy különbség, és ebből a szempontból már a GPU-szerű dizájnok erős hátrányt szenvednek el a svájci bicska jellegű, mindenre jó, de semmire sem a legjobb felépítésükkel. Besorolható lenne még a Xilinx is, amely szintén lefed egy nagyon specifikus területet az AI-piacon, de ezt a céget már felvásárolta az AMD.
A hardverek tekintetében tehát rengeteg alternatíva van, de általánosan egyik sem a legjobb. És, hogy melyiket érdemes venni? Ez az érdekes kérdés. Nyilván, ha nem számít a pénz, akkor a Cerebras dizájnja legyőzhetetlennek tűnik, de amikor az erre épített szolgáltatásnál a tokenek árát szabják meg, akkor ennek azért lesz némi böjtje. Tehát azt sem lehet mondani, hogy csak vegyük az abszolút leggyorsabbat, mert ma már számít, hogy mennyiért lehet üzemeltetni. Itt jön képbe az, hogy az AI szolgáltatást kínáló nagyobb cégek egyre inkább saját hardverdizájnban gondolkodnak. Ez pont azt szolgálja, hogy a lehető legjobb teljesítményt kapják meg, a lehető legkisebb üzemeltetési költség mellett. És ez olyannyira jelentős tényező vált, hogy gyakorlatilag már megéri a költséges hardvertervezést is bevállalni.
Ezen a ponton érdekes az AMD friss bejelentése a Taalas felvásárlásáról. Utóbbi vállalat egy kicsit specifikus irányban mozog, mivel nem tipikusan a GroQ, a SambaNova és a Cerebras trió általánosabb hardvertervezését erőltetik, hanem az a céljuk, hogy egy adott neuronháló modellcsaládjának súlyait eleve rögzítsék a lapkában, miközben az adapterek és a finomhangolás módosítható.
A vállalat első tesztchipje, vagyis a HC1 a TSMC 6 nm-es node-ján készült, és a Meta Llama 3.1 8B modellt, illetve annak finomhangolt variánsait támogatja, amelyek ugyanazt a súlyozást használják. Ez a hardverdizájn 16 960 token/s tempót tud, vagyis még a Cerebras dizájnjára is ráígér, miközben a fogyasztása is jóval kisebb. Szintén megjegyezhető, hogy a szélesebb körben használt GPU-khoz viszonyítva a tesztlapka előnye nagyságrendekben mérhető. Viszont itt azt is szóvá kell tenni, hogy mi a hátrány. Mivel a súlyok eleve rögzítve vannak ezért azokat már nem kell a memóriában tárolni. Innen jön a hardver letaglózó sebessége és döbbenetesen jó energiahatékonysága, de ez azt is jelenti, hogy csak azokat a modelleket tudja futtatni, amelyek a rögzített súlyokat használják.
Ha nagyon le akarjuk ezt egyszerűsíteni, akkor a Taalas dizájnja az első, ami az AI problémáját megpróbálja ASIC jellegű hardverrel megoldani, teszi ezt annak minden előnyével és hátrányával.
De miért értékes ez az AMD-nek? Leginkább azért lehet, mert a cégen belül eleve van Semi-Custom üzletág, tehát a nagyobb megrendelőknek terveznek egyedi chipdizájnt. Ebbe a portfólióba nagyon jól illik a Taalas, főleg annak tudatában, hogy előbb-utóbb majd nyereséget is kellene termelni az AI szolgáltatást kínáló cégeknek. Ezt csak úgy tudják majd megtenni, ha az üzemeltetési költségeket minimalizálják, és részben ezt a célt szolgálja az is, hogy több érintett inkább saját hardverek felé mozdul. A Taalas viszont érdekes alternatíva lehet számukra, mert a Meta, a Google, az OpenAI és az Anthropic egyes modelljei jó darabig elérhetők maradnak. Ez akár másfél-két évet is jelenthet, vagy akár többet. Ha egy ilyen modell nagyon sok lekérést szolgál ki, akkor azért megfontolandó építeni alá egy olyan célirányos hardvert, ami nagyjából egy nagyságrenddel kevesebb energia felhasználásával oldja meg a feladatot, mert még egy-két éves távon is bőven visszahozza a fejlesztési költségeket. Ha pedig a későbbiekben kitolják a modellek élettartamát, akkor nem is kérdés, hogy hasznos-e ezt az irányt erőltetni.
Annyi biztos, hogy a Taalas koncepciójával az AMD csak a nagy szolgáltatókat tudja majd célozni, mert szükség van egy bizonyos mennyiségű minimum igénybevételre, hogy megérje egyáltalán elgondolkodni abban, hogy a súlyokat rögzítsék hardveresen. De ha van mondjuk évente több száz milliárd lekérés, és ez a Meta, a Google, az OpenAI és az Anthropic szintjén megvan, akkor magasan ez a leggyorsabb, legkevesebbet fogyasztó és legolcsóbb alternatíva.
