Hardware pro lokální výpočty a AI modely

Provozování vlastních algoritmů vyžaduje víc než jen běžný kancelářský počítač. V Tangoline se zaměřujeme na stavbu infrastruktury, která zvládne náročné datové operace přímo u vás, bez závislosti na cloudu.

Close-up of a high-end server rack with glowing LED indicato

Příběh o jednom přehřátém serveru v Plzni

„Pamatuji si to jako dnes, bylo léto 2018 a jeden z našich prvních klientů v Plzni se rozhodl, že si AI model pro analýzu skladu spustí na starém workstationu, který mu zbyl po grafikovi. ‚Vždyť to má i7 a 32 GB RAM, to musí stačit,‘ říkal mi tehdy majitel firmy. Jenže zapomněl na jednu zásadní věc: trénování neuronových sítí není jako renderování videa. Je to kontinuální, brutální zátěž, která nepoleví ani na sekundu.“

„Po třech dnech nepřetržitého provozu mi volal v osm ráno. V serverovně, což byla v podstatě jen větší skříň bez větrání, bylo přes padesát stupňů. Zdroj to nevydržel, kondenzátory se nafoukly a celý systém lehl těsně před dokončením důležitého výpočtu. ‚— A já mu říkám,‘ vzpomínám si na ten rozhovor, ‚že bez pořádného chlazení a dedikovaných Tensor jader to prostě nepůjde.‘ Tenkrát jsme se naučili, že hardware pro lokální AI není o tabulkových hodnotách, ale o schopnosti udržet stabilitu pod tlakem.“

Tato zkušenost nás dovedla k definování přísných standardů pro technický vývoj do roku 2030. Dnes už víme, že pro lokální nasazení musíme počítat s rezervou výkonu alespoň 40 %, abychom předešli podobným incidentům. Hardware musí být navržen tak, aby mohl běžet týdny v kuse bez jediného restartu, což vyžaduje specifické komponenty s certifikací pro nepřetržitý provoz.

Výkonné GPU jednotky

Pro lokální AI nepoužíváme běžné grafické karty. Zaměřujeme se na modely s vysokou kapacitou VRAM (minimálně 24 GB), které umožňují načtení celých jazykových modelů do paměti bez nutnosti swapování na disk.

NVMe Storage pole

Rychlost čtení dat je kritickým úzkým hrdlem. Naše systémy využívají PCIe 5.0 sběrnice a RAID 10 konfigurace pro zajištění maximální propustnosti a zároveň bezpečnosti vašich dat při zpracování dat a algoritmů.

Redundantní napájení

Výpadek proudu během trénování modelu může znamenat ztrátu dnů práce. Implementujeme UPS systémy s přímou komunikací s OS, které v případě nouze korektně uloží stav výpočtu a bezpečně vypnou hardware.

Infrastruktura pro 21. století

Lokální výpočty nejsou jen o hrubém výkonu, ale o kontrole nad vlastními daty. V době, kdy se cloudové služby stávají čím dál dražšími a méně transparentními z hlediska soukromí, představuje vlastní hardware jedinou cestu k opravdové digitální suverenitě. Naše řešení v Tangoline stavíme na otevřených standardech, které umožňují snadný upgrade v budoucnu.

Při návrhu infrastruktury se řídíme třemi pilíři: škálovatelnost, tichý provoz a energetická efektivita. Uvědomujeme si, že ne každá firma má dedikovanou serverovnu, proto nabízíme i "office-friendly" varianty s kapalinovým chlazením, které neruší okolí hlukem ventilátorů.

„Hardware je základ, na kterém stojí veškerá inteligence algoritmu. Pokud je základ slabý, celá stavba se zřítí.“

Proč zvolit lokální hardware?

  • Nulová latence při komunikaci s interními systémy a databázemi.
  • Absolutní kontrola nad bezpečností a přístupovými právy k citlivým datům.
  • Fixní náklady bez překvapivých faktur za přenosy dat v cloudu.
  • Možnost provozovat neomezené množství experimentů bez dodatečných poplatků.

Doporučené konfigurace pro rok 2024

Komponenta Základní (Inferenční) Pokročilá (Tréninková) Enterprise (Cluster)
Procesor (CPU) Intel Core i9 / Ryzen 9 (16 jader) AMD Threadripper (32 jader) 2x Intel Xeon Gold (64+ jader)
Grafika (GPU) RTX 4090 24GB VRAM 2x RTX 6000 Ada 48GB NVIDIA H100 / A100 Tensor Core
Paměť (RAM) 64 GB DDR5 256 GB ECC DDR5 1 TB+ LRDIMM
Úložiště 2 TB NVMe Gen4 8 TB NVMe RAID 1 All-Flash Array (San/Nas)

* Uvedené specifikace jsou orientační a vždy závisí na konkrétním typu nasazeného modelu. Pro správnou volbu doporučujeme konzultaci našich expertů.

Cesta k vlastnímu AI serveru

1. Analýza zátěže

Změříme náročnost vašich algoritmů a definujeme potřebný výpočetní výkon pro hladký chod.

1

2. Návrh architektury

Vybereme komponenty s ohledem na budoucí škálování a energetickou náročnost vašeho pracoviště.

2

3. Montáž a zahoření

Hardware sestavíme a podrobíme 72hodinovému zátěžovému testu, abychom eliminovali vadné kusy.

3

4. Implementace a dohled

Nasadíme software a nastavíme monitoring, který nás upozorní na jakékoli anomálie v provozu.

4

Přestaňte platit za cloud, investujte do vlastního

Máme zkušenosti s nasazováním lokálních výpočetních jednotek v průmyslu i administrativě. Rádi s vámi probereme vaše potřeby a navrhneme řešení, které se zaplatí během prvního roku provozu. Přečtěte si také o našem pohledu na budoucnost technologií.

Zpět na hlavní přehled