Jaki serwer do lokalnego LLM
Chcesz uruchomić model językowy w firmie, ale nie wiesz, ile pamięci, jaka karta i czy wystarczy komputer na biurku? Pokazujemy, od czego zależy dobór sprzętu i jakie dwie konfiguracje sprawdzają się w praktyce.
Ile pamięci potrzebuje model
Przy lokalnym AI pierwsze pytanie nie brzmi „jaki procesor”, tylko „ile pamięci”. Model musi w całości zmieścić się w pamięci karty graficznej albo w pamięci wspólnej dla procesora i GPU. Jeśli się nie zmieści, albo nie ruszy, albo będzie działać boleśnie wolno.
Rachunek na start jest prosty: liczba parametrów × liczba bajtów na parametr. Ile bajtów, zależy od precyzji, w jakiej trzymasz wagi modelu:
| Precyzja | Bajty na parametr | Model 27B | Model 70B |
|---|---|---|---|
| 16-bit (FP16 / BF16) | 2 | ok. 54 GB | ok. 140 GB |
| 8-bit | 1 | ok. 27 GB | ok. 70 GB |
| 4-bit | ok. 0,5 | ok. 14 GB | ok. 35 GB |
To tylko wagi. Do tego dochodzi pamięć podręczna kontekstu (KV cache). Rośnie z długością rozmowy i z liczbą osób, które pracują jednocześnie. Asystent, który czyta długą umowę dla pięciu prawników naraz, potrzebuje dużo więcej pamięci niż ten sam model odpowiadający jednej osobie na krótkie pytania.
Dlatego zawsze zostawiamy zapas. Model, który „ledwo się mieści”, w codziennej pracy będzie się dusił przy pierwszym długim dokumencie.
Kwantyzacja do 4 czy 8 bitów oszczędza dużo pamięci, ale kosztem pewnej utraty jakości. Jak dużej, zależy od modelu i zadania. Dlatego przy zadaniach wymagających precyzji, na przykład przy analizie umów, testujemy różne warianty na przykładach klienta, zanim wybierzemy jeden.
Od czego zależy szybkość
Odpowiedź modelu powstaje w dwóch etapach i każdy ma inne wąskie gardło:
- Czytanie pytania i dokumentów (tzw. prefill). Tu liczy się moc obliczeniowa GPU. Długi dokument w kontekście to dużo liczenia na starcie.
- Pisanie odpowiedzi, token po tokenie. Przy każdym tokenie model odczytuje z pamięci swoje wagi. Decyduje więc przepustowość pamięci, czyli ile gigabajtów na sekundę sprzęt przerzuca.
Stąd ważna obserwacja: sprzęt z dużą, ale wolniejszą pamięcią zmieści większy model, a karta z szybką pamięcią szybciej napisze odpowiedź mniejszym modelem. To nie jest wybór „lepszy czy gorszy”, tylko dopasowanie do zadania.
Pomagają tu modele MoE (mixture of experts). Mają dużo parametrów, ale przy każdym tokenie pracuje tylko ich część. Przykład: Qwen3.6-35B-A3B ma 35 mld parametrów, z których przy każdym tokenie aktywne są 3 mld. Pamięci potrzebuje jak model 35B, ale przy każdym tokenie odczytuje tylko ułamek wag, więc pisze dużo szybciej niż gęsty model tej wielkości. Na sprzęcie z ograniczoną przepustowością pamięci to często najlepszy kompromis.
Dwie sprawdzone konfiguracje
W naszych wdrożeniach powtarzają się dwa scenariusze. Opisujemy je szerzej niż w przewodniku po lokalnym AI.
Zespół do 10 osób
NVIDIA DGX Spark lub Lenovo ThinkStation PGX
Układ NVIDIA GB10: 20-rdzeniowy procesor Arm i GPU Blackwell na wspólnych 128 GB pamięci LPDDR5X. Przepustowość pamięci to 273 GB/s, moc układu 140 W, obudowa 15 × 15 cm. NVIDIA podaje, że jedno urządzenie obsłuży wnioskowanie modeli do 200 mld parametrów.
Mieści duże modele, ale pisze wolniej niż serwer z osobną kartą. Na takim sprzęcie wdrażamy między innymi Firmaris Legal Studio.
Większe zespoły
Serwer z kartą NVIDIA RTX 6000 Ada
Profesjonalna karta z 48 GB pamięci GDDR6 z korekcją błędów (ECC) i przepustowością do 960 GB/s, czyli ok. 3,5 raza większą niż w GB10. Mniejszy model pisze na niej odpowiedzi wyraźnie szybciej.
Gdy przybywa użytkowników albo potrzebujesz większego modelu, dokładasz kolejne karty w tym samym serwerze.
NVIDIA oferuje też wersję DGX Spark z 64 GB pamięci. Do zastosowań firmowych wdrażamy wariant 128 GB, bo zapas pamięci przekłada się wprost na większe modele, dłuższe dokumenty i więcej osób naraz.
Ile to przetwarza w praktyce? Nasz benchmark RAG na ThinkStation PGX porównuje przetwarzanie dokumentów na tym sprzęcie i w chmurze.
Jak dobrać sprzęt do zespołu
Sprzęt dobieramy do trzech rzeczy: liczby osób pracujących naraz, wielkości modelu i długości dokumentów. Orientacyjnie wygląda to tak:
| Zespół | Model | Sprzęt |
|---|---|---|
| Kilka osób, krótkie zadania | Średni model w kwantyzacji 4- lub 8-bit | DGX Spark / ThinkStation PGX z dużym zapasem |
| Do 10 osób, dokumenty i agenci | Średni model albo duży model MoE | DGX Spark / ThinkStation PGX |
| Kilkadziesiąt osób | Średni lub duży model, wiele zapytań naraz | Serwer z jedną lub kilkoma kartami RTX 6000 Ada |
| Kilka modeli równolegle | Np. model ogólny, model do kodu, model do RAG | Serwer z kilkoma kartami, model na kartę |
Liczba pracowników w firmie to nie to samo co liczba zapytań naraz. Dwudziestoosobowy zespół rzadko pyta asystenta w tej samej sekundzie. Inaczej jest z agentami AI, którzy pracują w tle całą dobę: oni też zajmują sprzęt i trzeba ich doliczyć.
Jaki model wybrać, opisujemy w sekcji o modelach oraz w artykule Bielik w firmie. Ceny sprzętu zmieniały się w 2026 roku kilka razy, dlatego każdą konfigurację wyceniamy na bieżąco. Z czego składa się cały koszt, piszemy w tekście ile kosztuje wdrożenie AI.
Oprogramowanie: vLLM czy Ollama
Ten sam sprzęt potrafi działać dużo lepiej albo dużo gorzej, zależnie od tego, czym serwujesz model.
- Ollama jest świetna do testów. Instalujesz, pobierasz model, po kilku minutach rozmawiasz. Używamy jej w laboratorium do szybkiego porównywania modeli.
- vLLM to nasz wybór do produkcji. Zarządza pamięcią kontekstu w blokach (PagedAttention) i na bieżąco dokłada nowe zapytania do obliczeń (continuous batching), więc ten sam sprzęt obsługuje więcej użytkowników naraz.
Nad modelem stawiamy LiteLLM, czyli jedno API dla wszystkich modeli. Dzięki temu podmieniasz model na nowszy bez przerabiania aplikacji. Jeśli chcesz łączyć modele lokalne z chmurowymi, z budżetami i rejestrem zapytań, służy do tego Enterprise AI Gateway.
Prąd, hałas, miejsce i kopie zapasowe
Kilka praktycznych spraw, o które klienci pytają przed zakupem:
- Miejsce. DGX Spark i ThinkStation PGX mieszczą się na biurku albo w szafie sieciowej. Serwer z kartami RTX 6000 Ada lepiej postawić w serwerowni lub w osobnym pomieszczeniu.
- Prąd. DGX Spark ma zasilacz 240 W na całe urządzenie. Jedna karta RTX 6000 Ada pobiera do 300 W, więc serwer z kilkoma kartami potrzebuje solidnego zasilania i chłodzenia. Ile prądu zużywa każdy agent, pokazuje moduł FinOps, opisany w przewodniku.
- Kopie zapasowe. Model zawsze da się pobrać ponownie, ale baza wiedzy, historia rozmów i konfiguracja są Twoje. Po Twojej stronie jest miejsce na regularne kopie: dysk sieciowy NAS albo dysk USB.
- Sieć. Sprzęt działa w firmowej sieci LAN. Może pracować też w środowisku odciętym od internetu, co ma znaczenie przy danych objętych tajemnicą.
Pytania i odpowiedzi
Czy wystarczy zwykły komputer z kartą do gier?
Do nauki i testów tak. Do pracy całego zespołu zwykle nie: karty konsumenckie mają mniej pamięci, więc mieszczą mniejsze modele i krótszy kontekst dla mniejszej liczby osób. Dla firmy wybieramy sprzęt z dużym zapasem pamięci.
Co jest ważniejsze: ilość pamięci czy szybkość GPU?
Najpierw pamięć, bo od niej zależy, czy model w ogóle się zmieści i ile osób obsłużysz naraz. Szybkość pisania odpowiedzi zależy głównie od przepustowości pamięci, a szybkość czytania długich dokumentów od mocy obliczeniowej GPU.
Czy sprzęt można rozbudować, gdy zespół urośnie?
Tak. Do serwera z kartami RTX 6000 Ada dokładasz kolejne karty. Mały komputer DGX Spark możesz zostawić do jednego zadania, na przykład do bazy wiedzy, a resztę ruchu przenieść na większy serwer.
Ile kosztuje serwer do lokalnego LLM?
Ceny sprzętu zmieniały się w 2026 roku kilka razy, dlatego każdą konfigurację wyceniamy na bieżąco, po rozmowie o liczbie użytkowników i zadaniach. Sprzęt kupujesz raz, a potem płacisz głównie za prąd.
Źródła
- NVIDIA DGX Spark: specyfikacja (nvidia.com)
- Lenovo ThinkStation PGX: specyfikacja (PSREF) (lenovo.com)
- NVIDIA RTX 6000 Ada Generation (nvidia.com)
- NVIDIA RTX 6000 Ada: dane techniczne (Lenovo Press)
- Dokumentacja vLLM oraz publikacja o PagedAttention (arXiv)
- Qwen3.6-35B-A3B: parametry modelu (LLM Stats)
- Ollama