Artykuł

Jaki serwer do lokalnego LLM

Chcesz uruchomić model językowy w firmie, ale nie wiesz, ile pamięci, jaka karta i czy wystarczy komputer na biurku? Pokazujemy, od czego zależy dobór sprzętu i jakie dwie konfiguracje sprawdzają się w praktyce.

Łukasz Poźniak, AI Transformation ·

Ile pamięci potrzebuje model

Przy lokalnym AI pierwsze pytanie nie brzmi „jaki procesor”, tylko „ile pamięci”. Model musi w całości zmieścić się w pamięci karty graficznej albo w pamięci wspólnej dla procesora i GPU. Jeśli się nie zmieści, albo nie ruszy, albo będzie działać boleśnie wolno.

Rachunek na start jest prosty: liczba parametrów × liczba bajtów na parametr. Ile bajtów, zależy od precyzji, w jakiej trzymasz wagi modelu:

PrecyzjaBajty na parametrModel 27BModel 70B
16-bit (FP16 / BF16)2ok. 54 GBok. 140 GB
8-bit1ok. 27 GBok. 70 GB
4-bitok. 0,5ok. 14 GBok. 35 GB

To tylko wagi. Do tego dochodzi pamięć podręczna kontekstu (KV cache). Rośnie z długością rozmowy i z liczbą osób, które pracują jednocześnie. Asystent, który czyta długą umowę dla pięciu prawników naraz, potrzebuje dużo więcej pamięci niż ten sam model odpowiadający jednej osobie na krótkie pytania.

Dlatego zawsze zostawiamy zapas. Model, który „ledwo się mieści”, w codziennej pracy będzie się dusił przy pierwszym długim dokumencie.

Kwantyzacja do 4 czy 8 bitów oszczędza dużo pamięci, ale kosztem pewnej utraty jakości. Jak dużej, zależy od modelu i zadania. Dlatego przy zadaniach wymagających precyzji, na przykład przy analizie umów, testujemy różne warianty na przykładach klienta, zanim wybierzemy jeden.

Od czego zależy szybkość

Odpowiedź modelu powstaje w dwóch etapach i każdy ma inne wąskie gardło:

  • Czytanie pytania i dokumentów (tzw. prefill). Tu liczy się moc obliczeniowa GPU. Długi dokument w kontekście to dużo liczenia na starcie.
  • Pisanie odpowiedzi, token po tokenie. Przy każdym tokenie model odczytuje z pamięci swoje wagi. Decyduje więc przepustowość pamięci, czyli ile gigabajtów na sekundę sprzęt przerzuca.

Stąd ważna obserwacja: sprzęt z dużą, ale wolniejszą pamięcią zmieści większy model, a karta z szybką pamięcią szybciej napisze odpowiedź mniejszym modelem. To nie jest wybór „lepszy czy gorszy”, tylko dopasowanie do zadania.

Pomagają tu modele MoE (mixture of experts). Mają dużo parametrów, ale przy każdym tokenie pracuje tylko ich część. Przykład: Qwen3.6-35B-A3B ma 35 mld parametrów, z których przy każdym tokenie aktywne są 3 mld. Pamięci potrzebuje jak model 35B, ale przy każdym tokenie odczytuje tylko ułamek wag, więc pisze dużo szybciej niż gęsty model tej wielkości. Na sprzęcie z ograniczoną przepustowością pamięci to często najlepszy kompromis.

Dwie sprawdzone konfiguracje

W naszych wdrożeniach powtarzają się dwa scenariusze. Opisujemy je szerzej niż w przewodniku po lokalnym AI.

Zespół do 10 osób

NVIDIA DGX Spark lub Lenovo ThinkStation PGX

Układ NVIDIA GB10: 20-rdzeniowy procesor Arm i GPU Blackwell na wspólnych 128 GB pamięci LPDDR5X. Przepustowość pamięci to 273 GB/s, moc układu 140 W, obudowa 15 × 15 cm. NVIDIA podaje, że jedno urządzenie obsłuży wnioskowanie modeli do 200 mld parametrów.

Mieści duże modele, ale pisze wolniej niż serwer z osobną kartą. Na takim sprzęcie wdrażamy między innymi Firmaris Legal Studio.

Większe zespoły

Serwer z kartą NVIDIA RTX 6000 Ada

Profesjonalna karta z 48 GB pamięci GDDR6 z korekcją błędów (ECC) i przepustowością do 960 GB/s, czyli ok. 3,5 raza większą niż w GB10. Mniejszy model pisze na niej odpowiedzi wyraźnie szybciej.

Gdy przybywa użytkowników albo potrzebujesz większego modelu, dokładasz kolejne karty w tym samym serwerze.

NVIDIA oferuje też wersję DGX Spark z 64 GB pamięci. Do zastosowań firmowych wdrażamy wariant 128 GB, bo zapas pamięci przekłada się wprost na większe modele, dłuższe dokumenty i więcej osób naraz.

Ile to przetwarza w praktyce? Nasz benchmark RAG na ThinkStation PGX porównuje przetwarzanie dokumentów na tym sprzęcie i w chmurze.

Jak dobrać sprzęt do zespołu

Sprzęt dobieramy do trzech rzeczy: liczby osób pracujących naraz, wielkości modelu i długości dokumentów. Orientacyjnie wygląda to tak:

ZespółModelSprzęt
Kilka osób, krótkie zadaniaŚredni model w kwantyzacji 4- lub 8-bitDGX Spark / ThinkStation PGX z dużym zapasem
Do 10 osób, dokumenty i agenciŚredni model albo duży model MoEDGX Spark / ThinkStation PGX
Kilkadziesiąt osóbŚredni lub duży model, wiele zapytań narazSerwer z jedną lub kilkoma kartami RTX 6000 Ada
Kilka modeli równolegleNp. model ogólny, model do kodu, model do RAGSerwer z kilkoma kartami, model na kartę

Liczba pracowników w firmie to nie to samo co liczba zapytań naraz. Dwudziestoosobowy zespół rzadko pyta asystenta w tej samej sekundzie. Inaczej jest z agentami AI, którzy pracują w tle całą dobę: oni też zajmują sprzęt i trzeba ich doliczyć.

Jaki model wybrać, opisujemy w sekcji o modelach oraz w artykule Bielik w firmie. Ceny sprzętu zmieniały się w 2026 roku kilka razy, dlatego każdą konfigurację wyceniamy na bieżąco. Z czego składa się cały koszt, piszemy w tekście ile kosztuje wdrożenie AI.

Oprogramowanie: vLLM czy Ollama

Ten sam sprzęt potrafi działać dużo lepiej albo dużo gorzej, zależnie od tego, czym serwujesz model.

  • Ollama jest świetna do testów. Instalujesz, pobierasz model, po kilku minutach rozmawiasz. Używamy jej w laboratorium do szybkiego porównywania modeli.
  • vLLM to nasz wybór do produkcji. Zarządza pamięcią kontekstu w blokach (PagedAttention) i na bieżąco dokłada nowe zapytania do obliczeń (continuous batching), więc ten sam sprzęt obsługuje więcej użytkowników naraz.

Nad modelem stawiamy LiteLLM, czyli jedno API dla wszystkich modeli. Dzięki temu podmieniasz model na nowszy bez przerabiania aplikacji. Jeśli chcesz łączyć modele lokalne z chmurowymi, z budżetami i rejestrem zapytań, służy do tego Enterprise AI Gateway.

Prąd, hałas, miejsce i kopie zapasowe

Kilka praktycznych spraw, o które klienci pytają przed zakupem:

  • Miejsce. DGX Spark i ThinkStation PGX mieszczą się na biurku albo w szafie sieciowej. Serwer z kartami RTX 6000 Ada lepiej postawić w serwerowni lub w osobnym pomieszczeniu.
  • Prąd. DGX Spark ma zasilacz 240 W na całe urządzenie. Jedna karta RTX 6000 Ada pobiera do 300 W, więc serwer z kilkoma kartami potrzebuje solidnego zasilania i chłodzenia. Ile prądu zużywa każdy agent, pokazuje moduł FinOps, opisany w przewodniku.
  • Kopie zapasowe. Model zawsze da się pobrać ponownie, ale baza wiedzy, historia rozmów i konfiguracja są Twoje. Po Twojej stronie jest miejsce na regularne kopie: dysk sieciowy NAS albo dysk USB.
  • Sieć. Sprzęt działa w firmowej sieci LAN. Może pracować też w środowisku odciętym od internetu, co ma znaczenie przy danych objętych tajemnicą.

Pytania i odpowiedzi

Czy wystarczy zwykły komputer z kartą do gier?

Do nauki i testów tak. Do pracy całego zespołu zwykle nie: karty konsumenckie mają mniej pamięci, więc mieszczą mniejsze modele i krótszy kontekst dla mniejszej liczby osób. Dla firmy wybieramy sprzęt z dużym zapasem pamięci.

Co jest ważniejsze: ilość pamięci czy szybkość GPU?

Najpierw pamięć, bo od niej zależy, czy model w ogóle się zmieści i ile osób obsłużysz naraz. Szybkość pisania odpowiedzi zależy głównie od przepustowości pamięci, a szybkość czytania długich dokumentów od mocy obliczeniowej GPU.

Czy sprzęt można rozbudować, gdy zespół urośnie?

Tak. Do serwera z kartami RTX 6000 Ada dokładasz kolejne karty. Mały komputer DGX Spark możesz zostawić do jednego zadania, na przykład do bazy wiedzy, a resztę ruchu przenieść na większy serwer.

Ile kosztuje serwer do lokalnego LLM?

Ceny sprzętu zmieniały się w 2026 roku kilka razy, dlatego każdą konfigurację wyceniamy na bieżąco, po rozmowie o liczbie użytkowników i zadaniach. Sprzęt kupujesz raz, a potem płacisz głównie za prąd.

Źródła

Dobierzmy sprzęt do Twojego zespołu

Bezpłatna konsultacja. Policzymy, jaki model i jaka konfiguracja obsłużą Twoją pracę.