Artykuł

Bielik w firmie: kiedy ma sens

Polski model językowy brzmi jak oczywisty wybór dla polskiej firmy. Czasem jest. Czasem lepiej sprawdzi się większy model ogólny. Pokazujemy, do czego Bielik nadaje się najlepiej, gdzie odpuścić i jak sprawdzić go na własnych dokumentach.

Łukasz Poźniak, AI Transformation ·

Czym jest Bielik

Bielik to rodzina otwartych modeli językowych uczonych z myślą o języku polskim. Rozwija ją społeczność SpeakLeash razem z Akademickim Centrum Komputerowym Cyfronet AGH. Modele możesz pobrać i uruchomić na własnym serwerze, tak jak każdy inny otwarty model.

Obecnie rozwijana jest trzecia generacja, v3:

  • Bielik-11B-v3.0-Instruct: główny model rodziny, z 11 mld parametrów. Według karty modelu obsługuje 32 języki europejskie, z naciskiem na polski. Wersja 3 z 11 mld parametrów ukazała się 1 stycznia 2026,
  • Bielik-PL-11B-v3.0-Instruct: ten sam rozmiar, ale z tokenizerem APT4 zoptymalizowanym pod język polski,
  • Bielik-PL-Minitron-7B-v3.0-Instruct: model zmniejszony do 7,35 mld parametrów przez przycinanie i destylację wiedzy. Twórcy podają do 50% szybsze generowanie przy zachowaniu około 90% jakości modelu bazowego. Też ma polski tokenizer,
  • mniejsze modele v3 w rozmiarach 1,5 i 4,5 mld parametrów, do prostszych zadań i słabszego sprzętu.

Licencja: wszystkie trzy modele 11B i 7B wymienione wyżej są udostępnione na licencji Apache 2.0, która pozwala na użycie komercyjne. Każdy wariant ma jednak własną kartę modelu na Hugging Face. Licencję wybranej wersji sprawdź tam, zanim wdrożysz ją w firmie.

Kiedy Bielik ma sens

Bielik wygrywa tam, gdzie liczy się brzmienie polskiego tekstu. Duże modele ogólne piszą po polsku poprawnie, ale czasem sztywno. Zdarzają im się kalki z angielskiego i dziwny szyk zdania. Klient to wyczuje.

Teksty, które czyta klient

  • Korespondencja. Odpowiedzi na maile, przypomnienia, podziękowania. Krótkie teksty, w których ton jest ważniejszy niż głęboka analiza.
  • Pisma i dokumenty. Projekty pism, opisy ofert, notatki ze spotkań. Bielik dobrze trzyma się polskiej składni i urzędowego stylu.
  • Streszczenia. Skrót długiego maila albo dokumentu, który ma przeczytać człowiek, a nie inny program.

Mały model, mały sprzęt

11 mld parametrów to niewiele jak na dzisiejsze modele. Bielik zmieści się na skromniejszym sprzęcie i odpowie szybciej niż model kilka razy większy. Na serwerze, który już obsługuje duży model, możesz go uruchomić obok, bez dokupowania kolejnej karty. Więcej o doborze sprzętu piszemy w artykule Jaki serwer do lokalnego LLM.

Polski tokenizer, czyli mniej „kawałków” tekstu

Model nie czyta liter ani słów. Dzieli tekst na tokeny, czyli fragmenty słów. Tokenizery większości modeli powstały głównie pod angielski, więc polskie słowo z końcówką fleksyjną rozpada się często na kilka tokenów. Tokenizer zbudowany pod polszczyznę tnie ten sam tekst na mniej części.

Dlaczego to ważne? Bo model generuje odpowiedź token po tokenie. Mniej tokenów na ten sam polski tekst oznacza:

  • szybsze odpowiedzi, bo model ma mniej kroków do wykonania,
  • więcej treści w oknie kontekstu, bo limit liczy się w tokenach, a nie w stronach,
  • mniejsze zużycie sprzętu na każde zapytanie.

Dlatego warianty Bielik-PL z tokenizerem APT4 są ciekawe właśnie przy dużej liczbie polskich tekstów. Ile faktycznie zyskasz, zależy od Twoich dokumentów, więc warto to zmierzyć w teście opisanym niżej.

Kiedy wybrać inny model

Uczciwie: rozmiar ma swoją cenę. Model z 11 mld parametrów nie zastąpi kilka razy większego modelu w każdym zadaniu. Z naszego doświadczenia wynika taki podział:

ZadanieLepszy wybór
List do klienta, streszczenie, notatkaBielik
Analiza umowy krok po kroku, wnioskowanieWiększy model ogólny (np. Gemma 4, Qwen 3.8)
Agent, który wywołuje narzędzia i wykonuje wieloetapowe zadaniaWiększy model ogólny
Pisanie i poprawianie koduModel wyspecjalizowany w kodzie
Bardzo długie dokumenty narazModel z dużym oknem kontekstu

Agenci to osobny temat. Agent, który czyta skrzynkę, zakłada sprawę w CRM i przypisuje ją do pracownika, musi niezawodnie wywoływać narzędzia i pilnować kolejnych kroków. Tu sięgamy po większe modele ogólne. Tak pracują agenci w Firmaris Legal Studio i Oferris RFQ Studio.

Duet: model ogólny i Bielik

Nie musisz wybierać jednego modelu do wszystkiego. W wielu wdrożeniach najlepiej działa podział pracy:

  1. Model ogólny wykonuje zadanie

    Analizuje dokumenty, wyciąga fakty, podejmuje kroki agenta.

  2. Bielik pisze tekst dla człowieka

    Na podstawie gotowych ustaleń przygotowuje odpowiedź do klienta albo streszczenie po polsku.

  3. Pracownik zatwierdza

    Decyzja zawsze należy do człowieka. AI przygotowuje materiał.

Tak też podchodzimy do Bielika w naszych wdrożeniach: sięgamy po niego, gdy tekst ma brzmieć naturalnie po polsku. Modele serwujemy przez vLLM, a dostęp spina LiteLLM. Dzięki temu możesz w każdej chwili podmienić model na nowszą wersję albo przekierować część zadań do innego modelu, bez przerabiania aplikacji. Ruch między modelami lokalnymi i chmurowymi w całej organizacji rozdziela Enterprise AI Gateway.

Więcej o tym, jak dobieramy modele do zadań, przeczytasz w przewodniku, w części Jakie modele wybrać.

Jak sprawdzić Bielika u siebie

Rankingi i benchmarki mówią, jak model radzi sobie średnio. Ciebie interesuje, jak poradzi sobie z Twoimi dokumentami. Zanim zdecydujesz, zrób mały test:

  1. Zbierz 20-30 prawdziwych przykładów

    Maile od klientów, pisma, notatki. Takie, z jakimi zespół pracuje na co dzień. Dane osobowe zanonimizuj albo przeprowadź test na sprzęcie w firmie.

  2. Daj to samo zadanie kilku modelom

    Ten sam prompt dla Bielika i jednego lub dwóch modeli ogólnych.

  3. Oceniaj na ślepo

    Niech osoby, które piszą te teksty na co dzień, ocenią odpowiedzi bez wiedzy, który model je napisał. Liczą się poprawność, ton i to, ile trzeba poprawiać.

  4. Zmierz czas i obciążenie

    Sprawdź, jak szybko przychodzi odpowiedź i ile pamięci zajmuje model na Twoim sprzęcie.

Taki test zajmuje kilka dni, a oszczędza miesiące pracy na niewłaściwym modelu. Jeśli testujesz na prawdziwych danych klientów, przeczytaj najpierw, jak lokalne AI ma się do RODO i tajemnicy zawodowej.

Pytania i odpowiedzi

Czy Bielik jest lepszy od ChatGPT po polsku?

To zależy od zadania. Przewaga Bielika to polszczyzna i to, że działa na Twoim serwerze. W trudnym rozumowaniu i zadaniach wieloetapowych przewagę mają większe modele. Najpewniejszą odpowiedź da test na Twoich własnych tekstach.

Czy Bielika można używać komercyjnie?

Modele Bielik-11B-v3.0-Instruct, Bielik-PL-11B-v3.0-Instruct i Bielik-PL-Minitron-7B-v3.0-Instruct są na licencji Apache 2.0, która dopuszcza użycie komercyjne. Licencję konkretnego wariantu zawsze sprawdź na jego karcie modelu przed wdrożeniem.

Czy Bielik wystarczy jako jedyny model w firmie?

Przy prostych zadaniach tekstowych tak. Jeśli planujesz agentów, analizę długich dokumentów albo pracę z kodem, dołóż większy model ogólny. Oba mogą działać na jednym serwerze.

Źródła

Sprawdźmy Bielika na Twoich dokumentach

Bezpłatna konsultacja. Dobierzemy modele do zadań w Twojej firmie.