Artykuł

RAG: firmowa baza wiedzy AI

Chcesz, żeby asystent AI odpowiadał na podstawie Waszych procedur, umów i dokumentacji, a nie ogólnej wiedzy z internetu? Do tego służy RAG. Wyjaśniamy, jak działa, od czego zależy jakość odpowiedzi i dlaczego może działać w całości na Twoim serwerze.

Łukasz Poźniak, AI Transformation ·

Czym jest RAG

Model językowy sam z siebie nie zna Twojej firmy. Nie wie, jak wygląda procedura reklamacji, co jest w umowie z kluczowym klientem ani która wersja instrukcji obowiązuje. Zapytany o to, zgaduje. Albo uczciwie odpowiada, że nie wie.

RAG rozwiązuje ten problem. Zanim model napisze odpowiedź, system przeszukuje firmową bazę dokumentów i dokłada do pytania kilka najtrafniejszych fragmentów. Model odpowiada na ich podstawie i wskazuje, skąd wziął informację. Ty dostajesz odpowiedź z odnośnikiem do źródła, które możesz sprawdzić jednym kliknięciem.

To trochę jak praca z nowym, bystrym pracownikiem, któremu przed każdym pytaniem kładziesz na biurku właściwy segregator.

Dlaczego nie trenować modelu na danych firmy

Pierwszy pomysł wielu firm brzmi: „nauczmy model naszych dokumentów”. Wiedza zapisana w parametrach modelu ma jednak ograniczenia, które autorzy pracy wprowadzającej RAG opisali wprost: trudno ją aktualizować i trudno wskazać, skąd pochodzi odpowiedź. Baza dokumentów, z której model korzysta przy odpowiedzi, da się natomiast po prostu poprawiać i rozszerzać. W praktyce firmy oznacza to:

  • Wiedza się starzeje. Zmiana cennika czy procedury oznacza ponowne trenowanie. W RAG po prostu podmieniasz dokument.
  • Trudno „oduczyć”. Z wytrenowanego modelu nie usuniesz po prostu pojedynczej umowy. Z bazy RAG usuniesz ją w każdej chwili, co ma znaczenie także przy RODO.
  • Brak uprawnień. Wiedza zapisana w modelu nie ma podziału na to, kto może ją zobaczyć. W RAG wyszukiwanie uwzględnia, kto pyta i do czego ma dostęp.
  • Brak źródeł. Model z douczoną wiedzą nie wskaże wiarygodnie, z którego dokumentu pochodzi odpowiedź. RAG może podać fragment i odnośnik do źródła.

Dlatego w naszych wdrożeniach model nie jest trenowany na Twoich danych. Sięga po nie dopiero w chwili odpowiedzi.

Jak działa RAG krok po kroku

RAG ma dwie fazy. Najpierw dokumenty trafiają do bazy (ładowanie). Potem, przy każdym pytaniu, system szuka w niej odpowiednich fragmentów.

Ładowanie dokumentów

  1. Odczyt treści

    System wyciąga tekst z PDF, DOCX czy plików tekstowych. Skany i zdjęcia dokumentów przechodzą przez OCR, a nagrania przez transkrypcję.

  2. Podział na fragmenty

    Długi dokument dzielimy na fragmenty (chunki), na przykład po paragrafach lub punktach umowy. Sposób podziału dobieramy do rodzaju dokumentów.

  3. Embeddingi

    Osobny model zamienia każdy fragment na wektor liczb (embedding), który oddaje jego znaczenie. Dzięki temu wyszukiwanie radzi sobie z synonimami i skrótami, a nie tylko z identycznymi słowami.

  4. Indeks

    Wektory, tekst i metadane (dokument, wersja, data, uprawnienia) trafiają do bazy, w której da się je szybko przeszukiwać.

Odpowiedź na pytanie

  1. Wyszukiwanie hybrydowe

    Łączymy dwa sposoby szukania: wektorowy, który dopasowuje sens pytania, i pełnotekstowy BM25, który pilnuje dokładnych słów, numerów i sygnatur. Wyniki obu łączymy w jedną listę, w której wyżej trafiają fragmenty dobrze ocenione przez którąkolwiek z metod.

  2. Ponowne sortowanie

    Opcjonalnie dodatkowy model (reranker) ocenia każdą parę „pytanie i fragment” jeszcze raz. Jest dokładniejszy, ale wolniejszy, dlatego sprawdza tylko kilkadziesiąt najlepszych wyników z wyszukiwania.

  3. Odpowiedź ze źródłami

    Model językowy dostaje pytanie i wybrane fragmenty. Pisze odpowiedź i podaje, z których dokumentów skorzystał.

W naszym stosie odpowiada za to baza wiedzy we frameworku CerebrOS, z wyszukiwaniem hybrydowym (wektory + BM25). Dokumenty ładujesz w formatach PDF, DOCX, TXT i Markdown, a także jako skany (JPG, PNG) i nagrania audio.

Od czego zależy jakość odpowiedzi

Większość problemów z RAG nie wynika z modelu, tylko z dokumentów i sposobu ich przygotowania. Na co zwracamy uwagę przy wdrożeniu:

  • Aktualne wersje. Jeśli w bazie leżą trzy wersje regulaminu, asystent może zacytować najstarszą. Archiwum warto oznaczyć albo trzymać osobno.
  • Duplikaty. Ten sam dokument w pięciu kopiach zajmuje miejsce w wynikach i wypycha inne, potrzebne fragmenty.
  • Tabele i skany. Cenniki, specyfikacje i słabej jakości skany to najtrudniejszy materiał. Wymagają dobrego parsowania i OCR, czasem ręcznej poprawki.
  • Uprawnienia. Dział handlowy nie powinien dostać fragmentu umowy o pracę. Uprawnienia przenosimy do bazy razem z dokumentem.
  • Cytaty. Odpowiedź bez źródła trudno sprawdzić. Asystent ma pokazywać, skąd wie, a gdy nie znajdzie odpowiedzi, mówić to wprost.
  • Test na prawdziwych pytaniach. Przed startem zbieramy pytania, które pracownicy faktycznie zadają, i sprawdzamy na nich odpowiedzi. Bez tego trudno ocenić, czy baza działa dobrze.

Zasada: AI przygotowuje odpowiedź, człowiek ją weryfikuje. Odnośnik do źródła sprawia, że ta weryfikacja trwa sekundy, a nie minuty.

Zastosowania w firmie

RAG przydaje się wszędzie tam, gdzie ludzie tracą czas na szukanie informacji, która gdzieś już jest zapisana:

  • Wdrażanie nowych pracowników. Nowa osoba pyta asystenta zamiast kolegów. Odpowiedź opiera się na procedurach i instrukcjach.
  • Procedury i regulaminy. „Jak rozliczyć delegację?”, „Kto zatwierdza zamówienie powyżej limitu?”. Odpowiedź z odnośnikiem do właściwego dokumentu.
  • Dokumentacja techniczna. Instrukcje maszyn, karty produktów, specyfikacje. Serwisant szybciej znajduje właściwy parametr.
  • Umowy i akta. Przeszukiwanie umów, akt spraw i korespondencji. Firmaris Legal Studio, nasz agent AI dla kancelarii, korzysta z multimodalnej bazy RAG na kodeksy, akta i bazę wiedzy kancelarii.
  • Obsługa klienta. Projekty odpowiedzi na pytania klientów, oparte na aktualnej ofercie i warunkach. Pracownik sprawdza i wysyła.

RAG lokalnie czy w chmurze

Baza wiedzy to zwykle najbardziej wrażliwa część systemu AI. Trafiają do niej umowy, akta, dane klientów i know-how firmy. W chmurowym RAG te dokumenty, ich embeddingi i indeks leżą u dostawcy.

Lokalnie cały proces zostaje u Ciebie: parsowanie, OCR, embeddingi, indeks i sam model językowy. Dokument nie opuszcza firmowej sieci ani przy ładowaniu, ani przy odpowiedzi. Więcej o tym, co to oznacza dla ochrony danych, piszemy w przewodniku, w części o RODO i tajemnicy zawodowej.

Ile to trwa na lokalnym sprzęcie? Zmierzyliśmy to. W naszym benchmarku ładowania dokumentów 10 plików PDF trafiło do lokalnej bazy w 89,2 sekundy na Lenovo ThinkStation PGX (tryb równoległy). Ten sam zestaw na zwykłym komputerze biurowym zajął 317 sekund. Ładowanie mocno obciąża procesor, bo parsowanie, OCR i podział na fragmenty to praca obliczeniowa. Jak dobrać sprzęt do liczby użytkowników i dokumentów, opisujemy w artykule Jaki serwer do lokalnego LLM.

Masz już narzędzia w chmurze? Nie musisz wybierać. Enterprise AI Gateway kieruje zapytania z wrażliwymi danymi do lokalnego modelu, a pozostałe do wybranego modelu w chmurze.

Pytania i odpowiedzi

Czy model AI uczy się na dokumentach z bazy wiedzy?

Nie. Model nie jest trenowany na Twoich danych. Sięga po fragmenty dokumentów dopiero w chwili odpowiedzi. Dokument możesz w każdej chwili dodać, podmienić albo usunąć, a dostęp do niego wynika z uprawnień.

Jakie dokumenty można załadować do bazy RAG?

PDF, DOCX, pliki tekstowe i Markdown, a także skany i zdjęcia dokumentów (tekst odczytuje OCR) oraz nagrania audio, które przed indeksowaniem są transkrybowane.

Co, jeśli w bazie nie ma odpowiedzi na pytanie?

Dobrze skonfigurowany asystent mówi wtedy wprost, że nie znalazł informacji w dokumentach, zamiast zgadywać. Każda odpowiedź ma podawać źródło, żeby dało się ją łatwo sprawdzić.

Czy RAG może działać bez internetu?

Tak. Parsowanie, embeddingi, indeks i model językowy mogą działać w całości na serwerze w Twojej firmie. Dokumenty nie opuszczają firmowej sieci.

Źródła

Zbudujmy bazę wiedzy Twojej firmy

Bezpłatna konsultacja. Sprawdzimy Wasze dokumenty i pokażemy, jak asystent może na nich pracować.