Ragable

← Wszystkie artykuły

Od pilotażu do produkcji: wdrożenie asystenta dokumentów

5 min czytania
Od pilotażu do produkcji: wdrożenie asystenta dokumentów

Każdy projekt asystenta dokumentów, jaki prowadziliśmy, przechodził pilotaż bez trudu, a tydzień później trafiał na zupełnie inny zestaw problemów. Różnica nie leży w jakości modelu. Pilotaż i wdrożenie produkcyjne odpowiadają na osobne pytania, a to drugie dotyczy głównie dokumentów, uprawnień i operacji, nie matematyki wyszukiwania. Poniżej kolejność, której dziś używamy - taka, w jakiej decyzje naprawdę się pojawiają.

Dlaczego pilotaż nigdy nie był trudną częścią

Pilotaż odpowiada na jedno wąskie pytanie: czy asystent znajdzie właściwy fragment w małym, wyselekcjonowanym zbiorze i wskaże jego źródło. Produkcja pyta o coś trudniejszego. Czy robi to dalej, gdy korpus rośnie trzykrotnie, uprawnienia różnią się między użytkownikami, a nikt niczego nie selekcjonował? Pilotaż działa na plikach, które ktoś wybrał ręcznie w zeszłym tygodniu. Produkcja działa na dysku współdzielonym, nietykanym od 2019 roku. Publiczność na demo wybaczy błędną odpowiedź. Dział finansowy składający wniosek już nie. Dlatego traktujemy pilotaż jako test wykonalności, nie próbę generalną. Inżynieria zaczyna się po jego zaliczeniu.

Ustal, czego asystent ma prawo nie wiedzieć

Retrieval augmented generation odpowiada na podstawie twoich dokumentów, więc uczciwy tryb porażki to „nie udało mi się tego znaleźć", a nie płynnie brzmiąca zmyślona odpowiedź. Próg odmowy ustal przed startem: poniżej jakiej pewności wyszukiwania asystent ma odmówić? Zakres korpusu też wyznacz świadomie. Wrzuć do indeksu każdy firmowy PDF i rozmyjesz ranking, zakopując materiały, o które ludzie naprawdę pytają. Każda odpowiedź nosi ze sobą fragment, z którego powstała, więc weryfikacja przestaje być kwestią zaufania i staje się kliknięciem na dwie sekundy.

Wskazówka: zapisz pięć pytań, na które asystent powinien odmówić odpowiedzi, i testuj je przy każdym wydaniu. Ciche rozjeżdżanie się zakresu ujawnia się tam najpierw.

Chmura czy własna infrastruktura: decyzja podjęta raz

Przesądza zwykle nie technika, a umowy: to, na co pozwala klasyfikacja twoich danych i podpisane kontrakty. Wdrożenie on-premise trzyma dokumenty, embeddingi i logi zapytań wewnątrz sieci klienta, razem z samym modelem tam, gdzie jest to wymagane. Wdrożenie w chmurze zdejmuje z klienta planowanie zasobów GPU, aktualizacje modeli i utrzymanie indeksu. Czym się różnią:

  • Profil opóźnień: limity lokalnego sprzętu kontra skalowanie u dostawcy
  • Rytm aktualizacji: planujesz ty albo platforma
  • Miejsce indeksu wektorowego: sieć klienta albo usługa zarządzana
  • Łatanie środowiska: twój zespół albo nasz

Migracja później jest możliwa. Kosztuje jednak pełne przeindeksowanie i nowy przebieg testów, więc zdecyduj, zanim korpus się rozrośnie.

Jakość produkcyjna rozstrzyga się na etapie wczytywania dokumentów

Prawdziwe korpusy to zeskanowane umowy, arkusze używane jako bazy danych, prezentacje z tekstem zamkniętym w obrazkach i sześć wersji jednej polityki. Nasz proces:

  1. Spis źródeł
  2. Wybór obowiązującej wersji każdego dokumentu
  3. Ekstrakcja tekstu i chunking
  4. Dopisanie metadanych
  5. Indeksowanie
  6. Ręczne sprawdzenie próbki

Metadane robią więcej roboty niż rozmiar chunka. Właściciel, data wejścia w życie, dział i informacja o tym, co dany dokument zastąpiło, pozwalają asystentowi najpierw filtrować, a potem szeregować. Cicha porażka to dokumenty wycofane: powołanie się na nieobowiązującą politykę jest gorsze od milczenia. Ponowne wczytywanie zaplanuj od pierwszego dnia, bo jednorazowy import traci aktualność w ciągu kwartału.

Uprawnienia są częścią wyszukiwania, nie warstwą na wierzchu

Jeśli kontrolę dostępu nakładasz po wyszukiwaniu, model już przeczytał zastrzeżony fragment i może go wypuścić w parafrazie. Filtruj na poziomie indeksu. Każdy chunk nosi grupy dostępu swojego źródła, a zapytanie przeszukuje tylko ten podzbiór, do którego pytający ma prawo. Dwie osoby z tym samym pytaniem powinny dostać różne odpowiedzi i musi to być zachowanie zaprojektowane, a nie zaskoczenie. Logi zapytań zawierają treść dokumentów i intencje użytkowników, więc obowiązują je te same zasady przechowywania co korpus. Testuj na koncie o niskich uprawnieniach - logowanie administratora ukrywa dokładnie te błędy, które mają znaczenie.

Zbuduj zestaw testowy, zanim będzie potrzebny

Zbierz prawdziwe pytania od użytkowników pilotażu, do każdego dopisz fragment, który powinien się pokazać, i zamroź to jako zestaw regresyjny. Mierz wyszukiwanie osobno od generowania. Jeśli właściwy chunk nigdy się nie pojawił, żadna poprawka promptu nie uratuje odpowiedzi. Przepuszczaj zestaw przy każdej aktualizacji korpusu i każdej zmianie modelu, bo jedno i drugie po cichu przesuwa wyniki.

Wskazówka: trzymaj garść pytań podchwytliwych - bliźniaczych duplikatów, nieobowiązujących polityk, pytań, na które w korpusie nie ma odpowiedzi. Pokazują regresje, których zwykłe pytania w ogóle nie zauważają. Przegląd przez człowieka obejmuje ustaloną próbkę, a jej wielkość spada, gdy zestaw zdobędzie zaufanie.

Wdrożenie, wsparcie i pierwszy miesiąc

Startuj w jednym dziale, z wyznaczonym właścicielem, który naprawdę może poprawić dokumenty. Nie u wszystkich naraz. Daj ludziom sposób na zgłoszenie złej odpowiedzi jednym kliknięciem i kieruj te zgłoszenia do osoby utrzymującej korpus. Większość pierwszych skarg okazuje się problemem z dokumentami, nie z modelem: brakujący plik, nieaktualna wersja, skan, którego nie da się odczytać. Patrz, o co ludzie pytają i czego asystent odmawia, bo log odmów to najcenniejsza lista zadań, jaką będziesz mieć. I mów wprost, czym to jest - szybkim czytelnikiem twoich dokumentów, nie wyrocznią, ze wskazanymi źródłami do sprawdzenia.

Często zadawane pytania

Ile trwa przejście z pilotażu do produkcji?

Zależy to niemal wyłącznie od gotowości dokumentów, nie od asystenta. Wyszukiwanie i generowanie to praca konfiguracyjna. Harmonogram wyznacza porządkowanie korpusu.

Czy asystent może działać bez wysyłania czegokolwiek do zewnętrznego dostawcy?

Tak. W pełni własne wdrożenie trzyma dokumenty, indeks, model i logi na twojej infrastrukturze.

Co się dzieje, gdy asystent nie zna odpowiedzi?

Mówi o tym i wskazuje najbliższy materiał, jaki znalazł. To zachowanie zamierzone, nie coś do wyprostowania ustawieniami.

Co zrobilibyśmy ponownie

Ta kolejność się broni: wyznacz zakres korpusu, wcześnie rozstrzygnij sposób wdrożenia, zainwestuj we wczytywanie dokumentów i metadane, wepnij uprawnienia w wyszukiwanie, zamroź zestaw testowy, a potem wdrażaj wąsko. Wracająca lekcja jest taka, że asystent dokumentów to projekt dokumentowy z doklejonym modelem, a nie odwrotnie. Odpowiedzi ze wskazanym źródłem zmieniają też przyjęcie narzędzia, bo kto może sprawdzić w kilka sekund, przestaje traktować je jak czarną skrzynkę. Utrzymaniu korpusu przypisz konkretnego właściciela i traktuj je jako stałą pracę operacyjną.

Zbuduj asystenta AI na własnych dokumentach

Ragable indeksuje Twoje pliki i odpowiada na ich podstawie, z odnośnikami do źródeł. Zacznij w SaaS albo postaw na własnej infrastrukturze.

Zacznij od 99 USD miesięcznie