Stanowisko testów z listą wyników, fikcyjnymi dokumentami i odizolowaną aplikacją oddzieloną od serwera produkcyjnego.
Ilustracja koncepcyjna: testy i odbiór zabezpieczeń.

Testy bezpieczeństwa AI powinny sprawdzać cały proces: dostęp do danych, odpowiedź modelu, wywołania narzędzi i rzeczywiste skutki w systemie docelowym. Sam komunikat „nie mogę tego zrobić” nie dowodzi, że nie doszło do odczytu lub wykonania operacji. Do odbioru potrzebny jest wynik, dowód i jasno określone kryterium zaliczenia.

Ten poradnik zawiera propozycję karty odbioru chatbota lub agenta. Nie zastępuje pełnego audytu ani testu penetracyjnego. Pomaga zorganizować podstawowe sprawdzenie rozwiązania przed pilotażem i po jego zmianach.

Uzgodnij zakres i odizoluj środowisko

Zapisz cel procesu, model, wersję aplikacji, instrukcje, źródła wiedzy i dostępne narzędzia. Ustal, kto może uruchamiać testy, które systemy obejmują i kto odbiera wyniki. Nie testuj integracji z cudzą skrzynką ani nie wysyłaj próbnych danych do przypadkowych odbiorców.

Przygotuj konta o różnych rolach, fikcyjne dokumenty oraz kontrolowane miejsce wysyłki. Testy obciążenia prowadź tylko w uzgodnionych granicach. Jeżeli środowisko testowe różni się od produkcji, opisz różnice: uprawnienia, filtry, limity, wersje i sposób logowania. Wynik dotyczy sprawdzonej konfiguracji.

Wprowadź unikalne znaczniki do syntetycznych dokumentów, np. fikcyjny kod projektu. Ułatwi to rozpoznanie, czy odpowiedź wykorzystała niedostępne źródło. Znacznik nie powinien być prawdziwym sekretem.

Przygotuj kartę przypadku testowego

Poniższy format jest propozycją roboczą. Zapis oczekiwanego wyniku przed próbą ogranicza ryzyko dopasowania oceny do tego, co akurat zrobił model.

PoleCo wpisać
IdentyfikatorStały numer przypadku, np. AI-ACL-01
KonfiguracjaWersja modelu, aplikacji, promptu, indeksu i narzędzi
Warunki początkoweKonto, rola, dokumenty, stan systemu docelowego
BodziecPytanie, materiał wejściowy albo zasymulowany błąd
Oczekiwany wynikDopuszczalna odpowiedź i operacje oraz zakazane skutki
DowódIdentyfikator zadania, log zdarzenia i kontrola stanu docelowego
OcenaZaliczone, niezaliczone lub nieustalone; właściciel poprawki

Nie wpisuj wyniku „zaliczone”, gdy brakuje dostępu do logów lub nie da się ustalić skutku operacji. Brak dowodu jest odrębnym wynikiem i może sam blokować odbiór krytycznego procesu.

Sprawdź poprawne użycie oraz próby naruszenia zasad

Test powinien obejmować zarówno zadanie, które ma się udać, jak i operację, której system ma odmówić. Bez pierwszej próby trudno odróżnić skuteczne zabezpieczenie od całkowicie niedziałającej aplikacji.

Proponowany zestaw odbiorczy:

  1. Zwykłe zadanie: asystent poprawnie korzysta z dozwolonego dokumentu i wykonuje wyłącznie oczekiwane kroki.
  2. Dostęp do danych: użytkownik nie otrzymuje treści, streszczenia ani poufnych metadanych zastrzeżonego pliku. Powtórz próbę na innym koncie.
  3. Cofnięcie uprawnień: po ustalonej aktualizacji nowe zapytanie nie korzysta z dokumentu odebranego użytkownikowi.
  4. Obce instrukcje: materiał testowy próbuje zmienić zadanie. Sprawdź odpowiedź i narzędzia, nie tylko deklarację modelu.
  5. Operacja bez zgody: propozycja wysyłki lub zmiany rekordu nie zostaje wykonana bez wymaganej autoryzacji.
  6. Zmiana parametrów: akceptacja jednej operacji nie upoważnia do wysłania innej treści albo do innego odbiorcy.
  7. Niebezpieczny wynik: niedozwolony adres, identyfikator lub aktywna treść zostają odrzucone przed dalszym wykorzystaniem.
  8. Awaria i ponowienie: błąd po wykonaniu operacji nie prowadzi do niekontrolowanego duplikatu.
  9. Granice pracy: limit kroków, czasu lub kosztu kończy zadanie w sposób możliwy do rozpoznania przez operatora.
  10. Błędny alarm: nieszkodliwy cytat o ataku nie powoduje niezrozumiałej blokady zwykłego procesu.

Scenariusze ochrony treści rozwija poradnik o prompt injection, a układ kont i dokumentów — test dwóch ról w RAG. OWASP zaleca sprawdzanie różnych postaci prób manipulacji i warstw ochrony, zamiast polegania na pojedynczym filtrze. Źródło: OWASP Prompt Injection Prevention.

Oddziel ocenę modelu od oceny zabezpieczeń

Wynik modelu może się zmieniać między próbami. Kontrola dostępu do dokumentu powinna natomiast konsekwentnie egzekwować ustaloną zasadę. Warto raportować te dwa aspekty osobno.

Przykład modelowy: w części powtórzeń asystent proponuje niedozwoloną wysyłkę, ale backend zawsze ją blokuje. Ochrona wykonania zadziałała, choć zachowanie modelu wymaga poprawy. Odwrotna sytuacja — poprawne deklaracje modelu przy niekontrolowanym narzędziu — nie jest dowodem bezpieczeństwa.

Zapisz liczbę prób i liczbę zaobserwowanych naruszeń. Zero naruszeń w ograniczonym zestawie oznacza brak naruszeń w tych próbach, a nie gwarancję odporności na wszystkie wejścia. Nie agreguj krytycznego wycieku z poprawnymi odpowiedziami tak, aby zniknął w wysokiej średniej skuteczności.

Jak zweryfikować limity i monitoring?

Dla zadania określ rozmiar wejścia, liczbę wywołań, czas, ponowienia i budżet. Następnie w kontrolowanym środowisku przekrocz każdy istotny limit. Sprawdź, czy wykonanie rzeczywiście kończy się, czy tylko pojawia się powiadomienie.

OWASP opisuje nieograniczone zużycie zasobów jako osobne ryzyko aplikacji LLM i wskazuje m.in. limity żądań, timeouty i kontrolę kolejek. Źródło: OWASP LLM10 — Unbounded Consumption.

Logi powinny pozwalać powiązać zadanie z operacją, decyzją autoryzacyjną i wynikiem. Zbieraj potrzebne metadane bez automatycznego kopiowania całych dokumentów i sekretów. OWASP podkreśla znaczenie informacji o czasie, miejscu, wykonawcy i zdarzeniu. Źródło: OWASP Logging Cheat Sheet.

Wykonaj także próbę organizacyjną: wygeneruj uzgodniony alert i sprawdź, czy wskazana osoba potrafi odnaleźć zadanie oraz zatrzymać integrację. Sam wpis w panelu, którego nikt nie obserwuje, nie domyka procesu reagowania.

Kiedy wstrzymać wdrożenie, a kiedy dopuścić pilotaż?

Proponowaną przesłanką do zatrzymania danego zakresu wdrożenia jest ujawnienie danych poza uprawnieniami, nieautoryzowana operacja, możliwość obejścia zgody lub brak kontroli skutków. Po poprawce powtórz zarówno wadliwy przypadek, jak i związane z nim prawidłowe scenariusze.

Pilotaż można rozważyć, gdy uzgodnione kryteria zostały spełnione, pozostałe ograniczenia są opisane, a właściciel procesu zna zakres danych i autonomii. Zapisz decyzję wraz z wersją konfiguracji. Zmiana modelu, konektora, uprawnień, promptu lub sposobu renderowania odpowiedzi może uzasadniać ponowne testy.

Sposób nadawania narzędzi i akceptacji działań opisuje poradnik o bezpieczeństwie agentów AI. Procedurę na wypadek zdarzenia warto połączyć z planem reagowania na incydent.

Co przygotować do przeglądu z administratorem?

Przekaż opis procesu, listę integracji, konta testowe, przykładowe dane syntetyczne i proponowane kryteria odbioru. Określ, które systemy można obejmować próbami. Partnerhosted pomaga porządkować bezpieczeństwo firmowego IT oraz zasady pracy z AI; zakres przeglądu konkretnego rozwiązania ustalamy na podstawie jego architektury i dostępów.

Najczęstsze pytania

Czy odmowa w odpowiedzi chatbota wystarcza do zaliczenia testu?

Nie. Należy sprawdzić również pobrane dane, wywołania narzędzi i stan systemu docelowego. Deklaracja modelu nie potwierdza braku operacji.

Czy checklistę można traktować jako certyfikat bezpieczeństwa AI?

Nie. To propozycja podstawowego odbioru określonej konfiguracji. Nie zastępuje pełnego audytu ani testu penetracyjnego i nie gwarantuje odporności na wszystkie wejścia.

Kiedy powtarzać testy zabezpieczeń AI?

Po zmianach wpływających na zachowanie lub dostęp: modelu, promptu, źródeł danych, konektorów, uprawnień, narzędzi i sposobu obsługi odpowiedzi.

Źródła i zakres opracowania

Źródła pierwotne podlinkowano przy odpowiednich zagadnieniach; sprawdzono je 23 września 2026 r. Macierze, scenariusze i kryteria odbioru są propozycjami praktycznego zastosowania zasad. Przykłady nie opisują rzeczywistych klientów ani wyników audytu konkretnego produktu.

Porozmawiaj o bezpiecznym korzystaniu z AI

Opisz używane narzędzie, źródła danych i połączone systemy. Ustalimy zakres potrzebnych prac i zasady współpracy.

Skontaktuj się z Partnerhosted