Testy bezpieczeństwa AI i LLM
Testujemy aplikacje LLM i agenty jak adversary, który traktuje każdy kanał wejściowy jako podatny na wstrzyknięcie: prompty użytkownika, pobrane dokumenty, wyjście narzędzi i dane upstream. Pytanie brzmi: do czego system daje się nakłonić — nie tylko co powie, ale co zrobi.
Pełna powierzchnia ataku — nie tylko to, co jest widoczne z zewnątrz.
Prompt injection
Pobrane treści stają się instrukcjami
Bezpośrednie i — co ważniejsze — pośrednie wstrzyknięcia przez pobrane treści, dokumenty i wyjście narzędzi, które model traktuje jak instrukcje.
Agencja i nadużycie narzędzi
Model nie jest granicą autoryzacji
Do czego agenta z function calling, dostępem do API lub wykonywaniem kodu można nakłonić i czy autoryzacja jest egzekwowana poza modelem.
RAG i zatruwanie danych
Fałszywa baza wiedzy
Manipulacja bazą wiedzy i źródłami upstream, by poprzez model zniekształcić, wprowadzić w błąd lub wyeksfiltrować dane.
Wyciek danych
Kradzież promptów i danych treningowych
Ujawnienie system promptu i instrukcji, wyciek danych treningowych i cross-tenant, wrażliwe wyjście przez legalne zapytania.
Omijanie guardrails
Łamanie miękkich zabezpieczeń
Pokonywanie filtrów treści i bezpieczeństwa przez enkodowanie, role-play i wieloetapowe framing.
Otaczająca aplikacja
Model bezpieczny, aplikacja nie
Backend, API, auth i integracje wokół modelu, testowane konwencjonalnie — bo tam zazwyczaj ląduje realne naruszenie.
Sprawdzone frameworki branżowe, nie autorskie listy kontrolne.
Model ryzyka dla aplikacji LLM stosowany jako testy adversarialne, nie kwestionariusz.
Mapowanie narzędzi, danych i uprawnień, do których model może dotrzeć — a następnie atakowanie tych ścieżek.
Ponieważ funkcja AI to wciąż aplikacja — a otaczający kod wciąż jest najmiększym celem.
Ustrukturyzowany proces od zakresu do retestów — bez niespodzianek na etapie dostarczenia.

Pytania, które słyszymy najczęściej przed podpisaniem umowy.
Oba — ale to aplikacja i jej integracje są miejscem, gdzie naprawdę dochodzi do naruszeń. Atakujemy model (wstrzyknięcia, wycieki, jailbreaki) i system wokół niego (auth, narzędzia, dostęp do danych) jako jedną powierzchnię.
Powierzchnią ataku jest integracja, nie wagi modelu. Testujemy modele self-hosted, hostowane API i frameworki agentów — narzędzia i dane, do których model może dotrzeć, definiują ryzyko.
Dodaje warstwę specyficzną dla AI, którą normalny pentest pomija — pośrednie wstrzyknięcie, nadużycie narzędzi, zatruwanie RAG — na standardowych testach aplikacji, które i tak wykonujemy.
Skontaktuj się z nami
W każdej sprawie możesz kontaktować się z nami za pomocą poniższych danych, lub formularza kontaktowego
Jeżeli chcesz porozmawiać z nami osobiście, zapraszamy do bookowania spotkań przy użyciu platformy Microsoft Bookings.
Umów spotkanie w Microsoft Bookings