Słownik bezpieczeństwa agentów
Jasne, cytowalne definicje kluczowych pojęć bezpieczeństwa autonomicznych agentów — słownictwo, na którym opiera się reszta badań.
- 01Prompt injection (wstrzyknięcie polecenia)
- Atak, który przemyca do wejścia modelu instrukcje kontrolowane przez napastnika, tak by agent wykonał je zamiast intencji twórcy. To podstawowa klasa większości przejęć agentów.
- 02Pośrednie wstrzyknięcie polecenia
- Wstrzyknięcie dostarczone przez treść, którą agent pobiera — stronę, dokument, wiadomość lub wynik narzędzia — a nie wpisaną przez użytkownika. Ładunek czeka, aż agent go odczyta.
- 03Nadmierna sprawczość
- Sytuacja, w której agent ma więcej uprawnień, narzędzi lub autonomii niż wymaga zadanie, przez co pojedynczy błąd lub wstrzyknięcie zamienia się w realną szkodę. Lekarstwem są minimalne uprawnienia na każde działanie.
- 04Zatruwanie narzędzi
- Manipulacja narzędziem — jego opisem, parametrami lub wynikiem — tak by kierowało skądinąd uczciwego agenta ku szkodliwym działaniom. Częste w niezaufanych serwerach MCP i ekosystemach wtyczek.
- 05Model Context Protocol (MCP)
- Otwarty protokół, który pozwala agentom łączyć się z zewnętrznymi narzędziami i danymi przez ujednolicone serwery. Jego wygoda czyni go też powierzchnią ataku na łańcuch dostaw, którą warto świadomie zabezpieczyć.
- 06Zdezorientowany zastępca
- Atak, w którym uprzywilejowany agent zostaje nakłoniony do nadużycia swoich uprawnień w imieniu mniej uprzywilejowanego napastnika — na przykład do odczytania sekretu, do którego zlecający nie miałby dostępu wprost.
- 07Eksfiltracja danych
- Wyprowadzenie wrażliwych danych poza granicę zaufania — często przez agenta nakłonionego do wysłania sekretów pod kontrolowany przez napastnika adres, narzędzie lub wiadomość. Ostatni krok wielu ataków na agentów.
- 08Bariera ochronna
- Mechanizm ograniczający to, co agent może przyjąć lub zrobić — filtry wejścia i wyjścia, kontrole polityk, listy dozwolonych lub zgoda człowieka. Skuteczne bariery są warstwowe i testowane przeciw własnym obejściom.
- 09Red teaming
- Uporządkowana praktyka atakowania własnego agenta tak, jak zrobiłby to przeciwnik — budowania ładunków, uruchamiania ich przeciw systemowi i oceniania wyniku — by znaleźć słabości, zanim zrobi to ktoś inny.
- 10MITRE ATLAS
- Publiczna baza wiedzy o taktykach i technikach przeciwnika wobec systemów AI, wzorowana na MITRE ATT&CK. Daje zespołom wspólne słownictwo do opisywania, mapowania i wykrywania ataków na agentów.
- 11OWASP Top 10 dla aplikacji agentowych
- Lista z 2025 roku (kategorie „ASI", ASI01–ASI10) katalogująca najważniejsze ryzyka bezpieczeństwa swoiste dla autonomicznych agentów — od przejęcia celu agenta po agentów zbuntowanych — odrębna od pierwotnej listy OWASP LLM Top 10.
- 12Zero trust
- Model bezpieczeństwa, który domyślnie nie ufa żadnemu żądaniu i weryfikuje każde — tożsamość, zakres i kontekst — w chwili jego wykonania. Dla agentów oznacza to autoryzowanie każdego wywołania narzędzia na nowo, a nie raz na zawsze.
- 13Tożsamość agenta
- Weryfikowalna, kryptograficzna tożsamość agenta nieosobowego — wydawana przez mTLS, podpisane tokeny lub framework taki jak SPIFFE — by jego działania można było uwierzytelnić, ograniczyć zakresem i poddać audytowi, a nie ufać im na ślepo.
- 14Bezpieczeństwo oparte na uprawnieniach
- Model dostępu, w którym prawo do działania jest wąskim, niemożliwym do podrobienia tokenem powiązanym z konkretnym zasobem i operacją, a nie uprawnieniem ogólnym. Pozwala agentowi mieć dokładnie tę władzę, której wymaga zadanie, i nic ponadto.