// glossary · DefinedTermSet

Słownik bezpieczeństwa agentów

Jasne, cytowalne definicje kluczowych pojęć bezpieczeństwa autonomicznych agentów — słownictwo, na którym opiera się reszta badań.

01Prompt injection (wstrzyknięcie polecenia)
Atak, który przemyca do wejścia modelu instrukcje kontrolowane przez napastnika, tak by agent wykonał je zamiast intencji twórcy. To podstawowa klasa większości przejęć agentów.
02Pośrednie wstrzyknięcie polecenia
Wstrzyknięcie dostarczone przez treść, którą agent pobiera — stronę, dokument, wiadomość lub wynik narzędzia — a nie wpisaną przez użytkownika. Ładunek czeka, aż agent go odczyta.
03Nadmierna sprawczość
Sytuacja, w której agent ma więcej uprawnień, narzędzi lub autonomii niż wymaga zadanie, przez co pojedynczy błąd lub wstrzyknięcie zamienia się w realną szkodę. Lekarstwem są minimalne uprawnienia na każde działanie.
04Zatruwanie narzędzi
Manipulacja narzędziem — jego opisem, parametrami lub wynikiem — tak by kierowało skądinąd uczciwego agenta ku szkodliwym działaniom. Częste w niezaufanych serwerach MCP i ekosystemach wtyczek.
05Model Context Protocol (MCP)
Otwarty protokół, który pozwala agentom łączyć się z zewnętrznymi narzędziami i danymi przez ujednolicone serwery. Jego wygoda czyni go też powierzchnią ataku na łańcuch dostaw, którą warto świadomie zabezpieczyć.
06Zdezorientowany zastępca
Atak, w którym uprzywilejowany agent zostaje nakłoniony do nadużycia swoich uprawnień w imieniu mniej uprzywilejowanego napastnika — na przykład do odczytania sekretu, do którego zlecający nie miałby dostępu wprost.
07Eksfiltracja danych
Wyprowadzenie wrażliwych danych poza granicę zaufania — często przez agenta nakłonionego do wysłania sekretów pod kontrolowany przez napastnika adres, narzędzie lub wiadomość. Ostatni krok wielu ataków na agentów.
08Bariera ochronna
Mechanizm ograniczający to, co agent może przyjąć lub zrobić — filtry wejścia i wyjścia, kontrole polityk, listy dozwolonych lub zgoda człowieka. Skuteczne bariery są warstwowe i testowane przeciw własnym obejściom.
09Red teaming
Uporządkowana praktyka atakowania własnego agenta tak, jak zrobiłby to przeciwnik — budowania ładunków, uruchamiania ich przeciw systemowi i oceniania wyniku — by znaleźć słabości, zanim zrobi to ktoś inny.
10MITRE ATLAS
Publiczna baza wiedzy o taktykach i technikach przeciwnika wobec systemów AI, wzorowana na MITRE ATT&CK. Daje zespołom wspólne słownictwo do opisywania, mapowania i wykrywania ataków na agentów.
11OWASP Top 10 dla aplikacji agentowych
Lista z 2025 roku (kategorie „ASI", ASI01–ASI10) katalogująca najważniejsze ryzyka bezpieczeństwa swoiste dla autonomicznych agentów — od przejęcia celu agenta po agentów zbuntowanych — odrębna od pierwotnej listy OWASP LLM Top 10.
12Zero trust
Model bezpieczeństwa, który domyślnie nie ufa żadnemu żądaniu i weryfikuje każde — tożsamość, zakres i kontekst — w chwili jego wykonania. Dla agentów oznacza to autoryzowanie każdego wywołania narzędzia na nowo, a nie raz na zawsze.
13Tożsamość agenta
Weryfikowalna, kryptograficzna tożsamość agenta nieosobowego — wydawana przez mTLS, podpisane tokeny lub framework taki jak SPIFFE — by jego działania można było uwierzytelnić, ograniczyć zakresem i poddać audytowi, a nie ufać im na ślepo.
14Bezpieczeństwo oparte na uprawnieniach
Model dostępu, w którym prawo do działania jest wąskim, niemożliwym do podrobienia tokenem powiązanym z konkretnym zasobem i operacją, a nie uprawnieniem ogólnym. Pozwala agentowi mieć dokładnie tę władzę, której wymaga zadanie, i nic ponadto.