Jak „bomby kontekstowe” neutralizują agentów hakujących AI

14

Złośliwe oprogramowanie AI nie jest już tylko teoretycznym zagrożeniem. To już istnieje. Atakujący wykorzystują duże modele językowe (LLM) do automatyzacji cyberataków i działają szybciej, niż mogą zareagować obrońcy.

Skutki są często katastrofalne.

Co zrobić, jeśli atakujący użyją sztucznej inteligencji? Z jego pomocy muszą skorzystać także obrońcy. Badacze z Tracebit zidentyfikowali środek zaradczy, który nazywają „bombami kontekstowymi”. Jest to specyficzny rodzaj natychmiastowego wstrzyknięcia, mający na celu wyłączenie złośliwych agentów AI.

Jak działa bomba kontekstowa

„Bomba kontekstowa” to w zasadzie cyfrowa pułapka. Specjaliści ds. bezpieczeństwa przekazują agentowi AI monit o włamanie zawierający bardzo wrażliwe lub sprzeczne informacje. Uruchamia to mechanizmy bezpieczeństwa wbudowane w sztuczną inteligencję. Agent zaprogramowany do odrzucania szkodliwych żądań staje się zdezorientowany lub ograniczony i porzuca szkodliwe zadanie.

Naukowcy przetestowali tę technikę w porównaniu z pięcioma wiodącymi modelami językowymi:

  • Opus 4.8
  • Gemini 3.1 Pro
    -GLM 5.2
  • DeepSeek 4 Pro
    -Kimi 2.6

Skuteczność była niesamowita.

Samo użycie bomby kontekstowej zmniejszyło skuteczność hakerów AI o około 90%. W niektórych przypadkach wynik był absolutny. Jeden z zaawansowanych agentów, który w 93% przypadków uzyskał pełny dostęp administracyjny bez interwencji, w 100% przypadków zawiódł po rozmieszczeniu bomby kontekstowej.

Technika ta opiera się na wykorzystaniu tego, czego powinny unikać wytrenowane modele.

W przypadku wysoce cenzurowanych modeli, takich jak chińskie LLM, wzmianki o tematach drażliwych politycznie służą jako „wyłącznik awaryjny”. Badacze wykorzystali odniesienia do protestów na placu Tiananmen w 1989 roku. W szczególności zawierały odniesienia do Tank Mana. Ponieważ tematy te są ściśle cenzurowane, agenci AI zmuszeni byli odrzucić wszystkie polecenia, w tym atak, aby zachować zgodność z filtrami bezpieczeństwa.

Dlaczego jest to ważne dla obrońców

To jest zmiana paradygmatu.

Natychmiastowe zastrzyki są zwykle bronią ofensywną. Hakerzy wykorzystują je do porywania korporacyjnych chatbotów i kradzieży danych. Jest to sposób na zmanipulowanie sztucznej inteligencji w celu nagięcia zasad. Ustalenia Tracebit pokazują, że obrońcy mogą odwrócić tę sytuację.

Eksperci powiedzieli Ars Technica, że jest to pierwszy raz, kiedy taka strategia obrony została udokumentowana i przetestowana przeciwko automatycznym agentom hakerskim. Wdrażając szybkie zastrzyki w celach obronnych, zespoły ds. bezpieczeństwa mogą zatrzymać ataki, zanim zostaną zakończone.

Zachodnie modele, takie jak Opus 4.8 i Gemini, reagują inaczej niż ich chińskie odpowiedniki. Nie podlegają cenzurze polityki rządu, więc użyte przeciwko nim „bomby” są wycelowane w inne obszary. Naukowcy odkryli, że środki te skutecznie powstrzymują wzmianki o niebezpiecznych tematach biologicznych lub innych szkodliwych treściach.

Rodzi to trudne pytanie: czy powinniśmy powstrzymać atakujących AI, czy powinniśmy? Czy istnieje ryzyko masowego stosowania takich środków zaradczych?

Odpowiedź kryje się w szczegółach implementacji.

Tracebit opublikował szczegółową analizę badania. Konsekwencje są jasne: bezpieczeństwo sztucznej inteligencji nie polega tylko na ulepszaniu zapór ogniowych i wzmacnianiu haseł. Jest to zrozumienie cech samych modeli.

Wyścig zbrojeń wszedł na nowy poziom. Obrońcy nie tylko patrzą. Wkraczają do bitwy.