Prompt Injections for Defense
Tracebit-Forschende entdeckten, dass Prompt Injections neben sensiblen Daten auf AWS KI-Hacking-Angriffe stoppen können. Diese Injections weisen angreifende LLMs an, verbotene Aktionen auszuführen, woraufhin die KI sich selbst abschaltet. Betroffen sind Unternehmen, die LLMs mit Guardrails nutzen. Es wird empfohlen, diese Technik als zusätzliche Verteidigungsschicht zu implementieren, solange die Angreifer-KIs noch über solche Sicherheitsbarrieren verfügen.