Prompt Injection
Prompt Injection ist eine Klasse von Schwachstellen, bei der speziell gestaltete Eingaben ein großes Sprachmodell dazu bringen, seine ursprünglichen Anweisungen zu ignorieren und stattdessen denen eines Angreifers zu folgen. Anders als ein Fehler in klassischem Code nutzt dieser Angriff die Unfähigkeit des Modells aus, vertrauenswürdige Anweisungen zuverlässig von nicht vertrauenswürdigen Daten zu trennen — was besonders für KI-Agenten gefährlich ist, die externe Inhalte lesen, Tools aufrufen oder mit Code, Geldern und Infrastruktur in Fintech- und Web3-Systemen agieren.
Auf dieser Seite finden Sie Artikel dazu, wie Prompt Injection funktioniert, zu direkten und indirekten Angriffsvektoren, realen Vorfällen bei LLM-integrierten Produkten, warum sie sich nicht wie SQL Injection patchen lässt, sowie zu Defense-in-Depth-Strategien für den Aufbau von KI-Agenten und LLM-Anwendungen, die im Produktivbetrieb sicher bleiben.