Prüfungen
LLM und KI-Agenten testen
Bei Sprachmodellen kommt zum klassischen ML-Test dazu: Die Antwort ist nicht festgelegt, Eingaben können Befehle enthalten, und Werkzeuge haben Rechte.
- Goldsatz und RegressionFeste Fälle mit bekannter Antwort. Läuft bei jeder Änderung von Modell, Prompt, Daten oder Werkzeugen.
- MehrfachläufeJeder Fall n-mal, weil die Antwort streut. Fehlerrate mit Obergrenze statt «hat einmal geklappt». Sicherheitsfälle verlangen null Fehler.
- BegründetheitJede Aussage muss durch eine Stelle im Quelldokument gedeckt sein. Zitate prüft Code, nicht das Modell.
- Prompt-InjectionDirekte und indirekte Angriffe über Dokumente, Mails, Webseiten. Geheimer Marker im Systemprompt: taucht er in einer Antwort auf, ist er abgeflossen.
- Werkzeug-RechteNur das Nötigste (Least Privilege), Bestätigung bei Schreibzugriff, Sandbox, Kostenlimit, maximale Schrittzahl.
- Mandantentrennung und DatenabflussFremddaten im Kontext dürfen nie in der Antwort erscheinen. Ausgabefilter und Scanner als zweite Linie.
- Missbrauch und AblehnungRed-Team-Satz für Missbrauch und ein Satz für Übervorsicht: Zu viel zu verweigern ist auch ein Fehler.
- Vier SprachenDieselbe Prüfung auf Deutsch, Französisch, Italienisch, Englisch, dazu Mundart und Sprachmix.
- KI als RichterinNur nach Eichung an Urteilen von Menschen (Übereinstimmung κ) und nie allein. Auch die Richterin wird getestet.
- ModellwechselVersion fixieren, bei jedem Update alt gegen neu vergleichen, Abweichungsbericht lesen.
- Schleifen und KostenAbbruchbedingungen, Obergrenzen für Schritte, Tokens und Geld. Ein Agent ohne Bremse ist ein Risiko.
- Aufsicht und ProtokollFreigabeschritt dort, wo Schaden entsteht. Prompt, Version, Werkzeugaufrufe und Entscheid werden protokolliert, damit man später nachvollziehen kann, was geschah.
Antworten
Wie teste ich ein Sprachmodell auf Prompt-Injection?
Ein Sprachmodell testet man auf Prompt-Injection, indem man Dokumente mit eingebauten Befehlen in mehreren Sprachen durch den Agenten schickt und zählt, wie oft er Werkzeuge missbraucht, einen geheimen Marker ausgibt oder Fremddaten nennt. Jeder Fall läuft mehrfach, weil die Antworten streuen. Bei Sicherheitsfällen gilt ein Fehler als Ablehnung.
Warum reicht bei einem Sprachmodell ein einzelner Testlauf nicht?
Ein einzelner Testlauf reicht bei einem Sprachmodell nicht, weil dieselbe Eingabe verschiedene Antworten liefern kann. Ein Agent, der in 4 von 100 Läufen die Regeln bricht, besteht zwölf Läufe mit gut 60 Prozent Wahrscheinlichkeit, hundertzwanzig dagegen nur mit unter 1 Prozent. Darum läuft jeder Fall mehrfach, und die Grenze wird mit der Zahl der Läufe angegeben.
Welche Rechte soll ein KI-Agent haben?
Ein KI-Agent soll nur die Rechte haben, die seine Aufgabe braucht (Least Privilege): Lesezugriff nur auf die Daten dieses Kunden, Schreibzugriff nur mit Bestätigung, ein Kostenlimit und eine Obergrenze für Schritte. Dokumentinhalte gelten als Daten, nie als Anweisung. Ob diese Sperren halten, prüft man mit Angriffsfällen.
Kontakt
Schick mir den Einsatz in zwei Sätzen. Ich melde mich und sage dir, ob und wie sich dein Vorhaben prüfen lässt. Ob ich den Auftrag übernehmen kann, hängt von meiner Auslastung ab.