ai-assist Benutzerhandbuch
Testen
Der Reiter Testen verbindet manuellen Live-Chat, Debug-Spalte, Testfall-Recorder, automatische Regression, QS-Startberatung und AFS-Split-Screen-Prüfung.
Was Sie hier erledigen
1
2
3
4
5
| Marker | Element | Bedeutung |
|---|---|---|
| 1 | Manuell | Direkter Test einer Chat-Session in der Admin-Oberfläche. |
| 2 | Chatverlauf | Zeigt Assistenten- und Benutzernachrichten. |
| 3 | Eingabe | Sendet Testnachrichten an den Chat. |
| 4 | Recorder, Export und Judge | Zeichnet Testfälle auf, kopiert oder speichert den Chat, bewertet die aktuelle Antwort mit dem Judge oder startet neu. |
| 5 | Debugspalte | Zeigt Ablauf, Schritt, Sprache und ausgewählten Service. |
Abb. T-01 zeigt die manuelle Testansicht vor der Erklärung der Testaufgaben. Der Chat links nutzt eine echte Session, die Debugspalte rechts zeigt Ablauf, Sprache und Serviceauswahl.
- Beratungen aus Sicht der Bürger:innen manuell durchspielen.
- Testfälle aufzeichnen, speichern und automatisch erneut ausführen.
- Services, Fakten, Prompts, Voraussetzungen und AFS-Verhalten prüfen.
- AFS-Feldmarkierung und Formularbefüllung im Split-Screen absichern.
Sicht Manuell
- Der Chat verhält sich wie der Bürgerchat und nutzt eine echte Session.
- Mit Aufzeichnung starten/stoppen erzeugen Sie einen neuen Testfall.
- Der Export speichert den sichtbaren Verlauf; neue Session setzt den Testkontext zurück.
- Aktuelle Antwort mit Judge bewerten öffnet eine Ein-Klick-Bewertung der letzten relevanten Bot-Antwort. Der Judge leitet den erwarteten Service aus der Session ab, prüft gegen aktive Wissenskarten und zeigt bei auffälliger Wissenslage konkrete Pflegehinweise.
- Formular anzeigen blendet die AFS-Split-Ansicht ein.
- Die Debug-Spalte zeigt Ablauf & Services, Parameter und Voraussetzungen.
Die Judge-Bewertung ist verfügbar, wenn eine aktive Testsession mindestens eine Nutzerfrage mit nachfolgender Bot-Antwort enthält und die angemeldete Person die Leserechte für Chat-Tests, Debug, Services und Wissen besitzt. Das Overlay enthält keine manuelle Service- oder Antwortauswahl; es startet automatisch und zeigt Judge prüft ..., bis ein Ergebnis oder ein nicht bewertbarer Zustand vorliegt.
Bewertbar sind deutschsprachige Testdialoge mit ausreichendem Service-, Frage- und Wissenskartenkontext. Fehlt dieser Kontext, ändert ai-assist keine Daten, sondern meldet, dass keine belastbare Bewertung möglich ist.
Beispiel: Testfall aus einem Dialog erzeugen
Starten Sie die Aufzeichnung, stellen Sie ein Bürger:innenanliegen, bestätigen Sie den richtigen Service und beantworten Sie die wichtigsten Rückfragen. Beim Stoppen der Aufzeichnung zeigt ai-assist eine Vorschau der erkannten Schritte. Prüfen Sie dort, ob die vorgeschlagenen Prüfungen sinnvoll sind, bevor Sie den Testfall speichern.
Beispiel: Wissenslücke aus dem Testchat prüfen
Stellen Sie im manuellen Testchat eine freie Fachfrage. Wenn die Antwort fehlt, zu grob ist oder nicht zum erwarteten Detail passt, öffnen Sie Aktuelle Antwort mit Judge bewerten. Prüfen Sie Begründung, Coverage und angezeigte Wissenskarten. Springen Sie über den Kartenpfeil in Fakten > Wissen, wenn eine Quelle oder Wissenskarte ergänzt oder präzisiert werden muss.
Sicht QS-Service & Assistenz
1
2
3
4
| Marker | Element | Bedeutung |
|---|---|---|
| 1 | QS-Service & Assistenz | Wechselt zur Verwaltung gespeicherter Dialog- und AFS-Testfälle. |
| 2 | Testfallliste | Sucht, filtert, wählt und markiert gespeicherte Dialogtests. |
| 3 | Testfall/Testlauf | Trennt gespeicherte Erwartung von tatsächlichem Laufprotokoll. |
| 4 | Ausführen und Verwalten | Startet Tests, steuert Sichtprüfung oder speichert den Inspector. |
Abb. T-02 steht vor der Beschreibung der Sicht QS-Service & Assistenz. Links werden Testfälle gesucht und ausgewählt, rechts werden Erwartung, Testlauf und Ergebnisse kontrolliert.
- Links stehen Testfälle mit Suche, Checkboxen und Auswahlzähler.
- nur offen filtert auf Testfälle, die noch nicht fachlich erledigt oder freigegeben sind.
- Der Punkt für AUTT-Freigabe markiert, ob ein automatischer UI-/Split-Screen-Test als freigegeben gilt.
- Abspielen führt ausgewählte Fälle nacheinander aus.
- Sprache startet den nächsten Lauf in der gewählten Dialogsprache; deutsch aufgezeichnete Nutzereingaben werden beim Abspielen übersetzt. Alle führt die freigegebenen und vollständig übersetzten Sprachen nacheinander aus und zeigt je Sprache einen eigenen Testlauf-Reiter mit OK- oder Fehler-Symbol.
- Sichtprüfung ist standardmäßig aus; bei Bedarf pausiert sie bei AFS-Prüfkarten für OK/NOK.
- Die Tabs Testfall und Testlauf trennen gespeicherte Erwartung und tatsächlichen Lauf; Fehlerartefakte werden im jeweiligen Testlauf als JSON heruntergeladen.
- Prüfungen und Werte können im Testfall-Inspector bearbeitet werden.
Beispiel: Testlauf-Fehlerartefakt JSON
{
"artifact_id": "autt-failure-wohnbeihilfe-001",
"artifact_filename": "autt-failure-wohnbeihilfe-001.json",
"screenshot_selector": "#afsPreviewFrame",
"frame_selector": "#afsPreviewFrame",
"preview_proxy_url": "/admin/afs-preview/..."
}
Dieses JSON ist ein technisches Analysepaket für fehlgeschlagene Testläufe. Es wird nicht importiert und ersetzt keinen gespeicherten Testfall.
Beispiel: stabile Erwartung wählen
Wenn die Antwortformulierung schwankt, ist Antwort ok plus Service oder State meist robuster als ein langer exakter Textvergleich. Für AFS-Schritte ergänzen Sie AFS-Felder, damit nicht nur die Chatantwort, sondern auch die Formularmarkierung geprüft wird.
QS-Startberatung
Die Ansicht QS-Startberatung prüft, ob die freie Startberatung passende Antworten aus den Wissenskarten liefert und ob die Bewertung durch den Judge nachvollziehbar ist. Links steht die Serviceauswahl, rechts die Auswertung der Testfragen.
1
2
3
4
5
6
| Marker | Element | Bedeutung |
|---|---|---|
| 1 | QS-Startberatung | Wechselt zur Qualitätssicherung der freien Startberatung. |
| 2 | Servicefilter | Sucht Services und filtert bei Bedarf auf offene QS-Ergebnisse. |
| 3 | Servicekarte | Zeigt Fragenset, Freigabestatus und Durchschnittsbewertung. |
| 4 | Testfragen | Zeigt die Fragenansicht des ausgewählten Services. |
| 5 | Fragen und Bewertungen | Zeigt Antwortvorschau, Judge-Score und Detailzugang je Frage. |
| 6 | Import, Export und Pflege | Importiert CSV, exportiert Fragen, legt Fragen an oder löscht markierte Fragen. |
- Links wählen Sie einen oder mehrere Services aus. nur offen filtert auf Services mit noch offenen oder auffälligen QS-Ergebnissen.
- Der Prozentwert in der Serviceliste zeigt den Durchschnitt der bewerteten Fragen dieses Services.
- Das Statuslämpchen eines Services zeigt, ob das Frageset freigeschaltet, teilweise freigeschaltet oder noch Entwurf ist.
- In der Fragenansicht werden Frage, Antwort und Bewertung laufend eingetragen; nicht beantwortete Fragen sind mit einem roten Ausrufezeichen markiert.
- Fragen aus CSV importieren liest eine ausgewählte CSV-Datei ein. Der Import erkennt Komma-, Semikolon- und Tab-Trennzeichen. Unterstützt werden Kopfzeilen mit
frageoderquestion; ohne Kopfzeile gilt jede nicht leere Zeile als eigene Frage für den gewählten Service. Kommas im Fragetext bleiben erhalten. - Fragen als CSV exportieren erzeugt eine reimportierbare Datei für das aktive Service-Frageset. Die Exportspalten sind
frage,service_slug,split,test_goal,expected_answer_modeundweight. - Diagnose-Backlog als CSV exportieren erzeugt eine Arbeitsliste für Nacharbeit und Triage. Diese Datei ist nicht als Fragenimport gedacht.
- Mit Neue Frage anlegen ergänzen Sie einzelne Fragen direkt im Tab. Mit Markierte Fragen löschen entfernen Sie bewusst ausgewählte Fragen.
- Ein Klick auf den Prozentwert öffnet Details zur Bewertung mit Frage, Antwort, Ergebnis, Einschätzung, Begründung, Verbesserung und verwendeten Wissenskarten.
- Die Wissenskarten zeigen, welche Karte die Antwort verwendet hat, welche der Judge bestätigt und welche der Judge zusätzlich empfiehlt. Der Pfeil an der Kartenfläche springt zur jeweiligen Wissenskarte im Reiter Fakten.
- Fachliche Nacharbeit erfolgt primär im Reiter Fakten über Wissenskarten, Kategorien und Schlüsselwörter sowie bei kundenspezifischer Begrifflichkeit über Fachprofile.
CSV-Import und -Export für Fragen
Der Fragenexport verwendet Komma als Trennzeichen und ist als Importvorlage geeignet. Der Import akzeptiert zusätzlich Semikolon- und Tab-getrennte Dateien. Zulässige Werte für split sind training, validation und holdout; ohne Wert wird training verwendet. test_goal akzeptiert routing, knowledge_answer, boundary, no_answer oder mixed. expected_answer_mode akzeptiert answerable, no_answer, boundary_answer oder unknown. Das Gewicht weight ist eine positive Zahl; bei Komma-CSV verwenden Sie am besten Dezimalpunkte oder setzen Dezimalkommas in Anführungszeichen.
Beispiel: reimportierbare CSV
frage,service_slug,split,test_goal,expected_answer_mode,weight
Welche Nachweise brauche ich?,wohnbeihilfe,training,knowledge_answer,answerable,1
Wann muss ich den Antrag stellen?,wohnbeihilfe,validation,boundary,boundary_answer,1.5
Beispiel: einfache Datei ohne Kopfzeile
Welche Unterlagen brauche ich?
Gibt es eine Frist?
Muss ich den Antrag neu stellen, wenn sich mein Einkommen ändert?;
X Darf ich den Antrag rückwirkend stellen?
Diese Kurzform ist nur eindeutig, wenn der Import aus einem ausgewählten Service heraus erfolgt oder der Service aus dem Dateinamen erkannt werden kann. Ein führendes X wird als Markierung gespeichert und nicht Teil der Frage. Ein abschließendes Semikolon wird bei reinen Fragenlisten toleriert.
Beispiel: Semikolon-CSV
frage;service_slug
Muss ich den Antrag neu stellen, wenn sich mein Einkommen ändert?;wohnbeihilfe
Welche Nachweise brauche ich?;wohnbeihilfe
Beispiel: erweiterte Importspalten
question,service,split,ziel,antwortmodus,expected_route,response_pattern,projection,gewicht
Wird ein bestimmtes Einkommen vorausgesetzt?,wohnbeihilfe,holdout,knowledge_answer,answerable,answer,"Einkommen|Grenze",free_first_turn,2
Die zusätzlichen Spalten expected_route, response_pattern und projection werden als Metadaten übernommen, erscheinen aber nicht im Standardexport.
CSV-Diagnose-Backlog
Der Diagnose-Backlog exportiert die aktuelle QS-Sicht als Arbeitsliste. Die Datei enthält unter anderem service_slug, frage_ref, projektion, diagnosegruppe, prioritaet, verdict, frage, antwort, begruendung, verbesserung und karten. Sie dient der fachlichen Nacharbeit und wird nicht wieder importiert.
Beispiel: Backlog-Zeile
service_slug,service_name,frage_ref,frage_id,projektion,diagnosegruppe,handlungsziel,chat_score,wissen_score,source_gap,prioritaet,verdict,issue_type,frage,antwort,begruendung,verbesserung,coverage_reason,karten
wohnbeihilfe,Wohnbeihilfe,Wohnbeihilfe-003,128,free_first_turn,Wissenslage,Wissenskarte ergänzen,72,40,ja,hoch,Teilweise richtig,knowledge_gap,"Welche Unterlagen brauche ich?","Antwortauszug ...","Begründung ...","Verbesserung ...","Quelle unvollständig","Karte A; Karte B"
1
2
3
4
5
6
| Marker | Element | Bedeutung |
|---|---|---|
| 1 | Frage | Zeigt, welche QS-Frage bewertet wurde. |
| 2 | Bewertung | Erklärt Antwort, Ergebnis, Einschätzung, Begründung und Verbesserung. |
| 3 | Diagnosehinweise | Zeigt nachvollziehbare Hinweise aus Bewertung und Antwortpipeline, falls vorhanden. |
| 4 | Kartenvergleich | Vergleicht verwendete, bestätigte und zusätzlich empfohlene Karten. |
| 5 | Wissenskarte | Zeigt die fachliche Quelle mit Sprung in den Reiter Fakten. |
| 6 | Schliessen | Kehrt zur QS-Fragenliste zurück. |
Beispiel: fachliche Lücke schließen
Wenn eine Antwort fachlich nicht beantwortet werden konnte, öffnen Sie die Bewertungsdetails, prüfen Sie die vom Judge empfohlenen Wissenskarten und wechseln Sie per Pfeil in den Reiter Fakten. Dort können Sie Antworttext, Kategorie oder Schlüsselwörter der Wissenskarte korrigieren und danach den QS-Lauf erneut starten.
Arbeitsablauf: Testfall aufzeichnen
- Starten Sie in Manuell eine neue Session.
- Starten Sie die Aufzeichnung.
- Führen Sie einen realistischen Dialog bis zum erwarteten Ergebnis.
- Stoppen Sie die Aufzeichnung.
- Prüfen Sie die vorgeschlagenen Prüfungen und Werte.
- Speichern Sie den Testfall.
- Führen Sie ihn in QS-Service & Assistenz erneut aus.
AFS-Split-Screen-Prüfung
1
2
3
4
5
| Marker | Element | Bedeutung |
|---|---|---|
| 1 | Manuell | Direkter Test einer Chat-Session in der Admin-Oberfläche. |
| 2 | Chatverlauf | Zeigt Assistenten- und Benutzernachrichten. |
| 3 | Eingabe | Sendet Testnachrichten an den Chat. |
| 4 | Recorder, Export und Judge | Zeichnet Testfälle auf, kopiert oder speichert den Chat, bewertet die aktuelle Antwort mit dem Judge oder startet neu. |
| 5 | Debugspalte | Zeigt Ablauf, Schritt, Sprache und ausgewählten Service. |
Abb. T-01 zeigt den manuellen Testkontext, in dem die AFS-Split-Screen-Prüfung durchgeführt wird. Die Formularvorschau erscheint parallel zum Chat, sobald ein geeigneter AFS-Link in der Session verfügbar ist.
- Die Formularvorschau zeigt das AFS-Formular parallel zum Chat.
- Aktuell abgefragte Felder werden markiert und in den sichtbaren Bereich gescrollt.
- Markierung prüft, ob das richtige Formularfeld hervorgehoben ist.
- Befüllung prüft, ob die Antwort im richtigen Formularfeld angekommen ist.
- Bei wiederholbaren Blöcken und Datei-Uploads ist die richtige Blockinstanz besonders wichtig.
Referenz: wichtige Prüfungen
| Prüfung | Bedeutung | Typischer Einsatz |
|---|---|---|
| Antwort ok | Bot-Antwort ist technisch vorhanden und enthält keine Fehlerzeichen. | Grundprüfung für jeden Erwartungsschritt. |
| Textanker | wichtige erwartete oder verbotene Begriffe im Antworttext. | Kurze fachliche Kernaussagen prüfen, ohne ganze Antwort festzunageln. |
| State | erwarteter Workflow-Zustand. | Dialogsteuerung stabil prüfen, wenn Text variieren darf. |
| Service | vorgeschlagener oder ausgewählter Service. | Matching und Serviceauswahl absichern. |
| AFS-Felder | im Chat abgefragte Formularfelder. | Split-Screen-Markierung und Formularbefüllung prüfen. |
Häufige Probleme
- Test schlägt nach Fachänderung fehl: prüfen, ob Erwartung oder Fachlogik angepasst werden muss.
- AFS-Prüfung ist rot: sichtbares Formular, Markierung und JSON-Fehlerartefakt im Testlauf prüfen.
- LLM-Formulierung schwankt: stabile Prüfungen wie State, Service und Textanker bevorzugen.
- Testfall bleibt offen: Ergebnis im Tab Testlauf lesen, Ursache beheben und danach AUTT-Freigabe bewusst setzen.