Die Sandbox spielt historische Tickets, Rechnungen und Anfragen ab — Agenten üben an echten Daten, ohne echte Systeme zu berühren.
Unit-Tests fangen Regressionen in reinen Funktionen ab. Agenten scheitern am Long Tail realer Eingaben, an die niemand gedacht hat. Die Sandbox ist der Ort, an dem dieser Tail getestet wird: sicher, abspielbar und teilbar.
Produktionsanfragen werden mit Eingaben, Systemzustand und Ergebnissen erfasst — automatisch, kontinuierlich.
Die Sandbox spielt erfasste Arbeit gegen neue Agentenversionen in einer abgeschotteten Umgebung ab. Keine echten Tickets werden berührt.
Unterschiede zwischen alten und neuen Ergebnissen werden zur Prüfung herausgestellt. Regressionen blockieren das Deploy.
Replays sind reproduzierbar — gleiche Eingabe, gleiche Ausgabe — sodass Bugs debuggbar sind, nicht nach Gefühl.
Sensible Felder werden vor dem Replay redigiert. Tester arbeiten auf realistischen Daten ohne PII-Fußabdruck.
Replay gegen einen Verkehrsausschnitt (nach Tenant, Kategorie oder Segment), um Risiken vor dem vollständigen Rollout abzuschätzen.
Vergangene Bugs werden zu hartnäckigen Regressionsfällen. Fixes bleiben fix.