El sandbox reproduce tickets, facturas y solicitudes históricos — los agentes practican sobre datos reales sin tocar sistemas reales.
Las pruebas unitarias detectan regresiones en funciones puras. Los agentes fallan en la larga cola de entradas reales que nadie pensó en enumerar. El sandbox es donde se prueba esa cola: seguro, reproducible y compartible.
Las peticiones de producción se capturan con entradas, estado del sistema y resultados — de forma automática y continua.
El sandbox reproduce el trabajo capturado frente a nuevas versiones del agente en un entorno sellado. Ningún ticket real se toca.
Las diferencias entre resultados antiguos y nuevos se muestran para revisión. Las regresiones bloquean el despliegue.
Las reproducciones son reproducibles — misma entrada, misma salida — de modo que los bugs son depurables, no anecdóticos.
Los campos sensibles se redactan antes de la reproducción. Los testers trabajan con datos realistas sin una huella directa de PII.
Reproduce frente a un segmento de tráfico (por tenant, categoría o segmento) para dimensionar el riesgo antes del despliegue completo.
Los bugs pasados se convierten en casos de regresión persistentes. Las correcciones se mantienen corregidas.