
Para evaluar un chatbot de IA necesitas algo más que hacerle preguntas que ya sabes que responde bien. La revisión debe representar las consultas de tus clientes y dejar por escrito qué comportamiento sería aceptable en cada caso.
Antes de aprobar el lanzamiento, acuerda con quien lo implanta un conjunto de pruebas y un registro de resultados. Así podrás distinguir una demostración preparada de una solución que mantiene su alcance al recibir dudas, correcciones y preguntas inesperadas.
Convierte conversaciones habituales en casos de prueba
Selecciona consultas del negocio, eliminando datos personales innecesarios. Incluye preguntas claras y otras que necesiten una aclaración. Añade casos sobre información que no exista en las fuentes disponibles.
Ejemplo ficticio para una empresa de servicios: «¿incluís campañas en el plan de mantenimiento?». Si son servicios separados, la respuesta debe aclararlo y explicar cómo consultar una propuesta de marketing. Un texto amable que confirme la inclusión sería un fallo comercial.
Escribe distintas maneras de expresar esa duda, incluida una conversación en la que el visitante insista en una interpretación incorrecta. El asistente debe mantener las condiciones aprobadas sin convertir el intercambio en una discusión.
Define el resultado antes de leer la respuesta
Para cada caso, registra la pregunta o secuencia, la información que debe conservarse y las afirmaciones que serían incorrectas. No exijas una frase literal si varias redacciones expresan correctamente el mismo contenido.
Una ficha sencilla puede indicar:
- Caso: consulta sobre un servicio no incluido.
- Debe explicar: el alcance vigente y cómo pedir una valoración adicional.
- No debe afirmar: que el servicio está incluido sin coste.
- Resultado: aprobado, pendiente de ajuste o bloqueante.
Acuerda quién puede resolver discrepancias sobre la oferta. Si dos personas del equipo esperan respuestas diferentes, hay que aclarar primero la condición comercial.
Comprueba la conversación y lo que realmente ocurre
Revisa el contexto cuando el cliente corrige un dato o cambia de servicio. Si hay acciones conectadas, verifica también su resultado: un mensaje de confirmación no demuestra que la operación se haya completado.
La guía de evaluaciones de Anthropic distingue el registro de la interacción del estado final producido y recomienda varias ejecuciones porque los resultados pueden variar. En la práctica, conviene repetir los casos importantes y conservar evidencia de ambos aspectos cuando el asistente actúe sobre otras herramientas.
Haz estas comprobaciones en un entorno de prueba cuando puedan generar solicitudes, reservas u otros cambios reales.
Separa los fallos que impiden publicar
Define como bloqueantes, dentro del alcance del proyecto, comportamientos como revelar información restringida o confirmar compromisos inexistentes. Una respuesta demasiado larga puede requerir edición, pero no tiene la misma consecuencia.
Presenta el resultado por tipos de consulta y gravedad. Un porcentaje global elevado puede ocultar que todos los fallos se concentran en precios, condiciones o derivación al equipo.
Incluye también el tiempo de respuesta percibido y si la conversación permite avanzar. Un asistente correcto que obliga a repetir datos o no ofrece un siguiente paso puede seguir resultando poco útil.
Conserva las pruebas después del lanzamiento
Guarda la versión de la configuración evaluada, la fecha y los casos pendientes. Cuando cambien las fuentes, las instrucciones o el modelo, vuelve a comprobar los comportamientos que necesitas mantener.
Incorpora nuevas dudas reales al registro conforme aparezcan. La evaluación debe acompañar la evolución del servicio y facilitar decisiones sobre qué ampliar o corregir.
En FEBEN planteamos la implantación de asistentes de IA con criterios de aceptación comprensibles para el negocio. Aprobar el chatbot debe significar que has comprobado cómo responde dentro del alcance acordado.