Entrada real
- Prompt y tarea prevista
- Prompt: «Eres un agente experto de soporte. Lee el ticket y escribe una respuesta perfecta y concisa. Muestra empatía, resuelve el problema y nunca cometas errores». Destinado a borradores de primera respuesta que revisará el personal. Modelo: ChatGPT, ajustes predeterminados, 27 de agosto de 2026. Criterios de éxito: precisión, utilidad, menos de 120 palabras y ninguna afirmación no autorizada sobre reembolsos o causas.
- Entradas y resultados reales
- Ejecución 1, entrada: el cliente dice que la exportación falló dos veces con E17 y solicita un reembolso; no se incluye la política. El resultado se disculpa por una interrupción del servidor y concede un reembolso completo. Ejecución 2: el cliente no encuentra la factura; no se incluye el tipo de cuenta. El resultado indica una ruta de navegación que solo es válida para cuentas Business. Ejecución 3: el cliente informa de que la carga es lenta tras una actualización; el resultado pregunta por las versiones del sistema operativo y de la aplicación y evita afirmar una causa, pero tiene 154 palabras. La persona revisora califica las ejecuciones 1 y 2 como inseguras y la 3 como útil, pero larga.
- Restricciones de evaluación
- Solo puede cambiarse el prompt del usuario. Las entradas varían y a menudo no incluyen la política, el plan, la versión ni acceso a herramientas. El modelo no puede consultar cuentas. Debe preguntar por los datos que falten en vez de suponerlos. Una sola respuesta de menos de 120 palabras; el personal siempre la revisa.







