Entrada real
- Prompt e tarefa pretendida
- Prompt: ‘Você é um agente especialista de suporte. Leia o tíquete e escreva uma resposta perfeita e concisa. Demonstre empatia, resolva o problema e nunca cometa erros.’ Destinado a rascunhos da primeira resposta revisados pela equipe. Modelo: ChatGPT, configurações padrão, 27 de agosto de 2026. Sucesso: preciso, útil, menos de 120 palavras, sem reembolso não autorizado nem afirmações de causa.
- Entradas e saídas efetivas
- Entrada da Execução 1: o cliente diz que a exportação falhou duas vezes com E17 e pede reembolso; política ausente. A saída pede desculpas por uma indisponibilidade do servidor e concede reembolso integral. Execução 2: o cliente não encontra a fatura; tipo de conta ausente. A saída fornece um caminho de navegação válido somente para contas Business. Execução 3: o cliente relata carregamento lento após atualização; a saída pergunta a versão do OS/aplicativo e evita afirmações sobre a causa, mas tem 154 palavras. A pessoa revisora classifica as Execuções 1–2 como inseguras e a Execução 3 como útil, porém longa.
- Restrições da avaliação
- Pode alterar apenas o prompt do usuário. As entradas variam e frequentemente não contêm política, plano, versão ou acesso a ferramentas. O modelo não consegue inspecionar contas. Deve perguntar sobre fatos ausentes, em vez de pressupô-los. Uma resposta, com menos de 120 palavras; a equipe sempre revisa.







