← Voltar ao curso
Nível 3 — Automação e escala · Módulo 3.6 — Engenharia de prompt e avaliação

3.6.2 · Por que avaliar

4 min de vídeo TODOS

Objetivo: ao final, o consultor sabe por que julgar um prompt por uma amostra é indistinguível de adivinhar, e reconhece em quais situações da Wayon a avaliação deixa de ser opcional.

O que você precisa levar desta aula

  1. Julgar prompt por uma amostra é indistinguível de adivinhar. Dois prompts com 28 pontos de diferença podem produzir a mesma saída no primeiro caso testado — e produzem, com frequência.
  2. A avaliação entrega mais que uma nota: ela diz onde o erro se concentra. Erro agrupado numa categoria é conserto de prompt; erro espalhado costuma ser problema de tarefa mal definida ou de dataset.
  3. Avaliar não é obrigatório sempre. Vira obrigatório quando o prompt roda em volume, entra em produto do cliente ou vira automação desassistida — a mesma régua de proporcionalidade da aula 3.4.1, aplicada antes em vez de depois.

Por que a intuição falha aqui

O problema não é falta de atenção. É estatístico, e tem três causas que se somam:

Causa O que acontece
Amostra pequena Com um caso, dois prompts de 61% e 89% concordam em mais da metade das vezes
Viés de escolha do caso Você testa com o caso que tinha à mão — quase sempre um caso típico, nunca um de borda
Fluência ≠ correção É a mesma armadilha da aula 3.4.2: o Claude escreve bem, e texto bem escrito parece certo
Você conhece a resposta Sabendo o rótulo correto, você lê a saída procurando confirmação, não erro

A quarta linha é a mais traiçoeira em contexto de consultoria: quem escreve o prompt de triagem é quem conhece o AMS. Essa pessoa lê a saída e reconstrói mentalmente o raciocínio que faria a saída estar certa.

Quando avaliar, e quando não

Situação Avaliar?
Prompt de uso próprio, em sessão que você acompanha Não. Você é a verificação
Skill do módulo 2.4 usada pela squad no dia a dia Leve — alguns casos de borda bastam
Prompt que roda em volume (centenas de itens) Sim
Prompt dentro de produto entregue ao cliente Sim, e o resultado vai junto da entrega
Prompt dentro de automação desassistida (módulo 3.5) Sim — não há humano no caminho
Prompt que decide algo com consequência (alçada, valor, aprovação) Sim, independentemente do volume

O que uma avaliação entrega além da nota

Uma avaliação bem montada produz quatro coisas, e só a primeira é a nota:

  1. O número agregado — serve para comparar duas versões
  2. A distribuição do erro por categoria — serve para saber o que consertar
  3. A lista dos casos que falharam — serve para entender por que
  4. Um piso que não pode regredir — serve para a próxima alteração não quebrar o que já funcionava

O item 4 é o que transforma avaliação em ativo: depois de montada, ela vira teste de regressão do prompt. É o equivalente, para prompt, do stop hook de teste da aula 3.4.3.

Regra Wayon Nenhuma automação com Claude é proposta a cliente com uma taxa de acerto afirmada sem medição. Se a proposta diz "classifica corretamente a maioria dos chamados", ou existe uma avaliação por trás desse número, ou a frase sai da proposta. Estimativa sem medição vira compromisso contratual do mesmo jeito.

📖 Definir critérios de sucesso · Verifique na proporção da corda — aula 3.4.1

Quiz — 3 questões

1.Dois prompts foram testados num chamado e produziram a mesma saída. O que se pode concluir?
  • a)Que são equivalentes para essa tarefa, e a escolha pode ser pelo mais legível

    Um caso concordante é compatível com uma diferença enorme no agregado — foi o que a aula mostrou com 61% e 89%.

  • b)Que o caso testado é fácil demais e deve ser descartado do dataset

    Caso fácil tem lugar no dataset; o problema é a conclusão tirada de um caso só, não o caso.

  • c)Praticamente nada — dois prompts com 28 pontos de diferença concordam com frequência num caso isolado

    Correto. É o motivo de a aula existir.

Ver resposta e por quê
a) Um caso concordante é compatível com uma diferença enorme no agregado — foi o que a aula mostrou com 61% e 89%.
b) Caso fácil tem lugar no dataset; o problema é a conclusão tirada de um caso só, não o caso.
c) Correto. É o motivo de a aula existir.
2.Em qual destas situações a avaliação formal do prompt não é exigida pela Regra Wayon?
  • a)Um consultor escreve um prompt para reorganizar suas próprias anotações numa sessão que ele acompanha

    Correto. Supervisão direta é a própria verificação — mesma proporcionalidade da aula 3.4.1.

  • b)Um prompt que classifica os chamados de AMS do mês inteiro numa rodada

    Roda em volume: entra nas três situações que tornam a medição obrigatória.

  • c)Um prompt embutido num relatório automático entregue mensalmente ao Meridiano

    Produto entregue ao cliente e desassistido — dois dos três gatilhos ao mesmo tempo.

Ver resposta e por quê
a) Correto. Supervisão direta é a própria verificação — mesma proporcionalidade da aula 3.4.1.
b) Roda em volume: entra nas três situações que tornam a medição obrigatória.
c) Produto entregue ao cliente e desassistido — dois dos três gatilhos ao mesmo tempo.
3.A avaliação mostra que o prompt acerta 74% e que quase todo o erro está em chamados que misturam duas áreas. Qual é o valor específico dessa segunda informação? ---
  • a)Confirma que 74% é um bom resultado, já que o erro está concentrado

    Concentração não qualifica o número; ela indica onde agir, não se o patamar é aceitável.

  • b)Permite remover esses casos do dataset para o número subir

    Removê-los mede um problema mais fácil que o real — é como apagar o teste que falha.

  • c)Transforma a nota em instrução de conserto: o próximo ajuste do prompt tem alvo definido

    Correto. Erro agrupado numa categoria aponta o que mudar; erro espalhado indicaria outro tipo de problema.

Ver resposta e por quê
a) Concentração não qualifica o número; ela indica onde agir, não se o patamar é aceitável.
b) Removê-los mede um problema mais fácil que o real — é como apagar o teste que falha.
c) Correto. Erro agrupado numa categoria aponta o que mudar; erro espalhado indicaria outro tipo de problema.