Uma pontuação de detector de IA não é uma cadeia de custódia. É um sinal estatístico produzido por uma ferramenta com uma taxa de erro que varia de acordo com o comprimento do texto, gênero, idioma de fundo, histórico de edição e versão do modelo.
Este guia de avaliação de detecção de IA oferece um fluxo de trabalho mais justo para escolas, editores e equipes de produtos. Ele se baseia no exemplo de falso positivo da Declaração de Independência e no artigo mais amplo Métodos de detecção de chatbot de IA.
Comece com a pergunta real
“A IA foi usada?” é muitas vezes demasiado vago para governar. Uma revisão útil separa pelo menos quatro questões:
- Um sistema de IA foi usado em algum momento?
- Seu uso foi permitido para esta tarefa ou fluxo de trabalho?
- A pessoa divulgou ou documentou esse uso conforme necessário?
- O trabalho enviado é preciso, original e atribuível à pessoa?
A pontuação do detector não pode responder a todas as quatro. Ele não pode identificar a ferramenta exata, provar a intenção ou explicar se uma correção gramatical permitida se tornou um envio escrito por fantasma não divulgado.
Hierarquia de evidências
Prefira evidências que descrevam o processo em vez de um número inferido do texto final.
| Evidência | O que ajuda a estabelecer | Limitação principal |
|---|---|---|
| Rascunhos e histórico de versões | Como o trabalho mudou ao longo do tempo | Algumas ferramentas não retêm histórico |
| Notas, fontes e citações | Se o autor entende e apoia as reivindicações | As notas também podem ser geradas ou incompletas |
| Registros de conversas ou ferramentas | O que um sistema de IA foi solicitado a fazer | Os registros podem estar indisponíveis ou ser sensíveis à privacidade |
| Entrevista ou passo a passo com o autor | Se a pessoa pode explicar as decisões e revisar o trabalho | O julgamento humano ainda é falível |
| Pontuação do detector | Um motivo para fazer mais perguntas | Falsos positivos e desvio de ferramenta |
O resultado correto geralmente é uma avaliação de confiança com incerteza documentada, e não um rótulo binário produzido por uma varredura.
Por que as pontuações do detector falham
As ferramentas de detecção procuram padrões associados ao texto gerado. Esses padrões também aparecem na escrita humana que é formal, altamente editada, estereotipada, traduzida ou produzida por alguém que escreve em um segundo idioma.
Passagens curtas são especialmente instáveis porque há menos evidências para distinguir estilo de acaso. Uma pontuação também pode mudar quando o mesmo texto é levemente editado, reformatado ou enviado para uma versão diferente do detector.
Por esse motivo, nunca compare pontuações de ferramentas diferentes como se fossem probabilidades calibradas. Registre o nome da ferramenta, versão, data, comprimento de entrada, idioma e se o texto foi editado antes da digitalização.
Um fluxo de trabalho de revisão em quatro estágios
1. Preservar o contexto
Salve o texto enviado, o relatório do detector e as condições em que foi produzido. Não cole trabalhos confidenciais em serviços de terceiros não aprovados apenas para obter outra pontuação.
2. Solicitar procedência
Peça rascunhos, material de origem, notas resumidas, citações e uma breve explicação do processo de edição. Em um local de trabalho, o histórico do repositório, os arquivos de projeto e os comentários de revisão podem fornecer o mesmo tipo de evidência.
3. Conduza uma revisão humana
O revisor deve verificar a exatidão factual, a qualidade da fonte, a consistência com trabalhos anteriores e a capacidade do autor de explicar o resultado. A revisão não deve ser um interrogatório disfarçado baseado no estilo de escrita.
4. Ofereça um caminho de apelação
Documente quais evidências alteram a decisão, quem pode analisar uma apelação, por quanto tempo os registros são retidos e como a privacidade é protegida. Uma rejeição automatizada opaca não é uma política defensável.
Projetando uma política responsável
Uma política responsável deveria dizer:
- quais usos de IA são permitidos, restritos ou proibidos;
- qual divulgação é necessária;
- quais evidências de processo as pessoas devem reter;
- que as pontuações dos detectores nunca são conclusivas por si só;
- quem analisa um caso sinalizado;
- como a pessoa pode responder ou recorrer;
- como rascunhos e registros confidenciais são armazenados e excluídos.
A política também deve ser testada em escrita humana conhecida, escrita traduzida e escrita editada antes de ser usada em uma decisão de alto risco. Se a taxa de falsos positivos não for aceitável, o detector não deve ser usado como porta.
Resultado final
A detecção de IA funciona melhor como um estímulo para uma conversa justa sobre processo, qualidade e política. Torna-se prejudicial quando uma pontuação probabilística é tratada como prova. Preserve a proveniência, revise o trabalho, explique a incerteza e mantenha um caminho de recurso significativo.