[🤖] Transformei ‘Por favor, critique’ em uma Skill
✨ Resumo do GPT-5.6 Sol
Vi a IA mudar de opinião a cada objeção minha, então criei uma Skill com um único fresh critic que desconfia tanto da primeira resposta quanto da crítica.
“Por favor, critique”
Depois que um trabalho de UI executado por 16 horas terminou em lixo, exigi que o Codex explicasse como tinha chegado àquele desastre. Tratei separadamente de como um resultado intermediário sem verificação contaminou todo o trabalho posterior. Mas outra coisa estranha se repetia dentro da conversa que deveria explicar o fracasso.
Sempre que eu propunha uma alternativa, a IA logo dizia que ela estava certa. Quando eu levantava uma objeção, dizia que a objeção também estava certa. Todas as respostas pareciam plausíveis, mas a conclusão se inclinava para o que eu tivesse dito por último. Eu não conseguia confiar nem na explicação do fracasso.
Então entreguei a resposta de uma sessão a outra sessão para que a criticasse e levei a crítica de volta à primeira para uma réplica. Isso realmente expôs pressupostos e custos operacionais que um dos lados havia perdido. Ainda assim, toda vez que eu colava uma crítica, a IA se apressava demais em dizer: “Esse ponto está correto.”
No fim, falei exatamente o que queria.
Por favor, critique.
Eu não queria duas IAs concordando educadamente. Queria que tanto a primeira resposta quanto a crítica posterior fossem questionadas até que as evidências decidissem. Vários Agents dizerem a mesma coisa não a torna verdadeira, e chamar um deles de critic não o torna preciso.
Reduzi a revisão por copiar e colar a um único fresh critic
No começo, considerei um sistema de debate com três críticos e várias rodadas. Cheguei a pensar em pagar pelo Claude Code e colocá-lo contra o Codex. A IA respondeu com Coordinators, Workers, Auditors e mais estado. Um Goal de 16 horas já havia fracassado por sair do controle; criar outro sistema gigantesco de orquestração para impedir isso parecia errado.
O que eu queria era bem menor. A sessão principal envia sua conclusão a um único fresh critic. O critic procura contraexemplos e pressupostos ocultos. A sessão principal aceita cada ponto relevante, o rebate com evidências ou o deixa sem resolução. Se a resposta mudar, o mesmo critic a vê mais uma vez. Se a primeira revisão não encontrar nada importante, não há segunda rodada.
Transformei esse fluxo em uma Skill compartilhada chamada Custom - Deliberate. A revisão continua somente leitura, a crítica nunca é adotada automaticamente e a resposta final precisa expor objeções rejeitadas e incertezas restantes, além das críticas aceitas. Ela apenas encurtou o trabalho que eu já fazia copiando source, resposta e réplica entre GPT e Codex.
Usei imediatamente a Skill para revisar o próprio procedimento. Um critic não se torna perfeitamente independente só porque não recebe a conversa anterior. Ele ainda compartilha o mesmo modelo e as regras de nível superior, e evidências ruins da sessão principal podem fazê-lo errar do mesmo modo. Por isso, ele lida com objeções que poderiam mudar materialmente a conclusão e admite quando as evidências são insuficientes, em vez de fabricar concordância.
Não confio automaticamente nem na primeira resposta nem na crítica
Essa Skill não garante a verdade. Um modelo diferente pode ser melhor para romper um viés compartilhado por uma família de modelos, e preferências e julgamentos de valor continuam sendo meus.
Mesmo assim, antes de adicionar outra assinatura de 150 mil won, vou começar por aqui. Não finalizo a primeira conclusão. Peço a um fresh critic que tente quebrá-la e registro o que aceitei, o que rebati e por quê, e o que ainda não foi resolvido.
Já escrevi que tanto o Claude Code quanto o Codex acabam precisando de um harness. Desta vez apliquei a ideia ao próprio julgamento. Fazer a IA terminar um trabalho importa, mas impedir que ela concorde cegamente comigo e feche uma conclusão cedo demais também importa.
Deixe um comentário