2026.08.12 (Mié)
2026.08.14 (Vie) actualizado

✨ Resumen de GPT-5.6 Sol

Vi cómo la IA cambiaba de opinión con cada objeción mía, así que creé una Skill con un solo fresh critic que desconfía tanto de la primera respuesta como de la crítica.

«Por favor, critícalo»

Después de que una tarea de UI de 16 horas terminara en basura, exigí a Codex que explicara cómo había llegado a ese desastre. Traté aparte el problema de un resultado intermedio no verificado que contaminó todo el trabajo posterior. Pero dentro de la conversación que debía explicar el fracaso se repetía otra cosa extraña.

Si yo proponía una alternativa, la IA decía enseguida que era correcta. Si luego planteaba una objeción, pasaba a decir que la objeción era correcta. Todo sonaba razonable, pero la conclusión se inclinaba hacia lo último que yo había dicho. Tampoco podía confiar sin más en su explicación del fracaso.

Entregué la respuesta de una sesión a otra para que la criticara y devolví esa crítica a la primera para que respondiera. Una parte sí encontraba supuestos y costes operativos que la otra había omitido. Aun así, al pegar una crítica, la IA aceptaba demasiado rápido que «ese punto es correcto».

Al final dije exactamente lo que quería.

Por favor, critícalo.

No quería ver a dos IA llegar educadamente a un acuerdo. Quería que tanto la primera respuesta como la crítica posterior fueran puestas en duda hasta que decidieran las pruebas. Que varios Agents digan lo mismo no lo convierte en verdad, y llamar critic a uno de ellos no lo vuelve preciso.

Reduje la revisión por copia y pega a un solo fresh critic

Primero imaginé un sistema de debate con tres critics y varias rondas. Incluso pensé en pagar Claude Code para enfrentarlo a Codex. La IA respondió con Coordinators, Workers, Auditors y más estado. Un Goal de 16 horas ya había fallado por crecer sin control; construir otra orchestration gigante para impedirlo no tenía sentido.

Yo quería algo mucho más pequeño. La sesión principal envía su conclusión a un fresh critic. El critic busca contraejemplos y supuestos ocultos. La sesión principal acepta cada objeción material, la refuta con pruebas o la deja sin resolver. Si cambia la respuesta, el mismo critic la revisa una sola vez más. Si en la primera revisión no aparece nada importante, no hay segunda ronda.

Convertí ese flujo en una Skill compartida llamada Custom - Deliberate. La revisión es read-only, la respuesta del critic nunca se adopta automáticamente y la respuesta final debe mostrar también las objeciones rechazadas y la incertidumbre restante. Solo reduje el trabajo que hacía copiando entre GPT y Codex el texto, la respuesta y la refutación.

Nada más crearla, usé la Skill para revisar su propio procedimiento. Un critic no se vuelve completamente independiente por no recibir la conversación anterior. Sigue compartiendo el mismo modelo y reglas superiores, y unas pruebas erróneas pueden hacerlo equivocarse de la misma manera. Por eso solo trata objeciones capaces de cambiar materialmente la conclusión y admite cuando faltan pruebas, en vez de fabricar consenso.

No confío automáticamente ni en la primera respuesta ni en la crítica

Esta Skill no garantiza la verdad. Otro modelo quizá rompa mejor un sesgo compartido por una familia de modelos, y las preferencias y los juicios de valor siguen siendo míos.

Aun así, antes de sumar otra suscripción de 150.000 wones, empezaré por aquí. No fijo la primera conclusión: pido a un fresh critic que intente romperla y dejo escrito qué acepté, qué refuté y por qué, y qué sigue sin resolver.

Ya había escrito que tanto Claude Code como Codex terminan necesitando un harness. Esta vez apliqué la idea al propio juicio. Importa que la IA termine el trabajo, pero también impedir que me dé la razón a ciegas y cierre una conclusión demasiado pronto.

Categorías: ,

Actualizado:

Deja un comentario