2026.08.12 (Mer)
2026.08.14 (Ven) mis Ă  jour

✹ RĂ©sumĂ© de GPT-5.6 Sol

J’ai vu l’IA changer d’avis Ă  chacune de mes objections, alors j’ai créé une Skill avec un seul fresh critic qui se mĂ©fie autant de la premiĂšre rĂ©ponse que de la critique.

« S’il te plaĂźt, critique »

AprĂšs qu’un travail d’UI exĂ©cutĂ© pendant 16 heures a fini en dĂ©chet, j’ai exigĂ© de Codex qu’il explique comment il en Ă©tait arrivĂ© Ă  ce dĂ©sastre. J’ai traitĂ© sĂ©parĂ©ment la maniĂšre dont un rĂ©sultat intermĂ©diaire non vĂ©rifiĂ© avait contaminĂ© tout le travail en aval. Mais quelque chose d’autre se rĂ©pĂ©tait dans la conversation censĂ©e expliquer l’échec.

Chaque fois que je proposais une solution diffĂ©rente, l’IA disait aussitĂŽt qu’elle Ă©tait juste. Quand j’objectais, elle disait que l’objection Ă©tait juste Ă  son tour. Toutes les rĂ©ponses semblaient plausibles, mais la conclusion penchait vers ce que j’avais dit en dernier. Je ne pouvais mĂȘme plus faire confiance Ă  l’explication de l’échec.

J’ai donc confiĂ© la rĂ©ponse d’une session Ă  une autre pour qu’elle la critique, puis ramenĂ© la critique Ă  la premiĂšre session pour une rĂ©futation. Cela a bien rĂ©vĂ©lĂ© des hypothĂšses et des coĂ»ts d’exploitation qu’un cĂŽtĂ© avait manquĂ©s. Pourtant, chaque fois que je collais une critique, l’IA s’empressait encore de dire : « Ce point est correct. »

À la fin, j’ai dit exactement ce que je voulais.

S’il te plaüt, critique.

Je ne voulais pas que deux IA se mettent poliment d’accord. Je voulais que la premiĂšre rĂ©ponse et la critique suivante soient toutes deux remises en question jusqu’à ce que les preuves tranchent. Le fait que plusieurs Agents disent la mĂȘme chose ne la rend pas vraie, et appeler l’un d’eux critic ne le rend pas exact.

J’ai rĂ©duit la revue par copier-coller Ă  un seul fresh critic

Au dĂ©but, j’ai envisagĂ© un systĂšme de dĂ©bat avec trois critiques et plusieurs tours. J’ai mĂȘme pensĂ© Ă  payer Claude Code pour l’opposer Ă  Codex. L’IA m’a rĂ©pondu avec des Coordinators, Workers, Auditors et davantage d’état. Un Goal de 16 heures venait dĂ©jĂ  d’échouer parce qu’il Ă©tait parti hors de contrĂŽle ; construire un autre Ă©norme systĂšme d’orchestration pour Ă©viter cela me semblait absurde.

Ce que je voulais Ă©tait bien plus petit. La session principale envoie sa conclusion Ă  un seul fresh critic. Le critic cherche des contre-exemples et des hypothĂšses cachĂ©es. La session principale accepte chaque point important, le rĂ©fute avec des preuves ou le laisse non rĂ©solu. Si la rĂ©ponse change, le mĂȘme critic la revoit une seule fois. Si la premiĂšre revue ne trouve rien d’important, il n’y a pas de second tour.

J’ai transformĂ© ce flux en une Skill partagĂ©e appelĂ©e Custom - Deliberate. La revue reste en lecture seule, la critique n’est jamais adoptĂ©e automatiquement et la rĂ©ponse finale doit exposer les objections rejetĂ©es et les incertitudes restantes, autant que les critiques acceptĂ©es. Elle ne fait que raccourcir le travail que j’effectuais dĂ©jĂ  en copiant source, rĂ©ponse et rĂ©futation entre GPT et Codex.

J’ai immĂ©diatement utilisĂ© la Skill pour examiner sa propre procĂ©dure. Un critic ne devient pas parfaitement indĂ©pendant simplement parce qu’il ne reçoit pas la conversation prĂ©cĂ©dente. Il partage encore le mĂȘme modĂšle et les mĂȘmes rĂšgles de niveau supĂ©rieur, et de mauvaises preuves fournies par la session principale peuvent l’induire en erreur de la mĂȘme maniĂšre. Il traite donc les objections capables de modifier rĂ©ellement la conclusion et reconnaĂźt quand les preuves ne suffisent pas, au lieu de fabriquer un accord.

Je ne fais automatiquement confiance ni à la premiÚre réponse ni à la critique

Cette Skill ne garantit pas la vérité. Un autre modÚle peut mieux briser un biais partagé par une famille de modÚles, et les préférences et jugements de valeur restent les miens.

MalgrĂ© tout, avant d’ajouter un autre abonnement Ă  150 000 wons, je commence par lĂ . Je ne valide pas la premiĂšre conclusion. Je demande Ă  un fresh critic d’essayer de la casser et je note ce que j’ai acceptĂ©, ce que j’ai rĂ©futĂ© et pourquoi, ainsi que ce qui reste non rĂ©solu.

J’avais dĂ©jĂ  Ă©crit que Claude Code comme Codex finissent par avoir besoin d’un harness. Cette fois, j’ai appliquĂ© l’idĂ©e au jugement lui-mĂȘme. Faire terminer un travail Ă  l’IA compte, mais l’empĂȘcher de me donner aveuglĂ©ment raison et de figer une conclusion trop tĂŽt compte aussi.

Catégories : ,

Mis Ă  jour :

Laisser un commentaire