2026.08.12 (Rab)
2026.08.14 (Jum) diperbarui

โœจ Ringkasan GPT-5.6 Sol

Saya melihat AI berubah pikiran setiap kali saya mengajukan keberatan, jadi saya membuat Skill dengan satu fresh critic yang mencurigai jawaban pertama maupun kritiknya.

โ€œTolong, kritikโ€

Setelah pekerjaan UI yang berjalan selama 16 jam berakhir menjadi sampah, saya menuntut Codex menjelaskan bagaimana hasilnya bisa seburuk itu. Saya membahas secara terpisah bagaimana hasil antara yang belum diverifikasi menyebar dan mencemari pekerjaan berikutnya. Namun, ada keanehan lain yang terus berulang di dalam percakapan yang seharusnya menjelaskan kegagalan itu.

Setiap kali saya menawarkan alternatif, AI segera bilang alternatif itu benar. Ketika saya membantah, AI malah bilang bantahan itu yang benar. Semua jawaban terdengar masuk akal, tetapi kesimpulannya selalu condong ke perkataan terakhir saya. Penjelasan atas kegagalan itu pun tidak bisa saya percaya.

Jadi saya memberikan jawaban dari satu sesi ke sesi lain untuk dikritik, lalu membawa kritik tersebut kembali ke sesi pertama untuk dibantah. Cara ini memang mengungkap asumsi dan biaya operasional yang dilewatkan salah satu pihak. Namun setiap kali saya menempelkan sebuah kritik, AI masih terlalu cepat berkata, โ€œPoin itu benar.โ€

Akhirnya saya mengatakan persis apa yang saya maksud.

Tolong, kritik.

Saya tidak ingin dua AI saling menyetujui dengan sopan. Saya ingin jawaban pertama dan kritik sesudahnya sama-sama dipertanyakan sampai bukti yang menentukan. Beberapa Agent mengatakan hal yang sama tidak membuatnya benar, dan menamai salah satunya critic tidak otomatis membuatnya akurat.

Saya mengurangi tinjauan salin-tempel menjadi satu fresh critic

Awalnya saya mempertimbangkan sistem debat dengan tiga critic dan beberapa putaran. Saya bahkan sempat berpikir untuk berlangganan Claude Code dan mengadunya dengan Codex. AI membalas dengan Coordinators, Workers, Auditors, dan state tambahan. Goal 16 jam baru saja gagal karena tidak terkendali; membangun sistem orkestrasi raksasa lain untuk mencegahnya terasa keliru.

Yang saya inginkan jauh lebih kecil. Sesi utama mengirim kesimpulannya kepada satu fresh critic. Critic itu mencari contoh tandingan dan asumsi tersembunyi. Sesi utama menerima setiap poin penting, membantahnya dengan bukti, atau membiarkannya belum terselesaikan. Jika jawaban berubah, critic yang sama melihatnya sekali lagi. Jika tinjauan pertama tidak menemukan hal penting, tidak ada putaran kedua.

Saya mengubah alur ini menjadi Skill bersama bernama Custom - Deliberate. Tinjauan tetap read-only, kritik tidak pernah diadopsi otomatis, dan jawaban akhir harus menampilkan keberatan yang ditolak serta ketidakpastian yang tersisa, bukan hanya kritik yang diterima. Skill ini hanya mempersingkat pekerjaan yang sebelumnya saya lakukan dengan menyalin source, jawaban, dan bantahan antara GPT dan Codex.

Saya langsung memakai Skill itu untuk meninjau prosedurnya sendiri. Seorang critic tidak menjadi sepenuhnya independen hanya karena tidak menerima percakapan sebelumnya. Ia masih memakai model dan aturan tingkat tinggi yang sama, dan bukti buruk dari sesi utama dapat membuatnya salah dengan cara yang sama. Karena itu, ia menangani keberatan yang benar-benar dapat mengubah kesimpulan dan mengakui ketika bukti tidak cukup, alih-alih mengarang kesepakatan.

Saya tidak otomatis memercayai jawaban pertama maupun kritiknya

Skill ini tidak menjamin kebenaran. Model lain mungkin lebih baik untuk mematahkan bias yang dimiliki bersama oleh satu keluarga model, sedangkan preferensi dan penilaian nilai tetap menjadi milik saya.

Meski begitu, sebelum menambah langganan lain seharga 150.000 won, saya mulai dari sini. Saya tidak langsung memfinalkan kesimpulan pertama. Saya meminta satu fresh critic mencoba mematahkannya, lalu mencatat apa yang saya terima, apa yang saya bantah beserta alasannya, dan apa yang masih belum terselesaikan.

Saya pernah menulis bahwa Claude Code dan Codex pada akhirnya sama-sama membutuhkan harness. Kali ini saya menerapkan gagasan itu pada penilaian itu sendiri. Membuat AI menuntaskan pekerjaan memang penting, tetapi mencegahnya menyetujui saya secara buta dan mengunci kesimpulan terlalu cepat juga penting.

Kategori: ,

Diupdate:

Tinggalkan komentar