2026.08.12 (Rab)
2026.08.14 (Jum) diperbarui

โœจ Ringkasan GPT-5.6 Sol

Laporan bahwa semua pemeriksaan lolos menyembunyikan struktur informasi buruk yang menyebar ke layar lain dan backend. Saya mewajibkan tinjauan sebelum pekerjaan lanjutan.

Laporan mengatakan semua pemeriksaan lolos. Saya memercayainya dan membuka layar yang ternyata sampah. Namun masalah yang dibahas tulisan ini terjadi sebelum layar akhir itu.

Tidak ada yang menghentikan struktur informasi ketika pertama kali melenceng, jadi halaman berikutnya dan backend terus dibangun di atasnya. Saya membuat hasil antara yang salah menutup pekerjaan lanjutan.

Laporan PASS membiarkan layar yang salah tumbuh selama 16 jam

Saya tidak melihat sendiri setiap hasil antara yang diproduksi Codex. Sesi implementasi menandai pekerjaannya sendiri selesai, lalu sesi lain melanjutkan pembangunan halaman dan backend di atasnya. Struktur informasi yang buruk menyebar sebelum ada yang memeriksanya. Saat saya membuka UI, enam belas jam pekerjaan telah berdiri di atas arah yang salah.

Saya tidak membutuhkan cara untuk menjalankan AI lebih lama.

Saya membutuhkan struktur yang menghentikan pekerjaan berikutnya ketika hasil antaranya salah.

Ketika memperdebatkan masalah ini, saya menemukan istilah Graph Engineering: merancang hasil yang dapat ditinjau dan syarat untuk maju sebagai graph eksplisit, alih-alih menyerahkan seluruh loop panjang kepada satu Agent.1 Saya tidak membutuhkan graph runtime yang megah. Saya membutuhkan satu fakta: hasil yang belum diverifikasi tidak boleh membuka edge berikutnya.

โ€œBukankah ini menjadi rumit tanpa perlu?โ€

Begitu saya mengusulkan Graph Engineering, AI menghasilkan Coordinators, Workers, Auditors, versi kontrak, ledger permanen, dashboard, dan audit ulang penuh. Setiap bagian terdengar masuk akal. Namun jika obat untuk pemborosan token selama 16 jam dimulai dengan membesarkan sistem pengelolaan, obat itu bisa berubah menjadi kegagalan yang sama.

Graph pertama saya hanya memiliki work session dan audit session. Work session menyelesaikan satu hasil yang dapat ditinjau lalu berhenti. Audit session melihat hasil yang sudah dibekukan dan persyaratan asli, bukan suasana percakapan sebelumnya atau penilaian worker terhadap pekerjaannya sendiri. Jika perlu diperbaiki, hasil yang sama mendapat satu revisi. Jika arahnya salah, hasil itu kembali ke perencanaan, bukan ditambal lagi. Pekerjaan lanjutan langsung tetap tertutup sampai audit berakhir.

Keberatan yang muncul membantu menutup celah dalam desain kecil ini. Worker tidak boleh menentukan standar audit yang menguntungkan dirinya. Jika Runtime atau kandidat berubah, putusan lama dibuang. Gate juga tidak dipakai untuk setiap typo atau bug yang punya satu test pasti. Gate hanya dipakai di titik ketika hasil yang salah dapat mencemari beberapa pekerjaan berikutnya.

Saya memasukkan sebatas itu ke dalam Skill bernama custom-graph-engineering-gate. Saya tidak membuat database atau dashboard terpisah. Skill membekukan satu hasil dan membatasi tindakan berikutnya berdasarkan PASS, CHANGES_REQUESTED, REPLAN_REQUIRED, atau NOT_VERIFIABLE. Codex Skills dan subagents sudah cukup.23

Gate pertama benar-benar menghentikan pekerjaan berikutnya

Membuat Skill bukan bukti bahwa Skill itu bekerja. Saya membekukan kontrak transisi otorisasi yang akan menjadi dasar beberapa fitur, lalu mengirimkannya ke audit session tanpa percakapan sebelumnya.

Putusan pertama adalah CHANGES_REQUESTED, bukan PASS. Kontrak belum cukup jelas menjelaskan kapan otoritas dievaluasi, dari mana otoritas delegasi berasal dan bagaimana pencabutannya, serta apakah pengguna, otoritas, dan perusahaan target berada dalam scope yang sama. Jika hasil itu menyebar, nanti saya harus membongkar seluruh model otorisasi.

Work session merevisi hasil tersebut satu kali. Hanya setelah audit session yang sama memeriksanya lagi, hasilnya menjadi PASS. Tidak ada implementasi atau deployment lanjutan yang dibuka selama itu. Inilah efek yang saya inginkan: edge berikutnya benar-benar tertutup tepat ketika worker sudah berkata โ€œcukup baikโ€.

Satu kontrak otorisasi tidak membuktikan bahwa cara ini akan mencegah kegagalan UI 16 jam berikutnya. Penilaian manusia atas arah visual lebih sulit diberi Gate, dan auditor yang menggunakan model serta Working Tree yang sama dapat berbagi asumsi salah yang sama. Skill juga bukan enforcement engine.

Namun kali ini saya tidak memasang framework raksasa hanya karena mendengar istilah baru. Saya mempertahankan hanya graph yang dibutuhkan kegagalan saya dan membuatnya cukup kecil untuk diuji lagi pada pekerjaan panjang berikutnya.

Jadi saya tidak perlu baru mengetahui enam belas jam kemudian bahwa semuanya salah.

Referensi

  1. LangChain, โ€œ3 Years of Graph Engineering with LangGraphโ€, tentang istilah Graph Engineering dan perancangan workflow Agent sebagai graph eksplisit.ย โ†ฉ

  2. OpenAI, โ€œBuild skillsโ€, tentang penyimpanan workflow yang dapat digunakan ulang sebagai Codex Skills.ย โ†ฉ

  3. OpenAI, โ€œSubagentsโ€, tentang Agent utama yang membuat subagent terpisah dan mengumpulkan hasilnya.ย โ†ฉ

Kategori: ,

Diupdate:

Tinggalkan komentar