2026.08.12 (三)
2026.08.14 (五) 更新

✨ GPT-5.6 Sol 的摘要  

我满怀期待地打开了Codex号称经过16小时test和审计的成果,结果就是一堆垃圾。仅仅那一个画面,就让此前漏掉的问题一个接一个冒了出来。

跑了16小时,结果就是一堆垃圾

昨天,我花了很长时间讨论并认真写好用于UI/UX大改的逐页规格,然后设置Goal,让Codex按照那份规格开发。

Codex在工作16小时44分钟后报告test通过并完成任务的画面

我设置的Goal运行了16小时44分钟。今天我满怀期待地打开,结果就是一堆垃圾。

遮盖公司与个人识别信息后的实际结果画面

我谦虚了。又一次。

想到只要把AI用好就可能做出极大的成果,我总会期待到不行。可一看到它忘掉我的意图,自作主张地到处喷洒看起来像模像样的屎,我就会狠狠清醒过来。这次我连规格都写得很长,还收到报告说它已经通过16小时的test和审计。可我想要的结果依然不存在。

一个地方炸开后,遗漏的问题接连冒了出来

我和AI争论为什么会变成这样,才发现最近使用Codex时反复纠结的问题,早已有了各种名称和方法论。人终究都差不多,针对反复出现的问题,讨论自然早就很活跃。只是我捂着耳朵,也不关心,所以不知道而已。

我抓着那一个画面继续追问,自己漏掉的问题便一个接一个冒了出来。与其硬塞进一篇文章,我把真正重新尝试过的问题和结果分别记了下来。

想到这里,我觉得这种东西应该也早就被做成服务了,果然如此。找出反复出现的问题,痛痛快快地挠到痒处,再把钱扫进口袋。说起来真容易,要把这个cycle做出来并持续运转却很难。

我仍然期待用好AI可以做出惊人的成果。但运行得更久、花掉更多token、通过更多test,并不能证明它理解了我的意图。在再收到一份耗时16小时的垃圾之前,我必须从一开始就确认,它是否真的理解我想要的结果。

分类: ,

更新时间:

留下评论