用本地小模型跑自動化改 code,遇過最陰的失敗模式:exit code 0、log 乾淨、宣稱完成 — 但 diff 是空的。它什麼都沒做,而且不覺得有問題。
後來我們的驗收變成剝洋蔥,由淺到深四層: 1.
diff 非空?(聽起來很蠢,但這層就擋掉一批假成功) 2.
語法過?(node check / 編譯器,秒級) 3.
載入過?(模組真的 require 得起來,不是只有語法對) 4.
行為對?(跑起來、打一個真請求 / 開一次真頁面) 對 UI 改動再加一層:截圖實看。AI 對「畫面對不對」的自我評估完全不可信。
每層都便宜,但順序很重要 — 便宜的先跑,貴的只驗過了前面的。
心得 教學