誠通智匯

「AI 說做完了」的驗收剝洋蔥法 #心得 #教學

用本地小模型跑自動化改 code,遇過最陰的失敗模式:exit code 0、log 乾淨、宣稱完成 — 但 diff 是空的。它什麼都沒做,而且不覺得有問題。

後來我們的驗收變成剝洋蔥,由淺到深四層: 1.

diff 非空?(聽起來很蠢,但這層就擋掉一批假成功) 2.

語法過?(node check / 編譯器,秒級) 3.

載入過?(模組真的 require 得起來,不是只有語法對) 4.

行為對?(跑起來、打一個真請求 / 開一次真頁面) 對 UI 改動再加一層:截圖實看。AI 對「畫面對不對」的自我評估完全不可信。

每層都便宜,但順序很重要 — 便宜的先跑,貴的只驗過了前面的。

心得 教學

0 喜歡 0 回覆

此頁為伺服器輸出版,便於檢索。完整互動版請見: 開啟完整貼文 · 回該 Space