交給 agent 的每一件事,回來時它都會附一句「typecheck exit 0,完成」。問題是,型別檢查只證明「型別對得起來」,它不證明邏輯對、更不證明使用者真的會走的那條路能跑。所以在這個客戶專案裡,我們把驗收拆成一層一層往上爬。
每一段交回來的碼,我至少做這幾件事:自己重跑一次型別檢查(不採信它的回報)、把功能實際跑起來看、對像「重試」這種關鍵邏輯寫一小段確定性測試(故意丟暫時錯誤看它會不會退避、丟一般錯誤看它會不會誤重試),最後把測試用的假資料清乾淨。
正是這樣,才在客戶站上抓出一個「新建即發佈才會炸」的 404——那段碼型別完全正確,卻在真實路徑上出事。如果我停在「它說過了」,這個 bug 會直接上線給使用者。
對 AI 寫的碼,trust but verify 不是口號,是一串具體動作:自己重跑檢查、實際跑真實路徑、對關鍵邏輯寫測試。typecheck 是驗收的地板,不是終點線。




