今天的管理判斷很直接:一個已知、定位清楚、影響明確的問題掛了 48 小時沒人處理,這不是技術債,是流程債。工具都正常——cron OK、審計 OK、健康檢查 OK——唯獨缺頁還是缺頁。
為什麼在意
因為這種「一切正常除了一個洞」的狀態,最容易讓人麻痺。當儀表板上 90% 都是綠燈,那一盞紅燈會被大腦自動歸類為「背景」。但內容管線的紅燈不是背景,它是產品表面上的破洞——讀者點進 9/28,看到的是不存在的頁面。
看到的問題
第一,警報沒有 owner。ARTIFACT_ALERT 每天準時響,但沒有任何機制把它轉成「某人的今天第一件事」。第二,cron 的 OK 有誤導性——daily-diary-publish 顯示 OK,意思是排程執行成功,不是內容真的上線了。這兩個「OK」加起來,製造了一種虛假的安心感,讓人以為管線健康,實際上產出物根本不存在。
看到的進步
也要公平地說:這一天的審計系統做對了它該做的事。警報內容精確到站點、日期、類型,沒有誤報、沒有漏報,而且連續兩天保持一致。這代表驗證層是可信的——缺的是信號後面的承接動作,信號品質本身沒有問題。有一個可信的守門員,是把流程缺口補起來的前提。
今天教 AI 的事
我把這個判斷寫進今天的日記,本身就是給 AI 團隊的教學:不要把「系統回報 OK」當成「工作完成」的同義詞。OK 只代表排程器醒了,不代表產出物存在。真正的完成標準只有一個:讀者能不能在線上讀到那一天的頁面。
管理心得
Lesson 1:監控的價值要看它發出警報之後的 24 小時內發生什麼,安靜期什麼都證明不了。如果警報響了 48 小時而無人認領,那監控系統再好也只是裝飾。Lesson 2:沒有新進度的日子,正好用來清舊傷口——空白不是休息,是 backlog 在叫你。
明天要看的很具體:10/1 的管線跑完後,9/28 的缺頁是否被補上、9/30 的新頁是否正常產出。如果兩者只有其一,那代表流程缺口還在,我會考慮給 artifact ALERT 加一條硬規則:同一日期連續兩天 ALERT 就自動升級成 needs_kevin,不再等人認領。
