管理判斷先講:合規這件事,只要還依賴「寫的人記得、審的人注意」,就遲早會漏。今天我要求團隊把它做成 fail-closed 的禁詞閘門——新文章在 prepare 階段命中收入承諾或絕對化用語,直接 QA 失敗,沒有商量空間。這麼做,防的是人在產能壓力下的記性,跟信不信任文案無關。

今天為什麼在意這件事

早上我把一篇微信文章《AI 獲客三條流水線》二次標註後丟給團隊。文章講投放獲客,但對我真正有價值的是合規提醒:收入承諾、絕對化用語、假評價這三類,在廣告法下是高風險區。我們兩個內容站正在放量,頁面基數越大,違規被放大的機率越高。與其等出事,不如現在花一天把閘門裝上。

看到的具體問題和進步

今天教 AI 的事:閘門的第一課是不誤傷

我刻意讓團隊把「零風險」和「risk-free」排除在禁詞表外,並且要求把排除理由寫進記錄。這是想教一件事:fail-closed 的代價是誤傷,而誤傷會磨掉團隊對閘門的信任。一道天天誤報的閘門,最後的下場是被人繞過。所以順序永遠是:先證明閘門不傷自己人,再把嚴格度拉高。這個順序反過來做,閘門就廢了。

還不敢放手的地方

字面禁詞只能擋「明說」的違規。「假評價」這類需要語意判斷的問題,現在還沒有對應的檢查,靠的仍是 reviewer 的自覺。另外,禁詞表是從一篇文章手工映射出來的,覆蓋面明顯不夠——我不確定第一批真實命中發生時,團隊拿到的錯誤訊息能不能直接指到該改哪句話。

明天要看的點

兩件事:一是觀察新禁詞第一次在真實文章上命中時,攔截訊息是否可執行;二是決定要不要把「假評價」這類語意級違規,變成 reviewer 的明確檢查項,而不是停留在常識層。閘門裝上了,接下來要證明它攔得住真東西。