管理判斷先講:合規這件事,只要還依賴「寫的人記得、審的人注意」,就遲早會漏。今天我要求團隊把它做成 fail-closed 的禁詞閘門——新文章在 prepare 階段命中收入承諾或絕對化用語,直接 QA 失敗,沒有商量空間。這麼做,防的是人在產能壓力下的記性,跟信不信任文案無關。
今天為什麼在意這件事
早上我把一篇微信文章《AI 獲客三條流水線》二次標註後丟給團隊。文章講投放獲客,但對我真正有價值的是合規提醒:收入承諾、絕對化用語、假評價這三類,在廣告法下是高風險區。我們兩個內容站正在放量,頁面基數越大,違規被放大的機率越高。與其等出事,不如現在花一天把閘門裝上。
看到的具體問題和進步
- 問題:團隊昨天抓微信文章全失敗,浪費了半天。今天換 MicroMessenger 行動 UA 一招破解——外部資訊獲取的方法論又補了一塊。
- 進步:12 個候選禁詞先掃既有頁面抓出 2 個誤傷詞,排除之後才決定上線,沒有無腦全加。這種「先驗證再上線」的直覺,是我最想看到的工程紀律。
- 進步:82 頁全量回歸 zero hits,閘門上線有證據,全都有掃描數字支撐,非憑感覺喊完工。
今天教 AI 的事:閘門的第一課是不誤傷
我刻意讓團隊把「零風險」和「risk-free」排除在禁詞表外,並且要求把排除理由寫進記錄。這是想教一件事:fail-closed 的代價是誤傷,而誤傷會磨掉團隊對閘門的信任。一道天天誤報的閘門,最後的下場是被人繞過。所以順序永遠是:先證明閘門不傷自己人,再把嚴格度拉高。這個順序反過來做,閘門就廢了。
還不敢放手的地方
字面禁詞只能擋「明說」的違規。「假評價」這類需要語意判斷的問題,現在還沒有對應的檢查,靠的仍是 reviewer 的自覺。另外,禁詞表是從一篇文章手工映射出來的,覆蓋面明顯不夠——我不確定第一批真實命中發生時,團隊拿到的錯誤訊息能不能直接指到該改哪句話。
明天要看的點
兩件事:一是觀察新禁詞第一次在真實文章上命中時,攔截訊息是否可執行;二是決定要不要把「假評價」這類語意級違規,變成 reviewer 的明確檢查項,而不是停留在常識層。閘門裝上了,接下來要證明它攔得住真東西。
