Writing

讓小模型真正接手工作:Gemma 4 E4B 如何加速日常任務

通常,機械性的任務,要麼是正則,要麼是小參數大模型的基本智能已經足夠。

在 Telegram 廣告這件事上,我認為 Gemma 4 E4B 就很夠用。

這是一個案例分享。

GroupSentry 是一個 Telegram 群組廣告審核機器人。它會讀取訊息正文、引用內容、發言者 profile 和群組語境,判斷一則訊息是在招攬、推銷,還是在討論或舉報廣告。

原本的處理流程裡,確定性規則可以很快攔截組合特徵完全明確的廣告,其餘訊息交給 Luna Medium。Luna 適合處理需要綜合理解的複雜案例,但一次分類通常需要十幾秒。對真正模糊的訊息,這個成本合理;對大量重複、邊界清楚的日常判斷,每次都使用 Luna 並不划算。

所以我把本機運行的 gemma-4-e4b-it-8bit 引入 GroupSentry,放在確定性規則和 Luna 之間,作為一個加速模組。

Gemma 不需要成為縮小版 Luna

引入小模型之後,首先要回答的不是它能不能分類,而是它可以在哪些條件下直接完成分類。

GroupSentry 最後形成三層路由:

  1. 確定性組合規則處理不需要模型的明確廣告。
  2. Gemma 處理高信心正常訊息,以及證據完整的高信心廣告。
  3. Luna 接手模糊、衝突、資料不足或 Gemma 執行失敗的情況。

Gemma 的工作形式要足夠機械。

對正常訊息,已知非新成員在 Gemma 給出 0–2 分時可以直接放行;新成員或年資未知的發言者,只有 0–1 分可以直接放行。如果文字同時出現強風險訊號,即使分數很低,也會升級到 Luna。

對廣告訊息,直接刪除的條件更嚴格:Gemma 必須給出恰好 10 分,正文、引用或 profile 裡還要存在獨立的強風險證據,而且理由不能包含「中立討論」、「舉報或批評」或「證據不足」等衝突。

9 分仍然交給 Luna。即使是 10 分,只要缺少獨立證據,或者理由彼此矛盾,也交給 Luna。

這個分工不要求 Gemma 解決最困難的理解問題。它只需要穩定處理最頻繁、最清楚的那一部分,讓那些訊息不必再進入較慢的 Luna 路徑。

Gemma 的低分放行和高信心刪除會按比例交給 Luna 做非阻塞的事後審計。大模型仍然參與品質控制,但不位於每一次處理的關鍵路徑上。

部署後的變化

在約 26.5 小時的部署日誌裡,GroupSentry 共處理了 91 次分類。Gemma 被使用 84 次,其中直接放行 27 次、直接刪除 5 次;確定性規則另外直接刪除了 7 次。

與前一段同樣包含 91 次分類的樣本相比,Luna 的使用量由 86 次降至 52 次,減少約 39.5%。38 次刪除裡,有 12 次由 Gemma 或確定性規則直接完成,不再經過 Luna。

平均刪除延遲的差異也很直接:

  • 確定性規則:約 1.66 秒;
  • Gemma 直接刪除:約 3.92 秒;
  • Luna 路徑:約 19.96 秒。

一次真實的高信心廣告 smoke test,從 Gemma 判斷到走完直接刪除路徑約 5.5 秒。

Gemma 4 E4B 帶來的性能收益,不只來自它本身推理較快,而是它讓一部分日常工作不再需要啟動 Luna。

結語

Gemma 4 E4B 不需要處理所有問題。它只要把高頻、機械、輸出固定的日常判斷留在本機完成,困難和不確定的部分再交給 Luna。

這就是小模型作為加速模組最實際的價值。