NLP Day 11 標註、弱監督與資料增強 執行需求:CPU 可跑 。本篇所有範例都在 CPU 上執行,包含 Snorkel 弱監督標註、文字資料增強(nlpaug)、主動學習抽樣(用 sklearn 的不確定性分數)。不需要預訓練模型下載,幾分鐘內能跑完全部流程。 引言 前一篇我們把分類任務的評估寫成可重現的流程,並指出 macro-F1 卡住時常常是資料問題。但「資料問題」的解法說起來簡單、做起來難:人工標註成本高、委外因素多、IAA 常常比想像中差。如果一個分類任務需要 50,000 筆標註,以每筆 0.5 美元計算,就要 25,000 美元;如果標註者彼此一致性只有 0.7 的 Cohen's Kappa,再多標註也只是把錯誤放大。今天要把「沒有標註怎麼辦」這個問題展開:標註流程設計、弱監督、文字資料增強、主動學習。 標註流程設計的第一步是 標籤指南 (annotation guideline)。很多人以為「給標註者一份類別清單」就夠了,但實務上類別的邊界通常比想像中模糊。例如「抱怨」與「建議」差在哪?「正面」與「中性」要不要區分?「諷刺」要標成負面還是獨立類別?這些問題沒事先定義好,標註者會各自解讀,導致 IAA 過低。好的標籤指南應該包含:每個類別的正面定義、反例、邊界案例的處理方式、特殊情境的規則(例如空白、太短、與主題無關的內容要怎麼處理)。 標註者之間一致性(IAA, Inter-Annotator Agreement)是檢驗標註品質的關鍵指標。Cohen's Kappa 適合兩位標註者的場景;Krippendorff's Alpha 適合兩位以上,且對遺漏值與資料型別更有彈性。一般來說 Kappa 在 0.6–0.8 視為「足夠一致」、0.8 以上為「優秀」、低於 0.6 通常代表標籤指南不清或任務設計有問題。實務上在標註正式上線前,會先讓 2–3 位標註者試標 200–500 筆,計算 IAA 並調整指南,再正式啟動大數字標註。 標註成本太高時,「 弱監督 」(weak supervision)就是救星。Snorkel 是 2017 年開始流行的弱監督框架,核心想法是讓領域專家用 labeling functions(LFs)寫出啟發式規則,這些規則會對每筆資料給出「可能正確」的標籤與信心分數;...