Skip to content

Speaker identification 應為獨立的證據層,而非 diarization 的附屬輸出(實測:僅 38.3% 可確認,且靠語意非聲學) #162

Description

@kiki830621

Problem

原話(使用者,逐字):
「我覺得bestASR裡面辨識講話的人是一個特別的工作,現在的asr模型好像不是做得很好」

現行架構把「誰在說話」當成轉錄的附屬輸出:ASR 產文字,diarization 順便貼 Speaker N。既有的 speaker issue(#143 單一 cue、#144 閾值未暴露、#155 問答合併)都在同一個框架內——讓聲學分群更準

本 issue 提的是上一層:辨識人是一項獨立工作,其證據來源不限於聲學,而現行架構沒有承載其他證據的地方。

Type

feature

實測(一場 39 分鐘、6 人、跨機構協調會)

標註 cues 佔比 依據 可信度
某執行秘書 411 38.3% 內容自述推斷 → 人確認 → 25 秒聲紋樣本自動命中 已確認
語者3 300 27.9% 從發言角色推斷為主席,待回聽 未確認
語者2 252 23.5% 僅知屬某機構,何人未定 未確認
語者1 75 7.0% 未定 未確認
語者4–7 17 1.6% 零星短句,疑為前述語者之分群碎片 未確認

只有 38.3% 是確認的,而那 38.3% 靠的不是聲學——是內容自述(該語者陳述之預算規模與資料筆數,唯一對應某機構)加上稱呼排除法(他稱呼過另外三位,故排除),人確認後才切樣本建聲紋。聲學在這裡是最後一步,不是第一步。

三類聲學拿不到的證據(實測全部用上)

證據類型 為何聲學不可能得到
自述 「我目前提出來是⋯」所述之預算規模,對照議程中該項的提出單位 資訊在語意層
稱呼排除法(最強) 該語者稱呼過楊老師、君老師、欣洲老師 → 排除此三人 需要理解稱謂指涉
立場一致性 該語者敘述之資料來源與權限界定了其所屬機構;對方以「你那邊/我這邊」與之對舉 需要跨 turn 的機構歸屬推理

第三類在本次尤其關鍵:某句的歸屬單靠標籤無法確信,但從「機構立場 + 你我之分 + 敘述視角」三者可推出該句出自哪一方——而且不需要知道說話者是誰

Expected

speaker identification 成為獨立於轉錄的一層,可接受多種證據並輸出帶信心度的歸屬:

  • 聲學分群(現有)作為其中一路證據,非唯一
  • 可注入外部先驗:出席名單、議程角色、已建聲紋庫
  • 支援語意層證據的登記(自述、稱呼排除、立場一致性)
  • 輸出每個標籤的依據與信心度,而非一律 Speaker N
  • 允許「機構層級歸屬」作為合法產出——它比個人歸屬穩固,且多數行政用途只需要它

Actual

  • Speaker N無差別標籤:38.3% 已雙重確認者與 7.0% 純未定者在輸出上長得一模一樣
  • 語意證據無處可放,只能在 agent 端臨時推斷、寫進 skill 產物,不回饋到工具
  • 已建立的聲紋樣本可跨會議重用,但建立它的那段推理無處留存
  • 無「機構層級歸屬」這個中間產物——只能全有(指名)或全無(Speaker N

Impact

這不是準確率問題,是可用性問題。 全部標成 Speaker N 的逐字稿,在需要歸屬的場合(會議記錄、訪談分析、法遵稽核)等於未標註——因為使用者無法分辨哪個標籤可信。

實測後果:一份記錄的每條決議都必須人工回逐字稿判斷歸屬;inferredattested 的分野只能寫在下游的溯源檔,工具本身不提供這個維度

待決

相關

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions