Problem
原話(使用者,逐字):
「我覺得bestASR裡面辨識講話的人是一個特別的工作,現在的asr模型好像不是做得很好」
現行架構把「誰在說話」當成轉錄的附屬輸出:ASR 產文字,diarization 順便貼 Speaker N。既有的 speaker issue(#143 單一 cue、#144 閾值未暴露、#155 問答合併)都在同一個框架內——讓聲學分群更準。
本 issue 提的是上一層:辨識人是一項獨立工作,其證據來源不限於聲學,而現行架構沒有承載其他證據的地方。
Type
feature
實測(一場 39 分鐘、6 人、跨機構協調會)
| 標註 |
cues |
佔比 |
依據 |
可信度 |
| 某執行秘書 |
411 |
38.3% |
內容自述推斷 → 人確認 → 25 秒聲紋樣本自動命中 |
已確認 |
| 語者3 |
300 |
27.9% |
從發言角色推斷為主席,待回聽 |
未確認 |
| 語者2 |
252 |
23.5% |
僅知屬某機構,何人未定 |
未確認 |
| 語者1 |
75 |
7.0% |
未定 |
未確認 |
| 語者4–7 |
17 |
1.6% |
零星短句,疑為前述語者之分群碎片 |
未確認 |
只有 38.3% 是確認的,而那 38.3% 靠的不是聲學——是內容自述(該語者陳述之預算規模與資料筆數,唯一對應某機構)加上稱呼排除法(他稱呼過另外三位,故排除),人確認後才切樣本建聲紋。聲學在這裡是最後一步,不是第一步。
三類聲學拿不到的證據(實測全部用上)
| 證據類型 |
例 |
為何聲學不可能得到 |
| 自述 |
「我目前提出來是⋯」所述之預算規模,對照議程中該項的提出單位 |
資訊在語意層 |
| 稱呼排除法(最強) |
該語者稱呼過楊老師、君老師、欣洲老師 → 排除此三人 |
需要理解稱謂指涉 |
| 立場一致性 |
該語者敘述之資料來源與權限界定了其所屬機構;對方以「你那邊/我這邊」與之對舉 |
需要跨 turn 的機構歸屬推理 |
第三類在本次尤其關鍵:某句的歸屬單靠標籤無法確信,但從「機構立場 + 你我之分 + 敘述視角」三者可推出該句出自哪一方——而且不需要知道說話者是誰。
Expected
speaker identification 成為獨立於轉錄的一層,可接受多種證據並輸出帶信心度的歸屬:
- 聲學分群(現有)作為其中一路證據,非唯一
- 可注入外部先驗:出席名單、議程角色、已建聲紋庫
- 支援語意層證據的登記(自述、稱呼排除、立場一致性)
- 輸出每個標籤的依據與信心度,而非一律
Speaker N
- 允許「機構層級歸屬」作為合法產出——它比個人歸屬穩固,且多數行政用途只需要它
Actual
Speaker N 是無差別標籤:38.3% 已雙重確認者與 7.0% 純未定者在輸出上長得一模一樣
- 語意證據無處可放,只能在 agent 端臨時推斷、寫進 skill 產物,不回饋到工具
- 已建立的聲紋樣本可跨會議重用,但建立它的那段推理無處留存
- 無「機構層級歸屬」這個中間產物——只能全有(指名)或全無(
Speaker N)
Impact
這不是準確率問題,是可用性問題。 全部標成 Speaker N 的逐字稿,在需要歸屬的場合(會議記錄、訪談分析、法遵稽核)等於未標註——因為使用者無法分辨哪個標籤可信。
實測後果:一份記錄的每條決議都必須人工回逐字稿判斷歸屬;inferred 與 attested 的分野只能寫在下游的溯源檔,工具本身不提供這個維度。
待決
相關
Problem
現行架構把「誰在說話」當成轉錄的附屬輸出:ASR 產文字,diarization 順便貼
Speaker N。既有的 speaker issue(#143 單一 cue、#144 閾值未暴露、#155 問答合併)都在同一個框架內——讓聲學分群更準。本 issue 提的是上一層:辨識人是一項獨立工作,其證據來源不限於聲學,而現行架構沒有承載其他證據的地方。
Type
feature
實測(一場 39 分鐘、6 人、跨機構協調會)
只有 38.3% 是確認的,而那 38.3% 靠的不是聲學——是內容自述(該語者陳述之預算規模與資料筆數,唯一對應某機構)加上稱呼排除法(他稱呼過另外三位,故排除),人確認後才切樣本建聲紋。聲學在這裡是最後一步,不是第一步。
三類聲學拿不到的證據(實測全部用上)
第三類在本次尤其關鍵:某句的歸屬單靠標籤無法確信,但從「機構立場 + 你我之分 + 敘述視角」三者可推出該句出自哪一方——而且不需要知道說話者是誰。
Expected
speaker identification 成為獨立於轉錄的一層,可接受多種證據並輸出帶信心度的歸屬:
Speaker NActual
Speaker N是無差別標籤:38.3% 已雙重確認者與 7.0% 純未定者在輸出上長得一模一樣Speaker N)Impact
這不是準確率問題,是可用性問題。 全部標成
Speaker N的逐字稿,在需要歸屬的場合(會議記錄、訪談分析、法遵稽核)等於未標註——因為使用者無法分辨哪個標籤可信。實測後果:一份記錄的每條決議都必須人工回逐字稿判斷歸屬;
inferred與attested的分野只能寫在下游的溯源檔,工具本身不提供這個維度。待決
bestasr子命令、還是 diarization 的後處理層?相關
--diarize可能靜默輸出單一 cue(聲學層)