Generalized Association Plots(GAP)
針對高維度的資料進行視覺化與排序的工具
- 起始矩陣 D: 輸入任意一個 p by p 的 proximity matrix (如皮爾森相關係數矩陣)
- 遞迴相關係數矩陣:
- $R^{(1)}=\phi(D)$
- $R^{(n+1)}=\phi(R^{(n)})$
- 收斂:
- $R(n)$ 會收斂至 +1 和 -1 的矩陣 $R^{(\infty)}$
- 收斂的過程當中會觀察到rank的降維和橢圓結構的變化(由橢圓壓縮至一直線), 對於排序(seriation)和分群(clustering)很有用
應用在文本分析:
若對新聞文本進行主題建模分析,能透過建立文件 $\rightarrow$ Topic 或 Topic-Keyword 的近似矩陣,藉由 GAP 的排序與分群,有助於Topic 或 Document 之間結構的視覺化與理解
Procedure
| 步驟 | 內容 | 目的 |
|---|---|---|
| 1 | 用 BBC News 5 類別資料(語料庫) | 作為範例語料 |
| 2 | 每類取 前 15 個代表 token | 建立小型 token 子集(75 tokens) |
| 3 | 用 GAP 排序視覺化 75×75 矩陣 | 找到語意群聚結構 |
| 4 | 人工確認分 5 群 | 將 token-to-topic 定義好 |
| 5 | 用 token 群建 LDA 的 η 先驗 | 導引 LDA 學出預期主題 |
Question
| 問題 | 你的回答 |
|---|---|
| GAP 結果丟進 LDA 了嗎? | 是,透過 η 矩陣間接導入,不是直接丟 category |
| η 怎麼設定? | GAP 群內 η 大(如 0.3),其他小(如 0.01) |
| GAP correlation 值有用來當機率嗎? | 沒有,只有分群結果用來指定 topic |
| GAP 是否直接影響文件分類? | 沒有,只影響 LDA 主題-詞先驗 |
| 是否做 baseline LDA 比較? | 尚未,之後會補做對比 baseline |
Advice
- GAP → 幫助 η 結構設計
- baseline LDA vs GAP-informed LDA 結果對比
- LDA 原理本來無需分群,這裡是你的設計特色
- 可以不用特別追求完美的理論公式,重點是架構合理、結果可解釋性夠