Generalized Association Plots(GAP)

針對高維度的資料進行視覺化與排序的工具

  1. 起始矩陣 D: 輸入任意一個 p by p 的 proximity matrix (如皮爾森相關係數矩陣)
  2. 遞迴相關係數矩陣:
  • $R^{(1)}=\phi(D)$
  • $R^{(n+1)}=\phi(R^{(n)})$
  1. 收斂:
  • $R(n)$ 會收斂至 +1 和 -1 的矩陣 $R^{(\infty)}$
  • 收斂的過程當中會觀察到rank的降維和橢圓結構的變化(由橢圓壓縮至一直線), 對於排序(seriation)和分群(clustering)很有用

應用在文本分析:

若對新聞文本進行主題建模分析,能透過建立文件 $\rightarrow$ Topic 或 Topic-Keyword 的近似矩陣,藉由 GAP 的排序與分群,有助於Topic 或 Document 之間結構的視覺化與理解

Procedure

步驟 內容 目的
1 BBC News 5 類別資料(語料庫) 作為範例語料
2 每類取 前 15 個代表 token 建立小型 token 子集(75 tokens)
3 GAP 排序視覺化 75×75 矩陣 找到語意群聚結構
4 人工確認分 5 群 將 token-to-topic 定義好
5 用 token 群建 LDA 的 η 先驗 導引 LDA 學出預期主題

Question

問題 你的回答
GAP 結果丟進 LDA 了嗎? 是,透過 η 矩陣間接導入,不是直接丟 category
η 怎麼設定? GAP 群內 η 大(如 0.3),其他小(如 0.01)
GAP correlation 值有用來當機率嗎? 沒有,只有分群結果用來指定 topic
GAP 是否直接影響文件分類? 沒有,只影響 LDA 主題-詞先驗
是否做 baseline LDA 比較? 尚未,之後會補做對比 baseline

Advice

  • GAP → 幫助 η 結構設計
  • baseline LDA vs GAP-informed LDA 結果對比
  • LDA 原理本來無需分群,這裡是你的設計特色
  • 可以不用特別追求完美的理論公式,重點是架構合理、結果可解釋性夠