20250717

20250717 Meeting

GAP 補上辭意的訊息來強化語意的合理性 1️⃣ 加入 Word Embedding(詞向量)相似性 工具 用途 Word2Vec / GloVe / FastText 表示詞意分布的向量空間 Cosine Similarity 衡量兩詞語意相似性 做法: 1️. GAP 排完後,對每個群的 token: 計算該群內所有詞的 embedding 平均 檢查這些詞彼此 cosine similarity 是否夠高 2️. 若有明顯「語意不合」的詞: 你可以手動微調或重新分群 或將 GAP + embedding 結果結合成 新的相似矩陣 2️⃣ 建立 混合型相似矩陣(共現 × 詞意) 將 GAP 的 col_prox(共現 correlation)與 Word2Vec 相似性做結合: $$ Final_Similarity = \lambda \cdot GAP_Col_Prox + (1 - \lambda) \cdot Cosine_Similarity $$ $\lambda$:權重 GAP 捕捉共現結構,詞向量補足語意距離 用這個混合矩陣再進行 GAP 排序或分群,更穩健。 3️⃣ 或者導入 詞典 / 知識圖譜 強化語意結構 ...

July 16, 2026 · 1 min
20250710

20250710 Meeting

Generalized Association Plots(GAP) 針對高維度的資料進行視覺化與排序的工具 起始矩陣 D: 輸入任意一個 p by p 的 proximity matrix (如皮爾森相關係數矩陣) 遞迴相關係數矩陣: $R^{(1)}=\phi(D)$ $R^{(n+1)}=\phi(R^{(n)})$ 收斂: $R(n)$ 會收斂至 +1 和 -1 的矩陣 $R^{(\infty)}$ 收斂的過程當中會觀察到rank的降維和橢圓結構的變化(由橢圓壓縮至一直線), 對於排序(seriation)和分群(clustering)很有用 應用在文本分析: 若對新聞文本進行主題建模分析,能透過建立文件 $\rightarrow$ Topic 或 Topic-Keyword 的近似矩陣,藉由 GAP 的排序與分群,有助於Topic 或 Document 之間結構的視覺化與理解 Procedure 步驟 內容 目的 1 用 BBC News 5 類別資料(語料庫) 作為範例語料 2 每類取 前 15 個代表 token 建立小型 token 子集(75 tokens) 3 用 GAP 排序視覺化 75×75 矩陣 找到語意群聚結構 4 人工確認分 5 群 將 token-to-topic 定義好 5 用 token 群建 LDA 的 η 先驗 導引 LDA 學出預期主題 Question 問題 你的回答 GAP 結果丟進 LDA 了嗎? 是,透過 η 矩陣間接導入,不是直接丟 category η 怎麼設定? GAP 群內 η 大(如 0.3),其他小(如 0.01) GAP correlation 值有用來當機率嗎? 沒有,只有分群結果用來指定 topic GAP 是否直接影響文件分類? 沒有,只影響 LDA 主題-詞先驗 是否做 baseline LDA 比較? 尚未,之後會補做對比 baseline Advice GAP → 幫助 η 結構設計 baseline LDA vs GAP-informed LDA 結果對比 LDA 原理本來無需分群,這裡是你的設計特色 可以不用特別追求完美的理論公式,重點是架構合理、結果可解釋性夠

July 10, 2026 · 1 min