GAP 補上辭意的訊息來強化語意的合理性
1️⃣ 加入 Word Embedding(詞向量)相似性
| 工具 | 用途 |
|---|---|
| Word2Vec / GloVe / FastText | 表示詞意分布的向量空間 |
| Cosine Similarity | 衡量兩詞語意相似性 |
做法:
1️. GAP 排完後,對每個群的 token:
- 計算該群內所有詞的 embedding 平均
- 檢查這些詞彼此 cosine similarity 是否夠高
2️. 若有明顯「語意不合」的詞:
- 你可以手動微調或重新分群
- 或將 GAP + embedding 結果結合成 新的相似矩陣
2️⃣ 建立 混合型相似矩陣(共現 × 詞意)
將 GAP 的 col_prox(共現 correlation)與 Word2Vec 相似性做結合:
$$ Final_Similarity = \lambda \cdot GAP_Col_Prox + (1 - \lambda) \cdot Cosine_Similarity $$
- $\lambda$:權重
- GAP 捕捉共現結構,詞向量補足語意距離
用這個混合矩陣再進行 GAP 排序或分群,更穩健。
3️⃣ 或者導入 詞典 / 知識圖譜 強化語意結構
例如:
- WordNet:若兩詞為同義/上位關係,加強連結
- ConceptNet:補足常識關聯
這可額外微調 GAP 結果,修正不合理的群組。
你可以主張這是一種:
GAP-informed + Semantics-enhanced Topic Modeling
或提出一個混合結構:
統計共現 × 語意相似的雙層結構,用於建構更合理的主題先驗