GAP 補上辭意的訊息來強化語意的合理性

1️⃣ 加入 Word Embedding(詞向量)相似性

工具 用途
Word2Vec / GloVe / FastText 表示詞意分布的向量空間
Cosine Similarity 衡量兩詞語意相似性

做法:

1️. GAP 排完後,對每個群的 token:

  • 計算該群內所有詞的 embedding 平均
  • 檢查這些詞彼此 cosine similarity 是否夠高

2️. 若有明顯「語意不合」的詞:

  • 你可以手動微調或重新分群
  • 或將 GAP + embedding 結果結合成 新的相似矩陣

2️⃣ 建立 混合型相似矩陣(共現 × 詞意)

將 GAP 的 col_prox(共現 correlation)與 Word2Vec 相似性做結合:

$$ Final_Similarity = \lambda \cdot GAP_Col_Prox + (1 - \lambda) \cdot Cosine_Similarity $$

  • $\lambda$:權重
  • GAP 捕捉共現結構,詞向量補足語意距離

用這個混合矩陣再進行 GAP 排序或分群,更穩健。

3️⃣ 或者導入 詞典 / 知識圖譜 強化語意結構

例如:

  • WordNet:若兩詞為同義/上位關係,加強連結
  • ConceptNet:補足常識關聯

這可額外微調 GAP 結果,修正不合理的群組。


你可以主張這是一種:

GAP-informed + Semantics-enhanced Topic Modeling

或提出一個混合結構:

統計共現 × 語意相似的雙層結構,用於建構更合理的主題先驗