Graphify · Similarity Graph · Test Snapshot

KB 2,719 篇相關度與相似節點連結報告

分析保存的 2,719 篇 test KB:比較標題、正文與分類,找出可能重複或相關的文章;只有雙方都認為彼此相近且具多項證據時才保留關係,再由 Graphify 整理文章群組、檢查圖檔並產生互動報告。

一、結論摘要

2,719
本次分析的 KB 文章數(每篇算 1 個節點)
1,620
系統找出的相似關係數(需審核,不等於可合併)
554
不同來源文章之間的相似關係數
35.45%
有找到至少一篇相似文章的 KB 比例
一句話結論:2,719 篇 KB 必須整理成「一篇 active KB=一個主要概念」。Graphify 找到的 1,620 條相似邊只用來找出待拆分、待合併及應互相關聯的候選,不能直接把相連文章全部合併。

五個重點結論

  1. 59 組完全相同內容 → 第一批合併候選。先確認語言、受眾、時效與適用條件相同,再選一篇作為正式主文章(canonical KB);其他舊文章保留轉址,不直接刪除。
  2. 1,066 條同來源相似關係 → 先拆概念,不是全部合併。同一來源頁可能展開多個 FAQ;每個可獨立搜尋、獨立回答的意圖都應成為一篇單一概念 KB,並保留與原始來源的關係。
  3. 554 條不同來源間的相似關係 → 逐對判斷。只有同意圖、答案等價、適用條件相同且無衝突才能合併;只是相關或互補,就保留兩篇並建立「相關文章」連結。
  4. 1,755 篇沒有安全相似邊 → 保持獨立。沒有關聯證據不代表品質差,也不應為了提高覆蓋率強行合併。
  5. Graphify 原先提出 48 條語意關係,只有 3 條獲第二種方法支持 → 其餘 45 條只進人工複核。沒有第二證據前不得合併、刪除或更換正式主文章。
處理原則:多概念先拆、重複再併、互補只連結、衝突先解決。具體判斷規則見第七章,執行順序見第八章
快照聲明:本報告依指定的 2,719 筆保存快照執行;交付前 live test collection 已是 2,708 筆。兩個集合沒有混算,報告中的相似圖只代表 2,719 快照。

閱讀指南:每個數字到底代表什麼

先記住:這份報告是在找「哪些 KB 可能需要拆分、合併或互相關聯」。數字越大不代表內容越好,也不代表可以自動合併;它只表示值得優先檢查。
報告用語白話意思正在衡量什麼應該怎麼使用
節點(Node)一篇 KB 文章這次總共分析多少文章本報告固定為 2,719 篇,不代表概念數
相似邊(Edge)兩篇 KB 之間的一條「可能相似」連線系統找到多少文章配對值得審核不能直接當成合併指令;需判斷 duplicate、related 或誤連
候選配對(Candidate pair)初步拿來比較的兩篇文章相似篩選前的檢查範圍只有通過門檻與證據規則才成為最終相似邊
相似分數(0–1)標題、正文與分類有多接近排序用的相似程度;1 最接近、0 最不接近不是正確率或可合併機率,仍要檢查答案與適用條件
門檻(Threshold)最低要多相似才保留嚴格程度;越高保留越少,通常誤連也較少本報告 0.30 是探索門檻,不是自動合併門檻
涵蓋率(Coverage)有找到至少一篇相似文章的 KB 比例圖有涵蓋多少文章涵蓋率低不一定是錯;獨特 KB 本來就可能沒有相似文章
孤立 KB(Isolate)目前沒有安全相似連線的文章沒有足夠雙重證據的 KB 數量先保持獨立,不要為了連線而強行合併
相連群組(Component)彼此有路徑可連到的一群文章整張圖被分成多少個互不相連區塊用來看知識是否分散;不是正式分類
主題社群(Community)Graphify 判斷內部關係較密切的一群 KB可能的主題群或 FAQ 群用於發現整理單位,仍需人工命名與確認
連結數(Degree)一篇 KB 連到幾篇其他文章該文章在圖中有多少相似關係高連結可能是核心概念,也可能只是大量重複副本
群內緊密度(Cohesion)同一社群內的文章互相連得多不多0–1 的群組緊密程度高分表示群內連結集中,不代表內容品質較高
Graphify anchorGraphify 原先推論的一條語意關係非純文字相似、可能較隱性的關聯沒有第二證據時只能進 review,不能自動改資料
Canonical KB同一概念最後保留的正式主文章合併後哪一篇是唯一 active 版本其他舊 UUID 透過 redirect 指向它,不硬刪除

二、範圍、定義與方法

這章在做什麼:說明 2,719 篇文章從哪裡來,以及系統如何把標題、正文、分類轉成可比較的訊號。這是方法說明,不是合併結果。

資料與工具

環境test Weaviate 保存快照;唯讀
文章2,719
不同來源頁/文件數(source_id)2,193
Graphify官方 graphifyy 0.9.63
全域特徵維度119,113
LLM 成本新增全域相似層為 deterministic,0 tokens;48 anchors 沿用既有 Graphify 結果
產生時間2026-09-21T18:19:21+08:00

相似度不是什麼

  • 不是「可以刪除」或「可以合併」的直接證明。
  • 不是向量資料庫;特徵只用於離線候選生成,輸出是可稽核的靜態 graph edges。
  • 同 source_id 不代表重複,同標題也不一定代表同答案。
  • Graphify INFERRED edge 是探索假設;EXTRACTED 才表示來源中有直接證據。
  1. 每篇文章在圖上只算一個點。由保存快照建立 2,719 個文章節點,保留文章識別碼、來源文件、版本、分類與來源網址。
  2. 三層特徵。標題字元 n-gram 權重 0.55、正文 0.30、分類/labels 0.15;各層先 L2 normalize。
  3. 找出初步可能相似的文章。每篇先取最接近的 24 篇,得到 43,308 個不重複候選配對;另外一定納入 59 個內容完全相同的配對。
  4. 只保留有足夠證據的關係。總分至少 0.30,而且雙方都要把對方列入前 10 名,或相似度達強門檻 0.82;標題、正文、分類至少兩項要能互相支持。
  5. 合併 Graphify anchors。把原始 48 條 semantically_similar_to 邊保留並標記來源,不以低文字分數擅自刪除。
  6. Graphify 整理關聯圖。找出主題社群、計算群內緊密度與連結最多的文章,檢查圖檔錯誤,並產生互動式 HTML 報告。

三、相似關係是怎麼篩選的:候選、門檻與分數

這章在做什麼:顯示門檻提高或降低時會保留多少相似關係。目的是選擇合理的審核範圍,不是在決定哪些 KB 自動合併。

初步候選的相似分數分布

所有初步比較配對的分數;P50 表示一半候選低於此分數。

P25(25%候選低於此值)
0.089
P50(中位數)
0.117
P75
0.159
P90
0.227
P95
0.322
P99
0.612
最高分
1.000

最後保留關係的相似分數分布

通過規則後的 1,620 條關係;低分可能是保留的 Graphify anchor。

最低分
0.013
P25
0.392
P50(中位數)
0.449
P75
0.529
P90
0.963
P95
0.985
最高分
1.000

門檻敏感度

相同 mutual/雙證據規則下,降低 threshold 會增加覆蓋,也會納入更多弱推論。選擇 0.30 是探索報告的折衷,不代表可以自動執行內容合併。

最低相似門檻會保留的關係數有關聯的文章數文章涵蓋率本報告是否採用
0.251,8731,16742.92%
0.301,62096435.45%採用
0.351,40875827.88%
0.401,23259621.92%
0.4578946116.95%
0.5050836913.57%
0.5542429210.74%
0.603722438.94%
0.653321977.25%
0.703071676.14%

關係信心等級

信心等級是系統給關係的審核優先序,不是「有幾成正確」。

信心等級關係數占全部關係比例
0.551,24877.04%
0.65664.07%
0.75181.11%
0.85533.27%
0.9523514.51%
解讀:0.55 有 1,248 條,明確代表弱推論;高分區大量來自同來源的重複/近重複內容。分數是排序與複核依據,不是事實機率。

四、Graphify 關聯圖結果:文章形成哪些群組

這章在做什麼:把相似關係放成一張圖,觀察文章分成多少群、最大群有多大,以及哪些關係來自同一來源。群組是整理線索,不是新的正式 taxonomy。
2,019
彼此完全分開的文章群組數
2,028
Graphify 辨識出的主題社群數
85
最大相連群包含的文章數
778×
查詢時預估少讀取的文字量(非品質分數)

文章群組大小與連結程度

每篇平均/中位連到幾篇文章1.192/0
單篇最多連到幾篇文章17
只有 1 篇文章的社群1,755
少於 3 篇文章的小社群1,925
群內緊密度平均/中位數(0–1)0.9834/1.0000

1,620 條相似關係由什麼組成

雙方都把對方列為前 10 名相似文章1,483(91.54%)
正文內容完全相同的配對59
來自同一來源頁/文件的關係1,066(65.80%)
來自不同來源頁/文件的關係554(34.20%)
大分類相同/中分類相同1,210/1,083
模型推論關係/來源直接證據關係1,593/27
查詢內容量估算:原始內容約 135,950 字、粗估 181,266 tokens;透過關聯圖查詢時平均只需讀取約 233 tokens,預估少讀約 778 倍。這是內容量估算,不是答案品質提升 778 倍。
圖檔完整性檢查:2,719 篇文章/1,620 條關係;找不到文章端點的關係 0 條、自己連自己的關係 0 條、重複關係 0 條、未驗證文章 0 篇。Graphify 診斷通過。

五、問題點與確認結果

這章在做什麼:把圖表中看到的現象轉成可以採取行動的資料問題,並區分「已確認」與「仍待人工複核」。
問題確認證據意義
同來源/重複內容支配關聯圖已確認1,066/1,620 條關係來自同一來源;連結最多的文章全為 618 副本「連得多」不能直接解讀為內容最重要
原 Graphify anchor 缺少第二證據已確認48 條中僅 3 條同時被全域模型選中其餘 45 條要人工或 LLM pair verifier 複核
大量文章沒有安全相似關係已確認,但不等於錯誤1,755 篇目前沒有連線可能是內容獨特、標題過短或分類資訊不足
分類名稱太零碎已確認980 個中分類;551 個只用一次分類資訊無法穩定協助判斷文章是否屬於同一概念
低門檻產生句型誤連已確認並緩解「該如何處理/是什麼意思」可製造高 title cosine已加入雙證據閘門;仍需 golden-set 校準
live collection 已漂移已確認指定快照 2,719;目前 live 2,708相似圖必須版本化,不能覆蓋來源快照
審核原則:45 條只有 Graphify 支持的關係,以及接近 0.30 門檻的配對,全部留在人工複核清單;主報告不重複展開逐筆樣本。

六、三個解決方案

這章在做什麼:比較三種後續治理方式。方案 A 能同時處理單一概念、重複合併、人工複核與版本回滾,因此是建議方案。

方案 B:完全交給 Graphify 多輪分析

把文章分成多批,以深度模式重複分析,再合併各輪提出的語意關係。

  • 優點:較容易找到文字不相似、但意義相關的文章。
  • 限制:2,719 篇的分析成本高;分批方式會影響結果,較難重現與追查誤連。

方案 C:只在使用者搜尋時臨時找相似文章

只有使用者搜尋時才臨時找相似文章並整理搜尋結果,平常不保存整張關聯圖。

  • 優點:最快上線,不需維護完整關聯圖。
  • 限制:看不到全體品質、文章群組與資料變化;每次搜尋都要重算,也無法持續管理可疑關係。

七、多概念 KB 與 KB 合併處理辦法

這章在做什麼:明確規定一篇 KB 何時要拆、何時可以合併、何時只能保持分開並互相關聯。
不可妥協的核心原則:每一篇可被檢索並直接作答的 active KB,只能對應一個 canonical_concept_id。先拆概念,再判斷合併;合併是內容治理動作,不是相似分數的直接結果。原文不得直接刪除,所有拆分與合併都必須保留來源、版本、舊 UUID、redirect 與 rollback 資訊。

7.1 五種情況與處理決策

情況辨識條件處理是否合併
完全重複正規化後問題與答案相同,且語言、受眾、有效期間一致選定 canonical;其他 UUID 改為 redirect/alias,保留來源紀錄可以,先產生 proposal,再批次核准
同意圖、同答案問法不同,但使用者目的、解法與限制條件一致合併問法為 aliases,整理成一份 canonical answer可以,需 pair verifier 或人工確認
同意圖、答案衝突問題相同,但步驟、金額、日期、資格或版本不同禁止合併;先確認有效版本與適用範圍,舊版標記 superseded不可以
相關但互補同一活動/功能,但分別回答資格、操作、兌獎、例外等不同問題保留獨立 KB,建立 related_to 或共同 parent hub不可以
單篇含多個可獨立問題一篇同時回答兩個以上可單獨搜尋、單獨成立的意圖拆成 atomic child KB;原篇成為 parent/source container先拆,不做合併

7.2 多概念 KB 如何確認

一篇文章符合下列任兩項時進入 multi_concept_review;模型只能提案,不能直接拆文:

  • 標題或正文同時出現兩個以上獨立問句、FAQ 小節、編號答案或「以及/另外/如果」等意圖切換。
  • 各段落可各自回答不同搜尋,例如「參加資格」與「中獎後兌換」能分開成立。
  • Graph 上同一節點同時連到兩個以上語意明顯不同的 community,且不是泛用句型造成。
  • 同一 KB 的候選 query/labels 橫跨不同操作階段、角色、產品或時效條件。
不要拆的情況:同一任務的連續步驟、缺一不可的前置條件與結果、共同適用的一組限制條款,仍應維持一篇 KB,避免答案被切碎。

7.3 多概念拆分實作

  1. 保留原文。原文章不刪除,改作來源容器;記錄來源、版本與內容雜湊。
  2. 拆成單一概念文章。每篇子 KB 只回答一個可獨立搜尋的問題,並記錄對應的原文範圍;人工檢查日期、資格、金額與例外沒有遺漏。
  3. 更新檢索並保留回滾。子 KB 進入檢索,原文章保留追溯與還原用途。

7.4 KB 合併安全流程

  1. 確認能不能合併。必須同時符合:使用者意圖相同、答案等價、適用條件相同、內容沒有衝突;相似分數只用來排序。
  2. 選正式主文章。依來源權威、有效狀態、更新時間與完整度決定,並列出要保留的問法與答案。
  3. 非破壞式發布。舊文章不硬刪,改為轉址或已被取代狀態,舊 UUID 仍能找到正式主文章。
  4. 驗證與回滾。重新索引後確認舊問題仍能找到正確答案;異常時恢復上一版本。

八、建議執行計畫

這章在做什麼:把第七章的規則排成實際處理順序。這是建議計畫;本報告沒有執行任何資料庫寫入。
順序處理範圍要做什麼產出
P0全部 2,719 篇確認每篇是否只涵蓋一個可獨立回答的概念多概念拆分提案
P059 組完全相同內容核對適用條件,選定正式主文章合併與轉址提案
P11,066 條同來源關係區分重複、舊版本、不同 FAQ 與互補內容合併/保留/相關連結清單
P1554 條跨來源關係套用同意圖、答案等價、條件相同、無衝突四項檢查跨來源合併審核清單
P245 條只有 Graphify 支持的關係人工確認是真正的隱性關聯或錯誤連結接受/拒絕紀錄

每筆處理紀錄必須保留

  • 兩篇文章的 UUID、來源、版本與內容雜湊。
  • 判定為重複、版本變體、相關文章或不相關的理由與證據。
  • 人工審核人、時間、結果及正式主文章 UUID。
  • 拆分/合併前後內容與轉址資訊,確保可以回滾。

完成標準

  • 每篇啟用中的 KB 只回答一個主要概念。
  • 沒有任何文章只因相似分數高就被自動合併。
  • 合併後舊 UUID 仍能導向正式主文章,且來源與歷史可追溯。
  • 發布前通過檢索回歸測試;異常時能切回上一版本。

九、附錄與交付物

詳細文章樣本預設收合,需要時再展開,不干擾主要結論。

查看:不同來源之間、分數較高的相似文章配對

用來優先找跨來源重複或同概念文章;分數高仍不代表一定可以合併。

文章 A文章 B整體相似分數標題相似度正文相似度分類相似度關係由何者提出
誰可以參加誰可以參加0.8381.0000.4940.933全域模型
如何使用「彈幕喇叭(獨佔頭條)」功能如何使用「全站喇叭」功能0.8160.9080.5531.000全域模型
月新生代爭霸戰活動?月新生代爭霸戰?0.7330.8090.4940.933全域模型
決賽決賽0.7321.0000.5680.074全域模型
神皇等級有哪些專屬特權?神皇等級有哪些新增專屬特權?0.7240.9850.1091.000全域模型
決賽決賽0.7171.0000.5190.077全域模型
月榜統計到何時?週榜統計到何時?0.7110.8170.6610.423全域模型
決賽決賽0.7031.0000.4680.084全域模型
虛擬形象重複的服飾可以售出(拆解)嗎?虛擬形象重複的服飾可以轉送嗎?0.6860.8280.5220.492全域模型
葡萄的獲得方式是什麼?紅木的獲得方式是什麼?0.6790.9460.4340.189全域模型
如何隱藏爵位?如何隱藏我的爵位?0.6730.7570.7970.118全域模型
為什麼我不能贈送特權禮物?為什麼我不能贈送家族禮物?0.6560.9300.3720.220全域模型
VIP幸運抽抽樂抽中獎勵後該如何領取?VIP幸運抽抽樂抽中獎勵後該如何領取?0.6561.0000.1770.356全域模型
誰可以參加誰可以參加0.6491.0000.2920.075全域模型
虛擬形象時尚值是什麼?虛擬形象是什麼? 虛擬形象可以幹麻?0.6300.7550.4730.484全域模型
如何獲得虛擬形象的服飾與裝扮?如何獲得虛擬形象的貝殼?0.6280.8380.2810.555全域模型
誰可以參加誰可以參加0.6261.0000.2190.070全域模型
貴族隱藏貴族如何關閉0.6230.3300.9731.000全域模型
如何轉接真人客服?如何轉接真人客服?0.6211.0000.1690.138全域模型
貴族選票如何領取?貴族選票如何領取?0.6181.0000.1790.095全域模型
查看:連結最多的文章

連結多可能是核心概念,也可能只是重複副本;目前前幾名由 618 活動副本群主導。

KB 文章標題連到幾篇其他文章
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
查看:非直觀但可能相關的文章

這些配對是人工探索線索,不是合併清單。

文章 A關係類型文章 B證據屬性
活動期間如何使用貴族選票?semantically_similar_to活動期間貴族選票未使用會怎樣?INFERRED
沁涼小舖semantically_similar_to沁涼小舖活動中花火的火箭角色是什麼動物?INFERRED
在VIP幸運抽抽樂中獎後該如何向客服兌換獎勵?semantically_similar_to如何參與VIP幸運抽抽樂並兌換獎勵?INFERRED
送禮時禮物特效沒有顯示出來該如何處理?semantically_similar_to送禮物時沒有顯示特效該如何處理?INFERRED
生日跑馬燈要如何兌換與設定?semantically_similar_to生日跑馬燈的內容為何?INFERRED
生日跑馬燈要如何兌換與設定?semantically_similar_to生日跑馬燈設定後,若因主播晚開播而錯過,是否可以重新設定?INFERRED
如何累積追夢分?semantically_similar_to活動期間如何累積追夢分?INFERRED
曝光獎勵有哪些條件?semantically_similar_to計程車曝光獎勵有什麼限制?INFERRED

交付物

資料保護:文章原文與保存快照留在 git-ignored reports/;HTML 只呈現統計與必要樣本。若對外發布,仍須依組織資料政策確認 Graph JSON、文章標題及關聯樣本的公開範圍。