一、結論摘要
2,719
本次分析的 KB 文章數(每篇算 1 個節點)
1,620
系統找出的相似關係數(需審核,不等於可合併)
554
不同來源文章之間的相似關係數
35.45%
有找到至少一篇相似文章的 KB 比例
一句話結論:2,719 篇 KB 必須整理成「一篇 active KB=一個主要概念」。Graphify 找到的 1,620 條相似邊只用來找出待拆分、待合併及應互相關聯的候選,不能直接把相連文章全部合併。
五個重點結論
- 59 組完全相同內容 → 第一批合併候選。先確認語言、受眾、時效與適用條件相同,再選一篇作為正式主文章(canonical KB);其他舊文章保留轉址,不直接刪除。
- 1,066 條同來源相似關係 → 先拆概念,不是全部合併。同一來源頁可能展開多個 FAQ;每個可獨立搜尋、獨立回答的意圖都應成為一篇單一概念 KB,並保留與原始來源的關係。
- 554 條不同來源間的相似關係 → 逐對判斷。只有同意圖、答案等價、適用條件相同且無衝突才能合併;只是相關或互補,就保留兩篇並建立「相關文章」連結。
- 1,755 篇沒有安全相似邊 → 保持獨立。沒有關聯證據不代表品質差,也不應為了提高覆蓋率強行合併。
- Graphify 原先提出 48 條語意關係,只有 3 條獲第二種方法支持 → 其餘 45 條只進人工複核。沒有第二證據前不得合併、刪除或更換正式主文章。
快照聲明:本報告依指定的 2,719 筆保存快照執行;交付前 live test collection 已是 2,708 筆。兩個集合沒有混算,報告中的相似圖只代表 2,719 快照。
閱讀指南:每個數字到底代表什麼
先記住:這份報告是在找「哪些 KB 可能需要拆分、合併或互相關聯」。數字越大不代表內容越好,也不代表可以自動合併;它只表示值得優先檢查。
| 報告用語 | 白話意思 | 正在衡量什麼 | 應該怎麼使用 |
|---|---|---|---|
| 節點(Node) | 一篇 KB 文章 | 這次總共分析多少文章 | 本報告固定為 2,719 篇,不代表概念數 |
| 相似邊(Edge) | 兩篇 KB 之間的一條「可能相似」連線 | 系統找到多少文章配對值得審核 | 不能直接當成合併指令;需判斷 duplicate、related 或誤連 |
| 候選配對(Candidate pair) | 初步拿來比較的兩篇文章 | 相似篩選前的檢查範圍 | 只有通過門檻與證據規則才成為最終相似邊 |
| 相似分數(0–1) | 標題、正文與分類有多接近 | 排序用的相似程度;1 最接近、0 最不接近 | 不是正確率或可合併機率,仍要檢查答案與適用條件 |
| 門檻(Threshold) | 最低要多相似才保留 | 嚴格程度;越高保留越少,通常誤連也較少 | 本報告 0.30 是探索門檻,不是自動合併門檻 |
| 涵蓋率(Coverage) | 有找到至少一篇相似文章的 KB 比例 | 圖有涵蓋多少文章 | 涵蓋率低不一定是錯;獨特 KB 本來就可能沒有相似文章 |
| 孤立 KB(Isolate) | 目前沒有安全相似連線的文章 | 沒有足夠雙重證據的 KB 數量 | 先保持獨立,不要為了連線而強行合併 |
| 相連群組(Component) | 彼此有路徑可連到的一群文章 | 整張圖被分成多少個互不相連區塊 | 用來看知識是否分散;不是正式分類 |
| 主題社群(Community) | Graphify 判斷內部關係較密切的一群 KB | 可能的主題群或 FAQ 群 | 用於發現整理單位,仍需人工命名與確認 |
| 連結數(Degree) | 一篇 KB 連到幾篇其他文章 | 該文章在圖中有多少相似關係 | 高連結可能是核心概念,也可能只是大量重複副本 |
| 群內緊密度(Cohesion) | 同一社群內的文章互相連得多不多 | 0–1 的群組緊密程度 | 高分表示群內連結集中,不代表內容品質較高 |
| Graphify anchor | Graphify 原先推論的一條語意關係 | 非純文字相似、可能較隱性的關聯 | 沒有第二證據時只能進 review,不能自動改資料 |
| Canonical KB | 同一概念最後保留的正式主文章 | 合併後哪一篇是唯一 active 版本 | 其他舊 UUID 透過 redirect 指向它,不硬刪除 |
二、範圍、定義與方法
這章在做什麼:說明 2,719 篇文章從哪裡來,以及系統如何把標題、正文、分類轉成可比較的訊號。這是方法說明,不是合併結果。
資料與工具
| 環境 | test Weaviate 保存快照;唯讀 |
|---|---|
| 文章 | 2,719 |
| 不同來源頁/文件數(source_id) | 2,193 |
| Graphify | 官方 graphifyy 0.9.63 |
| 全域特徵維度 | 119,113 |
| LLM 成本 | 新增全域相似層為 deterministic,0 tokens;48 anchors 沿用既有 Graphify 結果 |
| 產生時間 | 2026-09-21T18:19:21+08:00 |
相似度不是什麼
- 不是「可以刪除」或「可以合併」的直接證明。
- 不是向量資料庫;特徵只用於離線候選生成,輸出是可稽核的靜態 graph edges。
- 同 source_id 不代表重複,同標題也不一定代表同答案。
- Graphify INFERRED edge 是探索假設;EXTRACTED 才表示來源中有直接證據。
- 每篇文章在圖上只算一個點。由保存快照建立 2,719 個文章節點,保留文章識別碼、來源文件、版本、分類與來源網址。
- 三層特徵。標題字元 n-gram 權重 0.55、正文 0.30、分類/labels 0.15;各層先 L2 normalize。
- 找出初步可能相似的文章。每篇先取最接近的 24 篇,得到 43,308 個不重複候選配對;另外一定納入 59 個內容完全相同的配對。
- 只保留有足夠證據的關係。總分至少 0.30,而且雙方都要把對方列入前 10 名,或相似度達強門檻 0.82;標題、正文、分類至少兩項要能互相支持。
- 合併 Graphify anchors。把原始 48 條
semantically_similar_to邊保留並標記來源,不以低文字分數擅自刪除。 - Graphify 整理關聯圖。找出主題社群、計算群內緊密度與連結最多的文章,檢查圖檔錯誤,並產生互動式 HTML 報告。
三、相似關係是怎麼篩選的:候選、門檻與分數
這章在做什麼:顯示門檻提高或降低時會保留多少相似關係。目的是選擇合理的審核範圍,不是在決定哪些 KB 自動合併。
初步候選的相似分數分布
所有初步比較配對的分數;P50 表示一半候選低於此分數。
最後保留關係的相似分數分布
通過規則後的 1,620 條關係;低分可能是保留的 Graphify anchor。
門檻敏感度
相同 mutual/雙證據規則下,降低 threshold 會增加覆蓋,也會納入更多弱推論。選擇 0.30 是探索報告的折衷,不代表可以自動執行內容合併。
| 最低相似門檻 | 會保留的關係數 | 有關聯的文章數 | 文章涵蓋率 | 本報告是否採用 |
|---|---|---|---|---|
| 0.25 | 1,873 | 1,167 | 42.92% | |
| 0.30 | 1,620 | 964 | 35.45% | 採用 |
| 0.35 | 1,408 | 758 | 27.88% | |
| 0.40 | 1,232 | 596 | 21.92% | |
| 0.45 | 789 | 461 | 16.95% | |
| 0.50 | 508 | 369 | 13.57% | |
| 0.55 | 424 | 292 | 10.74% | |
| 0.60 | 372 | 243 | 8.94% | |
| 0.65 | 332 | 197 | 7.25% | |
| 0.70 | 307 | 167 | 6.14% |
關係信心等級
信心等級是系統給關係的審核優先序,不是「有幾成正確」。
| 信心等級 | 關係數 | 占全部關係比例 |
|---|---|---|
| 0.55 | 1,248 | 77.04% |
| 0.65 | 66 | 4.07% |
| 0.75 | 18 | 1.11% |
| 0.85 | 53 | 3.27% |
| 0.95 | 235 | 14.51% |
解讀:
0.55 有 1,248 條,明確代表弱推論;高分區大量來自同來源的重複/近重複內容。分數是排序與複核依據,不是事實機率。四、Graphify 關聯圖結果:文章形成哪些群組
這章在做什麼:把相似關係放成一張圖,觀察文章分成多少群、最大群有多大,以及哪些關係來自同一來源。群組是整理線索,不是新的正式 taxonomy。
2,019
彼此完全分開的文章群組數
2,028
Graphify 辨識出的主題社群數
85
最大相連群包含的文章數
778×
查詢時預估少讀取的文字量(非品質分數)
文章群組大小與連結程度
| 每篇平均/中位連到幾篇文章 | 1.192/0 |
|---|---|
| 單篇最多連到幾篇文章 | 17 |
| 只有 1 篇文章的社群 | 1,755 |
| 少於 3 篇文章的小社群 | 1,925 |
| 群內緊密度平均/中位數(0–1) | 0.9834/1.0000 |
1,620 條相似關係由什麼組成
| 雙方都把對方列為前 10 名相似文章 | 1,483(91.54%) |
|---|---|
| 正文內容完全相同的配對 | 59 |
| 來自同一來源頁/文件的關係 | 1,066(65.80%) |
| 來自不同來源頁/文件的關係 | 554(34.20%) |
| 大分類相同/中分類相同 | 1,210/1,083 |
| 模型推論關係/來源直接證據關係 | 1,593/27 |
查詢內容量估算:原始內容約 135,950 字、粗估 181,266 tokens;透過關聯圖查詢時平均只需讀取約 233 tokens,預估少讀約 778 倍。這是內容量估算,不是答案品質提升 778 倍。
圖檔完整性檢查:2,719 篇文章/1,620 條關係;找不到文章端點的關係 0 條、自己連自己的關係 0 條、重複關係 0 條、未驗證文章 0 篇。Graphify 診斷通過。
五、問題點與確認結果
這章在做什麼:把圖表中看到的現象轉成可以採取行動的資料問題,並區分「已確認」與「仍待人工複核」。
| 問題 | 確認 | 證據 | 意義 |
|---|---|---|---|
| 同來源/重複內容支配關聯圖 | 已確認 | 1,066/1,620 條關係來自同一來源;連結最多的文章全為 618 副本 | 「連得多」不能直接解讀為內容最重要 |
| 原 Graphify anchor 缺少第二證據 | 已確認 | 48 條中僅 3 條同時被全域模型選中 | 其餘 45 條要人工或 LLM pair verifier 複核 |
| 大量文章沒有安全相似關係 | 已確認,但不等於錯誤 | 1,755 篇目前沒有連線 | 可能是內容獨特、標題過短或分類資訊不足 |
| 分類名稱太零碎 | 已確認 | 980 個中分類;551 個只用一次 | 分類資訊無法穩定協助判斷文章是否屬於同一概念 |
| 低門檻產生句型誤連 | 已確認並緩解 | 「該如何處理/是什麼意思」可製造高 title cosine | 已加入雙證據閘門;仍需 golden-set 校準 |
| live collection 已漂移 | 已確認 | 指定快照 2,719;目前 live 2,708 | 相似圖必須版本化,不能覆蓋來源快照 |
審核原則:45 條只有 Graphify 支持的關係,以及接近 0.30 門檻的配對,全部留在人工複核清單;主報告不重複展開逐筆樣本。
六、三個解決方案
這章在做什麼:比較三種後續治理方式。方案 A 能同時處理單一概念、重複合併、人工複核與版本回滾,因此是建議方案。
方案 A:固定規則找候選,再由 AI/人工複核 建議
第一層用固定、可重現的公式找出可能相似的文章;第二層才讓 Graphify/AI 審核不同來源、文字交集低或分數介於 0.30–0.60 的灰色地帶。完全重複、同來源版本與跨來源相似必須標記成不同關係。
- 優點:結果可重現、可處理新增文章、AI 使用量有限、保留判斷證據,也較容易控制誤連。
- 限制:需要先準備人工確認樣本,並維護一份待審清單。
方案 B:完全交給 Graphify 多輪分析
把文章分成多批,以深度模式重複分析,再合併各輪提出的語意關係。
- 優點:較容易找到文字不相似、但意義相關的文章。
- 限制:2,719 篇的分析成本高;分批方式會影響結果,較難重現與追查誤連。
方案 C:只在使用者搜尋時臨時找相似文章
只有使用者搜尋時才臨時找相似文章並整理搜尋結果,平常不保存整張關聯圖。
- 優點:最快上線,不需維護完整關聯圖。
- 限制:看不到全體品質、文章群組與資料變化;每次搜尋都要重算,也無法持續管理可疑關係。
七、多概念 KB 與 KB 合併處理辦法
這章在做什麼:明確規定一篇 KB 何時要拆、何時可以合併、何時只能保持分開並互相關聯。
不可妥協的核心原則:每一篇可被檢索並直接作答的 active KB,只能對應一個
canonical_concept_id。先拆概念,再判斷合併;合併是內容治理動作,不是相似分數的直接結果。原文不得直接刪除,所有拆分與合併都必須保留來源、版本、舊 UUID、redirect 與 rollback 資訊。7.1 五種情況與處理決策
| 情況 | 辨識條件 | 處理 | 是否合併 |
|---|---|---|---|
| 完全重複 | 正規化後問題與答案相同,且語言、受眾、有效期間一致 | 選定 canonical;其他 UUID 改為 redirect/alias,保留來源紀錄 | 可以,先產生 proposal,再批次核准 |
| 同意圖、同答案 | 問法不同,但使用者目的、解法與限制條件一致 | 合併問法為 aliases,整理成一份 canonical answer | 可以,需 pair verifier 或人工確認 |
| 同意圖、答案衝突 | 問題相同,但步驟、金額、日期、資格或版本不同 | 禁止合併;先確認有效版本與適用範圍,舊版標記 superseded | 不可以 |
| 相關但互補 | 同一活動/功能,但分別回答資格、操作、兌獎、例外等不同問題 | 保留獨立 KB,建立 related_to 或共同 parent hub | 不可以 |
| 單篇含多個可獨立問題 | 一篇同時回答兩個以上可單獨搜尋、單獨成立的意圖 | 拆成 atomic child KB;原篇成為 parent/source container | 先拆,不做合併 |
7.2 多概念 KB 如何確認
一篇文章符合下列任兩項時進入 multi_concept_review;模型只能提案,不能直接拆文:
- 標題或正文同時出現兩個以上獨立問句、FAQ 小節、編號答案或「以及/另外/如果」等意圖切換。
- 各段落可各自回答不同搜尋,例如「參加資格」與「中獎後兌換」能分開成立。
- Graph 上同一節點同時連到兩個以上語意明顯不同的 community,且不是泛用句型造成。
- 同一 KB 的候選 query/labels 橫跨不同操作階段、角色、產品或時效條件。
不要拆的情況:同一任務的連續步驟、缺一不可的前置條件與結果、共同適用的一組限制條款,仍應維持一篇 KB,避免答案被切碎。
7.3 多概念拆分實作
- 保留原文。原文章不刪除,改作來源容器;記錄來源、版本與內容雜湊。
- 拆成單一概念文章。每篇子 KB 只回答一個可獨立搜尋的問題,並記錄對應的原文範圍;人工檢查日期、資格、金額與例外沒有遺漏。
- 更新檢索並保留回滾。子 KB 進入檢索,原文章保留追溯與還原用途。
7.4 KB 合併安全流程
- 確認能不能合併。必須同時符合:使用者意圖相同、答案等價、適用條件相同、內容沒有衝突;相似分數只用來排序。
- 選正式主文章。依來源權威、有效狀態、更新時間與完整度決定,並列出要保留的問法與答案。
- 非破壞式發布。舊文章不硬刪,改為轉址或已被取代狀態,舊 UUID 仍能找到正式主文章。
- 驗證與回滾。重新索引後確認舊問題仍能找到正確答案;異常時恢復上一版本。
八、建議執行計畫
這章在做什麼:把第七章的規則排成實際處理順序。這是建議計畫;本報告沒有執行任何資料庫寫入。
| 順序 | 處理範圍 | 要做什麼 | 產出 |
|---|---|---|---|
| P0 | 全部 2,719 篇 | 確認每篇是否只涵蓋一個可獨立回答的概念 | 多概念拆分提案 |
| P0 | 59 組完全相同內容 | 核對適用條件,選定正式主文章 | 合併與轉址提案 |
| P1 | 1,066 條同來源關係 | 區分重複、舊版本、不同 FAQ 與互補內容 | 合併/保留/相關連結清單 |
| P1 | 554 條跨來源關係 | 套用同意圖、答案等價、條件相同、無衝突四項檢查 | 跨來源合併審核清單 |
| P2 | 45 條只有 Graphify 支持的關係 | 人工確認是真正的隱性關聯或錯誤連結 | 接受/拒絕紀錄 |
每筆處理紀錄必須保留
- 兩篇文章的 UUID、來源、版本與內容雜湊。
- 判定為重複、版本變體、相關文章或不相關的理由與證據。
- 人工審核人、時間、結果及正式主文章 UUID。
- 拆分/合併前後內容與轉址資訊,確保可以回滾。
完成標準
- 每篇啟用中的 KB 只回答一個主要概念。
- 沒有任何文章只因相似分數高就被自動合併。
- 合併後舊 UUID 仍能導向正式主文章,且來源與歷史可追溯。
- 發布前通過檢索回歸測試;異常時能切回上一版本。
九、附錄與交付物
詳細文章樣本預設收合,需要時再展開,不干擾主要結論。
查看:不同來源之間、分數較高的相似文章配對
用來優先找跨來源重複或同概念文章;分數高仍不代表一定可以合併。
| 文章 A | 文章 B | 整體相似分數 | 標題相似度 | 正文相似度 | 分類相似度 | 關係由何者提出 |
|---|---|---|---|---|---|---|
| 誰可以參加 | 誰可以參加 | 0.838 | 1.000 | 0.494 | 0.933 | 全域模型 |
| 如何使用「彈幕喇叭(獨佔頭條)」功能 | 如何使用「全站喇叭」功能 | 0.816 | 0.908 | 0.553 | 1.000 | 全域模型 |
| 月新生代爭霸戰活動? | 月新生代爭霸戰? | 0.733 | 0.809 | 0.494 | 0.933 | 全域模型 |
| 決賽 | 決賽 | 0.732 | 1.000 | 0.568 | 0.074 | 全域模型 |
| 神皇等級有哪些專屬特權? | 神皇等級有哪些新增專屬特權? | 0.724 | 0.985 | 0.109 | 1.000 | 全域模型 |
| 決賽 | 決賽 | 0.717 | 1.000 | 0.519 | 0.077 | 全域模型 |
| 月榜統計到何時? | 週榜統計到何時? | 0.711 | 0.817 | 0.661 | 0.423 | 全域模型 |
| 決賽 | 決賽 | 0.703 | 1.000 | 0.468 | 0.084 | 全域模型 |
| 虛擬形象重複的服飾可以售出(拆解)嗎? | 虛擬形象重複的服飾可以轉送嗎? | 0.686 | 0.828 | 0.522 | 0.492 | 全域模型 |
| 葡萄的獲得方式是什麼? | 紅木的獲得方式是什麼? | 0.679 | 0.946 | 0.434 | 0.189 | 全域模型 |
| 如何隱藏爵位? | 如何隱藏我的爵位? | 0.673 | 0.757 | 0.797 | 0.118 | 全域模型 |
| 為什麼我不能贈送特權禮物? | 為什麼我不能贈送家族禮物? | 0.656 | 0.930 | 0.372 | 0.220 | 全域模型 |
| VIP幸運抽抽樂抽中獎勵後該如何領取? | VIP幸運抽抽樂抽中獎勵後該如何領取? | 0.656 | 1.000 | 0.177 | 0.356 | 全域模型 |
| 誰可以參加 | 誰可以參加 | 0.649 | 1.000 | 0.292 | 0.075 | 全域模型 |
| 虛擬形象時尚值是什麼? | 虛擬形象是什麼? 虛擬形象可以幹麻? | 0.630 | 0.755 | 0.473 | 0.484 | 全域模型 |
| 如何獲得虛擬形象的服飾與裝扮? | 如何獲得虛擬形象的貝殼? | 0.628 | 0.838 | 0.281 | 0.555 | 全域模型 |
| 誰可以參加 | 誰可以參加 | 0.626 | 1.000 | 0.219 | 0.070 | 全域模型 |
| 貴族隱藏 | 貴族如何關閉 | 0.623 | 0.330 | 0.973 | 1.000 | 全域模型 |
| 如何轉接真人客服? | 如何轉接真人客服? | 0.621 | 1.000 | 0.169 | 0.138 | 全域模型 |
| 貴族選票如何領取? | 貴族選票如何領取? | 0.618 | 1.000 | 0.179 | 0.095 | 全域模型 |
查看:連結最多的文章
連結多可能是核心概念,也可能只是重複副本;目前前幾名由 618 活動副本群主導。
| KB 文章標題 | 連到幾篇其他文章 |
|---|---|
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
查看:非直觀但可能相關的文章
這些配對是人工探索線索,不是合併清單。
| 文章 A | 關係類型 | 文章 B | 證據屬性 |
|---|---|---|---|
| 活動期間如何使用貴族選票? | semantically_similar_to | 活動期間貴族選票未使用會怎樣? | INFERRED |
| 沁涼小舖 | semantically_similar_to | 沁涼小舖活動中花火的火箭角色是什麼動物? | INFERRED |
| 在VIP幸運抽抽樂中獎後該如何向客服兌換獎勵? | semantically_similar_to | 如何參與VIP幸運抽抽樂並兌換獎勵? | INFERRED |
| 送禮時禮物特效沒有顯示出來該如何處理? | semantically_similar_to | 送禮物時沒有顯示特效該如何處理? | INFERRED |
| 生日跑馬燈要如何兌換與設定? | semantically_similar_to | 生日跑馬燈的內容為何? | INFERRED |
| 生日跑馬燈要如何兌換與設定? | semantically_similar_to | 生日跑馬燈設定後,若因主播晚開播而錯過,是否可以重新設定? | INFERRED |
| 如何累積追夢分? | semantically_similar_to | 活動期間如何累積追夢分? | INFERRED |
| 曝光獎勵有哪些條件? | semantically_similar_to | 計程車曝光獎勵有什麼限制? | INFERRED |
交付物
- 本 HTML 報告
- 互動式 Graphify similarity graph
- Graphify GRAPH_REPORT.md
- GraphRAG-ready graph.json
- 完整 node/edge extraction
- 分析與門檻敏感度 JSON
資料保護:文章原文與保存快照留在 git-ignored
reports/;HTML 只呈現統計與必要樣本。若對外發布,仍須依組織資料政策確認 Graph JSON、文章標題及關聯樣本的公開範圍。