Graphify · Similarity Graph · Test Snapshot

KB 2,719 篇相關度與相似節點連結報告

分析保存的 2,719 篇 test KB:比較標題、正文與分類,找出可能重複或相關的文章;只有雙方都認為彼此相近且具多項證據時才保留關係,再由 Graphify 整理文章群組、檢查圖檔並產生互動報告。

一、結論摘要

2,719
本次分析的 KB 文章數(每篇算 1 個節點)
1,620
系統找出的相似關係數(需審核,不等於可合併)
554
不同來源文章之間的相似關係數
35.45%
有找到至少一篇相似文章的 KB 比例
一句話結論:2,719 篇 KB 必須整理成「一篇 active KB=一個主要概念」。Graphify 找到的 1,620 條相似邊只用來找出待拆分、待合併及應互相關聯的候選,不能直接把相連文章全部合併。

五個重點結論

  1. 59 組完全相同內容 → 第一批合併候選。先確認語言、受眾、時效與適用條件相同,再選一篇作為正式主文章(canonical KB);其他舊文章保留轉址,不直接刪除。
  2. 1,066 條同來源相似關係 → 先拆概念,不是全部合併。同一來源頁可能展開多個 FAQ;每個可獨立搜尋、獨立回答的意圖都應成為一篇單一概念 KB,並保留與原始來源的關係。
  3. 554 條不同來源間的相似關係 → 逐對判斷。只有同意圖、答案等價、適用條件相同且無衝突才能合併;只是相關或互補,就保留兩篇並建立「相關文章」連結。
  4. 1,755 篇沒有安全相似邊 → 保持獨立。沒有關聯證據不代表品質差,也不應為了提高覆蓋率強行合併。
  5. Graphify 原先提出 48 條語意關係,只有 3 條獲第二種方法支持 → 其餘 45 條只進人工複核。沒有第二證據前不得合併、刪除或更換正式主文章。
處理原則:多概念先拆、重複再併、互補只連結、衝突先解決。具體判斷規則見第七章,執行順序見第八章
快照聲明:本報告依指定的 2,719 筆保存快照執行;交付前 live test collection 已是 2,708 筆。兩個集合沒有混算,報告中的相似圖只代表 2,719 快照。

閱讀指南:每個數字到底代表什麼

先記住:這份報告是在找「哪些 KB 可能需要拆分、合併或互相關聯」。數字越大不代表內容越好,也不代表可以自動合併;它只表示值得優先檢查。
報告用語白話意思正在衡量什麼應該怎麼使用
節點(Node)一篇 KB 文章這次總共分析多少文章本報告固定為 2,719 篇,不代表概念數
相似邊(Edge)兩篇 KB 之間的一條「可能相似」連線系統找到多少文章配對值得審核不能直接當成合併指令;需判斷 duplicate、related 或誤連
候選配對(Candidate pair)初步拿來比較的兩篇文章相似篩選前的檢查範圍只有通過門檻與證據規則才成為最終相似邊
相似分數(0–1)標題、正文與分類有多接近排序用的相似程度;1 最接近、0 最不接近不是正確率或可合併機率,仍要檢查答案與適用條件
門檻(Threshold)最低要多相似才保留嚴格程度;越高保留越少,通常誤連也較少本報告 0.30 是探索門檻,不是自動合併門檻
涵蓋率(Coverage)有找到至少一篇相似文章的 KB 比例圖有涵蓋多少文章涵蓋率低不一定是錯;獨特 KB 本來就可能沒有相似文章
孤立 KB(Isolate)目前沒有安全相似連線的文章沒有足夠雙重證據的 KB 數量先保持獨立,不要為了連線而強行合併
相連群組(Component)彼此有路徑可連到的一群文章整張圖被分成多少個互不相連區塊用來看知識是否分散;不是正式分類
主題社群(Community)Graphify 判斷內部關係較密切的一群 KB可能的主題群或 FAQ 群用於發現整理單位,仍需人工命名與確認
連結數(Degree)一篇 KB 連到幾篇其他文章該文章在圖中有多少相似關係高連結可能是核心概念,也可能只是大量重複副本
群內緊密度(Cohesion)同一社群內的文章互相連得多不多0–1 的群組緊密程度高分表示群內連結集中,不代表內容品質較高
Graphify anchorGraphify 原先推論的一條語意關係非純文字相似、可能較隱性的關聯沒有第二證據時只能進 review,不能自動改資料
Canonical KB同一概念最後保留的正式主文章合併後哪一篇是唯一 active 版本其他舊 UUID 透過 redirect 指向它,不硬刪除

二、範圍、定義與方法

這章在做什麼:說明 2,719 篇文章從哪裡來,以及系統如何把標題、正文、分類轉成可比較的訊號。這是方法說明,不是合併結果。

資料與工具

環境test Weaviate 保存快照;唯讀
文章2,719
不同來源頁/文件數(source_id)2,193
Graphify官方 graphifyy 0.9.63
全域特徵維度119,113
LLM 成本新增全域相似層為 deterministic,0 tokens;48 anchors 沿用既有 Graphify 結果
產生時間2026-09-22T11:01:27+08:00

相似度不是什麼

  • 不是「可以刪除」或「可以合併」的直接證明。
  • 不是向量資料庫;特徵只用於離線候選生成,輸出是可稽核的靜態 graph edges。
  • 同 source_id 不代表重複,同標題也不一定代表同答案。
  • Graphify INFERRED edge 是探索假設;EXTRACTED 才表示來源中有直接證據。
  1. 每篇文章在圖上只算一個點。由保存快照建立 2,719 個文章節點,保留文章識別碼、來源文件、版本、分類與來源網址。
  2. 三層特徵。標題字元 n-gram 權重 0.55、正文 0.30、分類/labels 0.15;各層先 L2 normalize。
  3. 找出初步可能相似的文章。每篇先取最接近的 24 篇,得到 43,308 個不重複候選配對;另外一定納入 59 個內容完全相同的配對。
  4. 只保留有足夠證據的關係。總分至少 0.30,而且雙方都要把對方列入前 10 名,或相似度達強門檻 0.82;標題、正文、分類至少兩項要能互相支持。
  5. 合併 Graphify anchors。把原始 48 條 semantically_similar_to 邊保留並標記來源,不以低文字分數擅自刪除。
  6. Graphify 整理關聯圖。找出主題社群、計算群內緊密度與連結最多的文章,檢查圖檔錯誤,並產生互動式 HTML 報告。

三、相似關係是怎麼篩選的:候選、門檻與分數

這章在做什麼:顯示門檻提高或降低時會保留多少相似關係。目的是選擇合理的審核範圍,不是在決定哪些 KB 自動合併。

初步候選的相似分數分布

所有初步比較配對的分數;P50 表示一半候選低於此分數。

P25(25%候選低於此值)
0.089
P50(中位數)
0.117
P75
0.159
P90
0.227
P95
0.322
P99
0.612
最高分
1.000

最後保留關係的相似分數分布

通過規則後的 1,620 條關係;低分可能是保留的 Graphify anchor。

最低分
0.013
P25
0.392
P50(中位數)
0.449
P75
0.529
P90
0.963
P95
0.985
最高分
1.000

門檻敏感度

相同 mutual/雙證據規則下,降低 threshold 會增加覆蓋,也會納入更多弱推論。選擇 0.30 是探索報告的折衷,不代表可以自動執行內容合併。

最低相似門檻會保留的關係數有關聯的文章數文章涵蓋率本報告是否採用
0.251,8731,16742.92%
0.301,62096435.45%採用
0.351,40875827.88%
0.401,23259621.92%
0.4578946116.95%
0.5050836913.57%
0.5542429210.74%
0.603722438.94%
0.653321977.25%
0.703071676.14%

關係信心等級

信心等級是系統給關係的審核優先序,不是「有幾成正確」。

信心等級關係數占全部關係比例
0.551,24877.04%
0.65664.07%
0.75181.11%
0.85533.27%
0.9523514.51%
解讀:0.55 有 1,248 條,明確代表弱推論;高分區大量來自同來源的重複/近重複內容。分數是排序與複核依據,不是事實機率。

四、Graphify 關聯圖結果:文章形成哪些群組

這章在做什麼:把相似關係放成一張圖,觀察文章分成多少群、最大群有多大,以及哪些關係來自同一來源。群組是整理線索,不是新的正式 taxonomy。
2,019
彼此完全分開的文章群組數
2,028
Graphify 辨識出的主題社群數
85
最大相連群包含的文章數
778×
查詢時預估少讀取的文字量(非品質分數)

4.1 關聯圖上的點、線、顏色與箭頭代表什麼

畫面元素實際代表對應用途不能這樣解讀
一個圓點一篇 KB 文章,共 2,719 個點擊後查看文章標題、主題社群、來源檔、連結數與相鄰文章不是一個抽象概念;一篇多概念文章目前仍只是一個點
圓點顏色Graphify 分配的主題社群把可能屬於同一主題的文章放在一起檢查顏色不是正式分類;社群多達 2,028 個,色盤會重複,必須看左側社群名稱
圓點大小該文章連到其他文章的數量快速找到重複群、熱門模板或可能的核心文章圓點大不等於內容重要;618 副本就是被重複數量放大
圓點標題KB 標題;小節點為避免畫面擁擠可能不直接顯示用搜尋或點擊節點查看完整標題看不到文字不代表文章不存在
細虛線1,593 條模型推論關係(INFERRED)提供待審核的相似或相關候選不是已證實的重複,也不能直接合併
較粗實線27 條具直接證據屬性的關係(EXTRACTED)優先檢查證據與適用條件有直接證據仍不等於答案完全相同
線上的箭頭Graphify HTML 匯出時記錄的 source → target 顯示方向只用來定位線的兩端不代表因果、上下層、主文章方向或合併方向;本次圖分析按無向關係處理
線的粗細/透明度區分 EXTRACTED 與 INFERRED 的視覺樣式快速辨認證據屬性不是相似分數高低;實際分數要看報告或 Graph JSON

4.2 每條連線背後的欄位與對應功能

互動圖把所有線統一顯示為 semantically_similar_to,方便看拓撲;真正決定處理方式的是下列欄位組合,而不是線本身。

連線欄位意思治理功能
similarity_score標題、正文與分類加權後的整體相似分數排審核順序;不能單獨決定合併
title_similarity兩篇標題的文字接近程度找相同問法或改寫問法;要防止「如何處理」等模板句誤連
body_similarity兩篇答案正文的文字接近程度協助確認答案是否重複;仍要檢查日期、金額與例外
metadata_similarity分類與標籤的接近程度確認是否可能屬於同一主題;分類碎片化時只能當輔助
exact_content=true正文內容完全相同,本圖共有 59 組配對送入完全重複合併審核;先把配對合成重複群組
same_source_id=true兩篇來自同一來源頁/文件,本圖共有 1,066 條辨識同頁 FAQ、歷史版本與副本;不能假設全部重複
same_source_id=false兩篇來自不同來源,本圖共有 554 條找跨來源重複或相關文章,需通過四項合併檢查
mutual_neighbor=true雙方都把對方列入前 10 名相似文章,共 1,483 條降低單向熱門模板造成的誤連;仍不是合併證明
graphify_semantic_anchor=true原 Graphify 提出的語意關係,共 48 條找可能的隱性關聯;其中 45 條缺少全域模型第二證據,必須複核
selected_by_global_similarity=true通過全域文字/分類與安全閘門表示至少具多項可重現證據;不代表人工已核准

4.3 互動功能怎麼用

操作畫面會做什麼最適合回答的問題
左上搜尋框輸入 KB 標題關鍵字最多顯示前 20 個標題相符節點;點結果會放大並置中「這篇 KB 周圍有哪些可能重複或相關文章?」
點擊一個節點左側顯示標題、文件類型、主題社群、來源檔、連結數與鄰居清單「這篇文章屬於哪個群?為什麼看起來是中心節點?」
點擊鄰居清單中的文章直接跳到該鄰居並更新詳細資訊沿著一組疑似重複/相關文章逐篇檢查
滑鼠停在線上顯示 semantically_similar_to [INFERRED/EXTRACTED]快速確認這條線是推論或直接證據屬性
左側社群勾選框顯示或隱藏該主題社群;Select All 可全部顯示/隱藏集中檢查單一主題,降低 2,719 篇同時顯示的干擾
滾輪縮放、拖曳空白畫布放大局部或移動畫面;初始力導向排版完成後位置固定查看密集重複群與孤立文章的空間分布
目前互動圖的限制:節點資訊面板不直接顯示總分、三項分數、完全相同、同來源或 Graphify anchor。要判定是否拆分/合併,必須回到本報告的案例與規則,或查看 Graph JSON;不能只看線的外觀。

4.4 建議的圖上審核流程

  1. 用搜尋框找到要檢查的 KB,點擊節點查看社群與鄰居。
  2. 先看節點是否因大量同標題副本而變大;不要直接把大節點當正式主文章。
  3. 對每個鄰居查核 exact_content、來源是否相同、三項相似分數與證據來源。
  4. 依第七章判定為:拆分、完全重複合併、語意重複合併、保持版本、保持相關或拒絕關係。
  5. 把結果送入第八章的人工核准流程;互動圖本身不執行任何資料修改。

4.5 文章群組大小與連結程度

每篇平均/中位連到幾篇文章1.192/0
單篇最多連到幾篇文章17
只有 1 篇文章的社群1,755
少於 3 篇文章的小社群1,925
群內緊密度平均/中位數(0–1)0.9834/1.0000

4.6 連線組成統計

雙方都把對方列為前 10 名相似文章1,483(91.54%)
正文內容完全相同的配對59
來自同一來源頁/文件的關係1,066(65.80%)
來自不同來源頁/文件的關係554(34.20%)
大分類相同/中分類相同1,210/1,083
模型推論關係/來源直接證據關係1,593/27
查詢內容量估算:原始內容約 135,950 字、粗估 181,266 tokens;透過關聯圖查詢時平均只需讀取約 233 tokens,預估少讀約 778 倍。這是內容量估算,不是答案品質提升 778 倍。
圖檔完整性檢查:2,719 篇文章/1,620 條關係;找不到文章端點的關係 0 條、自己連自己的關係 0 條、重複關係 0 條、未驗證文章 0 篇。Graphify 診斷通過。

五、問題點與確認結果

這章在做什麼:把圖表中看到的現象轉成可以採取行動的資料問題,並區分「已確認」與「仍待人工複核」。
問題確認證據意義
同來源/重複內容支配關聯圖已確認1,066/1,620 條關係來自同一來源;連結最多的文章全為 618 副本「連得多」不能直接解讀為內容最重要
原 Graphify anchor 缺少第二證據已確認48 條中僅 3 條同時被全域模型選中其餘 45 條要人工或 LLM pair verifier 複核
大量文章沒有安全相似關係已確認,但不等於錯誤1,755 篇目前沒有連線可能是內容獨特、標題過短或分類資訊不足
分類名稱太零碎已確認980 個中分類;551 個只用一次分類資訊無法穩定協助判斷文章是否屬於同一概念
低門檻產生句型誤連已確認並緩解「該如何處理/是什麼意思」可製造高 title cosine已加入雙證據閘門;仍需 golden-set 校準
live collection 已漂移已確認指定快照 2,719;目前 live 2,708相似圖必須版本化,不能覆蓋來源快照
審核原則:45 條只有 Graphify 支持的關係,以及接近 0.30 門檻的配對,全部留在人工複核清單;主報告不重複展開逐筆樣本。

六、三個解決方案

這章在做什麼:比較三種後續治理方式。方案 A 能同時處理單一概念、重複合併、人工複核與版本回滾,因此是建議方案。
明確選擇方案 A。理由不是「AI 比較聰明」,而是目前同時存在 59 組完全相同內容、1,066 條同來源關係、554 條跨來源關係與 45 條只有 Graphify 支持的關係,必須使用不同規則處理。方案 A 會產出四份可審核清單:多概念拆分、完全重複合併、同來源分類、跨來源複核;AI 只提案,不直接寫入資料庫。

方案 B:完全交給 Graphify 多輪分析

把文章分成多批,以深度模式重複分析,再合併各輪提出的語意關係。

  • 優點:較容易找到文字不相似、但意義相關的文章。
  • 限制:2,719 篇的分析成本高;分批方式會影響結果,較難重現與追查誤連。

方案 C:只在使用者搜尋時臨時找相似文章

只有使用者搜尋時才臨時找相似文章並整理搜尋結果,平常不保存整張關聯圖。

  • 優點:最快上線,不需維護完整關聯圖。
  • 限制:看不到全體品質、文章群組與資料變化;每次搜尋都要重算,也無法持續管理可疑關係。

七、多概念 KB 與 KB 合併處理辦法

這章直接回答兩件事:如何把一篇多概念 KB 拆成數篇可獨立檢索的單一概念 KB;以及什麼條件全部成立時,兩篇 KB 才能安全合併。
唯一處理順序:先拆、再比、後併。先讓每篇 active KB 只剩一個核心問題,再比較是否重複。Graphify 的連線與相似分數只負責產生候選及安排審核順序,不具備自動拆分、合併或刪除權限。

7.1 一眼看懂:拆分與合併是兩條不同管線

處理管線啟動條件必須產出最後狀態
KB 拆分一篇文章可改寫成兩個以上、能被分開搜尋且能各自完整回答的問題每個子 KB 的單一問題、完整答案、原文段落、共同限制與來源追溯子 KB 分別啟用;原文改為不可檢索的來源容器或導覽頁,不刪除
KB 合併兩篇已經是單一概念 KB,且「同意圖、答案等價、適用條件相同、無衝突」四項全部通過正式主文章、搜尋別名、舊 UUID 轉址、合併證據與回滾版本一篇 canonical KB 啟用;其餘文章停止被檢索但保留轉址與歷史
只建立關聯主題相關,但回答的問題、操作階段或條件不同相關文章連結與關聯理由兩篇都保持獨立,不合併
硬性禁止:不可以把「同一社群」、「有一條線」、「標題很像」或「相似分數高」直接當作合併理由。只要兩篇在產品、功能、角色、平台、地區、語言、版本、有效期間、資格、金額、步驟或例外條件任一項不同,就先保持分開。

7.2 用本次真實資料說明判斷方式

實際文章配對/標題本圖訊號具體判定原因
「618年中最大狂歡檔活動時間為何?」對同標題同內容文章總分 1.000;標題、正文、分類皆 1.000完全重複合併候選先核對有效期間與適用對象;一致後選一篇正式主文章。注意:59 是配對數,若三篇互相重複會形成多個配對,不能直接當成 59 次合併。
「月榜統計到何時?」對「週榜統計到何時?」總分 0.711;正文 0.661保留兩篇並互相關聯「月榜」與「週榜」的統計週期不同,即使句型與答案結構接近,也不是同一概念。
「如何使用彈幕喇叭(獨佔頭條)功能」對「如何使用全站喇叭功能」總分 0.816;標題 0.908功能別複核,不直接合併名稱顯示可能是不同產品功能;必須比較操作、權限與適用範圍,四項條件全相同才可合併。
「禮物送出後可以收回嗎?如何贈送禮物?」一個標題包含兩個可獨立搜尋的問句多概念拆分候選拆成「如何贈送禮物」與「送出後能否撤回/退款」兩篇單一概念 KB;原文保留作來源。
「Apple 扣款訂閱未生效」對「儲值後申請退款」Graphify 提出關係,但全域總分僅 0.013預設拒絕此關係,送人工確認標題、正文與分類都缺乏第二證據;在人工找到直接內容證據前,不得合併或建立正式相關連結。

7.3 KB 拆分判定:什麼叫「一個核心概念」

一個核心概念=一種使用者目的+一個要解決的問題+一組不可分割的適用條件。審核時不要用段落數或文章長度判斷,而是依下列測試逐項判定。

判定測試通過「需要拆分」的明確條件例子
獨立提問測試內容可改寫成兩個以上自然、互不相同的使用者問題「如何贈送禮物?」與「禮物送出後能否收回?」是兩個問題
獨立回答測試移除其中一段後,其他問題仍有完整答案;兩段不互為必要步驟贈送步驟拿掉退款規則後仍可完整回答,因此可拆
獨立檢索測試使用者可能只搜尋其中一個問題,不會合理期待另一個答案搜尋「排行榜資格」的人不一定在找「領獎流程」
條件邊界測試不同段落具有不同產品、角色、平台、版本、期間、資格或例外iOS 訂閱與 Android 儲值若流程不同,必須分開

符合任一項即可列入 SPLIT_REVIEW,但必須由人工核准後才拆。Graph 上跨多個社群、標題含多個問號、正文有多個 FAQ 小節,可用來優先找候選,但不能取代上述內容判定。

下列情況不要拆:同一任務的連續操作步驟;不寫就會導致答案錯誤的前置條件;同一問題共同適用的限制與例外;短到單獨存在就無法理解的補充說明。這些內容應留在同一篇,使用小標題整理即可。

7.4 KB 拆分機制:從原文到可上線子 KB

  1. 鎖定來源版本。記錄原 UUID、來源網址、版本、更新時間與內容雜湊;處理期間原文維持唯讀,避免審核途中內容漂移。
  2. 列出概念清單。把文章改寫成「一行一個使用者問題」;每個問題都要標出對應原文段落,不得憑空補答案。
  3. 合併同一問題內的必要內容。操作步驟、前置條件、限制和例外若共同服務同一問題,放進同一子 KB,不再切碎。
  4. 複製共同適用條件。若日期、資格或平台限制同時約束多個子概念,必須明確帶到每篇子 KB,不能只留在原文。
  5. 產生子 KB 草稿。每篇固定包含:單一問題式標題、直接答案、必要步驟、適用條件、例外、來源與原文段落位置。
  6. 人工逐篇核准。檢查「答案是否自足、限制是否遺漏、子 KB 是否互相重疊」;任一項失敗就退回重拆。
  7. 非破壞式發布。核准的子 KB 才進入檢索;原文章改為來源容器或子文章導覽頁,不再作為直接回答,但保留追溯與回滾。
每篇子 KB 的必要欄位/內容驗收方式
唯一的核心問題標題只能回答一個「如何/是否/何時/誰可以/多少」問題;不能再出現第二個獨立問句
自足答案不開原文也能得到完整答案;不得只寫「請參考上文」
適用條件與例外產品、角色、平台、地區、版本、有效期間、資格、金額與例外均已保留或明確標示不適用
來源追溯可從子 KB 回查原 UUID、原文段落與內容版本
與其他子 KB 的邊界彼此不重複回答同一問題;若只是相關,使用相關文章連結
拆分完成的判定:每篇子 KB 都能被單獨搜尋、單獨顯示、單獨回答、單獨更新;任何一項做不到,就表示拆分邊界仍不正確。

7.5 KB 合併判定:四道閘門必須全部通過

合併閘門必須通過的具體條件失敗時怎麼做
1. 同一使用者意圖兩篇解決的是同一個問題與同一個完成目標;不能只是同主題、同活動或同功能家族不同問題 → 保持兩篇,必要時建立相關文章連結
2. 答案等價主要結論、操作步驟及結果一致;使用任一篇都不會得到不同做法步驟或結論不同 → 禁止合併,送內容負責人確認
3. 適用條件相同產品、功能、角色、平台、地區、語言、版本、期間、資格及金額均相同或可證明不影響答案任一條件不同/未知 → 保持版本化文章,不得猜測
4. 沒有內容衝突日期、數字、權限、限制、例外與政策沒有矛盾;引用來源也未互相否定有衝突 → 先決定哪個來源有效,再談取代或合併
合併公式:可合併=同一意圖 AND 答案等價 AND 適用條件相同 AND 無衝突 AND 人工核准。五項缺一不可;相似分數不在公式內。

7.6 KB 合併機制:候選群組、主文章與舊文章怎麼處理

  1. 先組群,不逐條直接合併。把完全相同或高度相似的連線轉成候選群組;同一篇出現在多條配對時只審一次,避免 A→B、B→C 後重複處理。
  2. 先確認每篇都是單一概念。群組中任何一篇仍含多概念,就移回拆分管線;完成拆分後才能重新比較。
  3. 逐篇套用四道閘門。每項都要引用兩篇原文的對應句;未知資料一律視為未通過,不允許 AI 自行推測。
  4. 選 canonical KB。依序採用:仍有效的權威來源 > 適用條件最明確 > 答案與例外最完整 > 更新日期較新 > 既有連結較穩定。排除過期、衝突或來源不明文章。
  5. 組成正式內容。主答案以 canonical KB 為底,只加入已核實且不衝突的必要資訊;其他文章標題與問法保存為搜尋別名,不把不同條件硬塞進同一答案。
  6. 非破壞式切換。canonical KB 維持 active;其他舊文章停止進入檢索並以舊 UUID 轉址到 canonical KB,來源、版本與合併紀錄永久保留,不硬刪除。
  7. 重新索引、測試、再發布。用所有舊標題、舊問法和舊 UUID 驗證;任一查詢找不到正確答案、轉址失效或限制遺漏,就中止發布並回滾。
合併後必須成立明確驗收條件
只有一篇正式答案同一核心概念只能有一篇 active canonical KB;舊文章不得繼續參與答案檢索
舊入口不失效每個舊 UUID/URL 都能導向 canonical KB,且不能形成循環轉址
舊問法仍找得到所有被合併文章的標題與常見問法都成為搜尋別名,回歸測試必須命中 canonical KB
資訊沒有遺失有效的步驟、限制與例外已逐項核對;不相容條件仍保留獨立文章
完整可回滾保留合併前內容、群組成員、核准人、時間與版本;可一次恢復全部舊文章
不應合併的典型情況:月榜與週榜、不同產品功能、iOS 與 Android 流程不同、新舊政策並存、不同國家/語言版本、相同問題但資格或金額不同、同主題但一篇講資格另一篇講操作。這些情況應保持獨立,使用版本標記或相關文章連結。

7.7 最終決策只有六種,不使用模糊答案

決策代碼唯一含義允許的後續動作
SPLIT_REVIEW單篇含多個可獨立回答的核心問題產生子 KB 草稿,等待人工核准
MERGE_EXACT_REVIEW內容完全相同,四道閘門待確認加入重複群組,核准後選 canonical KB
MERGE_SEMANTIC_REVIEW文字不同但疑似同意圖、同答案逐項驗證四道閘門,人工核准前不合併
KEEP_RELATED主題相關但回答不同問題保持獨立,只建立相關文章連結
KEEP_VERSIONED意圖相同但條件、版本或期間不同保持獨立,明確標示適用版本
KEEP_SEPARATE/REJECT_EDGE不應合併,或關聯證據不足維持原狀;必要時移除錯誤關聯

八、建議執行計畫

這章在做什麼:明確定義每批資料如何分流、AI 必須收到哪些欄位、必須回傳什麼結果,以及哪些動作一定要人工核准。這是可實作規格;本報告沒有執行任何資料庫寫入。

8.1 分批順序與實際產出

順序處理範圍要做什麼產出
P0全部 2,719 篇確認每篇是否只涵蓋一個可獨立回答的概念split_review.csv:原 UUID、建議子概念、原文範圍、拆分理由
P059 組完全相同內容先把互相重複的配對合成「重複群組」,再核對適用條件與正式主文章;不能把 59 組配對直接當成 59 次合併exact_merge_review.csv:群組成員、主文章、轉址清單、條件差異
P11,066 條同來源關係區分重複、舊版本、不同 FAQ 與互補內容合併/保留/相關連結清單
P1554 條跨來源關係套用同意圖、答案等價、條件相同、無衝突四項檢查跨來源合併審核清單
P245 條只有 Graphify 支持的關係人工確認是真正的隱性關聯或錯誤連結接受/拒絕紀錄

8.2 每個文章配對的固定路由規則

條件系統狀態後續動作
一篇含兩個以上可獨立回答的意圖SPLIT_REVIEW產生拆分草稿;內容人員逐篇核准
內容完全相同,且語言、受眾、時效與適用產品相同MERGE_EXACT_REVIEW加入重複群組,選正式主文章;仍需批次核准
總分 ≥ 0.60,但不是完全相同PAIR_VERIFY交給 AI 做四項檢查;不得直接合併
總分 0.30–0.60REVIEW_RELATED_OR_DUPLICATEAI 提供證據後,由人工判斷是重複、相關或不相關
只有 Graphify 支持、總分 < 0.30,且找不到直接引用證據REJECT_EDGE預設拒絕關係;人工可用明確證據覆寫
意圖相同但日期、資格、金額、版本或答案衝突KEEP_VERSIONED保持分開,標明適用版本;先解決內容衝突
主題相關但回答不同問題KEEP_RELATED保持兩篇,僅建立「相關文章」連結

8.3 AI 必須收到的輸入

  • 文章 A/B 的 UUID、標題、完整答案,以及命中相似的正文片段。
  • 來源頁、來源識別碼、語言、受眾、產品、有效日期與最後更新時間;缺少的欄位必須標記為未知,不能自行猜測。
  • 標題、正文、分類三個分數;是否完全相同、是否同來源、是否為 Graphify 提出的關係。
  • 如果是多概念檢查,必須提供完整文章與段落位置,不能只看標題。

8.4 AI 必須回傳的固定 JSON

{
  "decision": "MERGE_EXACT_REVIEW | MERGE_SEMANTIC_REVIEW | SPLIT_REVIEW | KEEP_RELATED | KEEP_VERSIONED | KEEP_SEPARATE | REJECT_EDGE",
  "same_intent": true,
  "answer_equivalent": false,
  "same_applicability": false,
  "contradictions": [
    {"field": "effective_period", "article_a": "...", "article_b": "..."}
  ],
  "evidence": [
    {"article_uuid": "...", "quote": "來源原句", "supports": "判斷項目"}
  ],
  "split_concepts": [
    {"intent": "單一問題", "source_span": "段落位置", "answer_scope": "必要答案範圍"}
  ],
  "canonical_recommendation": {"uuid": "...", "reason": "..."},
  "needs_human_approval": true
}
輸出無效條件:缺少原文引用、適用條件未知卻判定可合併、沒有列出衝突,或回傳 needs_human_approval=false,全部視為不合格並退回重審。

8.5 誰可以做什麼

角色可以做不可以做
AI/Graphify分類、引用證據、提出拆分/合併/保留建議、建議正式主文章直接更新、刪除、拆分或合併資料庫內容
內容審核人員核准單一概念拆分、答案等價、適用條件與正式主文章在沒有原文證據時只依分數核准
工程人員只執行已核准批次、建立轉址、重新索引、保存版本與回滾點自行變更內容判定
QA用原問題與別名驗證搜尋、答案引用、舊 UUID 轉址與回滾略過衝突或失效連結

8.6 正式主文章怎麼選

  1. 先排除已過期、條件不明或答案有衝突的文章。
  2. 優先選權威來源且仍有效的文章。
  3. 再比較答案是否完整包含步驟、限制、日期、資格與例外。
  4. 條件相同時選更新日期較新、既有引用較穩定者;保留其他文章標題作搜尋別名。

8.7 每筆處理紀錄必須保留

  • 兩篇文章的 UUID、來源、版本與內容雜湊。
  • 判定為重複、版本變體、相關文章或不相關的理由與證據。
  • 人工審核人、時間、結果及正式主文章 UUID。
  • 拆分/合併前後內容與轉址資訊,確保可以回滾。

8.8 驗收標準

  • 每篇啟用中的 KB 只回答一個主要概念。
  • 沒有任何文章只因相似分數高就被自動合併。
  • 合併後舊 UUID 仍能導向正式主文章,且來源與歷史可追溯。
  • 建立至少 200 組人工答案集:完全重複、同意圖、相關但不可合併、完全無關各 50 組;合併建議準確率至少 90%,跨大分類誤連率不超過 5%。
  • Graphify 圖檔維持找不到端點 0、自己連自己 0、重複關係 0。
  • 發布前通過檢索回歸測試;異常時能切回上一版本。

九、附錄與交付物

詳細文章樣本預設收合,需要時再展開,不干擾主要結論。

查看:不同來源之間、分數較高的相似文章配對

用來優先找跨來源重複或同概念文章;分數高仍不代表一定可以合併。

文章 A文章 B整體相似分數標題相似度正文相似度分類相似度關係由何者提出
誰可以參加誰可以參加0.8381.0000.4940.933全域模型
如何使用「彈幕喇叭(獨佔頭條)」功能如何使用「全站喇叭」功能0.8160.9080.5531.000全域模型
月新生代爭霸戰活動?月新生代爭霸戰?0.7330.8090.4940.933全域模型
決賽決賽0.7321.0000.5680.074全域模型
神皇等級有哪些專屬特權?神皇等級有哪些新增專屬特權?0.7240.9850.1091.000全域模型
決賽決賽0.7171.0000.5190.077全域模型
月榜統計到何時?週榜統計到何時?0.7110.8170.6610.423全域模型
決賽決賽0.7031.0000.4680.084全域模型
虛擬形象重複的服飾可以售出(拆解)嗎?虛擬形象重複的服飾可以轉送嗎?0.6860.8280.5220.492全域模型
葡萄的獲得方式是什麼?紅木的獲得方式是什麼?0.6790.9460.4340.189全域模型
如何隱藏爵位?如何隱藏我的爵位?0.6730.7570.7970.118全域模型
為什麼我不能贈送特權禮物?為什麼我不能贈送家族禮物?0.6560.9300.3720.220全域模型
VIP幸運抽抽樂抽中獎勵後該如何領取?VIP幸運抽抽樂抽中獎勵後該如何領取?0.6561.0000.1770.356全域模型
誰可以參加誰可以參加0.6491.0000.2920.075全域模型
虛擬形象時尚值是什麼?虛擬形象是什麼? 虛擬形象可以幹麻?0.6300.7550.4730.484全域模型
如何獲得虛擬形象的服飾與裝扮?如何獲得虛擬形象的貝殼?0.6280.8380.2810.555全域模型
誰可以參加誰可以參加0.6261.0000.2190.070全域模型
貴族隱藏貴族如何關閉0.6230.3300.9731.000全域模型
如何轉接真人客服?如何轉接真人客服?0.6211.0000.1690.138全域模型
貴族選票如何領取?貴族選票如何領取?0.6181.0000.1790.095全域模型
查看:連結最多的文章

連結多可能是核心概念,也可能只是重複副本;目前前幾名由 618 活動副本群主導。

KB 文章標題連到幾篇其他文章
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?17
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
618年中狂歡檔與端午加碼活動的活動時間為何?16
查看:非直觀但可能相關的文章

這些配對是人工探索線索,不是合併清單。

文章 A關係類型文章 B證據屬性
活動期間如何使用貴族選票?semantically_similar_to活動期間貴族選票未使用會怎樣?INFERRED
沁涼小舖semantically_similar_to沁涼小舖活動中花火的火箭角色是什麼動物?INFERRED
在VIP幸運抽抽樂中獎後該如何向客服兌換獎勵?semantically_similar_to如何參與VIP幸運抽抽樂並兌換獎勵?INFERRED
送禮時禮物特效沒有顯示出來該如何處理?semantically_similar_to送禮物時沒有顯示特效該如何處理?INFERRED
生日跑馬燈要如何兌換與設定?semantically_similar_to生日跑馬燈的內容為何?INFERRED
生日跑馬燈要如何兌換與設定?semantically_similar_to生日跑馬燈設定後,若因主播晚開播而錯過,是否可以重新設定?INFERRED
如何累積追夢分?semantically_similar_to活動期間如何累積追夢分?INFERRED
曝光獎勵有哪些條件?semantically_similar_to計程車曝光獎勵有什麼限制?INFERRED

交付物

資料保護:文章原文與保存快照留在 git-ignored reports/;HTML 只呈現統計與必要樣本。若對外發布,仍須依組織資料政策確認 Graph JSON、文章標題及關聯樣本的公開範圍。