一、結論摘要
2,719
本次分析的 KB 文章數(每篇算 1 個節點)
1,620
系統找出的相似關係數(需審核,不等於可合併)
一句話結論:2,719 篇 KB 必須整理成「一篇 active KB=一個主要概念」。Graphify 找到的 1,620 條相似邊只用來找出待拆分、待合併及應互相關聯的候選,不能直接把相連文章全部合併。
五個重點結論
- 59 組完全相同內容 → 第一批合併候選。先確認語言、受眾、時效與適用條件相同,再選一篇作為正式主文章(canonical KB);其他舊文章保留轉址,不直接刪除。
- 1,066 條同來源相似關係 → 先拆概念,不是全部合併。同一來源頁可能展開多個 FAQ;每個可獨立搜尋、獨立回答的意圖都應成為一篇單一概念 KB,並保留與原始來源的關係。
- 554 條不同來源間的相似關係 → 逐對判斷。只有同意圖、答案等價、適用條件相同且無衝突才能合併;只是相關或互補,就保留兩篇並建立「相關文章」連結。
- 1,755 篇沒有安全相似邊 → 保持獨立。沒有關聯證據不代表品質差,也不應為了提高覆蓋率強行合併。
- Graphify 原先提出 48 條語意關係,只有 3 條獲第二種方法支持 → 其餘 45 條只進人工複核。沒有第二證據前不得合併、刪除或更換正式主文章。
處理原則:多概念先拆、重複再併、互補只連結、衝突先解決。具體判斷規則見
第七章,執行順序見
第八章。
快照聲明:本報告依指定的 2,719 筆保存快照執行;交付前 live test collection 已是 2,708 筆。兩個集合沒有混算,報告中的相似圖只代表 2,719 快照。
閱讀指南:每個數字到底代表什麼
先記住:這份報告是在找「哪些 KB 可能需要拆分、合併或互相關聯」。數字越大不代表內容越好,也不代表可以自動合併;它只表示值得優先檢查。
| 報告用語 | 白話意思 | 正在衡量什麼 | 應該怎麼使用 |
| 節點(Node) | 一篇 KB 文章 | 這次總共分析多少文章 | 本報告固定為 2,719 篇,不代表概念數 |
| 相似邊(Edge) | 兩篇 KB 之間的一條「可能相似」連線 | 系統找到多少文章配對值得審核 | 不能直接當成合併指令;需判斷 duplicate、related 或誤連 |
| 候選配對(Candidate pair) | 初步拿來比較的兩篇文章 | 相似篩選前的檢查範圍 | 只有通過門檻與證據規則才成為最終相似邊 |
| 相似分數(0–1) | 標題、正文與分類有多接近 | 排序用的相似程度;1 最接近、0 最不接近 | 不是正確率或可合併機率,仍要檢查答案與適用條件 |
| 門檻(Threshold) | 最低要多相似才保留 | 嚴格程度;越高保留越少,通常誤連也較少 | 本報告 0.30 是探索門檻,不是自動合併門檻 |
| 涵蓋率(Coverage) | 有找到至少一篇相似文章的 KB 比例 | 圖有涵蓋多少文章 | 涵蓋率低不一定是錯;獨特 KB 本來就可能沒有相似文章 |
| 孤立 KB(Isolate) | 目前沒有安全相似連線的文章 | 沒有足夠雙重證據的 KB 數量 | 先保持獨立,不要為了連線而強行合併 |
| 相連群組(Component) | 彼此有路徑可連到的一群文章 | 整張圖被分成多少個互不相連區塊 | 用來看知識是否分散;不是正式分類 |
| 主題社群(Community) | Graphify 判斷內部關係較密切的一群 KB | 可能的主題群或 FAQ 群 | 用於發現整理單位,仍需人工命名與確認 |
| 連結數(Degree) | 一篇 KB 連到幾篇其他文章 | 該文章在圖中有多少相似關係 | 高連結可能是核心概念,也可能只是大量重複副本 |
| 群內緊密度(Cohesion) | 同一社群內的文章互相連得多不多 | 0–1 的群組緊密程度 | 高分表示群內連結集中,不代表內容品質較高 |
| Graphify anchor | Graphify 原先推論的一條語意關係 | 非純文字相似、可能較隱性的關聯 | 沒有第二證據時只能進 review,不能自動改資料 |
| Canonical KB | 同一概念最後保留的正式主文章 | 合併後哪一篇是唯一 active 版本 | 其他舊 UUID 透過 redirect 指向它,不硬刪除 |
二、範圍、定義與方法
這章在做什麼:說明 2,719 篇文章從哪裡來,以及系統如何把標題、正文、分類轉成可比較的訊號。這是方法說明,不是合併結果。
資料與工具
| 環境 | test Weaviate 保存快照;唯讀 |
| 文章 | 2,719 |
| 不同來源頁/文件數(source_id) | 2,193 |
| Graphify | 官方 graphifyy 0.9.63 |
| 全域特徵維度 | 119,113 |
| LLM 成本 | 新增全域相似層為 deterministic,0 tokens;48 anchors 沿用既有 Graphify 結果 |
| 產生時間 | 2026-09-22T11:01:27+08:00 |
相似度不是什麼
- 不是「可以刪除」或「可以合併」的直接證明。
- 不是向量資料庫;特徵只用於離線候選生成,輸出是可稽核的靜態 graph edges。
- 同 source_id 不代表重複,同標題也不一定代表同答案。
- Graphify INFERRED edge 是探索假設;EXTRACTED 才表示來源中有直接證據。
- 每篇文章在圖上只算一個點。由保存快照建立 2,719 個文章節點,保留文章識別碼、來源文件、版本、分類與來源網址。
- 三層特徵。標題字元 n-gram 權重 0.55、正文 0.30、分類/labels 0.15;各層先 L2 normalize。
- 找出初步可能相似的文章。每篇先取最接近的 24 篇,得到 43,308 個不重複候選配對;另外一定納入 59 個內容完全相同的配對。
- 只保留有足夠證據的關係。總分至少 0.30,而且雙方都要把對方列入前 10 名,或相似度達強門檻 0.82;標題、正文、分類至少兩項要能互相支持。
- 合併 Graphify anchors。把原始 48 條
semantically_similar_to 邊保留並標記來源,不以低文字分數擅自刪除。
- Graphify 整理關聯圖。找出主題社群、計算群內緊密度與連結最多的文章,檢查圖檔錯誤,並產生互動式 HTML 報告。
三、相似關係是怎麼篩選的:候選、門檻與分數
這章在做什麼:顯示門檻提高或降低時會保留多少相似關係。目的是選擇合理的審核範圍,不是在決定哪些 KB 自動合併。
初步候選的相似分數分布
所有初步比較配對的分數;P50 表示一半候選低於此分數。
最後保留關係的相似分數分布
通過規則後的 1,620 條關係;低分可能是保留的 Graphify anchor。
門檻敏感度
相同 mutual/雙證據規則下,降低 threshold 會增加覆蓋,也會納入更多弱推論。選擇 0.30 是探索報告的折衷,不代表可以自動執行內容合併。
| 最低相似門檻 | 會保留的關係數 | 有關聯的文章數 | 文章涵蓋率 | 本報告是否採用 |
|---|
| 0.25 | 1,873 | 1,167 | 42.92% | |
| 0.30 | 1,620 | 964 | 35.45% | 採用 |
| 0.35 | 1,408 | 758 | 27.88% | |
| 0.40 | 1,232 | 596 | 21.92% | |
| 0.45 | 789 | 461 | 16.95% | |
| 0.50 | 508 | 369 | 13.57% | |
| 0.55 | 424 | 292 | 10.74% | |
| 0.60 | 372 | 243 | 8.94% | |
| 0.65 | 332 | 197 | 7.25% | |
| 0.70 | 307 | 167 | 6.14% | |
關係信心等級
信心等級是系統給關係的審核優先序,不是「有幾成正確」。
| 信心等級 | 關係數 | 占全部關係比例 |
|---|
| 0.55 | 1,248 | 77.04% |
| 0.65 | 66 | 4.07% |
| 0.75 | 18 | 1.11% |
| 0.85 | 53 | 3.27% |
| 0.95 | 235 | 14.51% |
解讀:0.55 有 1,248 條,明確代表弱推論;高分區大量來自同來源的重複/近重複內容。分數是排序與複核依據,不是事實機率。
四、Graphify 關聯圖結果:文章形成哪些群組
這章在做什麼:把相似關係放成一張圖,觀察文章分成多少群、最大群有多大,以及哪些關係來自同一來源。群組是整理線索,不是新的正式 taxonomy。
4.1 關聯圖上的點、線、顏色與箭頭代表什麼
| 畫面元素 | 實際代表 | 對應用途 | 不能這樣解讀 |
| 一個圓點 | 一篇 KB 文章,共 2,719 個 | 點擊後查看文章標題、主題社群、來源檔、連結數與相鄰文章 | 不是一個抽象概念;一篇多概念文章目前仍只是一個點 |
| 圓點顏色 | Graphify 分配的主題社群 | 把可能屬於同一主題的文章放在一起檢查 | 顏色不是正式分類;社群多達 2,028 個,色盤會重複,必須看左側社群名稱 |
| 圓點大小 | 該文章連到其他文章的數量 | 快速找到重複群、熱門模板或可能的核心文章 | 圓點大不等於內容重要;618 副本就是被重複數量放大 |
| 圓點標題 | KB 標題;小節點為避免畫面擁擠可能不直接顯示 | 用搜尋或點擊節點查看完整標題 | 看不到文字不代表文章不存在 |
| 細虛線 | 1,593 條模型推論關係(INFERRED) | 提供待審核的相似或相關候選 | 不是已證實的重複,也不能直接合併 |
| 較粗實線 | 27 條具直接證據屬性的關係(EXTRACTED) | 優先檢查證據與適用條件 | 有直接證據仍不等於答案完全相同 |
| 線上的箭頭 | Graphify HTML 匯出時記錄的 source → target 顯示方向 | 只用來定位線的兩端 | 不代表因果、上下層、主文章方向或合併方向;本次圖分析按無向關係處理 |
| 線的粗細/透明度 | 區分 EXTRACTED 與 INFERRED 的視覺樣式 | 快速辨認證據屬性 | 不是相似分數高低;實際分數要看報告或 Graph JSON |
4.2 每條連線背後的欄位與對應功能
互動圖把所有線統一顯示為 semantically_similar_to,方便看拓撲;真正決定處理方式的是下列欄位組合,而不是線本身。
| 連線欄位 | 意思 | 治理功能 |
similarity_score | 標題、正文與分類加權後的整體相似分數 | 排審核順序;不能單獨決定合併 |
title_similarity | 兩篇標題的文字接近程度 | 找相同問法或改寫問法;要防止「如何處理」等模板句誤連 |
body_similarity | 兩篇答案正文的文字接近程度 | 協助確認答案是否重複;仍要檢查日期、金額與例外 |
metadata_similarity | 分類與標籤的接近程度 | 確認是否可能屬於同一主題;分類碎片化時只能當輔助 |
exact_content=true | 正文內容完全相同,本圖共有 59 組配對 | 送入完全重複合併審核;先把配對合成重複群組 |
same_source_id=true | 兩篇來自同一來源頁/文件,本圖共有 1,066 條 | 辨識同頁 FAQ、歷史版本與副本;不能假設全部重複 |
same_source_id=false | 兩篇來自不同來源,本圖共有 554 條 | 找跨來源重複或相關文章,需通過四項合併檢查 |
mutual_neighbor=true | 雙方都把對方列入前 10 名相似文章,共 1,483 條 | 降低單向熱門模板造成的誤連;仍不是合併證明 |
graphify_semantic_anchor=true | 原 Graphify 提出的語意關係,共 48 條 | 找可能的隱性關聯;其中 45 條缺少全域模型第二證據,必須複核 |
selected_by_global_similarity=true | 通過全域文字/分類與安全閘門 | 表示至少具多項可重現證據;不代表人工已核准 |
4.3 互動功能怎麼用
| 操作 | 畫面會做什麼 | 最適合回答的問題 |
| 左上搜尋框輸入 KB 標題關鍵字 | 最多顯示前 20 個標題相符節點;點結果會放大並置中 | 「這篇 KB 周圍有哪些可能重複或相關文章?」 |
| 點擊一個節點 | 左側顯示標題、文件類型、主題社群、來源檔、連結數與鄰居清單 | 「這篇文章屬於哪個群?為什麼看起來是中心節點?」 |
| 點擊鄰居清單中的文章 | 直接跳到該鄰居並更新詳細資訊 | 沿著一組疑似重複/相關文章逐篇檢查 |
| 滑鼠停在線上 | 顯示 semantically_similar_to [INFERRED/EXTRACTED] | 快速確認這條線是推論或直接證據屬性 |
| 左側社群勾選框 | 顯示或隱藏該主題社群;Select All 可全部顯示/隱藏 | 集中檢查單一主題,降低 2,719 篇同時顯示的干擾 |
| 滾輪縮放、拖曳空白畫布 | 放大局部或移動畫面;初始力導向排版完成後位置固定 | 查看密集重複群與孤立文章的空間分布 |
目前互動圖的限制:節點資訊面板不直接顯示總分、三項分數、完全相同、同來源或 Graphify anchor。要判定是否拆分/合併,必須回到本報告的案例與規則,或查看
Graph JSON;不能只看線的外觀。
4.4 建議的圖上審核流程
- 用搜尋框找到要檢查的 KB,點擊節點查看社群與鄰居。
- 先看節點是否因大量同標題副本而變大;不要直接把大節點當正式主文章。
- 對每個鄰居查核
exact_content、來源是否相同、三項相似分數與證據來源。
- 依第七章判定為:拆分、完全重複合併、語意重複合併、保持版本、保持相關或拒絕關係。
- 把結果送入第八章的人工核准流程;互動圖本身不執行任何資料修改。
4.5 文章群組大小與連結程度
| 每篇平均/中位連到幾篇文章 | 1.192/0 |
| 單篇最多連到幾篇文章 | 17 |
| 只有 1 篇文章的社群 | 1,755 |
| 少於 3 篇文章的小社群 | 1,925 |
| 群內緊密度平均/中位數(0–1) | 0.9834/1.0000 |
4.6 連線組成統計
| 雙方都把對方列為前 10 名相似文章 | 1,483(91.54%) |
| 正文內容完全相同的配對 | 59 |
| 來自同一來源頁/文件的關係 | 1,066(65.80%) |
| 來自不同來源頁/文件的關係 | 554(34.20%) |
| 大分類相同/中分類相同 | 1,210/1,083 |
| 模型推論關係/來源直接證據關係 | 1,593/27 |
查詢內容量估算:原始內容約 135,950 字、粗估 181,266 tokens;透過關聯圖查詢時平均只需讀取約 233 tokens,預估少讀約 778 倍。這是內容量估算,不是答案品質提升 778 倍。
圖檔完整性檢查:2,719 篇文章/1,620 條關係;找不到文章端點的關係 0 條、自己連自己的關係 0 條、重複關係 0 條、未驗證文章 0 篇。Graphify 診斷通過。
五、問題點與確認結果
這章在做什麼:把圖表中看到的現象轉成可以採取行動的資料問題,並區分「已確認」與「仍待人工複核」。
| 問題 | 確認 | 證據 | 意義 |
| 同來源/重複內容支配關聯圖 | 已確認 | 1,066/1,620 條關係來自同一來源;連結最多的文章全為 618 副本 | 「連得多」不能直接解讀為內容最重要 |
| 原 Graphify anchor 缺少第二證據 | 已確認 | 48 條中僅 3 條同時被全域模型選中 | 其餘 45 條要人工或 LLM pair verifier 複核 |
| 大量文章沒有安全相似關係 | 已確認,但不等於錯誤 | 1,755 篇目前沒有連線 | 可能是內容獨特、標題過短或分類資訊不足 |
| 分類名稱太零碎 | 已確認 | 980 個中分類;551 個只用一次 | 分類資訊無法穩定協助判斷文章是否屬於同一概念 |
| 低門檻產生句型誤連 | 已確認並緩解 | 「該如何處理/是什麼意思」可製造高 title cosine | 已加入雙證據閘門;仍需 golden-set 校準 |
| live collection 已漂移 | 已確認 | 指定快照 2,719;目前 live 2,708 | 相似圖必須版本化,不能覆蓋來源快照 |
審核原則:45 條只有 Graphify 支持的關係,以及接近 0.30 門檻的配對,全部留在人工複核清單;主報告不重複展開逐筆樣本。
六、三個解決方案
這章在做什麼:比較三種後續治理方式。方案 A 能同時處理單一概念、重複合併、人工複核與版本回滾,因此是建議方案。
明確選擇方案 A。理由不是「AI 比較聰明」,而是目前同時存在 59 組完全相同內容、1,066 條同來源關係、554 條跨來源關係與 45 條只有 Graphify 支持的關係,必須使用不同規則處理。方案 A 會產出四份可審核清單:多概念拆分、完全重複合併、同來源分類、跨來源複核;AI 只提案,不直接寫入資料庫。
方案 A:固定規則找候選,再由 AI/人工複核 建議
第一層用固定、可重現的公式找出可能相似的文章;第二層才讓 Graphify/AI 審核不同來源、文字交集低或分數介於 0.30–0.60 的灰色地帶。完全重複、同來源版本與跨來源相似必須標記成不同關係。
- 優點:結果可重現、可處理新增文章、AI 使用量有限、保留判斷證據,也較容易控制誤連。
- 限制:需要先準備人工確認樣本,並維護一份待審清單。
方案 B:完全交給 Graphify 多輪分析
把文章分成多批,以深度模式重複分析,再合併各輪提出的語意關係。
- 優點:較容易找到文字不相似、但意義相關的文章。
- 限制:2,719 篇的分析成本高;分批方式會影響結果,較難重現與追查誤連。
方案 C:只在使用者搜尋時臨時找相似文章
只有使用者搜尋時才臨時找相似文章並整理搜尋結果,平常不保存整張關聯圖。
- 優點:最快上線,不需維護完整關聯圖。
- 限制:看不到全體品質、文章群組與資料變化;每次搜尋都要重算,也無法持續管理可疑關係。
七、多概念 KB 與 KB 合併處理辦法
這章直接回答兩件事:如何把一篇多概念 KB 拆成數篇可獨立檢索的單一概念 KB;以及什麼條件全部成立時,兩篇 KB 才能安全合併。
唯一處理順序:先拆、再比、後併。先讓每篇 active KB 只剩一個核心問題,再比較是否重複。Graphify 的連線與相似分數只負責產生候選及安排審核順序,不具備自動拆分、合併或刪除權限。
7.1 一眼看懂:拆分與合併是兩條不同管線
| 處理管線 | 啟動條件 | 必須產出 | 最後狀態 |
| KB 拆分 | 一篇文章可改寫成兩個以上、能被分開搜尋且能各自完整回答的問題 | 每個子 KB 的單一問題、完整答案、原文段落、共同限制與來源追溯 | 子 KB 分別啟用;原文改為不可檢索的來源容器或導覽頁,不刪除 |
| KB 合併 | 兩篇已經是單一概念 KB,且「同意圖、答案等價、適用條件相同、無衝突」四項全部通過 | 正式主文章、搜尋別名、舊 UUID 轉址、合併證據與回滾版本 | 一篇 canonical KB 啟用;其餘文章停止被檢索但保留轉址與歷史 |
| 只建立關聯 | 主題相關,但回答的問題、操作階段或條件不同 | 相關文章連結與關聯理由 | 兩篇都保持獨立,不合併 |
硬性禁止:不可以把「同一社群」、「有一條線」、「標題很像」或「相似分數高」直接當作合併理由。只要兩篇在產品、功能、角色、平台、地區、語言、版本、有效期間、資格、金額、步驟或例外條件任一項不同,就先保持分開。
7.2 用本次真實資料說明判斷方式
| 實際文章配對/標題 | 本圖訊號 | 具體判定 | 原因 |
| 「618年中最大狂歡檔活動時間為何?」對同標題同內容文章 | 總分 1.000;標題、正文、分類皆 1.000 | 完全重複合併候選 | 先核對有效期間與適用對象;一致後選一篇正式主文章。注意:59 是配對數,若三篇互相重複會形成多個配對,不能直接當成 59 次合併。 |
| 「月榜統計到何時?」對「週榜統計到何時?」 | 總分 0.711;正文 0.661 | 保留兩篇並互相關聯 | 「月榜」與「週榜」的統計週期不同,即使句型與答案結構接近,也不是同一概念。 |
| 「如何使用彈幕喇叭(獨佔頭條)功能」對「如何使用全站喇叭功能」 | 總分 0.816;標題 0.908 | 功能別複核,不直接合併 | 名稱顯示可能是不同產品功能;必須比較操作、權限與適用範圍,四項條件全相同才可合併。 |
| 「禮物送出後可以收回嗎?如何贈送禮物?」 | 一個標題包含兩個可獨立搜尋的問句 | 多概念拆分候選 | 拆成「如何贈送禮物」與「送出後能否撤回/退款」兩篇單一概念 KB;原文保留作來源。 |
| 「Apple 扣款訂閱未生效」對「儲值後申請退款」 | Graphify 提出關係,但全域總分僅 0.013 | 預設拒絕此關係,送人工確認 | 標題、正文與分類都缺乏第二證據;在人工找到直接內容證據前,不得合併或建立正式相關連結。 |
7.3 KB 拆分判定:什麼叫「一個核心概念」
一個核心概念=一種使用者目的+一個要解決的問題+一組不可分割的適用條件。審核時不要用段落數或文章長度判斷,而是依下列測試逐項判定。
| 判定測試 | 通過「需要拆分」的明確條件 | 例子 |
| 獨立提問測試 | 內容可改寫成兩個以上自然、互不相同的使用者問題 | 「如何贈送禮物?」與「禮物送出後能否收回?」是兩個問題 |
| 獨立回答測試 | 移除其中一段後,其他問題仍有完整答案;兩段不互為必要步驟 | 贈送步驟拿掉退款規則後仍可完整回答,因此可拆 |
| 獨立檢索測試 | 使用者可能只搜尋其中一個問題,不會合理期待另一個答案 | 搜尋「排行榜資格」的人不一定在找「領獎流程」 |
| 條件邊界測試 | 不同段落具有不同產品、角色、平台、版本、期間、資格或例外 | iOS 訂閱與 Android 儲值若流程不同,必須分開 |
符合任一項即可列入 SPLIT_REVIEW,但必須由人工核准後才拆。Graph 上跨多個社群、標題含多個問號、正文有多個 FAQ 小節,可用來優先找候選,但不能取代上述內容判定。
下列情況不要拆:同一任務的連續操作步驟;不寫就會導致答案錯誤的前置條件;同一問題共同適用的限制與例外;短到單獨存在就無法理解的補充說明。這些內容應留在同一篇,使用小標題整理即可。
7.4 KB 拆分機制:從原文到可上線子 KB
- 鎖定來源版本。記錄原 UUID、來源網址、版本、更新時間與內容雜湊;處理期間原文維持唯讀,避免審核途中內容漂移。
- 列出概念清單。把文章改寫成「一行一個使用者問題」;每個問題都要標出對應原文段落,不得憑空補答案。
- 合併同一問題內的必要內容。操作步驟、前置條件、限制和例外若共同服務同一問題,放進同一子 KB,不再切碎。
- 複製共同適用條件。若日期、資格或平台限制同時約束多個子概念,必須明確帶到每篇子 KB,不能只留在原文。
- 產生子 KB 草稿。每篇固定包含:單一問題式標題、直接答案、必要步驟、適用條件、例外、來源與原文段落位置。
- 人工逐篇核准。檢查「答案是否自足、限制是否遺漏、子 KB 是否互相重疊」;任一項失敗就退回重拆。
- 非破壞式發布。核准的子 KB 才進入檢索;原文章改為來源容器或子文章導覽頁,不再作為直接回答,但保留追溯與回滾。
| 每篇子 KB 的必要欄位/內容 | 驗收方式 |
| 唯一的核心問題 | 標題只能回答一個「如何/是否/何時/誰可以/多少」問題;不能再出現第二個獨立問句 |
| 自足答案 | 不開原文也能得到完整答案;不得只寫「請參考上文」 |
| 適用條件與例外 | 產品、角色、平台、地區、版本、有效期間、資格、金額與例外均已保留或明確標示不適用 |
| 來源追溯 | 可從子 KB 回查原 UUID、原文段落與內容版本 |
| 與其他子 KB 的邊界 | 彼此不重複回答同一問題;若只是相關,使用相關文章連結 |
拆分完成的判定:每篇子 KB 都能被單獨搜尋、單獨顯示、單獨回答、單獨更新;任何一項做不到,就表示拆分邊界仍不正確。
7.5 KB 合併判定:四道閘門必須全部通過
| 合併閘門 | 必須通過的具體條件 | 失敗時怎麼做 |
| 1. 同一使用者意圖 | 兩篇解決的是同一個問題與同一個完成目標;不能只是同主題、同活動或同功能家族 | 不同問題 → 保持兩篇,必要時建立相關文章連結 |
| 2. 答案等價 | 主要結論、操作步驟及結果一致;使用任一篇都不會得到不同做法 | 步驟或結論不同 → 禁止合併,送內容負責人確認 |
| 3. 適用條件相同 | 產品、功能、角色、平台、地區、語言、版本、期間、資格及金額均相同或可證明不影響答案 | 任一條件不同/未知 → 保持版本化文章,不得猜測 |
| 4. 沒有內容衝突 | 日期、數字、權限、限制、例外與政策沒有矛盾;引用來源也未互相否定 | 有衝突 → 先決定哪個來源有效,再談取代或合併 |
合併公式:可合併=同一意圖 AND 答案等價 AND 適用條件相同 AND 無衝突 AND 人工核准。五項缺一不可;相似分數不在公式內。
7.6 KB 合併機制:候選群組、主文章與舊文章怎麼處理
- 先組群,不逐條直接合併。把完全相同或高度相似的連線轉成候選群組;同一篇出現在多條配對時只審一次,避免 A→B、B→C 後重複處理。
- 先確認每篇都是單一概念。群組中任何一篇仍含多概念,就移回拆分管線;完成拆分後才能重新比較。
- 逐篇套用四道閘門。每項都要引用兩篇原文的對應句;未知資料一律視為未通過,不允許 AI 自行推測。
- 選 canonical KB。依序採用:仍有效的權威來源 > 適用條件最明確 > 答案與例外最完整 > 更新日期較新 > 既有連結較穩定。排除過期、衝突或來源不明文章。
- 組成正式內容。主答案以 canonical KB 為底,只加入已核實且不衝突的必要資訊;其他文章標題與問法保存為搜尋別名,不把不同條件硬塞進同一答案。
- 非破壞式切換。canonical KB 維持 active;其他舊文章停止進入檢索並以舊 UUID 轉址到 canonical KB,來源、版本與合併紀錄永久保留,不硬刪除。
- 重新索引、測試、再發布。用所有舊標題、舊問法和舊 UUID 驗證;任一查詢找不到正確答案、轉址失效或限制遺漏,就中止發布並回滾。
| 合併後必須成立 | 明確驗收條件 |
| 只有一篇正式答案 | 同一核心概念只能有一篇 active canonical KB;舊文章不得繼續參與答案檢索 |
| 舊入口不失效 | 每個舊 UUID/URL 都能導向 canonical KB,且不能形成循環轉址 |
| 舊問法仍找得到 | 所有被合併文章的標題與常見問法都成為搜尋別名,回歸測試必須命中 canonical KB |
| 資訊沒有遺失 | 有效的步驟、限制與例外已逐項核對;不相容條件仍保留獨立文章 |
| 完整可回滾 | 保留合併前內容、群組成員、核准人、時間與版本;可一次恢復全部舊文章 |
不應合併的典型情況:月榜與週榜、不同產品功能、iOS 與 Android 流程不同、新舊政策並存、不同國家/語言版本、相同問題但資格或金額不同、同主題但一篇講資格另一篇講操作。這些情況應保持獨立,使用版本標記或相關文章連結。
7.7 最終決策只有六種,不使用模糊答案
| 決策代碼 | 唯一含義 | 允許的後續動作 |
SPLIT_REVIEW | 單篇含多個可獨立回答的核心問題 | 產生子 KB 草稿,等待人工核准 |
MERGE_EXACT_REVIEW | 內容完全相同,四道閘門待確認 | 加入重複群組,核准後選 canonical KB |
MERGE_SEMANTIC_REVIEW | 文字不同但疑似同意圖、同答案 | 逐項驗證四道閘門,人工核准前不合併 |
KEEP_RELATED | 主題相關但回答不同問題 | 保持獨立,只建立相關文章連結 |
KEEP_VERSIONED | 意圖相同但條件、版本或期間不同 | 保持獨立,明確標示適用版本 |
KEEP_SEPARATE/REJECT_EDGE | 不應合併,或關聯證據不足 | 維持原狀;必要時移除錯誤關聯 |
八、建議執行計畫
這章在做什麼:明確定義每批資料如何分流、AI 必須收到哪些欄位、必須回傳什麼結果,以及哪些動作一定要人工核准。這是可實作規格;本報告沒有執行任何資料庫寫入。
8.1 分批順序與實際產出
| 順序 | 處理範圍 | 要做什麼 | 產出 |
| P0 | 全部 2,719 篇 | 確認每篇是否只涵蓋一個可獨立回答的概念 | split_review.csv:原 UUID、建議子概念、原文範圍、拆分理由 |
| P0 | 59 組完全相同內容 | 先把互相重複的配對合成「重複群組」,再核對適用條件與正式主文章;不能把 59 組配對直接當成 59 次合併 | exact_merge_review.csv:群組成員、主文章、轉址清單、條件差異 |
| P1 | 1,066 條同來源關係 | 區分重複、舊版本、不同 FAQ 與互補內容 | 合併/保留/相關連結清單 |
| P1 | 554 條跨來源關係 | 套用同意圖、答案等價、條件相同、無衝突四項檢查 | 跨來源合併審核清單 |
| P2 | 45 條只有 Graphify 支持的關係 | 人工確認是真正的隱性關聯或錯誤連結 | 接受/拒絕紀錄 |
8.2 每個文章配對的固定路由規則
| 條件 | 系統狀態 | 後續動作 |
| 一篇含兩個以上可獨立回答的意圖 | SPLIT_REVIEW | 產生拆分草稿;內容人員逐篇核准 |
| 內容完全相同,且語言、受眾、時效與適用產品相同 | MERGE_EXACT_REVIEW | 加入重複群組,選正式主文章;仍需批次核准 |
| 總分 ≥ 0.60,但不是完全相同 | PAIR_VERIFY | 交給 AI 做四項檢查;不得直接合併 |
| 總分 0.30–0.60 | REVIEW_RELATED_OR_DUPLICATE | AI 提供證據後,由人工判斷是重複、相關或不相關 |
| 只有 Graphify 支持、總分 < 0.30,且找不到直接引用證據 | REJECT_EDGE | 預設拒絕關係;人工可用明確證據覆寫 |
| 意圖相同但日期、資格、金額、版本或答案衝突 | KEEP_VERSIONED | 保持分開,標明適用版本;先解決內容衝突 |
| 主題相關但回答不同問題 | KEEP_RELATED | 保持兩篇,僅建立「相關文章」連結 |
8.3 AI 必須收到的輸入
- 文章 A/B 的 UUID、標題、完整答案,以及命中相似的正文片段。
- 來源頁、來源識別碼、語言、受眾、產品、有效日期與最後更新時間;缺少的欄位必須標記為未知,不能自行猜測。
- 標題、正文、分類三個分數;是否完全相同、是否同來源、是否為 Graphify 提出的關係。
- 如果是多概念檢查,必須提供完整文章與段落位置,不能只看標題。
8.4 AI 必須回傳的固定 JSON
{
"decision": "MERGE_EXACT_REVIEW | MERGE_SEMANTIC_REVIEW | SPLIT_REVIEW | KEEP_RELATED | KEEP_VERSIONED | KEEP_SEPARATE | REJECT_EDGE",
"same_intent": true,
"answer_equivalent": false,
"same_applicability": false,
"contradictions": [
{"field": "effective_period", "article_a": "...", "article_b": "..."}
],
"evidence": [
{"article_uuid": "...", "quote": "來源原句", "supports": "判斷項目"}
],
"split_concepts": [
{"intent": "單一問題", "source_span": "段落位置", "answer_scope": "必要答案範圍"}
],
"canonical_recommendation": {"uuid": "...", "reason": "..."},
"needs_human_approval": true
}
輸出無效條件:缺少原文引用、適用條件未知卻判定可合併、沒有列出衝突,或回傳 needs_human_approval=false,全部視為不合格並退回重審。
8.5 誰可以做什麼
| 角色 | 可以做 | 不可以做 |
| AI/Graphify | 分類、引用證據、提出拆分/合併/保留建議、建議正式主文章 | 直接更新、刪除、拆分或合併資料庫內容 |
| 內容審核人員 | 核准單一概念拆分、答案等價、適用條件與正式主文章 | 在沒有原文證據時只依分數核准 |
| 工程人員 | 只執行已核准批次、建立轉址、重新索引、保存版本與回滾點 | 自行變更內容判定 |
| QA | 用原問題與別名驗證搜尋、答案引用、舊 UUID 轉址與回滾 | 略過衝突或失效連結 |
8.6 正式主文章怎麼選
- 先排除已過期、條件不明或答案有衝突的文章。
- 優先選權威來源且仍有效的文章。
- 再比較答案是否完整包含步驟、限制、日期、資格與例外。
- 條件相同時選更新日期較新、既有引用較穩定者;保留其他文章標題作搜尋別名。
8.7 每筆處理紀錄必須保留
- 兩篇文章的 UUID、來源、版本與內容雜湊。
- 判定為重複、版本變體、相關文章或不相關的理由與證據。
- 人工審核人、時間、結果及正式主文章 UUID。
- 拆分/合併前後內容與轉址資訊,確保可以回滾。
8.8 驗收標準
- 每篇啟用中的 KB 只回答一個主要概念。
- 沒有任何文章只因相似分數高就被自動合併。
- 合併後舊 UUID 仍能導向正式主文章,且來源與歷史可追溯。
- 建立至少 200 組人工答案集:完全重複、同意圖、相關但不可合併、完全無關各 50 組;合併建議準確率至少 90%,跨大分類誤連率不超過 5%。
- Graphify 圖檔維持找不到端點 0、自己連自己 0、重複關係 0。
- 發布前通過檢索回歸測試;異常時能切回上一版本。
九、附錄與交付物
詳細文章樣本預設收合,需要時再展開,不干擾主要結論。
查看:不同來源之間、分數較高的相似文章配對
用來優先找跨來源重複或同概念文章;分數高仍不代表一定可以合併。
| 文章 A | 文章 B | 整體相似分數 | 標題相似度 | 正文相似度 | 分類相似度 | 關係由何者提出 |
|---|
| 誰可以參加 | 誰可以參加 | 0.838 | 1.000 | 0.494 | 0.933 | 全域模型 |
| 如何使用「彈幕喇叭(獨佔頭條)」功能 | 如何使用「全站喇叭」功能 | 0.816 | 0.908 | 0.553 | 1.000 | 全域模型 |
| 月新生代爭霸戰活動? | 月新生代爭霸戰? | 0.733 | 0.809 | 0.494 | 0.933 | 全域模型 |
| 決賽 | 決賽 | 0.732 | 1.000 | 0.568 | 0.074 | 全域模型 |
| 神皇等級有哪些專屬特權? | 神皇等級有哪些新增專屬特權? | 0.724 | 0.985 | 0.109 | 1.000 | 全域模型 |
| 決賽 | 決賽 | 0.717 | 1.000 | 0.519 | 0.077 | 全域模型 |
| 月榜統計到何時? | 週榜統計到何時? | 0.711 | 0.817 | 0.661 | 0.423 | 全域模型 |
| 決賽 | 決賽 | 0.703 | 1.000 | 0.468 | 0.084 | 全域模型 |
| 虛擬形象重複的服飾可以售出(拆解)嗎? | 虛擬形象重複的服飾可以轉送嗎? | 0.686 | 0.828 | 0.522 | 0.492 | 全域模型 |
| 葡萄的獲得方式是什麼? | 紅木的獲得方式是什麼? | 0.679 | 0.946 | 0.434 | 0.189 | 全域模型 |
| 如何隱藏爵位? | 如何隱藏我的爵位? | 0.673 | 0.757 | 0.797 | 0.118 | 全域模型 |
| 為什麼我不能贈送特權禮物? | 為什麼我不能贈送家族禮物? | 0.656 | 0.930 | 0.372 | 0.220 | 全域模型 |
| VIP幸運抽抽樂抽中獎勵後該如何領取? | VIP幸運抽抽樂抽中獎勵後該如何領取? | 0.656 | 1.000 | 0.177 | 0.356 | 全域模型 |
| 誰可以參加 | 誰可以參加 | 0.649 | 1.000 | 0.292 | 0.075 | 全域模型 |
| 虛擬形象時尚值是什麼? | 虛擬形象是什麼? 虛擬形象可以幹麻? | 0.630 | 0.755 | 0.473 | 0.484 | 全域模型 |
| 如何獲得虛擬形象的服飾與裝扮? | 如何獲得虛擬形象的貝殼? | 0.628 | 0.838 | 0.281 | 0.555 | 全域模型 |
| 誰可以參加 | 誰可以參加 | 0.626 | 1.000 | 0.219 | 0.070 | 全域模型 |
| 貴族隱藏 | 貴族如何關閉 | 0.623 | 0.330 | 0.973 | 1.000 | 全域模型 |
| 如何轉接真人客服? | 如何轉接真人客服? | 0.621 | 1.000 | 0.169 | 0.138 | 全域模型 |
| 貴族選票如何領取? | 貴族選票如何領取? | 0.618 | 1.000 | 0.179 | 0.095 | 全域模型 |
查看:連結最多的文章
連結多可能是核心概念,也可能只是重複副本;目前前幾名由 618 活動副本群主導。
| KB 文章標題 | 連到幾篇其他文章 |
|---|
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 17 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
| 618年中狂歡檔與端午加碼活動的活動時間為何? | 16 |
查看:非直觀但可能相關的文章
這些配對是人工探索線索,不是合併清單。
| 文章 A | 關係類型 | 文章 B | 證據屬性 |
|---|
| 活動期間如何使用貴族選票? | semantically_similar_to | 活動期間貴族選票未使用會怎樣? | INFERRED |
| 沁涼小舖 | semantically_similar_to | 沁涼小舖活動中花火的火箭角色是什麼動物? | INFERRED |
| 在VIP幸運抽抽樂中獎後該如何向客服兌換獎勵? | semantically_similar_to | 如何參與VIP幸運抽抽樂並兌換獎勵? | INFERRED |
| 送禮時禮物特效沒有顯示出來該如何處理? | semantically_similar_to | 送禮物時沒有顯示特效該如何處理? | INFERRED |
| 生日跑馬燈要如何兌換與設定? | semantically_similar_to | 生日跑馬燈的內容為何? | INFERRED |
| 生日跑馬燈要如何兌換與設定? | semantically_similar_to | 生日跑馬燈設定後,若因主播晚開播而錯過,是否可以重新設定? | INFERRED |
| 如何累積追夢分? | semantically_similar_to | 活動期間如何累積追夢分? | INFERRED |
| 曝光獎勵有哪些條件? | semantically_similar_to | 計程車曝光獎勵有什麼限制? | INFERRED |
交付物
資料保護:文章原文與保存快照留在 git-ignored reports/;HTML 只呈現統計與必要樣本。若對外發布,仍須依組織資料政策確認 Graph JSON、文章標題及關聯樣本的公開範圍。