KPKOLpedia更正/認領

Methodology

資料方法、判定規則與不能亂講的事

KOLpedia 是公開內容的結構化情報庫,不是品牌、創作者或平台官方資料。設計原則很簡單:結論可以更新,原始證據不能消失;沒有資料支持的漂亮話,先不要讓它穿西裝上台。

原始資料列

8,435

品牌提及_母表.csv

公開資料列

8,241

通過第一層品質閘門

待審資料列

193

不進公開頁與搜尋

公開期間

2025/01/05 起

最近資料:2026/07/20

從一列資料到一張公開頁

01

讀取原始證據

保留列 ID、KOL、品牌原文、內容 ID、日期、原句、來源連結、時間碼與機器信心。

02

正規化實體

統一 KOL 與品牌別名,但原始值不覆蓋,讓後續仍可追查模型為何做出判定。

03

品質閘門

缺 KOL、日期或標題、疑似折扣碼/創作者名被當品牌、未知類型等資料先送待審。

04

建立關係

以 KOL × 品牌聚合不同內容、不同日期、合作型態、折扣碼與最近活躍度。

05

公開與可追溯

只有 published 資料生成公開頁;頁面保留內容連結與判讀限制。

什麼資料可以公開

  • • 有可辨識品牌、內容 ID、來源連結與合理的媒體類型。
  • • 基本欄位完整,且沒有命中高風險誤判規則。
  • • 品牌別名可回溯原始字串,機器信心與品質旗標被保留。
  • • 聚合統計只計算 published 資料,待審與拒絕資料不灌水。

什麼資料先不公開

  • • 疑似折扣碼、產品型號、一般名詞或創作者名稱被誤抓成品牌。
  • • 缺 KOL、日期、標題或合作類型無法合理判定。
  • • 「自家品牌」只有原始模型標記,尚未經人工或白名單驗證。
  • • 明確命中封鎖詞或已確認不是品牌的資料直接 rejected。

第一版指標怎麼算

指標第一版定義不能解讀成
品牌提及數published 的 KOL × 品牌證據列數付費金額或成交數
商業合作密度業配與混合型提及 ÷ 全部公開提及KOL 收入占比
不同活動日期同一關係中去重後的公開日期數合約續約次數
折扣碼紀錄原始資料標記有折扣碼的提及數實際轉換率
關係分數不同日期、內容、持續時間、近期活躍與合作型態的規則分數官方品牌大使資格
機器判讀信心來源模型對單筆分類的信心值事實正確率保證

關係階段

首次出現、重複合作、持續合作、長期合作與近似品牌大使,全部是內部模型標籤,頁面必須同步顯示推估聲明。

公平比較

YouTube 與 Podcast 的內容量、揭露方式及可跳秒能力不同,因此媒體數量可篩選,但不直接把兩者視為完全相同的曝光單位。

版本治理

每次匯入記錄來源檔名、原始列數、公開/待審/拒絕數、規則版本與完成時間,避免數字改變卻無法解釋。

人物主題分類(系統推估,三層規則)

人物資料庫本身沒有分類欄位。5 個主題入口(/collections)由系統掃描公開帳號名稱、自介,及已公開的合作品牌與原句,分三層套用:嚴格層keyword-rules-v1)依關鍵字命中計分,分數要明顯贏過第二名主題才分類;寬鬆層keyword-rules-v1-relaxed)用來處理沒贏過嚴格門檻、但至少命中一個關鍵字的人物,一律取分數最高的主題(同分時依固定主題優先序決定,不留白);AI 推估層ai-haiku-v1)是 phase 12b 新增的第三層,針對前兩層關鍵字規則仍留白、或只落在寬鬆層的人物,改用 AI 模型讀同一批公開帳號名稱、自介與合作紀錄做語意推估——不是關鍵字比對,而是模型依公開資訊綜合判斷最貼近的主題;AI 判不出來的人物維持原狀(若原本是寬鬆層就留著寬鬆層結果,不會被清空),AI 給出明確主題時才覆寫成 AI 推估層,且一律優先於寬鬆層、但永遠不會覆蓋嚴格層的分類。三層在頁面上都一律標示「系統推估」,不特別區分視覺等級,但層級愈後面,訊號愈弱、推估可能愈不準,歡迎透過更正/認領回報錯誤分類。

目前資料版本

8,241 筆公開證據,193 筆仍在門外排隊

資料最後生成時間為 2026年7月21日 凌晨1:56。正式環境會從 Neon 讀取;未設定資料庫時,網站使用同一套清洗規則產出的 demo 快照。