讀取原始證據
保留列 ID、KOL、品牌原文、內容 ID、日期、原句、來源連結、時間碼與機器信心。
Methodology
KOLpedia 是公開內容的結構化情報庫,不是品牌、創作者或平台官方資料。設計原則很簡單:結論可以更新,原始證據不能消失;沒有資料支持的漂亮話,先不要讓它穿西裝上台。
原始資料列
8,435
品牌提及_母表.csv
公開資料列
8,241
通過第一層品質閘門
待審資料列
193
不進公開頁與搜尋
公開期間
2025/01/05 起
最近資料:2026/07/20
保留列 ID、KOL、品牌原文、內容 ID、日期、原句、來源連結、時間碼與機器信心。
統一 KOL 與品牌別名,但原始值不覆蓋,讓後續仍可追查模型為何做出判定。
缺 KOL、日期或標題、疑似折扣碼/創作者名被當品牌、未知類型等資料先送待審。
以 KOL × 品牌聚合不同內容、不同日期、合作型態、折扣碼與最近活躍度。
只有 published 資料生成公開頁;頁面保留內容連結與判讀限制。
| 指標 | 第一版定義 | 不能解讀成 |
|---|---|---|
| 品牌提及數 | published 的 KOL × 品牌證據列數 | 付費金額或成交數 |
| 商業合作密度 | 業配與混合型提及 ÷ 全部公開提及 | KOL 收入占比 |
| 不同活動日期 | 同一關係中去重後的公開日期數 | 合約續約次數 |
| 折扣碼紀錄 | 原始資料標記有折扣碼的提及數 | 實際轉換率 |
| 關係分數 | 不同日期、內容、持續時間、近期活躍與合作型態的規則分數 | 官方品牌大使資格 |
| 機器判讀信心 | 來源模型對單筆分類的信心值 | 事實正確率保證 |
首次出現、重複合作、持續合作、長期合作與近似品牌大使,全部是內部模型標籤,頁面必須同步顯示推估聲明。
YouTube 與 Podcast 的內容量、揭露方式及可跳秒能力不同,因此媒體數量可篩選,但不直接把兩者視為完全相同的曝光單位。
每次匯入記錄來源檔名、原始列數、公開/待審/拒絕數、規則版本與完成時間,避免數字改變卻無法解釋。
人物資料庫本身沒有分類欄位。5 個主題入口(/collections)由系統掃描公開帳號名稱、自介,及已公開的合作品牌與原句,分三層套用:嚴格層(keyword-rules-v1)依關鍵字命中計分,分數要明顯贏過第二名主題才分類;寬鬆層(keyword-rules-v1-relaxed)用來處理沒贏過嚴格門檻、但至少命中一個關鍵字的人物,一律取分數最高的主題(同分時依固定主題優先序決定,不留白);AI 推估層(ai-haiku-v1)是 phase 12b 新增的第三層,針對前兩層關鍵字規則仍留白、或只落在寬鬆層的人物,改用 AI 模型讀同一批公開帳號名稱、自介與合作紀錄做語意推估——不是關鍵字比對,而是模型依公開資訊綜合判斷最貼近的主題;AI 判不出來的人物維持原狀(若原本是寬鬆層就留著寬鬆層結果,不會被清空),AI 給出明確主題時才覆寫成 AI 推估層,且一律優先於寬鬆層、但永遠不會覆蓋嚴格層的分類。三層在頁面上都一律標示「系統推估」,不特別區分視覺等級,但層級愈後面,訊號愈弱、推估可能愈不準,歡迎透過更正/認領回報錯誤分類。
資料最後生成時間為 2026年7月21日 凌晨1:56。正式環境會從 Neon 讀取;未設定資料庫時,網站使用同一套清洗規則產出的 demo 快照。