Logistic Regression
Random Forest
Decision Tree
1. 綜合能力雷達圖 (Radar Chart)
評估指標包含:精準度、召回率、可解釋性、訓練速度、穩健性、非線性能力。
2. 建議名單提升度曲線 (Lift Curve)
顯示排序 Top K% 建議名單抓出高風險對象的累積捕捉能力比例。
3. Top-10% 建議名單重疊率 (List Overlap)
不同模型所篩選出的 Top-10% 風險名單重疊交集度 ($J(A,B) = \frac{|A \cap B|}{|A \cup B|}$)。
4. 風險分數分位數與真實風險率 (Decile Distribution)
評價模型是否能將高風險案件集中在 Top 1-2 Deciles。
三大方法綜合比較對照表
針對建議名單(Recommendation / High Risk List)生成之全方位考量
| 評估維度 | 邏輯斯迴歸 (LR) | 隨機森林 (RF) | 決策樹 (TR) |
|---|---|---|---|
| 核心數學原理 | 對數幾率映射:$P(Y=1) = \frac{1}{1 + e^{-(\beta_0 + \sum \beta_i X_i)}}$ | Bagging 集成多棵特徵隨機抽樣樹,多數決 / 機率平均 | 資訊增益 (Information Gain) 或 Gini 不純度階層切割 |
| 名單精準度 (Precision@K) | 中等 (受限於線性分界) | 極高 (可捕捉高階非線性交互) | 偏低至中 (階梯狀分界容易階梯過擬合) |
| 可解釋性 (Interpretability) | 極高 (Odds Ratio & 權重係數) | 低 (黑盒) (需 SHAP / LIME 事後解釋) | 高 (明確 IF-THEN 規則樹路徑) |
| 分數區隔度 (Calibration) | 良好且分數天然為機率值,方便調整 Threshold | 分數集中於中間區域(平均化效應),需要 Calibration | 分數為離散階梯值,缺乏連續微調空間 |
| 數據異常值與缺失值容忍度 | 較敏感,需極佳的資料預處理與 Standardization | 極高容忍度,對 Outliers 與單一極端值強健 | 高容忍度,但對訓練集的微小變動非常敏感 (High Variance) |
| 上線維護與計算負擔 | 毫秒級推論,內存佔用極低 | 需儲存數百棵樹結構,推論延遲相對較高 | 推論極快,可直接轉成硬邏輯 SQL / Rule Engine 腳本 |
邏輯斯迴歸 (LR) 優缺點評估
🟢 主要優點 (Pros)
- 業務說明成本極低:每個特徵都有獨立係數 $\beta_i$,可直接導出機率與勝算比(Odds Ratio = $e^{\beta_i}$)。
- 合規審查完全無阻:金融與稽核機構對 LR 接受度最高,方便附帶「名單判定原因碼 (Reason Codes)」。
- 分數穩定性佳:模型不會因單一異常點而劇烈波動,不容易產生嚴重的過擬合。
🔴 主要缺點 (Cons)
- 無法捕捉複雜特徵交互:若未人工手動工程構建 $X_1 \cdot X_2$,將漏抓高階風險態樣。
- 邊界預測上限受限:對於非線性分界的風險數據,建議名單之 Recall@K 易低於 Tree-based 模型。
隨機森林 (RF) 優缺點評估
🟢 主要優點 (Pros)
- 強大之預測與抓捕率:在 Precision@K 與 Lift 表現上通常遠超單一 LR/TR。
- 自動處理非線性與交互:無須繁複人工特徵工程即可捕捉高風險行為組合。
- 抗噪能力強:Bagging 機制大幅降低高變異數 (Variance) 風險。
🔴 主要缺點 (Cons)
- 黑盒效應 (Black Box):難以直接回答「為什麼某位客戶會進入建議名單」,必須仰賴 SHAP 套件。
- 機率值壓平 (Probability Compression):Ensemble 平均會導致高分與低分機率向中間收斂,需做 Probability Calibration。
單一決策樹 (TR) 優缺點評估
🟢 主要優點 (Pros)
- 規則直觀透明:可直接轉化為 `IF Income < X AND Loan > Y THEN Risk = High` 之業務規則 Engine。
- 無需做特徵 Scaling:對單調轉換不敏感,離散與連續變數均可直接輸入。
🔴 主要缺點 (Cons)
- 極易過擬合 (Overfitting):單樹極為不穩定,樣本微小擾動會導致整個樹結構劇變。
- 階梯狀邊界 (Step Function):無法輸出平滑的連續風險機率值,建議名單排序細緻度不佳。
建議名單生成與業務落地策略指南
單一模型往往無法兼具「高精準度」與「高可解釋性」,建議採用以下複合架構生成建議名單:
高風險自動化打擊組 (RF):使用 RF 篩選 Top 3% 超高風險名單,直接進行自動化管控。
人工複審組 (LR):使用 LR 篩選 Top 3%-10% 中高風險名單,並附帶 Reason Codes 供調查員迅速核查。
建議名單長度 $K$ 應取決於「營運調查能力」與「風險成本損失平衡」: $$\text{Net ROI} = \text{Captured Risk Value} - (K \times \text{Manual Review Cost})$$
核心一致名單 (Core List):同時出現在 LR 與 RF Top 名單之對象(極高確信度)。
分歧名單 (Divergent List):僅 RF 抓出而 LR 未抓出者,常為複雜組合型新型作弊。
上載 CSV 名單進行動態交集與重疊度計算
您可以分別選取 `risklist_LR.csv`、`risklist_RF.csv` 與 `risklist_TR.csv`,系統將自動解析名單並計算包含項與重疊率 (Jaccard Similarity)。