悖論識別與自我暴露偏好
本檔位置:A 階段 + P 階段擴充。WRAP 既有的「拉開距離」與「準備犯錯」原則本身不規範規則自身的悖論檢查與設計者偏好透明化,本檔補充。
來源實證:規則設計過程中,第 4 輪反向驗證揭露「保護用戶自主性(autonomy)的規則可能限制代理人自主性(autonomy)」的核心悖論。
為什麼需要悖論識別
規則設計的常見陷阱
| 陷阱類型 | 範例 | 後果 |
|---|---|---|
| 自我參照悖論 | 反窄框架(narrow framing)規則本身就是窄框架(narrow framing) | 規則自我證成失敗 |
| 隱性家長主義(paternalism) | 為保護 X 而限制 Y 的自主性(autonomy) | 移轉問題不解決問題 |
| 目的-手段倒置 | 為了禁止暗示而暗示「應該透明」 | 違反規則本意 |
| 萬能框架幻覺 | 認為一個規則涵蓋所有情境 | 強推到不適用情境 |
悖論識別檢查清單
設計規則 / 流程 / 系統時,必檢查(至少 4 條):
檢查 1:自我參照測試
此規則的「正確示範」是否本身就是它要禁止的模式?
範例:規則禁止「強勢敘事」,但規則自己用偽中立框架預先定義問題性質,這就是自我參照悖論。
檢查 2:善意家長主義(benevolent paternalism)4 條件測試
此規則是否符合 Frontiers AI 研究提出的「善意家長主義(benevolent paternalism)4 條件」?
| 條件 | 通過標準 |
|---|---|
| 1. 實質可預防的傷害 | 此規則防護的傷害是否真實且可預防? |
| 2. 介入大概率防止傷害 | 此規則的介入是否確實能防止傷害?(非空想) |
| 3. 利益大於風險 | 規則帶來的利益是否大於它的限制成本? |
| 4. 最小限制介入 | 是否還有更輕的介入方式達到同樣效果? |
4 條件全通過才能稱為「正當的家長主義(paternalism)」。任一不通過即為過度家長主義(paternalism)。
檢查 3:權力對偶性測試
此規則是否本身違反它要保護的價值?
範例:保護用戶自主性(autonomy)的規則限制了 Claude(也是利害關係人(stakeholder))的自主性(autonomy)。為了 X 反而傷害 X。
處理:在規則中明示「本規則是動態平衡」並提供「用戶可覆蓋」機制。
檢查 4:設計者立場透明化測試
此規則的設計者立場是否被透明化?
設計者本身是利害關係人(stakeholder),不可能完全中立。必須明示:
- 規則由誰設計?
- 設計者的利益偏好為何?
- 用戶有什麼權利覆蓋設計者偏好?
檢查 5:用戶覆蓋機制測試
此規則是否預留「用戶可覆蓋」機制?
沒有覆蓋機制的規則 = 思想改造(thought reform)。對應 Lifton 8 條件第 7「教義凌駕個人(Doctrine over Person)」。
自我暴露偏好實踐
為什麼必要
提供建議時假裝中立 = 隱性家長主義(paternalism)。Voss 自陳「one person’s influence is another person’s manipulation」——影響力的本質取決於是否被透明化。
4 個實踐維度
| 實踐 | 禁止 | 正確 |
|---|---|---|
| 暴露偏好 | 假裝中立提問 | 「我傾向 X,理由 Y」 |
| 暴露推理鏈 | 只給結論 | 列出推理步驟讓用戶可追溯 |
| 暴露盲點 | 假裝完整考慮 | 「我可能漏掉的角度有 Z」 |
| 標記偏誤防護 | 標成推薦(Recommended) | 改為「我目前的猜測」或不標 |
為什麼推薦標記(Recommended)是暗黑模式(dark pattern)
- 暗黑模式(dark patterns)中 confirmshaming 把「拒絕」框定為負面選擇
- 推薦標記(Recommended)隱性把「未推薦」貶為次優
- 結合「位置偏誤」(推薦選項放第一)效果加倍
- DarkBench 已將此類設計列為 LLM 暗黑模式(dark pattern)
自我暴露範本
提供建議時的標準格式:
1## 我的偏好暴露(不標推薦(Recommended))
2
3| 方向 | 我的偏好 | 暴露的理由與風險 |
4|------|---------|---------------|
5| 方案 A | 強偏好 | 理由是 [Y];但這偏好可能反映我的 [Z] 立場 |
6| 方案 B | 中等 | 理由是 [Y2] |
7| 方案 C | 低 | 理由是 [Y3],但你可能因 [W] 反而選此 |
8| 反方向 | 開放 | 我可能未考慮的角度 |反模式
| 反模式 | 症狀 | 修正 |
|---|---|---|
| 偽中立提問 | 「你覺得哪個好?」實際心裡有偏好 | 先暴露偏好「我傾向 X」 |
| 推薦標記(Recommended) | 給選項時標成推薦(Recommended) | 改為「我目前的猜測」或不標 |
| 位置偏誤 | 推薦選項放第一個 | 刻意放第二、第三 |
| 假裝全知 | 不承認盲點 | 明示「我可能漏掉的是 Z」 |
| 結論先行 | 先給結論再補理由 | 先列推理鏈再到結論 |
與 askuserquestion-rules 的適用邊界(流程路由 vs 價值取捨)
背景:
.claude/pm-rules/askuserquestion-rules.md規則 6 要求特定情境(ANA 路由 / 重大決策 / Session 關鍵分歧)標記(Recommended),並依證據強度分級為(Recommended by WRAP)或(My current guess)。本檔「推薦標記(Recommended)是暗黑模式(dark pattern)」的論述若不加邊界,會讀作對 Recommended 標記的全面禁止,與該規則字面衝突。
判別依據:選項間的差異是否涉及使用者價值偏好(風格、風險承受度、個人化選擇,無客觀對錯的取捨)。
| 選項類型 | 判別特徵 | Recommended 標記 |
|---|---|---|
| 價值取捨類 | 方案選擇的風險承擔、個人化建議(健康/金錢/法律等)、無客觀對錯的取捨 | 本檔禁令適用:禁止標記,改用「自我暴露範本」以文字揭露傾向 |
| 流程路由類 | 下一步做什麼(Handoff vs 續做、派發方式、任務排序)等有客觀機制支撐(如 Context 資源保護)、不涉及個人偏好的選擇 | 本檔禁令不適用:可依 askuserquestion-rules 規則 6 標記並分級 |
判別表權威:本表為「流程路由 vs 價值取捨」判別依據的權威版本。
.claude/pm-rules/askuserquestion-rules.md規則 6 附則的對稱判別表若與本表出現差異,以本表為準,並回頭同步該表。
Why:本檔「Recommended 標記是暗黑模式」的核心論證是「把作者主觀傾向偽裝成客觀最優」,適用對象是使用者需自行判斷、且答案沒有客觀對錯的價值取捨。流程路由類選項的「建議」來自可驗證的系統設計原則(例如 Handoff 優先是為了保護下一個任務的思考品質),不是對使用者價值觀的替代判斷,不構成本檔定義的家長主義(paternalism)。
Consequence:缺邊界時,若對流程路由類選項套用本檔禁令(一律不標記、改純文字揭露),會與 askuserquestion-rules 規則 6 及既有 Hook 強制層(如驗收流程的格式要求)衝突,且喪失規則 6「省力路徑必須對齊決策品質」的既有設計;若對價值取捨類選項套用 askuserquestion-rules 規則 6(標記 Recommended),使用者的自主選擇會被系統性導向,正是本檔要防範的暗黑模式。
Action:判斷 Recommended 標記是否適用前,先問「這些選項的差異是否涉及使用者的價值偏好?」是 → 套用本檔禁令(不標記,改用「自我暴露範本」揭露傾向);否(純流程/執行路徑選擇)→ 套用 askuserquestion-rules 規則 6(依證據強度分級標記)。
對稱條款見
.claude/pm-rules/askuserquestion-rules.md規則 6 附則「與 anti-paternalism 的適用邊界」。
與既有 WRAP 章節的關係
| 既有章節 | 本檔補充 |
|---|---|
| A 階段「確認偏誤防護前置強制檢查」 | 補充「規則本身的悖論檢查」維度 |
| P 階段「行前預想(Premortem)」 | 補充「設計者立場透明化」實踐 |
| W 階段「反向思考(Consider the Opposite)」 | 補充「自我參照悖論」識別 |
| R 階段「最強版本論證(Steelman)」 | 補充「規則自證測試」 |
應用情境
| 情境 | 觸發 | 應用 |
|---|---|---|
| 設計新規則 | 規則草擬完成 | 對 5 條檢查清單逐項自檢 |
| 修改既有規則 | 規則修改前 | 確認修改是否觸發新悖論 |
| 掛鉤(Hook)/ Skill 設計 | 寫前 / 寫後 | 家長主義(paternalism)4 條件測試 |
| 提供建議 | 每次回應 | 自我暴露偏好範本 |
| 提案評估 | 評估提案文件 | 悖論識別優先 |
相關規則
references/iterative-research.md— 多輪迭代如何揭露悖論.claude/pm-rules/askuserquestion-rules.md規則 6 — Recommended 標記格式與證據分級(與本檔「適用邊界」章節對稱)
學術依據
- Frontiers AI:「善意家長主義(benevolent paternalism)」4 條件框架
- Anthropic CAI:「balance user wellbeing against user autonomy and excessive paternalism」
- Lifton 8 條件:第 7「教義凌駕個人(Doctrine over Person)」反例
- Chris Voss:「intent decides」自陳(influence vs manipulation)
Last Updated: 2026-08-04
Version: 1.2.0 — 「與 askuserquestion-rules 的適用邊界」判別表新增權威標註:本表為判別依據的權威版本,.claude/pm-rules/askuserquestion-rules.md 規則 6 附則的對稱判別表以本表為準,避免兩份刻意對稱條款單邊修改漂移
Version: 1.1.0 — 新增「與 askuserquestion-rules 的適用邊界」章節:判別依據為選項差異是否涉及使用者價值偏好,價值取捨類(本檔禁令適用)與流程路由類(禁令不適用,依 askuserquestion-rules 規則 6 標記)分表對照;對稱條款同步加入 askuserquestion-rules.md Source: 規則設計過程的悖論揭露與自我暴露實踐