論述基礎與限制

兩輪量測,對象都是同一篇 120 行的技術紀錄,該篇當時剛通過三輪九個高階 reviewer 的審查並依 finding 改寫過三次。

第一輪五個低階模型執行逐字相同的理解指令,產出十處修正,全部是補句子成分與具名指涉、沒有新增段落。第二輪四個探針各跑一種用途(重點涵蓋度兩份、閱讀負擔一份、語氣一份),另外產出五處。

限制:兩輪都是單篇、單一模型家族;樣本數五與四是當次用的數字,最佳 N 沒有測;「低階比高階更適合」由這次的對照觀察得到(同一篇、九個高階 reviewer 沒有一個報出探針找到的那些位置),未跨批驗證。讀者把它當一個值得排進審查的 frame,不當已驗證的流程。

核心原則

驗證文章會不會被誤解,判準要放在多份獨立理解之間的分歧上,不放在任何一個 reviewer 的判斷上。

三種檢查方式的分工:

方式判準來源抓得到結構性抓不到
grep 與 regex形態匹配已知形態、大量掃描、零成本重跑語意——同一串字在不同脈絡合規與否
單一高階 model reviewer該模型的判斷結構、事實、承重論點的反證自己的理解力會把作者留下的坑填平
多個低階 model 讀者份與份之間的分歧歧義位置、指涉斷裂、施事者缺失深層事實錯誤、跨檔一致性、承重論點

第三列的判準不在任何模型身上,也不在模型的評價上——在讀者實際帶走了什麼。這繞過了同源審查的結構上限:不依賴 reviewer 有沒有能力發現自己被卡住,只看讀完之後手上留下的東西對不對。多份之間的分歧是其中一種訊號,它決定證據強度、不決定要不要修(見下方判讀段)。

低階模型在這個用途上是優點不是妥協。 推理能力越強,越容易在讀到殘缺的句子時自動補完,坑因此被填平而不會現形;成本與速度也決定了能不能大量同步派發,而這個方法的判準需要多份才成立。

五種用途

同一套派發方式換問題,量的東西不同。

用途問法判準
理解正確性每段在講什麼、動作誰做的、指涉詞指什麼、讀完會做什麼讀出來的與作者的意思對不對得上
重點涵蓋度列出所有重點、主旨一句話、只能記住三件事作者的意圖清單與讀者的回報清單之間的差集
主旨明確度這篇要我知道的最重要的一件事是什麼幾份指向同一件事、那件事是不是作者要交付的
閱讀負擔讀到哪裡累、哪裡回頭重讀、想跳過哪段、長度偏長還偏短回報本身即資料,不需要收斂
語氣與讀者定位語氣三詞、作者把我當什麼讀者、六類語氣違規各有沒有指認出的形態值得逐一查,語氣是同源審查的硬盲區

重點涵蓋度那一項的判準跟其餘四項不同,值得單獨說明:它比對的是兩份清單,而讀者不知道自己漏了什麼,所以直接問「你讀懂了嗎」問不出來。作者列得出十點而讀者只列得出七點時,缺的三點就是沒寫清楚的位置。

主旨與涵蓋度都要問「只能記住三件事」這一題。讀者不是逐條吸收、是壓縮後吸收,而壓縮時丟掉的東西正是讀者實際帶不走的東西——檢查點要放在壓縮後的產物上,不放在完整清單上。

規則類文件的探針不是代理,是實際的消費者

對文章而言,低階模型是真人讀者的代理——量的是「一個能力相近的讀者大概會帶走什麼」,而真正的讀者是人。對規則類文件(工程規範、skill、spec、agent 指令)而言,這層代理關係消失:讀那份文件並照它執行的,本來就是模型。探針量到的不是近似值,是實際的執行輸入。

這改變兩件事。嚴重度——一條規則被讀錯,往後每一個 session 都會照錯的版本執行,而錯誤的執行不會回頭報告自己讀錯了;文章被讀錯的代價停在那一次閱讀。判準的論證方式——文章那邊「一份讀錯就是判決」要靠「模型變異度低於真人」這個推論來支撐,規則文件這邊不需要推論,讀錯的那一份就是一次真實的錯誤執行。

規則文件另有一種文章沒有的探針欄位:照這一節工作,我的第一個具體動作是什麼。它量的是規則落不落得到實體上,而不是句子讀不讀得懂——一條每個字都懂、卻沒有指向任何打得開的東西的規則,在理解正確性那一欄會全數通過。判別與修法見 #282

設計條件

五個條件缺一不可,少任何一個這個 frame 都會退化。

  • 指令逐字相同:差異才只來自模型的理解。指令有差別時,分歧無法歸因。
  • 不給審查框架:問「你讀到什麼」而不是「這寫得好不好」。給了審查框架,低階模型會退化成品質較差的 reviewer,優勢全部消失。
  • 明令標記不確定、禁止推測填平:模型被訓練出來的「有幫助」傾向會把空缺補起來。要它們寫「文章沒說」而不是猜一個答案。
  • 問理解不問評價:每段在講什麼、每個動作是誰做的、指涉詞各指什麼、讀完之後會做什麼。
  • 判準是分布不是結論:任何單一份報告都不作為判決,要看幾份落在同一處。

量測結果

第一輪:理解探針

收斂度處數形態
5/51全體帶走的是該節結尾那句摘要,而同一節的正文說的是相反的東西
2/54指涉詞讀出不同對象、方向讀反、術語只能猜
1/53施事者讀成錯的人、某句被指出「文章沒說」是誰做的、物理借詞讀不懂

5/5 那一項的歸因要說清楚,它不是讀者誤讀。 該節正文寫的是「事件會隨 issue 或 repo 消失、沒有任何操作能單獨移除它」,而同一節結尾的摘要句寫著「留下永久記錄」——兩句相隔四行、方向相反,都是作者寫的。五份報告忠實回報了結尾那句。

探針量到的因此是一條機制:一節的正文與它的結尾摘要衝突時,讀者帶走的是摘要。 九個高階 reviewer 沒有報出這個矛盾,因為他們讀完整節、腦中留下正文的版本。

第二輪的重點涵蓋度探針把這條機制看得更清楚:同一份清單同時列出了兩個互相矛盾的條目(正確版與摘要版),而壓縮到「只能記住三件事」時,活下來的是摘要版。讀者不是逐條吸收、是壓縮後吸收,檢查點要放在壓縮後的產物上。

第二輪:分用途探針

用途問法這一輪抓到的
重點涵蓋度列出所有重點、主旨一句話、只能記住三件事、哪條說不清楚兩處作者自認寫清楚而讀者明說講不清的宣稱;以及上述的壓縮丟失
閱讀負擔讀到哪裡累、哪裡回頭重讀、想跳過哪段、長度偏長還偏短兩段被指認「不確定為什麼要出現在這篇裡」,其中一段正是前輪審查要求補的
語氣語氣三詞、作者把我當什麼讀者、六類語氣違規各有沒有keyword bank 全清,另報出一項無關鍵詞可掃的形態(結尾帶著遺憾的語調)

閱讀負擔那一項值得單獨說明:被指認為「像是作者的查證筆記、不是讀者決策需要的資訊」的那一段,來歷是前一輪 reviewer 要求補的成本量級。審查要的跟讀者要的不是同一個東西,而只有讀者位置的探針問得出這件事。

判讀:歸因先於處置

歸因

探針回報的是資料、不是結論。判定「讀者讀錯了」之前,先在原文裡搜那個讀法對應的字串。結果分三種:

原文的狀況這是什麼處置
找得到逐字對應的句子不是讀者誤讀,是文章自己這樣寫的修那句話,並找出它跟哪裡衝突——同一節的正文與結尾摘要打架是高頻形態
找不到對應句子,而現有材料足以推出那個讀法表述有歧義修表述
找不到對應句子,現有材料也推不出模型自己的問題不修

跳過這一步的動力來自收斂本身:幾份一致的時候,「讀者讀錯了」這個結論順到不需要查證。本卡第一輪的頭號證據就是這樣被寫錯的——五份一致回報的那句話在原文裡逐字存在,是作者寫在該節結尾的摘要,而查證的成本只是一條 grep。

處置:一份讀錯就是判決

收斂度決定的是證據強度(這個讀法有多容易出現),不決定要不要修。兩者是不同的問題,把統計門檻當成處置門檻會放掉大部分的 finding。

一份報告讀錯,那個位置就是寫壞了。理由不在統計裡:引導讀者是寫作者的職責,讀者讀錯就沒有讀這篇的意義。而方向還是反的——模型群體的變異度低於真人,五份裡只有一份搞錯,代表真人裡搞錯的比例只會更高。

唯一的例外用一個操作測試分界:文章有沒有給出足以排除那個讀法的材料。給了而模型仍讀錯,是模型的問題;沒給,是寫作的問題。

收斂度處置收斂度告訴你的
全體一致必修這個讀法幾乎必然出現,而且作者與高階 reviewer 看不到
過半必修常見讀法
單份必修較少見,但一個讀者讀錯就足以構成寫作缺陷
零分歧不修表達沒有歧義,不代表內容正確——事實層由別的 frame 管

分歧點的修法多數落在補句子成分與具名指涉,不是補段落——判別見 #279

沒這樣做的麻煩

只跑機械檢查時,語意層完全沒有防線:關鍵字清單只收得到違規義項佔多數的詞,而誤解不挑詞。這次被命中的物理借詞「做功」就不在既有的物理化錯配清單裡。

只跑高階 reviewer 時,防線的上限是 reviewer 自己的理解力。一篇通過三輪九個 reviewer 的文章仍然有一處被全體讀者誤讀,而那一處的宣稱方向與作者的原意相反。

跟其他原則的關係

原則關係
#279 句子成分缺失會被讀成脈絡不足本卡是它的偵測工具——分歧點多數落在成分缺失的位置,而 #279 提供分歧出現之後的分流(補成分還是補脈絡)
#168 多輪審查要有冷讀者 frame同樣是冷讀,判準來源不同——#168 靠 reviewer 自陳「這裡讀不懂」,本卡靠多份之間的分歧,不依賴任何一份察覺自己卡住
#267 關鍵字清單只收違規義項佔多數的詞補它留下的空白——清單抓不到的部分需要一個不依賴清單的偵測入口,多份分歧正是這個入口
#149 keyword bank 命中是候選不是判決同一條分工推到另一端——那裡是機械偵測配人的語意判定,本卡是機械化的分歧統計取代單點判定
#114 multi-pass frame 顆粒度盲點補一個新軸——原本的軸是 frame、instance 與 surface,本卡加的是模型層級:同一個 frame 換不同能力的模型跑,暴露的東西不同
#282 規則要指到一個打得開的東西本卡的一個具體產出——探針指令裡「照這一節工作我的第一個動作是什麼」那一欄,量到的正是 #282 那一類缺陷;該欄不可省略成「你讀懂了嗎」,讀懂與執行得出來是兩回事

這條原則什麼時候不成立

事實正確性、跨檔一致性與承重論點的反證都要高階 reviewer,低階模型在這些維度上的產出不可信。

大量已知形態的掃描仍然由 grep 承擔,那裡它比派模型便宜好幾個量級。本卡處理的是機械檢查覆蓋不到的那一層,不是取代它。

零分歧也只證明表達沒有歧義,不證明內容對。這個 frame 與事實查核是兩件事,跑了它不能省掉後者。