feat(skill): 追加 F 类文书场景特化 tell,修正 P11/P04 映射

prodream essay-chat 那份裁剪版比 HVR 多出 5 条文书场景特化条目——罗列堆料、
匀速、换名、过度工整、模板过渡。它们在通用清单里不收(学术/媒体/技术写作
中都正常),放进申请文书才成为 tell,HVR 的 A–E 里没有对应位置。

处理:作为 F 节**追加**进现有分类,不替换 A–E(A–E 覆盖更全,且文末已解释
A–E 与 P01–P12 的关系)。同时补两类条目 + 误报警戒:§27/§29 正是用功的非
母语学生的典型写法,单独出现不报;§26/§30 升为「见一次就该动手」。

顺带修正文末映射表:P11 同义换写一直漏(↔ §28),P04 平行结构也漏(↔ §6);
「A–E 是你的判断框架」改为「A–F」。

证明:
- docs/_probe_skill_f_section_20260911.py:静态核对 skill 正文含 F 节 8/8 项
  (F 标题、§26–§30、误报警戒、删词不删意);真实 /api/chat/stream 跑两次,
  两次均逐字引原文报出 §26 名词堆砌,run2 另报 §27 句长均匀
- artifact: docs/_skill_f_probe_20260911.json(docs/ 已 gitignore)
- pytest:65 passed
This commit is contained in:
LuminousRuoxi
2026-09-11 11:03:13 +08:00
parent 76d3b30e7d
commit c2243a3200
+35 -4
View File
@@ -101,7 +101,8 @@ Word Limit: ...
模型每次都在选「最能适配最广读者与题材」的那个说法;人写作时心里只有一个读者、一件事,
所以人的选择是**不均匀的、具体的**。下面每一条都是这种「默认选择」的一种形态:
**装腔**(句子在提示重要性,而不是增加事实)、**机械节奏**(三连与破折号不问意思需不需要)、
**注水**(普通事实被包装成关键或权威背书)、**规则化排版**、**聊天残渣**
**注水**(普通事实被包装成关键或权威背书)、**规则化排版**、**聊天残渣**
**文书特化**(罗列堆料、匀速、换名、过度工整、模板过渡)。
词的习惯每代模型都在变,**结构习惯不变**,所以下面按结构分类。
@@ -109,7 +110,7 @@ Word Limit: ...
1. **每句话留下来,都必须给读者增添了原本没有的东西。**
2. **一个 tell 该不该动手,看「认真的写作者有多少概率会故意这么写」**——概率越低越是 tell。
§1–§5 **见一次就该动手**;标 ** 的,要**同一段里多个 tell 并存**才动手。
§1–§5、§26、§30 **见一次就该动手**;标 ** 的,要**同一段里多个 tell 并存**才动手。
单独一个破折号、一个被动句,都不是证据。
## A. 装腔,而不是陈述(最强、最频发,见一次就该改)
@@ -199,6 +200,32 @@ Word Limit: ...
> ChatGPT 直接粘进 Word 的稿子会带出这些痕迹,看到就当证据。**E 类照收**:学生用 AI 生成
> 文书时,`While specific details are not extensively documented...` 这类残渣是最常见也最致命的。
## F. 文书场景特化(通用清单没有,但文书里很致命)
这一组不在 blader/humanizer 的通用列表里——它们在学术、媒体、技术写作中都正常,
放进**申请文书**才成为 tell:读者是招生官,学生在为「我是谁」辩护,
「显得重要」的压力就会以这几种形态漏出来。
26. **名词堆砌** — 活动、项目、奖项、机构名一排排罗列,用密度证明自己重要
`volunteered at X, interned at Y, founded Z`)。**只留与主线相关的一两个,其余合并成一句或删掉**——
长度本身不是分量。
27. **句长均匀** — 全段每句长度接近,读起来像匀速朗读。真人写作长短交错:一个短句砸下来,
再一个长句铺开。**拆一句、并一句,制造起伏。** **
28. **反复换名** — 同一个人或物被反复换说法:`the mentor` / `this teacher` / `the professor`
中文里的「这位老师」「该导师」「恩师」。模型在刻意避免重复,人不会这么在意。
**统一称呼**——有意的重复是节奏,不是问题。 **
29. **教科书句式** — 每句都是「主谓宾 + 后置修饰」的完美工整句,没有一句是松的。
**全部完美本身就是信号**:允许一两处口语化、断句、不完整句。 **
30. **模板化过渡**`furthermore` / `moreover` / `in conclusion` / `firstly, secondly, finally` 连发,
或每段开头同一句式(和 §7 是同一件事的两面)。**删掉或改写**,让段落靠意思接上。
> **误报警戒**:§27 与 §29 正好是**用功的非母语学生**最典型的写法——工整、匀速、不出错。
> 这两条单独出现时**不要报**,必须和别的 tell 并存(§27 标 *弱* 就是为此)。
> 「谨慎、非母语、没把握」不等于 AI,见下方反误报。
>
> **这一组只作为你的补充观察出现**`diagnose_essay` 的 P01P12 里只有 P11 能对上(见文末
> 「与工具输出的关系」),所以别指望工具会替你报出来——但它们照样要逐字引原文证据。
## 这些不要动手(反误报)
每条 pattern 描述的只是一个默认选择,**人也可以故意这么写**。误报比漏报更伤顾问信任。
@@ -225,6 +252,9 @@ Word Limit: ...
- **第一人称的、他能解释的选择**
- **真实的题外话、插入语、自我更正**:`(I keep wanting to say "almost" here, but it really was certain.)`
**删词不删意**:动手时换掉高频词与模板句、用简单动词(`is` / `are` / `has`)直说就够,
**不要顺手把整句重写一遍**。改的是包装,不是学生自己的句子结构——后者正是他的声音。
诊断时如果一段**通篇没有上述任何一样东西**,这本身就是一条重要结论——往往比某个具体
Pattern 更值得告诉顾问。
@@ -232,8 +262,9 @@ Pattern 更值得告诉顾问。
- `diagnose_essay` 返回的 **P01P12** 是产品化的结构化 taxonomy(工作台按它渲染批注卡)。
它是上面这套框架在文书场景下的一个**收敛子集**:P02 显性教训 ↔ §13、P03 格言体 ↔ §3、
P07 完美成长 ↔ §13、P08 显性过渡 ↔ §5、P10 过度收尾 ↔ §2、P12 文学过度包装 ↔ §16。
- 上面 A–E 是你的**判断框架**,覆盖面更广,用在:解释某个 Pattern 为什么像 AI、
P04 平行结构 ↔ §6、P07 完美成长 ↔ §13、P08 显性过渡 ↔ §5、P10 过度收尾 ↔ §2、
P11 同义换写 ↔ §28、P12 文学过度包装 ↔ §16。
- 上面这套框架(A–F)是你的**判断框架**,覆盖面更广,用在:解释某个 Pattern 为什么像 AI、
顾问追问「这段还有别的问题吗」、以及复检时判断有没有出现**新的替代模板**。
- **两套结论冲突时,以工具输出为准**(它逐字引用原文证据并经过校验);
你的补充观察明确标成「补充」。