feat: 问题点数量口径改为 单段 1–3 / 全篇 5–10
产品口径(2026-09-11):全篇 Pattern 由「最多 5 个」改为 5–10 个,单段主要 Pattern 由「最多 2 个」改为 1–3 个。依据 PRD §13.1(单段最多默认展示 1–3 个 主要 Pattern)与 §19.3(只概括当前段最主要的 1–3 类问题)。每段批注 3 条上限不变。 全篇 5–10 带下限,与「模型不得无 evidence 输出 Pattern」冲突——只有下限没有 逃生口,模型会编证据凑数。因此两处同时补上「证据优先于数量,下限不得靠编造 evidence 来凑」;SKILL.md 原有「也不要硬凑到十条」随口径一并改写。 无硬截断代码需要同步:evidence.sanitize_patterns 只过滤证据不截数量,前端 index.html:1053/1059 的 slice(0,3) 本就是单段 1–3 的展示上限。 证明 artifact(docs/ 被 gitignore,本地留存): - docs/_probe_pattern_counts_20260911.py 真实链路探针 - docs/_pattern_counts_20260911_run1.json / _pattern_counts_20260911.json - docs/Agent化改造方案_20260911.md §十 口径与实测记录 实测(同篇文书,gemini-3.7-flash via OpenRouter,走真实 /api/diagnose): run1 patterns=5 批注 1/1/2/2 证据 11/11;run2 patterns=6 批注 1/1/3/2 证据 16/16。 两次均在区间内且非死咬下限,4 段 ai_focus 全非空,证据 100% 可逐字回溯。 单测 65 例全绿(test_demo.py 35 + test_agent.py 30)。
This commit is contained in:
+1
-1
@@ -115,7 +115,7 @@ def build_diagnose_prompt(
|
|||||||
|
|
||||||
要求:
|
要求:
|
||||||
- 输出 Generative Writing Patterns,不输出 AI 概率 / AI Score / 是否 AI 写的判断。
|
- 输出 Generative Writing Patterns,不输出 AI 概率 / AI Score / 是否 AI 写的判断。
|
||||||
- 只输出当前文章实际命中的 Pattern;没有确凿原文证据不得硬凑。全篇最多 5 个 Pattern(只保留最影响本人感的),单段最多 2 个主要 Pattern。
|
- 只输出当前文章实际命中的 Pattern;没有确凿原文证据不得硬凑。全篇 5–10 个 Pattern,单段 1–3 个主要 Pattern。证据优先于数量——原文里确实找不到确凿 evidence 的问题类型就不写它;数量下限永远不得靠编造 evidence 来凑(PRD §13.1:模型不得无 evidence 输出 Pattern)。
|
||||||
- 输出必须紧凑(这是给顾问的人工工作流,不是写报告):overall_diagnosis ≤ 3 句;每个 Pattern 的文本字段(why_ai_like / human_impact / transformation_rule)各 ≤ 1 句、evidence 每项 ≤ 12 个词;annotations 每段最多 3 条,每条 observation / rewrite_action / why_ai_like 各 ≤ 1 句;paragraph_briefs 的 confirmed_meaning / rewrite_goal / ai_focus / context_hint 各 ≤ 2 句;must_preserve ≤ 3 项;scaffold 只给填空 / 思考顺序 / 一句不完整起笔。
|
- 输出必须紧凑(这是给顾问的人工工作流,不是写报告):overall_diagnosis ≤ 3 句;每个 Pattern 的文本字段(why_ai_like / human_impact / transformation_rule)各 ≤ 1 句、evidence 每项 ≤ 12 个词;annotations 每段最多 3 条,每条 observation / rewrite_action / why_ai_like 各 ≤ 1 句;paragraph_briefs 的 confirmed_meaning / rewrite_goal / ai_focus / context_hint 各 ≤ 2 句;must_preserve ≤ 3 项;scaffold 只给填空 / 思考顺序 / 一句不完整起笔。
|
||||||
- evidence 必须是该段原文中的原句或原短语,逐字引用;禁止改写原文当作证据;禁止输出原文不存在的片段。
|
- evidence 必须是该段原文中的原句或原短语,逐字引用;禁止改写原文当作证据;禁止输出原文不存在的片段。
|
||||||
- 每个 Pattern 都要说明为什么生成模型容易这么写(why_ai_like)与为什么影响本人感(human_impact)。
|
- 每个 Pattern 都要说明为什么生成模型容易这么写(why_ai_like)与为什么影响本人感(human_impact)。
|
||||||
|
|||||||
@@ -269,8 +269,8 @@ Pattern 更值得告诉顾问。
|
|||||||
|
|
||||||
# 问题覆盖度
|
# 问题覆盖度
|
||||||
|
|
||||||
`diagnose_essay` 返回的是**最影响本人感的主问题**(全篇最多 5 个 Pattern、单段最多 2 个主 Pattern、
|
`diagnose_essay` 返回的是**最影响本人感的主问题**(全篇 5–10 个 Pattern、单段 1–3 个主 Pattern、
|
||||||
每段最多 3 条批注)。这是刻意的压缩——顾问是在工作台上人工改,不是读报告。
|
每段最多 3 条批注)。这是聚焦,不是穷举——顾问是在工作台上人工改,不是读报告。
|
||||||
|
|
||||||
但顾问追问「这段还有别的问题吗」时,**你可以基于上下文原文继续补充观察**:
|
但顾问追问「这段还有别的问题吗」时,**你可以基于上下文原文继续补充观察**:
|
||||||
|
|
||||||
@@ -278,7 +278,8 @@ Pattern 更值得告诉顾问。
|
|||||||
- 明确区分「工具已标记的主问题」和「我另外看到的次要问题」
|
- 明确区分「工具已标记的主问题」和「我另外看到的次要问题」
|
||||||
- 补充观察不改变主问题的优先级——主问题仍然是先改的
|
- 补充观察不改变主问题的优先级——主问题仍然是先改的
|
||||||
|
|
||||||
**禁止**:为了显得全面而凑数。宁可说「这一段主要就是 P05 一个问题」,也不要硬凑到十条。
|
**禁止**:为了显得全面而凑数。全篇 5–10 是目标区间,不是 quota——某类问题在原文里确实找不到确凿证据,
|
||||||
|
就不写它,更不许编造 evidence 去够数。宁可少报,不许假报。
|
||||||
|
|
||||||
---
|
---
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user