fix: 诊断提速与稳定性修复(reasoning 2048→512、输出精简、上限16000→8000、loading提示、观测日志+配置错误可读)

This commit is contained in:
LuminousRuoxi
2026-08-25 13:21:49 +08:00
parent d6f70b02f4
commit c04b6a0fd0
6 changed files with 70 additions and 11 deletions
@@ -101,3 +101,4 @@ Add to PATH)。
- 只有顾问真正展开过的 Scaffold / Reference 才会进入复制检测
- 分析中(AI 初审 / 诊断 / 复检进行中)在对话页输入框输入并点发送:输入框内显示红色「AI 分析中,请稍候…」,已输入文本不清除(可继续输入,发送会被拦截,不会丢字)
- 刷新位置规则:改写进行中刷新 → 回 Workbench(改写与进度保留);理解/诊断结果态刷新 → 回对话页(历史卡完整);复检结果已返回(pass 卡/返工卡在对话页)刷新 → 停留对话页;只有复检请求进行中刷新才回 Workbench(可重新提交复检)
- 分析耗时与超时提示(2026-08-25 同事实测诊断卡 5 分钟后的两轮优化):真实模型生成通常需要 1–2 分钟(上游排队时更久);loading 卡 45 秒后追加「仍在生成中,通常需要 1–3 分钟…」、2 分钟后追加「已超过 2 分钟…」——不是死机,是模型还在写。诊断侧已做三层控制:①输出精简(原来一次 6.6k tokens,现在约 2.5k);②思考预算 2048→512——DeepSeek 思考 token 生成速度约为正文的 1/10,预算给满会把时间全烧在想(实测 2048 = 309.8s、512 = 70200s),当前实测诊断约 1–3.5 分钟,波动来自 OpenRouter 吞吐(1280 tok/s),属外部因素;③模型打满输出上限时快速失败并自动重试一次,还不行会给出可读错误卡,稍后重试即可;嫌慢可换模型:启动前 `export HVR_LLM_MODEL=别的模型`(如 faster 或其它 deepseek 系列)。后端日志会打印每次模型调用的耗时与 token 用量(`llm ok model=... dt=... prompt=... completion=...`),排查慢链路直接看这个;思考预算调参入口在 `llm.py``reasoning_config`