核心做法是把自动评分降级为线索,而不是结论:让它负责筛出异常和分组,把需要语境、意图和商业取舍的判断留在人工复核清单里。只有当一项判断能被拆成可观察的规则、且误判代价可接受时,才适合交给自动评分。已经试过调阈值仍不放心,通常说明遗漏的条件不是分数本身,而是判断依据没有和评分口径对齐。
自动评分擅长处理一致性高的比较,例如同一批页面在结构完整度、字段缺失、重复程度上的相对位置。它不擅长处理需要外部语境的判断,例如某个栏目是否值得继续投入、某类内容是否只是过渡方案。把这两类混在一张评分表里,人工判断就会被分数挤掉。
一个可操作的区分方法是:把当前评分项逐条问三个问题——判断依据是否全部写在数据里、两个人独立看是否容易得出同一结论、判错一次要付出多少返工成本。三条都偏向“是”和“低”,可以保留自动评分;只要有一条明显偏向“否”或“高”,就应转为人工判断项。做完这一步,你会得到一张分层清单,下一步的取舍就有了依据,而不是继续在总分上做微调。
保留自动评分的前提是:它只用于排序和发现异常,最终结论由人签字。适合页面量大、单项判断重复度高、误判可以事后纠正的场景。此时要做的是给评分加一条人工确认环节,而不是提高它的权重。
改写的前提是评分口径与真实判断标准错位,但错位可以被拆解。例如评分把“内容长度”当作质量信号,而实际决策看的是“是否回答了目标问题”。可以把长项替换为可核对的结构化条件,如是否包含结论段、是否给出适用条件、是否标注信息来源类型。改写后要重新抽查一批样本,确认新口径没有把原来被误判的项目推向另一端。
退出的前提是判断依赖持续变化的外部语境,且每次误判都会带来明显返工或对外影响。这类项目继续保留评分,只会让人把精力花在解释分数上。退出不等于放弃量化,而是改为人工记录判断理由,积累到一定数量后再看是否存在可规则化的部分。
防止替代的关键不是取消评分,而是规定先看什么、后看什么。可以按下面的顺序执行:
这个顺序的实际作用是:评分负责缩小范围,人工负责给出方向。若某一步发现证据只能支持“继续观察”,就把它留在待定区,不要为了清空清单而强行打分。
假设一批页面自动评分普遍偏低,同时人工抽查发现其中一部分访问表现并不差。此时至少有两种合理解释:评分口径偏向结构指标,而访问表现受其他因素影响;或者这批页面的问题尚未在短期数据中体现。两种解释对应的动作不同,前者应改写评分口径,后者应保留观察并补充判断依据。若直接把低分当作处理依据,就可能把仍可用的项目提前退出;若完全无视评分,又会失去发现异常的线索。这个例子说明,分数变化本身不能单独证明判断正确,需要和人工理由对照。
人工判断完成后,至少留下三项记录:判断对象、判断理由、下次复核的触发条件。触发条件可以是数据形态变化、项目阶段变化或外部要求变化,而不是固定时间。这样做的结果是,下一轮不需要重新争论同一个问题,评分也不再有机会悄悄替代判断。若发现某类判断连续多轮理由一致,再考虑把它转为规则;在此之前,保持人工介入是更稳妥的选择。