第 3 步政策 v2

改为优先人工审核

用户决定将自动处置改为高置信优先审核,所有处置由人工确认。本轮据此改变路由、队列工作量和验收标准。

改变了什么

高置信不等于高危。先处理高置信评论可能挤占其他高危评论的审核时间,因此保留严重度排序作为对照,并直接检查高危完成数量。

本轮工作量与质量

层级评论数占全部评论测试精确率95% 区间
priority_review4,6257.23%0.763[0.750, 0.775]
human_review1,6852.63%0.419[0.396, 0.443]
allow57,66890.14%n/a

总人工需求为 6,310 / 63,978 条,占 9.86%;合并人工队列精确率为 0.671,95% 区间 [0.659, 0.682]。这里用任一真实标签为阳性作为审核价值的代理指标,并未独立测量一条评论是否值得人工审核。

运行声明的自动处置数为 0,所有待审评论均要求人工确认。这里评估的是路由建议,未模拟人工复核的正确率或实际处罚结果。

逐任务时间与主指标

每次仿真保存 simulation_jobs.csv,记录任务到达、开始和完成时间。 等待时间等于开始时间减到达时间,统计所有已开始任务,包括仍在审核的任务;完成耗时等于完成时间减到达时间,只统计窗口内已完成任务。 尚未开始的任务没有观测到完整等待时间,列入状态数量,不按零等待计入分位数。未完成任务也不按零耗时计入完成分位数。

本次配置选择的主指标为 开始审核前的等待 p50,负载为 108.000 条/小时。 人群是所有已经开始审核的任务,含窗口结束时仍在审核的任务,先合并各随机种子的逐任务记录再计算分位数。它与下方“每个种子先算分位数、再取均值”的表不同,不应混用。

主指标priority,分钟FIFO,分钟样本数 路由/FIFO绝对缩短 FIFO−路由,分钟
开始审核前的等待 p500.3991.4174356 / 43561.018

相对缩短 71.83%(负值表示更慢)。高危子集的等待用于补充诊断,不替换全体待审任务的主指标。不同策略在有限窗口内启动或完成的任务可能不同,比较时需同时看下面的状态数量。

入队负载/h排序到达完成审核中尚未开始高危 完成/审核中/未开始等待 p50/p90/p99,分钟完成耗时 p50/p90/p99,分钟p99 样本量
60fifo2349233982333 / 0 / 00.00 / 0.35 / 1.47
n=2347
2.00 / 2.33 / 3.47
n=2339
等待:足够;完成:足够
60prob2349233982333 / 0 / 00.00 / 0.26 / 1.58
n=2347
2.00 / 2.26 / 3.58
n=2339
等待:足够;完成:足够
60severity2349233982333 / 0 / 00.00 / 0.26 / 1.55
n=2347
2.00 / 2.26 / 3.55
n=2339
等待:足够;完成:足够
60priority2349233982333 / 0 / 00.00 / 0.26 / 1.55
n=2347
2.00 / 2.26 / 3.55
n=2339
等待:足够;完成:足够
108fifo43624337196617 / 2 / 01.42 / 6.44 / 13.53
n=4356
3.42 / 8.46 / 15.53
n=4337
等待:足够;完成:足够
108prob43624337196618 / 1 / 00.40 / 3.80 / 40.14
n=4356
2.40 / 5.82 / 42.37
n=4337
等待:足够;完成:足够
108severity43624337196618 / 1 / 00.40 / 3.68 / 41.84
n=4356
2.40 / 5.70 / 43.98
n=4337
等待:足够;完成:足够
108priority43624337196618 / 1 / 00.40 / 3.71 / 43.28
n=4356
2.40 / 5.72 / 45.52
n=4337
等待:足够;完成:足够
180fifo71104766202324688 / 3 / 34478.87 / 140.27 / 165.95
n=4786
80.39 / 141.59 / 167.25
n=4766
等待:足够;完成:足够
180prob71104766202324918 / 5 / 1120.73 / 10.21 / 102.92
n=4786
2.73 / 12.20 / 105.38
n=4766
等待:足够;完成:足够
180severity71104766202324945 / 4 / 860.70 / 11.54 / 130.85
n=4786
2.70 / 13.54 / 133.05
n=4766
等待:足够;完成:足够
180priority71104766202324921 / 4 / 1100.69 / 10.24 / 106.38
n=4786
2.69 / 12.14 / 108.50
n=4766
等待:足够;完成:足够

p99 样本量判据为该时间统计至少 100 条,达到此门槛仍不代表尾部分位数没有抽样误差。 完成审核不等于已证实采取正确处罚;这里没有另行模拟人工准确率、申诉或执行流程。

新验收标准与结果

本轮以 FIFO 为参照:超容量下处理的危害代理值不降低;近容量下高危等待 p90 不增加;两个负载下的高危完成数量都不减少。等待统计所有已开始任务,含窗口结束时仍在审核的任务;未开始任务另外计数。因此同时检查完成数量,避免只看较早启动的任务。下面的要求在看新结果前设定,是实测比值要求,不是统计非劣性证明。

指标优先排序FIFO比值比值要求结果
超容量:危害代理值 / 审核人时70.24456.0871.252≥ 1.000通过
近容量:已开始高危任务(含审核中)的等待 p901.0585.6040.189≤ 1.000通过
近容量:高危完成数量123.600123.4001.002≥ 1.000通过
超容量:高危完成数量184.200137.6001.339≥ 1.000通过

上述四项排序检查中有 0 项未通过;未设门槛或不可比较的项目另列,不计为通过。没有再要求测试精确率达到 99%,但新的排序策略仍需接受这些容量与完成量检查。

与严重度排序的配对比较也需要保留。超容量时,优先排序的高危完成数量平均差值为 -4.8 条,危害代理值/人时平均差值为 -1.375,方向均为优先排序减去严重度排序。优于 FIFO 并不说明它优于所有对照。

四类回归检查

门槛来自这次运行保存的政策快照。分类质量检查标签表现和预测量;路由质量检查送审队列;容量检查有限人力下的完成与积压;可复现性检查相同输入能否重放。 身份词差异在后面单独诊断。未设定的门槛不显示为通过。排序相对 FIFO 的四项检查见上表。

类别检查读数要求结果
分类质量AP toxic0.752≥ 0.732通过
分类质量AP obscene0.773≥ 0.753通过
分类质量AP insult0.696≥ 0.676通过
分类质量AP identity_hate0.480≥ 0.460通过
分类质量AP severe_toxic0.311≥ 0.291通过
分类质量AP threat0.458≥ 0.438通过
分类质量普通审核阈值处精确率 toxic0.663≥ 0.643通过
分类质量普通审核阈值处精确率 obscene0.773≥ 0.753通过
分类质量普通审核阈值处精确率 insult0.879≥ 0.858通过
分类质量普通审核阈值处精确率 severe_toxicn/a未设定未设门槛,仅报告
分类质量普通审核阈值处精确率 threatn/a未设定未设门槛,仅报告
分类质量普通审核阈值处精确率 identity_haten/a未设定未设门槛,仅报告
分类质量标签层级违例率0.000≤ 0.005通过
分类质量预测阳性量相对超出 severe_toxic0.916≤ 1.000通过
路由质量priority_review 精确率0.763未设定未设门槛,仅报告
路由质量human_review 精确率0.419未设定未设门槛,仅报告
容量近容量完成率0.994≥ 0.970通过
容量近容量结束时未开始数量,种子均值1.200≤ 10通过
容量近容量等待 p50,合并逐任务记录,分钟0.399≤ 1.000通过
容量近容量队列深度 p95,种子均值14.220≤ 39通过
容量近容量审核员利用率0.905≥ 0.600通过

可复现性:配置要求读取 simulation_jobs.csv,按负载 primary、种子 first 重放场景,浮点容差为 1e-09。 本页只展示保存的配置和指标;重算逐任务时间及重放顺序的检查由回归测试执行,不根据这张静态报告宣称已通过。

四种排序的仿真结果

容量为 120 条/小时,4 名审核员,每条 2 分钟。表格为 5 个种子的均值 ± 标准差;等待单位为分钟。等待统计所有已开始任务,含窗口结束时仍在审核的任务;未开始任务另外计数。高危剩余包括仍在服务中的任务,积压只计尚未开始的任务。

60 / 108 / 180 条每小时是进入人工队列后的到达率。新策略改变了候选池及入队比例,不能把这里的排序收益与旧自动处置策略的收益比直接当作端到端提升。
入队负载/h排序完成高危完成高危剩余危害代理值/人时高危等待 p90结束积压
60fifo467.8 ± 26.566.6 ± 13.50.0 ± 0.027.67 ± 3.480.26 ± 0.100.4 ± 0.8
60prob467.8 ± 26.566.6 ± 13.50.0 ± 0.027.67 ± 3.480.19 ± 0.090.4 ± 0.8
60severity467.8 ± 26.566.6 ± 13.50.0 ± 0.027.67 ± 3.480.18 ± 0.090.4 ± 0.8
60priority467.8 ± 26.566.6 ± 13.50.0 ± 0.027.67 ± 3.480.19 ± 0.090.4 ± 0.8
108fifo867.4 ± 20.3123.4 ± 17.70.4 ± 0.550.41 ± 3.465.60 ± 1.991.2 ± 1.6
108prob867.4 ± 20.3123.6 ± 17.40.2 ± 0.450.46 ± 3.421.10 ± 0.131.2 ± 1.6
108severity867.4 ± 20.3123.6 ± 17.40.2 ± 0.450.47 ± 3.401.05 ± 0.081.2 ± 1.6
108priority867.4 ± 20.3123.6 ± 17.40.2 ± 0.450.47 ± 3.401.06 ± 0.081.2 ± 1.6
180fifo953.2 ± 3.9137.6 ± 3.069.4 ± 8.656.09 ± 1.28138.94 ± 9.44464.8 ± 41.5
180prob953.2 ± 3.9183.6 ± 6.123.4 ± 4.569.62 ± 1.972.11 ± 0.50464.8 ± 41.5
180severity953.2 ± 3.9189.0 ± 5.718.0 ± 5.171.62 ± 1.561.88 ± 0.68464.8 ± 41.5
180priority953.2 ± 3.9184.2 ± 5.622.8 ± 5.370.24 ± 1.711.63 ± 0.31464.8 ± 41.5

身份词子组诊断

FDR 比较待审评论中的误报占比,FPR 比较正常评论被送审的比例;比值方向均为含身份词除以不含。FDR 只在完整区间不高于设定上限时通过,跨越则不确定。FPR 单独报告,不能用 FDR 通过替代它。

层级FDR 比95% 区间FDR 检查FPR 比95% 区间
predicted_positive1.023[0.922, 1.135]通过1.949[1.722, 2.205]
priority_review0.882[0.743, 1.047]通过1.498[1.237, 1.814]
human_review0.995[0.891, 1.112]通过2.489[2.105, 2.942]

如何复现

python scripts/run_pipeline.py --config configs/baseline.yaml
REVIEW_ROUTER_EVAL_REPORT=reports/<run>/report.json pytest -q tests/test_gate.py
python scripts/render_results.py reports/<run>
python record/collect_runs.py --human-review reports/<run>
python record/render.py

运行 20260922T141853710066Z-human-review-baseline,commit 563a0bf38226,工作区含未提交改动。本页读取保存的 运行数据与政策快照。首轮 99% 目标及未达标结果保留在历史记录,没有按新标准重算。