改为优先人工审核
用户决定将自动处置改为高置信优先审核,所有处置由人工确认。本轮据此改变路由、队列工作量和验收标准。
改变了什么
priority_review替代当前流程中的auto_action,不再绕过人工。- 高置信档先采用选择集精确率 0.95 作为分档参数,普通档为 0.90。这是本轮预先固定的初始设置,不是测试精确率保证。
- 威胁和标签关系不一致规则将评论送入优先档。优先排序先区分档位,再按预测严重度排序。
- 两个待审档都进入同一容量模型。FIFO、概率、严重度和优先档排序使用相同候选池与到达序列。
高置信不等于高危。先处理高置信评论可能挤占其他高危评论的审核时间,因此保留严重度排序作为对照,并直接检查高危完成数量。
本轮工作量与质量
| 层级 | 评论数 | 占全部评论 | 测试精确率 | 95% 区间 |
|---|---|---|---|---|
| priority_review | 4,625 | 7.23% | 0.763 | [0.750, 0.775] |
| human_review | 1,685 | 2.63% | 0.419 | [0.396, 0.443] |
| allow | 57,668 | 90.14% | n/a |
总人工需求为 6,310 / 63,978 条,占 9.86%;合并人工队列精确率为 0.671,95% 区间 [0.659, 0.682]。这里用任一真实标签为阳性作为审核价值的代理指标,并未独立测量一条评论是否值得人工审核。
运行声明的自动处置数为 0,所有待审评论均要求人工确认。这里评估的是路由建议,未模拟人工复核的正确率或实际处罚结果。
逐任务时间与主指标
每次仿真保存 simulation_jobs.csv,记录任务到达、开始和完成时间。
等待时间等于开始时间减到达时间,统计所有已开始任务,包括仍在审核的任务;完成耗时等于完成时间减到达时间,只统计窗口内已完成任务。
尚未开始的任务没有观测到完整等待时间,列入状态数量,不按零等待计入分位数。未完成任务也不按零耗时计入完成分位数。
本次配置选择的主指标为 开始审核前的等待 p50,负载为 108.000 条/小时。 人群是所有已经开始审核的任务,含窗口结束时仍在审核的任务,先合并各随机种子的逐任务记录再计算分位数。它与下方“每个种子先算分位数、再取均值”的表不同,不应混用。
| 主指标 | priority,分钟 | FIFO,分钟 | 样本数 路由/FIFO | 绝对缩短 FIFO−路由,分钟 |
|---|---|---|---|---|
| 开始审核前的等待 p50 | 0.399 | 1.417 | 4356 / 4356 | 1.018 |
相对缩短 71.83%(负值表示更慢)。高危子集的等待用于补充诊断,不替换全体待审任务的主指标。不同策略在有限窗口内启动或完成的任务可能不同,比较时需同时看下面的状态数量。
| 入队负载/h | 排序 | 到达 | 完成 | 审核中 | 尚未开始 | 高危 完成/审核中/未开始 | 等待 p50/p90/p99,分钟 | 完成耗时 p50/p90/p99,分钟 | p99 样本量 |
|---|---|---|---|---|---|---|---|---|---|
| 60 | fifo | 2349 | 2339 | 8 | 2 | 333 / 0 / 0 | 0.00 / 0.35 / 1.47 n=2347 | 2.00 / 2.33 / 3.47 n=2339 | 等待:足够;完成:足够 |
| 60 | prob | 2349 | 2339 | 8 | 2 | 333 / 0 / 0 | 0.00 / 0.26 / 1.58 n=2347 | 2.00 / 2.26 / 3.58 n=2339 | 等待:足够;完成:足够 |
| 60 | severity | 2349 | 2339 | 8 | 2 | 333 / 0 / 0 | 0.00 / 0.26 / 1.55 n=2347 | 2.00 / 2.26 / 3.55 n=2339 | 等待:足够;完成:足够 |
| 60 | priority | 2349 | 2339 | 8 | 2 | 333 / 0 / 0 | 0.00 / 0.26 / 1.55 n=2347 | 2.00 / 2.26 / 3.55 n=2339 | 等待:足够;完成:足够 |
| 108 | fifo | 4362 | 4337 | 19 | 6 | 617 / 2 / 0 | 1.42 / 6.44 / 13.53 n=4356 | 3.42 / 8.46 / 15.53 n=4337 | 等待:足够;完成:足够 |
| 108 | prob | 4362 | 4337 | 19 | 6 | 618 / 1 / 0 | 0.40 / 3.80 / 40.14 n=4356 | 2.40 / 5.82 / 42.37 n=4337 | 等待:足够;完成:足够 |
| 108 | severity | 4362 | 4337 | 19 | 6 | 618 / 1 / 0 | 0.40 / 3.68 / 41.84 n=4356 | 2.40 / 5.70 / 43.98 n=4337 | 等待:足够;完成:足够 |
| 108 | priority | 4362 | 4337 | 19 | 6 | 618 / 1 / 0 | 0.40 / 3.71 / 43.28 n=4356 | 2.40 / 5.72 / 45.52 n=4337 | 等待:足够;完成:足够 |
| 180 | fifo | 7110 | 4766 | 20 | 2324 | 688 / 3 / 344 | 78.87 / 140.27 / 165.95 n=4786 | 80.39 / 141.59 / 167.25 n=4766 | 等待:足够;完成:足够 |
| 180 | prob | 7110 | 4766 | 20 | 2324 | 918 / 5 / 112 | 0.73 / 10.21 / 102.92 n=4786 | 2.73 / 12.20 / 105.38 n=4766 | 等待:足够;完成:足够 |
| 180 | severity | 7110 | 4766 | 20 | 2324 | 945 / 4 / 86 | 0.70 / 11.54 / 130.85 n=4786 | 2.70 / 13.54 / 133.05 n=4766 | 等待:足够;完成:足够 |
| 180 | priority | 7110 | 4766 | 20 | 2324 | 921 / 4 / 110 | 0.69 / 10.24 / 106.38 n=4786 | 2.69 / 12.14 / 108.50 n=4766 | 等待:足够;完成:足够 |
p99 样本量判据为该时间统计至少 100 条,达到此门槛仍不代表尾部分位数没有抽样误差。 完成审核不等于已证实采取正确处罚;这里没有另行模拟人工准确率、申诉或执行流程。
新验收标准与结果
本轮以 FIFO 为参照:超容量下处理的危害代理值不降低;近容量下高危等待 p90 不增加;两个负载下的高危完成数量都不减少。等待统计所有已开始任务,含窗口结束时仍在审核的任务;未开始任务另外计数。因此同时检查完成数量,避免只看较早启动的任务。下面的要求在看新结果前设定,是实测比值要求,不是统计非劣性证明。
| 指标 | 优先排序 | FIFO | 比值 | 比值要求 | 结果 |
|---|---|---|---|---|---|
| 超容量:危害代理值 / 审核人时 | 70.244 | 56.087 | 1.252 | ≥ 1.000 | 通过 |
| 近容量:已开始高危任务(含审核中)的等待 p90 | 1.058 | 5.604 | 0.189 | ≤ 1.000 | 通过 |
| 近容量:高危完成数量 | 123.600 | 123.400 | 1.002 | ≥ 1.000 | 通过 |
| 超容量:高危完成数量 | 184.200 | 137.600 | 1.339 | ≥ 1.000 | 通过 |
上述四项排序检查中有 0 项未通过;未设门槛或不可比较的项目另列,不计为通过。没有再要求测试精确率达到 99%,但新的排序策略仍需接受这些容量与完成量检查。
与严重度排序的配对比较也需要保留。超容量时,优先排序的高危完成数量平均差值为 -4.8 条,危害代理值/人时平均差值为 -1.375,方向均为优先排序减去严重度排序。优于 FIFO 并不说明它优于所有对照。
四类回归检查
门槛来自这次运行保存的政策快照。分类质量检查标签表现和预测量;路由质量检查送审队列;容量检查有限人力下的完成与积压;可复现性检查相同输入能否重放。 身份词差异在后面单独诊断。未设定的门槛不显示为通过。排序相对 FIFO 的四项检查见上表。
| 类别 | 检查 | 读数 | 要求 | 结果 |
|---|---|---|---|---|
| 分类质量 | AP toxic | 0.752 | ≥ 0.732 | 通过 |
| 分类质量 | AP obscene | 0.773 | ≥ 0.753 | 通过 |
| 分类质量 | AP insult | 0.696 | ≥ 0.676 | 通过 |
| 分类质量 | AP identity_hate | 0.480 | ≥ 0.460 | 通过 |
| 分类质量 | AP severe_toxic | 0.311 | ≥ 0.291 | 通过 |
| 分类质量 | AP threat | 0.458 | ≥ 0.438 | 通过 |
| 分类质量 | 普通审核阈值处精确率 toxic | 0.663 | ≥ 0.643 | 通过 |
| 分类质量 | 普通审核阈值处精确率 obscene | 0.773 | ≥ 0.753 | 通过 |
| 分类质量 | 普通审核阈值处精确率 insult | 0.879 | ≥ 0.858 | 通过 |
| 分类质量 | 普通审核阈值处精确率 severe_toxic | n/a | 未设定 | 未设门槛,仅报告 |
| 分类质量 | 普通审核阈值处精确率 threat | n/a | 未设定 | 未设门槛,仅报告 |
| 分类质量 | 普通审核阈值处精确率 identity_hate | n/a | 未设定 | 未设门槛,仅报告 |
| 分类质量 | 标签层级违例率 | 0.000 | ≤ 0.005 | 通过 |
| 分类质量 | 预测阳性量相对超出 severe_toxic | 0.916 | ≤ 1.000 | 通过 |
| 路由质量 | priority_review 精确率 | 0.763 | 未设定 | 未设门槛,仅报告 |
| 路由质量 | human_review 精确率 | 0.419 | 未设定 | 未设门槛,仅报告 |
| 容量 | 近容量完成率 | 0.994 | ≥ 0.970 | 通过 |
| 容量 | 近容量结束时未开始数量,种子均值 | 1.200 | ≤ 10 | 通过 |
| 容量 | 近容量等待 p50,合并逐任务记录,分钟 | 0.399 | ≤ 1.000 | 通过 |
| 容量 | 近容量队列深度 p95,种子均值 | 14.220 | ≤ 39 | 通过 |
| 容量 | 近容量审核员利用率 | 0.905 | ≥ 0.600 | 通过 |
可复现性:配置要求读取 simulation_jobs.csv,按负载 primary、种子 first 重放场景,浮点容差为 1e-09。
本页只展示保存的配置和指标;重算逐任务时间及重放顺序的检查由回归测试执行,不根据这张静态报告宣称已通过。
四种排序的仿真结果
容量为 120 条/小时,4 名审核员,每条 2 分钟。表格为 5 个种子的均值 ± 标准差;等待单位为分钟。等待统计所有已开始任务,含窗口结束时仍在审核的任务;未开始任务另外计数。高危剩余包括仍在服务中的任务,积压只计尚未开始的任务。
| 入队负载/h | 排序 | 完成 | 高危完成 | 高危剩余 | 危害代理值/人时 | 高危等待 p90 | 结束积压 |
|---|---|---|---|---|---|---|---|
| 60 | fifo | 467.8 ± 26.5 | 66.6 ± 13.5 | 0.0 ± 0.0 | 27.67 ± 3.48 | 0.26 ± 0.10 | 0.4 ± 0.8 |
| 60 | prob | 467.8 ± 26.5 | 66.6 ± 13.5 | 0.0 ± 0.0 | 27.67 ± 3.48 | 0.19 ± 0.09 | 0.4 ± 0.8 |
| 60 | severity | 467.8 ± 26.5 | 66.6 ± 13.5 | 0.0 ± 0.0 | 27.67 ± 3.48 | 0.18 ± 0.09 | 0.4 ± 0.8 |
| 60 | priority | 467.8 ± 26.5 | 66.6 ± 13.5 | 0.0 ± 0.0 | 27.67 ± 3.48 | 0.19 ± 0.09 | 0.4 ± 0.8 |
| 108 | fifo | 867.4 ± 20.3 | 123.4 ± 17.7 | 0.4 ± 0.5 | 50.41 ± 3.46 | 5.60 ± 1.99 | 1.2 ± 1.6 |
| 108 | prob | 867.4 ± 20.3 | 123.6 ± 17.4 | 0.2 ± 0.4 | 50.46 ± 3.42 | 1.10 ± 0.13 | 1.2 ± 1.6 |
| 108 | severity | 867.4 ± 20.3 | 123.6 ± 17.4 | 0.2 ± 0.4 | 50.47 ± 3.40 | 1.05 ± 0.08 | 1.2 ± 1.6 |
| 108 | priority | 867.4 ± 20.3 | 123.6 ± 17.4 | 0.2 ± 0.4 | 50.47 ± 3.40 | 1.06 ± 0.08 | 1.2 ± 1.6 |
| 180 | fifo | 953.2 ± 3.9 | 137.6 ± 3.0 | 69.4 ± 8.6 | 56.09 ± 1.28 | 138.94 ± 9.44 | 464.8 ± 41.5 |
| 180 | prob | 953.2 ± 3.9 | 183.6 ± 6.1 | 23.4 ± 4.5 | 69.62 ± 1.97 | 2.11 ± 0.50 | 464.8 ± 41.5 |
| 180 | severity | 953.2 ± 3.9 | 189.0 ± 5.7 | 18.0 ± 5.1 | 71.62 ± 1.56 | 1.88 ± 0.68 | 464.8 ± 41.5 |
| 180 | priority | 953.2 ± 3.9 | 184.2 ± 5.6 | 22.8 ± 5.3 | 70.24 ± 1.71 | 1.63 ± 0.31 | 464.8 ± 41.5 |
身份词子组诊断
FDR 比较待审评论中的误报占比,FPR 比较正常评论被送审的比例;比值方向均为含身份词除以不含。FDR 只在完整区间不高于设定上限时通过,跨越则不确定。FPR 单独报告,不能用 FDR 通过替代它。
| 层级 | FDR 比 | 95% 区间 | FDR 检查 | FPR 比 | 95% 区间 |
|---|---|---|---|---|---|
| predicted_positive | 1.023 | [0.922, 1.135] | 通过 | 1.949 | [1.722, 2.205] |
| priority_review | 0.882 | [0.743, 1.047] | 通过 | 1.498 | [1.237, 1.814] |
| human_review | 0.995 | [0.891, 1.112] | 通过 | 2.489 | [2.105, 2.942] |
如何复现
python scripts/run_pipeline.py --config configs/baseline.yaml
REVIEW_ROUTER_EVAL_REPORT=reports/<run>/report.json pytest -q tests/test_gate.py
python scripts/render_results.py reports/<run>
python record/collect_runs.py --human-review reports/<run>
python record/render.py
运行 20260922T141853710066Z-human-review-baseline,commit 563a0bf38226,工作区含未提交改动。本页读取保存的 运行数据与政策快照。首轮 99% 目标及未达标结果保留在历史记录,没有按新标准重算。