Jev 与词模型:固定样本的探索性对照
2026-09-23T09:35:21.469035+00:00 更新。目标是在相同数据和审核政策下,检查语义判断能否改善六标签分类与审核排序。现有 baseline 是 TF-IDF 加逻辑回归,本轮没有训练 BERT。
2026-09-23: The project owner reported that signup was at capacity and could not obtain API access. No live Jev API calls have been attempted. The paired word baseline and offline integration tests are complete; simulated test responses verify the code only and are not evidence of model performance.
The project owner reported the following signup message. Registration is currently unavailable, so no live Jev API calls have been attempted.
Whoops, we're full - check https://x.com/typesafeai for more information!
The notice links to TypeSafe updates. This records a user-reported access limitation. No results are available to assess Jev's performance.
实验设计
word 使用原 train 子集训练六个逻辑回归。Jev 使用固定版本 jev-1.13.0,一次调用分别询问六个标签,保留六个独立概率,不将它们归一化为总和 1。输入仅含评论正文与固定任务定义,不含标签、模型分数或人工审计判断。问题定义见 jev_questions.json。
两种方法使用同一 calib 子集拟合 Platt 校准,同一 thresh 子集选择阈值,同一 test 子集评估。word 校准原始分类间隔,Jev 校准原始概率的 logit,裁剪范围为 0.000001 到 0.999999。若校准标签只有一类,保留原始概率并记录无法拟合。下游复用原有阈值选择、规则、人工确认与队列模拟。
两种方法的预训练条件不同,这是完整方法在本项目中的对照,不能把差异归因于某一项架构。所有处置仍由人工确认。
固定样本
从原始划分中按 seed、split 和 ID 的 SHA-256 排序取样,不看标签。保留原始行序,记录各集合 ID 哈希;样本少也不换 seed。协议见 protocol.json,选中的 ID 见 cohort.csv。
| 用途 | 行数 | toxic 阳性 | severe_toxic 阳性 | obscene 阳性 | threat 阳性 | insult 阳性 | identity_hate 阳性 |
|---|---|---|---|---|---|---|---|
| train | 95,743 | 9,182 | 983 | 5,140 | 293 | 4,776 | 854 |
| calib | 4,000 | 360 | 36 | 191 | 12 | 187 | 22 |
| thresh | 8,000 | 770 | 77 | 430 | 25 | 387 | 71 |
| test | 10,000 | 944 | 52 | 573 | 40 | 526 | 108 |
稀有标签的样本数限制结论强度。现有阈值规则至少需要 30 个预测阳性;90% 和 95% 的精确率目标分别至少需要 27 和 29 个真阳性。关闭某个标签的阈值不代表模型无法识别它;评论还可能通过其他标签或规则进入审核。
当前结果
| 方法 | 需人工审核 | 审核比例 | 队列精确率 | 高风险送审/总数 | 高风险留在放行 |
|---|---|---|---|---|---|
| word | 1,044 | 10.44% | 0.653 | 146 / 170 | 24 |
| Jev | 尚无真实预测,不能计算 | ||||
| 标签 | word AP | word Brier | Jev AP | Jev Brier |
|---|---|---|---|---|
| toxic | 0.737 | 0.0515 | 待实测 | 待实测 |
| severe_toxic | 0.331 | 0.0054 | 待实测 | 待实测 |
| obscene | 0.775 | 0.0258 | 待实测 | 待实测 |
| threat | 0.433 | 0.0030 | 待实测 | 待实测 |
| insult | 0.692 | 0.0266 | 待实测 | 待实测 |
| identity_hate | 0.437 | 0.0080 | 待实测 | 待实测 |
AP 越高越好,Brier 越低越好。表中正确性沿用原始 Jigsaw 标签,只是审核价值的代理指标。pilot 报告明确标为探索性,不能冒充完整语料上的 baseline 验收。
阈值选择与关闭原因
下表为全体选择样本上的分标签阈值。身份词子组还需通过自己的阈值;其明细保存在 jev_run.json 的 thresholds.subgroup 中。
| 方法 | 标签 | 层级 | 阈值 | 选择集预测阳性 | 选择集精确率 | 状态 |
|---|---|---|---|---|---|---|
| word | toxic | human_review | 0.587 | 547 | 0.901 | 已启用 |
| word | toxic | priority_review | 0.820 | 413 | 0.952 | 已启用 |
| word | severe_toxic | human_review | n/a | 0 | n/a | 关闭:没有分数阈值同时满足最低数量和精确率目标 |
| word | severe_toxic | priority_review | n/a | 0 | n/a | 关闭:没有分数阈值同时满足最低数量和精确率目标 |
| word | obscene | human_review | 0.577 | 324 | 0.901 | 已启用 |
| word | obscene | priority_review | 0.931 | 221 | 0.950 | 已启用 |
| word | threat | human_review | n/a | 0 | n/a | 关闭:阳性 25 条,少于至少所需的 27 条 |
| word | threat | priority_review | n/a | 0 | n/a | 关闭:阳性 25 条,少于至少所需的 29 条 |
| word | insult | human_review | 0.930 | 132 | 0.902 | 已启用 |
| word | insult | priority_review | 0.993 | 66 | 0.955 | 已启用 |
| word | identity_hate | human_review | n/a | 0 | n/a | 关闭:没有分数阈值同时满足最低数量和精确率目标 |
| word | identity_hate | priority_review | n/a | 0 | n/a | 关闭:没有分数阈值同时满足最低数量和精确率目标 |
相同标记量与相同评论流
Jev 预测尚未完成,暂无等标记量差异、配对区间或两模型队列比较。
是否值得扩大实验,需要同时看高风险漏审差异的方向与区间、实际送审量、积压和完成量。不能仅凭总准确率或新增送审带来的召回提升更换默认模型。
实现验证
全套测试 315 项通过,3 项跳过。未开启干净提交检查;两个分层精确率项目按既有政策只作诊断,没有固定验收下限。 Ruff 与 mypy 均通过。
完整 63,978 条测试行上的八个指标区块与已保存的人工审核 baseline 完全一致,仍有 6,310 条送审。全套测试使用此真实数据报告,包含固定语料哈希和回归门槛检查。 运行目录:20260923T091213816605Z-human-review-baseline。
这些检查验证接入代码与现有流程;它们不证明 Jev 的真实准确率、延迟或在线接口兼容性。
成本与复现边界
尚未完成 Jev 调用,暂无调用成本或延迟测量。
word 本次训练、校准和预测合计 14.9 秒;其中阈值集与测试集的批量预测合计 0.9 秒。这是本机批量耗时,不能直接与单条 API 延迟作倍数比较。
锁定模型版本、问题、样本与原始响应。缓存键绑定端点、版本、完整问题和文本;缺失、非法概率或版本不符会停止评估,不跳过困难样本。缓存重放能复算已保存预测,不能保证外部服务未来生成逐值相同的响应。
官方测试集已经反复查看,Jev 的预训练数据是否含此公开语料也未知。本轮不声称独立泛化结果,不比较 BERT 优劣,也不证明真实送审价值提升。独立人工评估继续暂缓。
复现命令
# 准备固定样本并运行配对 word 对照,不调用 API
python scripts/run_jev_experiment.py --prepare-only
# Once registration is available, obtain API access and set TYPESAFE_API_KEY
python scripts/run_jev_experiment.py --allow-network
# 只用缓存重放,缺失时停止
python scripts/run_jev_experiment.py
python record/render.py
真实调用需要有效 API 访问,密钥只从进程环境读取,不写入配置或报告。reports/jev-cache/ 不提交到 Git;跨机器复算需要另行取得该缓存或重新调用服务。
- word:
20260923T091052513799Z-jev-pilot-word,commit7a1765906648,工作区含未提交改动。
协议 SHA-256:4a85201c80d1246e93a4a0250bb83227d1527259b27677808ddb0602a19c056f。本页读取 jev_run.json,原始比较汇总保存在 analysis/jev/。