第 5 步Registration unavailable; live evaluation deferred

Jev 与词模型:固定样本的探索性对照

2026-09-23T09:35:21.469035+00:00 更新。目标是在相同数据和审核政策下,检查语义判断能否改善六标签分类与审核排序。现有 baseline 是 TF-IDF 加逻辑回归,本轮没有训练 BERT。

Current conclusion: Live Jev evaluation is deferred because TypeSafe registration is currently unavailable. No real Jev predictions have been collected, so its effect on classification and review queues is unknown. The default remains word.

2026-09-23: The project owner reported that signup was at capacity and could not obtain API access. No live Jev API calls have been attempted. The paired word baseline and offline integration tests are complete; simulated test responses verify the code only and are not evidence of model performance.

The project owner reported the following signup message. Registration is currently unavailable, so no live Jev API calls have been attempted.

Whoops, we're full - check https://x.com/typesafeai for more information!

The notice links to TypeSafe updates. This records a user-reported access limitation. No results are available to assess Jev's performance.

实验设计

word 使用原 train 子集训练六个逻辑回归。Jev 使用固定版本 jev-1.13.0,一次调用分别询问六个标签,保留六个独立概率,不将它们归一化为总和 1。输入仅含评论正文与固定任务定义,不含标签、模型分数或人工审计判断。问题定义见 jev_questions.json。

两种方法使用同一 calib 子集拟合 Platt 校准,同一 thresh 子集选择阈值,同一 test 子集评估。word 校准原始分类间隔,Jev 校准原始概率的 logit,裁剪范围为 0.000001 到 0.999999。若校准标签只有一类,保留原始概率并记录无法拟合。下游复用原有阈值选择、规则、人工确认与队列模拟。

两种方法的预训练条件不同,这是完整方法在本项目中的对照,不能把差异归因于某一项架构。所有处置仍由人工确认。

固定样本

从原始划分中按 seed、split 和 ID 的 SHA-256 排序取样,不看标签。保留原始行序,记录各集合 ID 哈希;样本少也不换 seed。协议见 protocol.json,选中的 ID 见 cohort.csv。

用途行数toxic 阳性severe_toxic 阳性obscene 阳性threat 阳性insult 阳性identity_hate 阳性
train95,7439,1829835,1402934,776854
calib4,000360361911218722
thresh8,000770774302538771
test10,0009445257340526108

稀有标签的样本数限制结论强度。现有阈值规则至少需要 30 个预测阳性;90% 和 95% 的精确率目标分别至少需要 27 和 29 个真阳性。关闭某个标签的阈值不代表模型无法识别它;评论还可能通过其他标签或规则进入审核。

当前结果

方法需人工审核审核比例队列精确率高风险送审/总数高风险留在放行
word1,04410.44%0.653146 / 17024
Jev尚无真实预测,不能计算
标签word APword BrierJev APJev Brier
toxic0.7370.0515待实测待实测
severe_toxic0.3310.0054待实测待实测
obscene0.7750.0258待实测待实测
threat0.4330.0030待实测待实测
insult0.6920.0266待实测待实测
identity_hate0.4370.0080待实测待实测

AP 越高越好,Brier 越低越好。表中正确性沿用原始 Jigsaw 标签,只是审核价值的代理指标。pilot 报告明确标为探索性,不能冒充完整语料上的 baseline 验收。

阈值选择与关闭原因

下表为全体选择样本上的分标签阈值。身份词子组还需通过自己的阈值;其明细保存在 jev_run.json 的 thresholds.subgroup 中。

方法标签层级阈值选择集预测阳性选择集精确率状态
wordtoxichuman_review0.5875470.901已启用
wordtoxicpriority_review0.8204130.952已启用
wordsevere_toxichuman_reviewn/a0n/a关闭:没有分数阈值同时满足最低数量和精确率目标
wordsevere_toxicpriority_reviewn/a0n/a关闭:没有分数阈值同时满足最低数量和精确率目标
wordobscenehuman_review0.5773240.901已启用
wordobscenepriority_review0.9312210.950已启用
wordthreathuman_reviewn/a0n/a关闭:阳性 25 条,少于至少所需的 27 条
wordthreatpriority_reviewn/a0n/a关闭:阳性 25 条,少于至少所需的 29 条
wordinsulthuman_review0.9301320.902已启用
wordinsultpriority_review0.993660.955已启用
wordidentity_hatehuman_reviewn/a0n/a关闭:没有分数阈值同时满足最低数量和精确率目标
wordidentity_hatepriority_reviewn/a0n/a关闭:没有分数阈值同时满足最低数量和精确率目标

相同标记量与相同评论流

Jev 预测尚未完成,暂无等标记量差异、配对区间或两模型队列比较。

是否值得扩大实验,需要同时看高风险漏审差异的方向与区间、实际送审量、积压和完成量。不能仅凭总准确率或新增送审带来的召回提升更换默认模型。

实现验证

全套测试 315 项通过,3 项跳过。未开启干净提交检查;两个分层精确率项目按既有政策只作诊断,没有固定验收下限。 Ruff 与 mypy 均通过。

完整 63,978 条测试行上的八个指标区块与已保存的人工审核 baseline 完全一致,仍有 6,310 条送审。全套测试使用此真实数据报告,包含固定语料哈希和回归门槛检查。 运行目录:20260923T091213816605Z-human-review-baseline。

这些检查验证接入代码与现有流程;它们不证明 Jev 的真实准确率、延迟或在线接口兼容性。

成本与复现边界

尚未完成 Jev 调用,暂无调用成本或延迟测量。

word 本次训练、校准和预测合计 14.9 秒;其中阈值集与测试集的批量预测合计 0.9 秒。这是本机批量耗时,不能直接与单条 API 延迟作倍数比较。

锁定模型版本、问题、样本与原始响应。缓存键绑定端点、版本、完整问题和文本;缺失、非法概率或版本不符会停止评估,不跳过困难样本。缓存重放能复算已保存预测,不能保证外部服务未来生成逐值相同的响应。

官方测试集已经反复查看,Jev 的预训练数据是否含此公开语料也未知。本轮不声称独立泛化结果,不比较 BERT 优劣,也不证明真实送审价值提升。独立人工评估继续暂缓。

复现命令

# 准备固定样本并运行配对 word 对照,不调用 API
python scripts/run_jev_experiment.py --prepare-only
# Once registration is available, obtain API access and set TYPESAFE_API_KEY
python scripts/run_jev_experiment.py --allow-network
# 只用缓存重放,缺失时停止
python scripts/run_jev_experiment.py
python record/render.py

真实调用需要有效 API 访问,密钥只从进程环境读取,不写入配置或报告。reports/jev-cache/ 不提交到 Git;跨机器复算需要另行取得该缓存或重新调用服务。

协议 SHA-256:4a85201c80d1246e93a4a0250bb83227d1527259b27677808ddb0602a19c056f。本页读取 jev_run.json,原始比较汇总保存在 analysis/jev/。

接口与版本依据:Noul、模型版本、已知限制。厂商关于性能和校准的描述不能替代本项目测量。