方法学导览

把 benchmark、评测设置和结果拆开。

这样才能回答“谁在哪篇工作中,用什么设置,测了 benchmark 的哪一部分”。

五类实体

  1. Benchmark:任务定义、版本、taxonomy、题数、许可和可运行状态。
  2. Work:创建论文、system card、正式技术报告或官方发布页。
  3. BenchmarkUse:说明一篇 Work 如何使用 benchmark,包括创建、评测、训练、微调、验证、模型选择或转述第三方结果;信息不完整时可保留 partial。
  4. EvaluationRun:来源足以规范化时,保存一套统一的 scope、精确模型/系统、prompt、工具、budget、grader 和指标。
  5. Model:来源中出现的精确模型名;相似名称不会自动合并。

Scope 规则

full 必须有实际题数,而且与对应版本总数一致;subset 必须写清 subset、过滤条件和 n;正式 track 使用 track;来源没写清楚就用 unknown,绝不默认全量。

缺失值

没报告的内容统一是 null + not_reported,不能用 0、空字符串或推断值代替。

结果可比性

只在显式 comparability_group 内比较模型。换了工具、subset、prompt、budget、grader 或 reasoning setting,必须拆成新的 run。

v1.1 字段级审计

每个 family 会从 legacy 独立升级为 auditedaudited-with-caveats。低置信度或来源冲突的值继续显示在正常字段中,但旁边必须有 Provisional/Conflicted 警告,JSON 与 CSV 也保留机器可读状态。

当前审计边界:首发 15 个 family 中已有 14 个完成字段级审计。维护者决定暂缓 VirBench 的细化,因此其已核验的 v1 record 继续明确标记为 legacy。CI 要求每个 legacy record 都必须在 registry 元数据中存在对应的机器可读例外。
保守比较:provisional/conflicted 总数不能证明全量评测;相同状态的结果行可以下载核查,但不会进入模型比较图。

证据

关键 setting 和公开结果需要永久 evidence ID、官方 work/resource、访问日期、精确 locator,以及能解析到真实字段的路径。第三方题目、附件和论文全文不镜像。

本地论文持续入库

系统每周从 Europe PMC、Crossref 和 arXiv 发现候选,最多创建 10 个 issue,并按 protein 4、DNA/RNA 2、small molecule 2、omics/cell 2 控制配额。候选 issue 不进入 Registry,也不会自动触发模型抽取。只有仓库 owner 在本地 Codex 中明确选择论文链接或 issue 后,正式入库才会开始。

只读取合法开放全文或提交者确认有权提供的来源;单篇上限 45 MiB、150 页。系统计算 SHA256,全文只保存在本机 gitignored 临时目录并在清理阶段删除,不进入 Git、Release 或网站。

本地双阶段独立核验

第一阶段和第二阶段分别运行在两个全新的 ephemeral codex exec 会话中,使用只读 sandbox 和本地 Codex 登录,不使用仓库 OPENAI_API_KEY。第一阶段只生成受 Pydantic Schema 约束的 claim draft,不能写 YAML;第二阶段重新阅读原始 source,独立核对每条 claim 的页码、table、figure 和数字。只有双方都为 high confidence 且 locator 可解析的 claim 才交给确定性 generator。无数字标签的图、版本不明、模型身份不明或 subset n 不明,都只能形成 partial BenchmarkUse。

Owner gate:本地 Codex 只能创建 Ready PR,不能自动合并。wang422003 必须评论 /approve-paper-intake <完整的当前 head SHA>;任何后续 push 都会让旧批准失效。