五类实体
- Benchmark:任务定义、版本、taxonomy、题数、许可和可运行状态。
- Work:创建论文、system card、正式技术报告或官方发布页。
- BenchmarkUse:说明一篇 Work 如何使用 benchmark,包括创建、评测、训练、微调、验证、模型选择或转述第三方结果;信息不完整时可保留 partial。
- EvaluationRun:来源足以规范化时,保存一套统一的 scope、精确模型/系统、prompt、工具、budget、grader 和指标。
- Model:来源中出现的精确模型名;相似名称不会自动合并。
Scope 规则
full 必须有实际题数,而且与对应版本总数一致;subset 必须写清 subset、过滤条件和 n;正式 track 使用 track;来源没写清楚就用 unknown,绝不默认全量。
缺失值
没报告的内容统一是 null + not_reported,不能用 0、空字符串或推断值代替。
结果可比性
只在显式 comparability_group 内比较模型。换了工具、subset、prompt、budget、grader 或 reasoning setting,必须拆成新的 run。
v1.1 字段级审计
每个 family 会从 legacy 独立升级为 audited 或 audited-with-caveats。低置信度或来源冲突的值继续显示在正常字段中,但旁边必须有 Provisional/Conflicted 警告,JSON 与 CSV 也保留机器可读状态。
legacy。CI 要求每个 legacy record 都必须在 registry 元数据中存在对应的机器可读例外。证据
关键 setting 和公开结果需要永久 evidence ID、官方 work/resource、访问日期、精确 locator,以及能解析到真实字段的路径。第三方题目、附件和论文全文不镜像。
本地论文持续入库
系统每周从 Europe PMC、Crossref 和 arXiv 发现候选,最多创建 10 个 issue,并按 protein 4、DNA/RNA 2、small molecule 2、omics/cell 2 控制配额。候选 issue 不进入 Registry,也不会自动触发模型抽取。只有仓库 owner 在本地 Codex 中明确选择论文链接或 issue 后,正式入库才会开始。
只读取合法开放全文或提交者确认有权提供的来源;单篇上限 45 MiB、150 页。系统计算 SHA256,全文只保存在本机 gitignored 临时目录并在清理阶段删除,不进入 Git、Release 或网站。
本地双阶段独立核验
第一阶段和第二阶段分别运行在两个全新的 ephemeral codex exec 会话中,使用只读 sandbox 和本地 Codex 登录,不使用仓库 OPENAI_API_KEY。第一阶段只生成受 Pydantic Schema 约束的 claim draft,不能写 YAML;第二阶段重新阅读原始 source,独立核对每条 claim 的页码、table、figure 和数字。只有双方都为 high confidence 且 locator 可解析的 claim 才交给确定性 generator。无数字标签的图、版本不明、模型身份不明或 subset n 不明,都只能形成 partial BenchmarkUse。
wang422003 必须评论 /approve-paper-intake <完整的当前 head SHA>;任何后续 push 都会让旧批准失效。