固定数据与 split
必须确认 benchmark 版本、dataset 版本、split/挑战轮次、目标子集与标签可见性。
口径先于排名
本站把 benchmark 名称当作起点,而不是可比性证明。真正的排名单元是经过指纹化的 protocol + metric。
四步对齐
必须确认 benchmark 版本、dataset 版本、split/挑战轮次、目标子集与标签可见性。
Macro/micro、mean/median、public/private、first/best model 都是不同口径;尺度转换保留原值与规则。
Zero-shot、probe、fine-tuning、外部数据、MSA/template、ensemble、best-of-N 与推理预算的差异会拆分比较组。
每个数值结果都需要 work、configuration、protocol、metric 和 canonical evidence;不接受未标注图中估读。
| Claim | 它真正表示什么 | 不能表示什么 |
|---|---|---|
| Official baseline | 官方指定的参考点。 | 不一定是最弱或最早方法。 |
| Original-table best | 同一来源表内的最佳数值。 | 不能声称跨论文 SOTA。 |
| Official-board leader | 同一挑战轮次与快照的官方领先者。 | 不能跨 public/private 或轮次外推。 |
| Strict cross-work SOTA | 至少两个独立 work 在完整一致口径中的最佳。 | 关键字段未知时不成立。 |
每个日期快照保留 manifest、内容哈希、分片行数与文献截止日。动态榜单变化时创建新快照,不静默改写旧分数。