口径先于排名

什么时候,两个分数才能放在一起?

本站把 benchmark 名称当作起点,而不是可比性证明。真正的排名单元是经过指纹化的 protocol + metric。

四步对齐

01

固定数据与 split

必须确认 benchmark 版本、dataset 版本、split/挑战轮次、目标子集与标签可见性。

02

固定指标定义

Macro/micro、mean/median、public/private、first/best model 都是不同口径;尺度转换保留原值与规则。

03

固定训练与推理制度

Zero-shot、probe、fine-tuning、外部数据、MSA/template、ensemble、best-of-N 与推理预算的差异会拆分比较组。

04

验证证据与配置身份

每个数值结果都需要 work、configuration、protocol、metric 和 canonical evidence;不接受未标注图中估读。

四类领先声明不能混用

Claim它真正表示什么不能表示什么
Official baseline官方指定的参考点。不一定是最弱或最早方法。
Original-table best同一来源表内的最佳数值。不能声称跨论文 SOTA。
Official-board leader同一挑战轮次与快照的官方领先者。不能跨 public/private 或轮次外推。
Strict cross-work SOTA至少两个独立 work 在完整一致口径中的最佳。关键字段未知时不成立。

排名和缺口

  • 官方名次原样保留;内部重算使用 competition ranking 并保留并列。
  • 结果库不完整时,重算名次标记为 observed subset rank。
  • 无公开精确值、访问受限、无标准数值协议和无法重建口径分开标记。
  • 不计算跨 benchmark 综合分或全局模型排名。

数据快照与可追溯性

每个日期快照保留 manifest、内容哈希、分片行数与文献截止日。动态榜单变化时创建新快照,不静默改写旧分数。