Paper and work explorer

Trace every benchmark claim back to a work.

Filter creator papers, provider releases, and independent studies by benchmark relationship, realized scope, and reporting completeness.

49 works · Download works CSV · Download benchmark-use CSV

WorkType / sourcePublishedReviewBenchmark usageCompleteness
A benchmark comparison of CRISPRn guide-RNA design algorithms and generation of small single and dual-targeting libraries to boost screening efficiency
Joint Astrazeneca-Cancer Research Horizons Functional Genomics Centre
paper
benchmark creator
2025-02-26AI-assisted
owner-reviewed
2 benchmark(s)
benchmark creation, evaluation
partial
AB-Bind: Antibody binding mutational database for computational affinity predictions
Massachusetts Institute of Technology · Pfizer Inc.
paper
benchmark creator
2015-11-06AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation, fine tuning
partial
AbBiBench: A Benchmark for Antibody Binding Affinity Maturation and Design
McWilliams School of Biomedical Informatics, UTHealth Houston · Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology · Texas Therapeutics Institute, Brown Foundation Institute of Molecular Medicine, UTHealth Houston
preprint
benchmark creator
2025-05-23AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation
partial
An integrative approach to protein sequence design through multiobjective optimization
University of California, San Francisco · Quantitative Biosciences Institute · Chan Zuckerberg Biohub
paper
benchmark creator
2024-07-11AI-assisted
owner-reviewed
3 benchmark(s)
benchmark creation, evaluation
partial
Advancing Claude in healthcare and the life sciences
Anthropic
official-release
official model provider
2026-01-11manual5 benchmark(s)
evaluation, benchmark creation, external result summary
partial
Claude for Life Sciences
Anthropic
official-release
official model provider
2025-10-20manual1 benchmark(s)
evaluation
partial
Claude Sonnet 4.5 System Card
Anthropic
system-card
official model provider
2025-09-29manualMetadata onlynon evaluation
Claude Sonnet 4.6 System Card
Anthropic
system-card
official model provider
2026-02-17manualMetadata onlynon evaluation
ATOM3D: Tasks On Molecules in Three Dimensions
Stanford University
paper
benchmark creator
2021-12-07manualMetadata onlynon evaluation
BEACON: Benchmark for Comprehensive RNA Tasks and Language Models
Shanghai Artificial Intelligence Laboratory · University of Sydney · University of Hong Kong · Shanghai Jiao Tong University · Fudan University · Chinese University of Hong Kong
paper
benchmark creator
2024-12-10manualMetadata onlynon evaluation
Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models
Shanghai Artificial Intelligence Laboratory · University of Science and Technology of China · University of Sydney · University of Toronto · Chinese University of Hong Kong · Shanghai Jiao Tong University · Fudan University · Shanghai Innovation Institute
paper
benchmark creator
2025-11-04manualMetadata onlynon evaluation
Evaluating Claude's bioinformatics research capabilities with BioMysteryBench
Anthropic
official-release
benchmark creator
2026-04-29manualMetadata onlynon evaluation
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
LatchBio · Aclid
preprint
benchmark creator
2026-07-21AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation
partial
BioSecBench-Surveillance repository result snapshot
LatchBio
official-release
benchmark creator
2026-07-09AI-assisted
owner-reviewed
1 benchmark(s)
evaluation
normalized
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
FutureHouse · ScienceMachine
preprint
benchmark creator
2025-02-28manualMetadata onlynon evaluation
BixBench v1.5 dataset and evaluation release
FutureHouse · ScienceMachine
official-release
benchmark creator
2025-09-26manualMetadata onlynon evaluation
BLADE: Benchmarking Language Model Agents for Data-Driven Science
University of Washington · UC Berkeley · New York University · Stanford University · University of British Columbia · Microsoft · George Washington University
paper
benchmark creator
2024-11-16manualMetadata onlynon evaluation
Continuous Automated Model EvaluatiOn (CAMEO) Complementing the Critical Assessment of Structure Prediction in CASP12
SIB Swiss Institute of Bioinformatics · Biozentrum University of Basel
paper
benchmark creator
2017-12-17manualMetadata onlynon evaluation
Beyond Single Chains: Benchmarking Macromolecular Complex Prediction Methods With the Continuous Automated Model EvaluatiOn (CAMEO)
SIB Swiss Institute of Bioinformatics · Biozentrum University of Basel
paper
benchmark creator
2025-09-28manualMetadata onlynon evaluation
CASP16 official competition and results archive
Prediction Center · CASP organizing committee
competition-site
benchmark creator
2024-05-01manualMetadata onlynon evaluation
Assessment of Pharmaceutical Protein-Ligand Pose and Affinity Predictions in CASP16
University of California San Diego · University of Basel · University of California Davis
paper
benchmark creator
2025-10-04manualMetadata onlynon evaluation
CASP16 Protein Monomer Structure Prediction Assessment
University of Texas Southwestern Medical Center · University of California Davis
paper
benchmark creator
2025-08-17manualMetadata onlynon evaluation
Assessment of Protein Complex Predictions in CASP16: Are We Making Progress?
University of Texas Southwestern Medical Center · University of California Davis · Stanford University
paper
benchmark creator
2025-10-31manualMetadata onlynon evaluation
CASP17 official competition
Prediction Center · CASP organizing committee
competition-site
benchmark creator
2026-03-31manualMetadata onlynon evaluation
Agentic systems are adept at solving well-scoped, verifiable problems in computational biology
Genentech · Roche
preprint
benchmark creator
2026-04-09manualMetadata onlynon evaluation
Comprehensive benchmark of differential transcript usage analysis for bulk and single-cell RNA sequencing
Data Science in Systems Biology, Technical University of Munich · Chair of Computational Systems Biology, University of Hamburg · Institute for Advanced Study, Technical University of Munich · National Institute of Diabetes, Digestive, and Kidney Diseases, National Institutes of Health · Institute of Mathematics and Computer Science, University of Southern Denmark · Munich Data Science Institute (MDSI), Technical University of Munich · Department of Computer Science, Bioinformatics, Vrije Universiteit Amsterdam
paper
benchmark creator
2025-09-11AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation
partial
Crafted experiments to evaluate feature selection methods for single-cell RNA-seq data
Lineberger Comprehensive Cancer Center, University of North Carolina · University of North Carolina at Chapel Hill
paper
benchmark creator
2025-03-19AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation
partial
Enhancing molecular property prediction with auxiliary learning and task-specific adaptation
The Ohio State University
paper
independent reproduction
2024-07-24AI-assisted
owner-reviewed
1 benchmark(s)
fine tuning, evaluation
partial
Explainable protein-protein binding affinity prediction via fine-tuning protein language models
Department of Computer Science and Engineering, Shiv Nadar University, Delhi-NCR · School of Informatics, University of Edinburgh · EaStCHEM School of Chemistry, University of Edinburgh
preprint
independent reproduction
2026-04-01AI-assisted
owner-reviewed
3 benchmark(s)
evaluation, fine tuning, training
partial
FLIP: Benchmark tasks in fitness landscape inference for proteins
Technical University of Munich · Microsoft Research New England · California Institute of Technology · University of California Berkeley · Massachusetts Institute of Technology · Salesforce Research
paper
benchmark creator
2021-10-11manualMetadata onlynon evaluation
GeneBench-Pro: Evaluating Multistage Statistical Reasoning in Genomics, Quantitative Biology, and Translational Biomedicine
OpenAI
preprint
benchmark creator
2026-06-30manualMetadata onlynon evaluation
Genomic benchmarks: a collection of datasets for genomic sequence classification
Masaryk University · CEITEC Masaryk University
paper
benchmark creator
2023-05-01manualMetadata onlynon evaluation
GuacaMol: Benchmarking Models for de Novo Molecular Design
BenevolentAI
paper
benchmark creator
2019-03-19manualMetadata onlynon evaluation
LAB-Bench: Measuring Capabilities of Language Models for Biology Research
FutureHouse
paper
benchmark creator
2024-07-14manualMetadata onlynon evaluation
LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences
OpenAI · Tacit Labs
preprint
benchmark creator
2026-06-17manualMetadata onlynon evaluation
MoleculeNet: a benchmark for molecular machine learning
Stanford University · DeepChem
paper
benchmark creator
2017-10-31manualMetadata onlynon evaluation
PPB-Affinity: Protein-Protein Binding Affinity dataset for AI-based protein drug discovery
Artificial Intelligence Innovation Center, Research Institute of Tsinghua, Pearl River Delta · Cyagen Biosciences (Suzhou) Inc. · Cyagen Biosciences (Guangzhou) Inc. · Cyagen Biomodels (Guangzhou) Co., Ltd · Department of Pain Medicine, Shenzhen Nanshan People’s Hospital, Shenzhen University Medical School
paper
benchmark creator
2024-12-03AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation, training
partial
ProteinGym: Large-Scale Benchmarks for Protein Fitness Prediction and Design
University of Oxford · Harvard Medical School · Seismic Therapeutic · Harvard University · Centre for Genomic Regulation · Universitat Pompeu Fabra · Broad Institute
paper
benchmark creator
2023-12-10manualMetadata onlynon evaluation
A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding
Toursun Synbio · Johns Hopkins University · University of Cambridge · Shanghai Institute for Biomedical and Pharmaceutical Technologies · Shanghai AI Laboratory · Shanghai Jiao Tong University · UNSW Sydney
preprint
benchmark creator
2024-06-08manualMetadata onlynon evaluation
scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis
LatchBio
preprint
benchmark creator
2026-02-09AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation, evaluation
partial
Benchmarking atlas-level data integration in single-cell genomics
Helmholtz Zentrum München · Technical University of Munich
paper
benchmark creator
2021-12-23manualMetadata onlynon evaluation
Measuring Scientific Capabilities of Language Models with a Systems Biology Dry Lab
University of Toronto · SickKids · Axiom · Mila · Vector Institute
paper
benchmark creator
2025-11-30manualMetadata onlynon evaluation
Single-cell omics arena: evaluation of large language models for automatic cell-type annotations on single-cell omics data via RNA-seq bridging
University of California, Irvine
paper
benchmark creator
2025-11-24AI-assisted
owner-reviewed
1 benchmark(s)
benchmark creation
non evaluation
Single-cell Omics Arena repository result snapshot
University of California, Irvine
official-release
benchmark creator
2025-08-03AI-assisted
owner-reviewed
1 benchmark(s)
evaluation
partial
SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
LatchBio
preprint
benchmark creator
2025-12-26manual1 benchmark(s)
benchmark creation, evaluation
normalized
SpatialBench 159-evaluation repository snapshot
LatchBio
official-release
benchmark creator
2026-06-10manual1 benchmark(s)
benchmark creation, evaluation
normalized
System Card: Claude Opus 5
Anthropic
system-card
official model provider
2026-07-24AI-assisted
owner-reviewed
4 benchmark(s)
evaluation
partial
Evaluating Protein Transfer Learning with TAPE
University of California Berkeley
paper
benchmark creator
2019-12-08manualMetadata onlynon evaluation
Paving the way for AI agents in biology
Anthropic
official-release
benchmark creator
2025-05-20manualMetadata onlynon evaluation

AbBiBench: A Benchmark for Antibody Binding Affinity Maturation and Design

McWilliams School of Biomedical Informatics, UTHealth Houston · Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology · Texas Therapeutics Institute, Brown Foundation Institute of Molecular Medicine, UTHealth Houston

2025-05-23preprintbenchmark creator
partialAI-assisted
Benchmark usage1
Relationsbenchmark creation, evaluation

Claude for Life Sciences

Anthropic

2025-10-20official-releaseofficial model provider
partialmanual review
Benchmark usage1
Relationsevaluation

Claude Sonnet 4.5 System Card

Anthropic

2025-09-29system-cardofficial model provider
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

Claude Sonnet 4.6 System Card

Anthropic

2026-02-17system-cardofficial model provider
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

BEACON: Benchmark for Comprehensive RNA Tasks and Language Models

Shanghai Artificial Intelligence Laboratory · University of Sydney · University of Hong Kong · Shanghai Jiao Tong University · Fudan University · Chinese University of Hong Kong

2024-12-10paperbenchmark creator
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

BLADE: Benchmarking Language Model Agents for Data-Driven Science

University of Washington · UC Berkeley · New York University · Stanford University · University of British Columbia · Microsoft · George Washington University

2024-11-16paperbenchmark creator
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

CASP17 official competition

Prediction Center · CASP organizing committee

2026-03-31competition-sitebenchmark creator
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

Comprehensive benchmark of differential transcript usage analysis for bulk and single-cell RNA sequencing

Data Science in Systems Biology, Technical University of Munich · Chair of Computational Systems Biology, University of Hamburg · Institute for Advanced Study, Technical University of Munich · National Institute of Diabetes, Digestive, and Kidney Diseases, National Institutes of Health · Institute of Mathematics and Computer Science, University of Southern Denmark · Munich Data Science Institute (MDSI), Technical University of Munich · Department of Computer Science, Bioinformatics, Vrije Universiteit Amsterdam

2025-09-11paperbenchmark creator
partialAI-assisted
Benchmark usage1
Relationsbenchmark creation, evaluation

FLIP: Benchmark tasks in fitness landscape inference for proteins

Technical University of Munich · Microsoft Research New England · California Institute of Technology · University of California Berkeley · Massachusetts Institute of Technology · Salesforce Research

2021-10-11paperbenchmark creator
non evaluationmanual review
Benchmark usage0
RelationsMetadata only

PPB-Affinity: Protein-Protein Binding Affinity dataset for AI-based protein drug discovery

Artificial Intelligence Innovation Center, Research Institute of Tsinghua, Pearl River Delta · Cyagen Biosciences (Suzhou) Inc. · Cyagen Biosciences (Guangzhou) Inc. · Cyagen Biomodels (Guangzhou) Co., Ltd · Department of Pain Medicine, Shenzhen Nanshan People’s Hospital, Shenzhen University Medical School

2024-12-03paperbenchmark creator
partialAI-assisted
Benchmark usage1
Relationsbenchmark creation, evaluation, training

System Card: Claude Opus 5

Anthropic

2026-07-24system-cardofficial model provider
partialAI-assisted
Benchmark usage4
Relationsevaluation