| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.26 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.29 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Coverage | 0.9 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.15 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.17 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Coverage | 0.9 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.18 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.22 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Coverage | 0.81 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.15 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.26 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Coverage | 0.6 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.48 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.55 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Coverage | 0.87 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.24 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.3 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Coverage | 0.8 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.11 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.31 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Coverage | 0.35 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.22 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.36 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.62 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.14 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.16 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.84 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.32 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.38 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Coverage | 0.83 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.27 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.49 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Coverage | 0.55 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.23 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.24 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.95 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.27 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.38 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Coverage | 0.7 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.45 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.51 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.87 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.17 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.19 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Coverage | 0.91 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.57 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.57 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.26 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.26 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.47 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.52 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Coverage | 0.92 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.61 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.61 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.57 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.57 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.51 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.51 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.99 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.83 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.83 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.13 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.14 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.95 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.26 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.26 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.86 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.86 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 1 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.81 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.82 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.99 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.39 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.4 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Coverage | 0.99 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.21 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.22 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.97 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.12 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.12 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.97 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.18 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.35 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.53 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.49 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.51 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.96 proportion |