| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.27 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.41 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Coverage | 0.65 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Coverage | 0.01 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Coverage | 0.01 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.36 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.71 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Coverage | 0.51 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.12 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.57 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Coverage | 0.2 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.11 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.03 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.05 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.18 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.26 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.14 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.65 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Coverage | 0.21 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.24 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.31 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.78 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.06 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.43 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Coverage | 0.14 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.52 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.62 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.84 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.03 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.13 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Coverage | 0.2 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.67 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.7 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Coverage | 0.95 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.07 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.28 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Coverage | 0.26 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.64 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.71 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Coverage | 0.9 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.75 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.87 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.86 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.48 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.75 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.65 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.34 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.4 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.86 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.76 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.84 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Coverage | 0.91 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.37 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.45 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.81 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.29 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.38 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Coverage | 0.78 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.8 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.83 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.96 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.83 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.91 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.91 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.45 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.5 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Coverage | 0.9 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.13 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.26 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.51 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.13 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.18 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.76 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.02 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.59 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.04 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.67 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.74 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.9 proportion |