| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.1 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.33 proportion |
| LAB-Bench CloningScenarios | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-cloning-scenarios-creator-mcq lab-bench-cloning-scenarios-paper-v3-zero-shot-cot-no-tools | Coverage | 0.3 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — Disease gene associations | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-dga-creator-mcq lab-bench-dbqa-dga-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.03 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.22 proportion |
| LAB-Bench DbQA — Gene location | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-gene-location-creator-mcq lab-bench-dbqa-gene-location-paper-v3-zero-shot-cot-no-tools | Coverage | 0.09 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — miRNA targets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mirna-targets-creator-mcq lab-bench-dbqa-mirna-targets-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.1 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.76 proportion |
| LAB-Bench DbQA — Mouse tumor gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-mouse-tumor-gene-sets-creator-mcq lab-bench-dbqa-mouse-tumor-gene-sets-paper-v3-zero-shot-cot-no-tools | Coverage | 0.14 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.04 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.75 proportion |
| LAB-Bench DbQA — Oncogenic signatures | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-oncogenic-signatures-creator-mcq lab-bench-dbqa-oncogenic-signatures-paper-v3-zero-shot-cot-no-tools | Coverage | 0.05 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — GTRD transcription-factor binding sites | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-tfbs-gtrd-creator-mcq lab-bench-dbqa-tfbs-gtrd-paper-v3-zero-shot-cot-no-tools | Coverage | 0.01 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.17 proportion |
| LAB-Bench DbQA — Protein variant from sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-from-sequence-creator-mcq lab-bench-dbqa-variant-from-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.01 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.33 proportion |
| LAB-Bench DbQA — Protein variant with multiple sequences | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-variant-multi-sequence-creator-mcq lab-bench-dbqa-variant-multi-sequence-paper-v3-zero-shot-cot-no-tools | Coverage | 0.04 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.13 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.61 proportion |
| LAB-Bench DbQA — Vaccine response gene sets | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-vax-response-creator-mcq lab-bench-dbqa-vax-response-paper-v3-zero-shot-cot-no-tools | Coverage | 0.21 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Accuracy | 0 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0 proportion |
| LAB-Bench DbQA — Viral protein–protein interactions | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-dbqa-viral-ppi-creator-mcq lab-bench-dbqa-viral-ppi-paper-v3-zero-shot-cot-no-tools | Coverage | 0 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.25 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.34 proportion |
| LAB-Bench FigQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-figqa-creator-mcq lab-bench-figqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.73 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.1 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.44 proportion |
| LAB-Bench LitQA2 | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-litqa2-creator-mcq lab-bench-litqa2-paper-v3-zero-shot-cot-no-tools | Coverage | 0.23 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.47 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.58 proportion |
| LAB-Bench ProtocolQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-protocolqa-creator-mcq lab-bench-protocolqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.81 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.02 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.09 proportion |
| LAB-Bench SeqQA — ORF amino-acid position | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaid-creator-mcq lab-bench-seqqa-orf-seq-aaid-paper-v3-zero-shot-cot-no-tools | Coverage | 0.23 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.41 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.67 proportion |
| LAB-Bench SeqQA — ORF amino-acid sequence | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-aaseq-creator-mcq lab-bench-seqqa-orf-seq-aaseq-paper-v3-zero-shot-cot-no-tools | Coverage | 0.61 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.05 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.18 proportion |
| LAB-Bench SeqQA — ORF count above length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-seq-numlen-creator-mcq lab-bench-seqqa-orf-seq-numlen-paper-v3-zero-shot-cot-no-tools | Coverage | 0.31 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.47 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.67 proportion |
| LAB-Bench SeqQA — Translation efficiency | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-orf-transeff-creator-mcq lab-bench-seqqa-orf-transeff-paper-v3-zero-shot-cot-no-tools | Coverage | 0.71 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.47 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.8 proportion |
| LAB-Bench SeqQA — Gene-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-enzprimers-creator-mcq lab-bench-seqqa-pcr-gene-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.59 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.43 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.71 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (HindIII) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibshindprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibshindprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.61 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.16 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.54 proportion |
| LAB-Bench SeqQA — Gene-to-Gibson primers (SmaI) | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-gene-gibssmaprimers-creator-mcq lab-bench-seqqa-pcr-gene-gibssmaprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.3 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.66 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.69 proportion |
| LAB-Bench SeqQA — Primers-to-restriction enzymes | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-geneprimers-enz-creator-mcq lab-bench-seqqa-pcr-geneprimers-enz-paper-v3-zero-shot-cot-no-tools | Coverage | 0.95 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.02 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.07 proportion |
| LAB-Bench SeqQA — Amplicon length to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-len-primers-creator-mcq lab-bench-seqqa-pcr-len-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.31 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.15 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.19 proportion |
| LAB-Bench SeqQA — Primers to amplicon length | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-primers-len-creator-mcq lab-bench-seqqa-pcr-primers-len-paper-v3-zero-shot-cot-no-tools | Coverage | 0.77 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.54 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.73 proportion |
| LAB-Bench SeqQA — Sequence-to-restriction primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-enzprimers-creator-mcq lab-bench-seqqa-pcr-seq-enzprimers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.75 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.48 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.64 proportion |
| LAB-Bench SeqQA — Amplicon sequence to primers | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-pcr-seq-primers-creator-mcq lab-bench-seqqa-pcr-seq-primers-paper-v3-zero-shot-cot-no-tools | Coverage | 0.75 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.39 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.41 proportion |
| LAB-Bench SeqQA — GC percentage | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-prop-seq-gcpercent-creator-mcq lab-bench-seqqa-prop-seq-gcpercent-paper-v3-zero-shot-cot-no-tools | Coverage | 0.93 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.07 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.17 proportion |
| LAB-Bench SeqQA — Restriction-fragment lengths | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-lenfrags-creator-mcq lab-bench-seqqa-re-seq-lenfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.43 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.17 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.22 proportion |
| LAB-Bench SeqQA — Restriction-fragment count | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-seqqa-re-seq-numfrags-creator-mcq lab-bench-seqqa-re-seq-numfrags-paper-v3-zero-shot-cot-no-tools | Coverage | 0.75 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.01 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.32 proportion |
| LAB-Bench SuppQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-suppqa-creator-mcq lab-bench-suppqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.04 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Accuracy | 0.59 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Precision (selective accuracy) | 0.71 proportion |
| LAB-Bench TableQA | LAB-Bench: Measuring Capabilities of Language Models for Biology Research | lab-bench-tableqa-creator-mcq lab-bench-tableqa-paper-v3-zero-shot-cot-no-tools | Coverage | 0.83 proportion |