Exact model identity

GPT-4o (BixBench version not reported)

OpenAI · version status: not reported

Similar model names are never merged automatically. Evaluation membership and numeric result rows only reference the exact ID bixbench-gpt-4o-unversioned.

Evaluation settings

BenchmarkWorkRun / groupScope
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-creator-paper
bixbench-v1-open-agentic-images-ten-runs
full · n=296
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-paper-mcq-no-images
bixbench-v1-mcq-refusal-no-images-ten-runs
full · n=296
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-paper-mcq-no-refusal
bixbench-v1-mcq-no-refusal-images-ten-runs
full · n=296
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-paper-mcq-refusal
bixbench-v1-mcq-refusal-images-ten-runs
full · n=296
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-agentic-mcq-no-refusal-images
bixbench-v1-5-agentic-mcq-no-refusal-images-five-replicas
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-agentic-mcq-refusal-images
bixbench-v1-5-agentic-mcq-refusal-images-five-replicas
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-agentic-mcq-refusal-no-images
bixbench-v1-5-agentic-mcq-refusal-no-images-five-replicas
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-agentic-open-images
bixbench-v1-5-agentic-open-images-five-replicas
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
full · n=205
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
full · n=205

Numeric results

BenchmarkWorkRun / groupMetricValue
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-creator-paper
bixbench-v1-open-agentic-images-ten-runs
Accuracy9 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
accuracy36.0975609756 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
precision36.0975609756 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
coverage100 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
accuracy3.9024390244 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
precision40 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
coverage9.756097561 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
accuracy2.9268292683 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
precision2.9268292683 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
coverage100 percent