Exact model identity

Claude 3.5 Sonnet (BixBench version not reported)

Anthropic · version status: not reported

Similar model names are never merged automatically. Evaluation membership and numeric result rows only reference the exact ID bixbench-claude-3-5-sonnet-unversioned.

Evaluation settings

Numeric results

BenchmarkWorkRun / groupMetricValue
BixBenchBixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologybixbench-creator-paper
bixbench-v1-open-agentic-images-ten-runs
Accuracy17 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
accuracy34.1463414634 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
precision34.1463414634 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-no-refusal
bixbench-v1-5-zero-shot-mcq-no-refusal-temperature-one
coverage100 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
accuracy8.2926829268 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
precision38.6363636364 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-mcq-refusal
bixbench-v1-5-zero-shot-mcq-refusal-temperature-one
coverage21.4634146341 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
accuracy2.9268292683 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
precision2.9268292683 percent
BixBenchBixBench v1.5 dataset and evaluation releasebixbench-v1-5-zero-shot-open
bixbench-v1-5-zero-shot-open-temperature-one
coverage100 percent