official-release · benchmark creator

SpatialBench 159-evaluation repository snapshot

LatchBio · 2026-06-10

Relationship layer

Benchmark usage

This table records what the work did with each benchmark before attempting to normalize a run. Partial claims remain visible without being treated as comparable evaluations.

benchmark creation

spatialbench-repository-creation

Non-evaluationunknown

Benchmark: SpatialBench · version repo-159-5042c4f

Selection
not applicable
Models
Not reported / not applicable
Metrics
Not reported / not applicable
Linked runs
None

Creator-maintained revised 159-evaluation benchmark snapshot fixed to the registered commit.

Evidence
  • repository-path: README.md and CHANGELOG.md at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Defines the revised 159-evaluation version.)
    Supports: /benchmark_version, /relation_type, /status, /scope, /notes

evaluation

spatialbench-repository-evaluation

Normalizedfull · n=159

Benchmark: SpatialBench · version repo-159-5042c4f

Selection
not applicable · all 159 evaluations
Metrics
Accuracy, Cost, Duration

mini-swe-agent, Claude Code, Pi, and OpenAI Codex are separate normalized runs and comparability groups.

Evidence
  • repository-path: METHODS.md and results/model_results.csv at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Full 159-evaluation methods and harness-specific result rows.)
    Supports: /benchmark_version, /relation_type, /status, /model_ids, /scope, /metric_labels, /evaluation_run_ids, /notes

Normalized evaluation runs

SpatialBench4 runs

Open benchmark record →

Evaluation run

spatialbench-repo-159-claude-code

From SpatialBench 159-evaluation repository snapshot

spatialbench-repo-159-claude-codevrepo-159-5042c4f

Evaluated models / systems: Claude Opus 4.7, Claude Opus 4.8

Scopefull · n=159
ShotsNot reported
Turnsmulti-turn Claude Code
System prompt publicYes
Reasoning / effortmaximum reasoning effort where applicable
BrowserNot reported
InternetYes
DatabasesNot reported
Code executionYes
ContainerYes
External toolsClaude Code with common scientific libraries and network-enabled shell
Token budgetNot reported
Time / cost budget21600 seconds per task with no step limit
TemperatureNot reported
SeedNot reported
Repeats3
Graderfive deterministic grader families · human review: no
Statisticst-distribution 95% confidence interval over per-evaluation means after averaging three runs
Contaminationfull suite withheld to reduce contamination
Metrics, results, and full protocol

Metrics

MetricKind / baselineUnitAggregationThreshold / tolerance
Accuracyabsolutepercentmean over 159 evaluation-level means after three repeatsdeterministic task-specific grader
CostabsoluteUSD per evaluationmean over the full result setNot reported
Durationabsoluteseconds per evaluationmean over the full result setNot reported

Results

ModelMetricValuen
Claude Opus 4.8Accuracy55.35 percent
model_results.csv
159
Claude Opus 4.8Cost0.8776 USD per evaluation
model_results.csv
159
Claude Opus 4.8Duration489.16 seconds per evaluation
model_results.csv
159
Claude Opus 4.7Accuracy51.36 percent
model_results.csv
159
Claude Opus 4.7Cost0.8023 USD per evaluation
model_results.csv
159
Claude Opus 4.7Duration532.85 seconds per evaluation
model_results.csv
159

Evidence

  • repository-path: METHODS.md at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Three runs, max reasoning, container resources, six-hour timeout, network access, binary placement, and aggregation.) — supports /benchmark_version, /scope, /protocol, /metrics
  • repository-path: results/model_results.csv at commit 5042c4f3ee597da1590650c7b894d068ae968e26; harness=claude-code (Exact model label, accuracy and CI, mean cost, mean duration, and N.) — supports /results

Evaluation run

spatialbench-repo-159-mini-swe-agent

From SpatialBench 159-evaluation repository snapshot

spatialbench-repo-159-mini-swe-agentvrepo-159-5042c4f

Evaluated models / systems: Claude Opus 4.5, Claude Opus 4.6, Claude Opus 4.7, Claude Opus 4.8, Claude Sonnet 4.5, Claude Sonnet 4.6, Gemini 2.5 Pro, gemini-3.1-pro-preview, Gemini 3.5 Flash, GPT-5.1, GPT-5.2, GPT-5.4, GPT-5.5, Grok-4, grok-4-1-fast-reasoning, grok-4.20-beta-0309-reasoning

Scopefull · n=159
ShotsNot reported
Turnsmulti-turn mini-swe-agent
System prompt publicYes
Reasoning / effortmaximum reasoning effort where applicable
BrowserNot reported
InternetYes
DatabasesNot reported
Code executionYes
ContainerYes
External toolsmini-swe-agent with common scientific libraries and network-enabled shell
Token budgetNot reported
Time / cost budget21600 seconds per task with no step limit
TemperatureNot reported
SeedNot reported
Repeats3
Graderfive deterministic grader families · human review: no
Statisticst-distribution 95% confidence interval over per-evaluation means after averaging three runs
Contaminationfull suite withheld to reduce contamination
Metrics, results, and full protocol

Metrics

MetricKind / baselineUnitAggregationThreshold / tolerance
Accuracyabsolutepercentmean over 159 evaluation-level means after three repeatsdeterministic task-specific grader
CostabsoluteUSD per evaluationmean over the full result setNot reported
Durationabsoluteseconds per evaluationmean over the full result setNot reported

Results

ModelMetricValuen
GPT-5.5Accuracy57.65 percent
model_results.csv
159
GPT-5.5Cost1.1207 USD per evaluation
model_results.csv
159
GPT-5.5Duration586.66 seconds per evaluation
model_results.csv
159
GPT-5.4Accuracy57.44 percent
model_results.csv
159
GPT-5.4Cost0.577 USD per evaluation
model_results.csv
159
GPT-5.4Duration1128.75 seconds per evaluation
model_results.csv
159
Claude Opus 4.6Accuracy52.83 percent
model_results.csv
159
Claude Opus 4.6Cost0.8456 USD per evaluation
model_results.csv
159
Claude Opus 4.6Duration609.15 seconds per evaluation
model_results.csv
159
Claude Opus 4.8Accuracy52.62 percent
model_results.csv
159
Claude Opus 4.8Cost1.1061 USD per evaluation
model_results.csv
159
Claude Opus 4.8Duration902.86 seconds per evaluation
model_results.csv
159
Claude Opus 4.7Accuracy52.41 percent
model_results.csv
159
Claude Opus 4.7Cost0.9817 USD per evaluation
model_results.csv
159
Claude Opus 4.7Duration626.84 seconds per evaluation
model_results.csv
159
gemini-3.1-pro-previewAccuracy51.57 percent
model_results.csv
159
gemini-3.1-pro-previewCost0.9362 USD per evaluation
model_results.csv
159
gemini-3.1-pro-previewDuration1061.63 seconds per evaluation
model_results.csv
159
GPT-5.2Accuracy50.1 percent
model_results.csv
159
GPT-5.2Cost0.6024 USD per evaluation
model_results.csv
159
GPT-5.2Duration931.76 seconds per evaluation
model_results.csv
159
Gemini 3.5 FlashAccuracy48.85 percent
model_results.csv
159
Gemini 3.5 FlashCost2.7608 USD per evaluation
model_results.csv
159
Gemini 3.5 FlashDuration1145.4 seconds per evaluation
model_results.csv
159
grok-4.20-beta-0309-reasoningAccuracy45.91 percent
model_results.csv
159
grok-4.20-beta-0309-reasoningCost0.1679 USD per evaluation
model_results.csv
159
grok-4.20-beta-0309-reasoningDuration342.63 seconds per evaluation
model_results.csv
159
Claude Sonnet 4.6Accuracy44.23 percent
model_results.csv
159
Claude Sonnet 4.6Cost0.273 USD per evaluation
model_results.csv
159
Claude Sonnet 4.6Duration405.3 seconds per evaluation
model_results.csv
159
Claude Opus 4.5Accuracy42.77 percent
model_results.csv
159
Claude Opus 4.5Cost0.4624 USD per evaluation
model_results.csv
159
Claude Opus 4.5Duration376.54 seconds per evaluation
model_results.csv
159
Claude Sonnet 4.5Accuracy41.51 percent
model_results.csv
159
Claude Sonnet 4.5Cost0.2247 USD per evaluation
model_results.csv
159
Claude Sonnet 4.5Duration294.44 seconds per evaluation
model_results.csv
159
GPT-5.1Accuracy39.83 percent
model_results.csv
159
GPT-5.1Cost0.1574 USD per evaluation
model_results.csv
159
GPT-5.1Duration309.79 seconds per evaluation
model_results.csv
159
grok-4-1-fast-reasoningAccuracy33.96 percent
model_results.csv
159
grok-4-1-fast-reasoningCost0.0164 USD per evaluation
model_results.csv
159
grok-4-1-fast-reasoningDuration357 seconds per evaluation
model_results.csv
159
Grok-4Accuracy31.87 percent
model_results.csv
159
Grok-4Cost0.4529 USD per evaluation
model_results.csv
159
Grok-4Duration732.47 seconds per evaluation
model_results.csv
159
Gemini 2.5 ProAccuracy28.93 percent
model_results.csv
159
Gemini 2.5 ProCost0.1086 USD per evaluation
model_results.csv
159
Gemini 2.5 ProDuration231.07 seconds per evaluation
model_results.csv
159

Evidence

  • repository-path: METHODS.md at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Three runs, max reasoning, container resources, six-hour timeout, network access, harness placement, and aggregation.) — supports /benchmark_version, /scope, /protocol, /metrics
  • repository-path: results/model_results.csv at commit 5042c4f3ee597da1590650c7b894d068ae968e26; harness=mini-swe-agent (Exact model label, accuracy and CI, mean cost, mean duration, and N.) — supports /results

Evaluation run

spatialbench-repo-159-openai-codex

From SpatialBench 159-evaluation repository snapshot

spatialbench-repo-159-openai-codexvrepo-159-5042c4f

Evaluated models / systems: GPT-5.5

Scopefull · n=159
ShotsNot reported
Turnsmulti-turn OpenAI Codex
System prompt publicYes
Reasoning / effortmaximum reasoning effort where applicable
BrowserNot reported
InternetYes
DatabasesNot reported
Code executionYes
ContainerYes
External toolsOpenAI Codex with common scientific libraries and network-enabled shell
Token budgetNot reported
Time / cost budget21600 seconds per task with no step limit
TemperatureNot reported
SeedNot reported
Repeats3
Graderfive deterministic grader families · human review: no
Statisticst-distribution 95% confidence interval over per-evaluation means after averaging three runs
Contaminationfull suite withheld to reduce contamination
Metrics, results, and full protocol

Metrics

MetricKind / baselineUnitAggregationThreshold / tolerance
Accuracyabsolutepercentmean over 159 evaluation-level means after three repeatsdeterministic task-specific grader
CostabsoluteUSD per evaluationmean over the full result setNot reported
Durationabsoluteseconds per evaluationmean over the full result setNot reported

Results

ModelMetricValuen
GPT-5.5Accuracy53.67 percent
model_results.csv
159
GPT-5.5Cost3.1616 USD per evaluation
model_results.csv
159
GPT-5.5Duration382.01 seconds per evaluation
model_results.csv
159

Evidence

  • repository-path: METHODS.md at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Three runs, max reasoning, container resources, six-hour timeout, network access, binary placement, and aggregation.) — supports /benchmark_version, /scope, /protocol, /metrics
  • repository-path: results/model_results.csv at commit 5042c4f3ee597da1590650c7b894d068ae968e26; harness=openai-codex (Exact model label, accuracy and CI, mean cost, mean duration, and N.) — supports /results

Evaluation run

spatialbench-repo-159-pi

From SpatialBench 159-evaluation repository snapshot

spatialbench-repo-159-pivrepo-159-5042c4f

Evaluated models / systems: Gemini 3.5 Flash

Scopefull · n=159
ShotsNot reported
Turnsmulti-turn Pi agent
System prompt publicYes
Reasoning / effortmaximum reasoning effort where applicable
BrowserNot reported
InternetYes
DatabasesNot reported
Code executionYes
ContainerYes
External toolsPi harness with common scientific libraries and network-enabled shell
Token budgetNot reported
Time / cost budget21600 seconds per task with no step limit
TemperatureNot reported
SeedNot reported
Repeats3
Graderfive deterministic grader families · human review: no
Statisticst-distribution 95% confidence interval over per-evaluation means after averaging three runs
Contaminationfull suite withheld to reduce contamination
Metrics, results, and full protocol

Metrics

MetricKind / baselineUnitAggregationThreshold / tolerance
Accuracyabsolutepercentmean over 159 evaluation-level means after three repeatsdeterministic task-specific grader
CostabsoluteUSD per evaluationmean over the full result setNot reported
Durationabsoluteseconds per evaluationmean over the full result setNot reported

Results

ModelMetricValuen
Gemini 3.5 FlashAccuracy55.56 percent
model_results.csv
159
Gemini 3.5 FlashCost1.4254 USD per evaluation
model_results.csv
159
Gemini 3.5 FlashDuration1739.29 seconds per evaluation
model_results.csv
159

Evidence

  • repository-path: METHODS.md at commit 5042c4f3ee597da1590650c7b894d068ae968e26 (Three runs, max reasoning, container resources, six-hour timeout, network access, and aggregation.) — supports /benchmark_version, /scope, /protocol, /metrics
  • repository-path: results/model_results.csv at commit 5042c4f3ee597da1590650c7b894d068ae968e26; harness=pi (Exact model label, accuracy and CI, mean cost, mean duration, and N.) — supports /results