| GPT-5.5 | Accuracy | 57.65 percent model_results.csv | 159 |
| GPT-5.5 | Cost | 1.1207 USD per evaluation model_results.csv | 159 |
| GPT-5.5 | Duration | 586.66 seconds per evaluation model_results.csv | 159 |
| GPT-5.4 | Accuracy | 57.44 percent model_results.csv | 159 |
| GPT-5.4 | Cost | 0.577 USD per evaluation model_results.csv | 159 |
| GPT-5.4 | Duration | 1128.75 seconds per evaluation model_results.csv | 159 |
| Claude Opus 4.6 | Accuracy | 52.83 percent model_results.csv | 159 |
| Claude Opus 4.6 | Cost | 0.8456 USD per evaluation model_results.csv | 159 |
| Claude Opus 4.6 | Duration | 609.15 seconds per evaluation model_results.csv | 159 |
| Claude Opus 4.8 | Accuracy | 52.62 percent model_results.csv | 159 |
| Claude Opus 4.8 | Cost | 1.1061 USD per evaluation model_results.csv | 159 |
| Claude Opus 4.8 | Duration | 902.86 seconds per evaluation model_results.csv | 159 |
| Claude Opus 4.7 | Accuracy | 52.41 percent model_results.csv | 159 |
| Claude Opus 4.7 | Cost | 0.9817 USD per evaluation model_results.csv | 159 |
| Claude Opus 4.7 | Duration | 626.84 seconds per evaluation model_results.csv | 159 |
| gemini-3.1-pro-preview | Accuracy | 51.57 percent model_results.csv | 159 |
| gemini-3.1-pro-preview | Cost | 0.9362 USD per evaluation model_results.csv | 159 |
| gemini-3.1-pro-preview | Duration | 1061.63 seconds per evaluation model_results.csv | 159 |
| GPT-5.2 | Accuracy | 50.1 percent model_results.csv | 159 |
| GPT-5.2 | Cost | 0.6024 USD per evaluation model_results.csv | 159 |
| GPT-5.2 | Duration | 931.76 seconds per evaluation model_results.csv | 159 |
| Gemini 3.5 Flash | Accuracy | 48.85 percent model_results.csv | 159 |
| Gemini 3.5 Flash | Cost | 2.7608 USD per evaluation model_results.csv | 159 |
| Gemini 3.5 Flash | Duration | 1145.4 seconds per evaluation model_results.csv | 159 |
| grok-4.20-beta-0309-reasoning | Accuracy | 45.91 percent model_results.csv | 159 |
| grok-4.20-beta-0309-reasoning | Cost | 0.1679 USD per evaluation model_results.csv | 159 |
| grok-4.20-beta-0309-reasoning | Duration | 342.63 seconds per evaluation model_results.csv | 159 |
| Claude Sonnet 4.6 | Accuracy | 44.23 percent model_results.csv | 159 |
| Claude Sonnet 4.6 | Cost | 0.273 USD per evaluation model_results.csv | 159 |
| Claude Sonnet 4.6 | Duration | 405.3 seconds per evaluation model_results.csv | 159 |
| Claude Opus 4.5 | Accuracy | 42.77 percent model_results.csv | 159 |
| Claude Opus 4.5 | Cost | 0.4624 USD per evaluation model_results.csv | 159 |
| Claude Opus 4.5 | Duration | 376.54 seconds per evaluation model_results.csv | 159 |
| Claude Sonnet 4.5 | Accuracy | 41.51 percent model_results.csv | 159 |
| Claude Sonnet 4.5 | Cost | 0.2247 USD per evaluation model_results.csv | 159 |
| Claude Sonnet 4.5 | Duration | 294.44 seconds per evaluation model_results.csv | 159 |
| GPT-5.1 | Accuracy | 39.83 percent model_results.csv | 159 |
| GPT-5.1 | Cost | 0.1574 USD per evaluation model_results.csv | 159 |
| GPT-5.1 | Duration | 309.79 seconds per evaluation model_results.csv | 159 |
| grok-4-1-fast-reasoning | Accuracy | 33.96 percent model_results.csv | 159 |
| grok-4-1-fast-reasoning | Cost | 0.0164 USD per evaluation model_results.csv | 159 |
| grok-4-1-fast-reasoning | Duration | 357 seconds per evaluation model_results.csv | 159 |
| Grok-4 | Accuracy | 31.87 percent model_results.csv | 159 |
| Grok-4 | Cost | 0.4529 USD per evaluation model_results.csv | 159 |
| Grok-4 | Duration | 732.47 seconds per evaluation model_results.csv | 159 |
| Gemini 2.5 Pro | Accuracy | 28.93 percent model_results.csv | 159 |
| Gemini 2.5 Pro | Cost | 0.1086 USD per evaluation model_results.csv | 159 |
| Gemini 2.5 Pro | Duration | 231.07 seconds per evaluation model_results.csv | 159 |