Human Frontier
90.6
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$4.50/M
Input Price
$2.00/M
Output Price
$12.00/M
Speed
134 tok/s
TTFT
21.37s
Axes
Filters
Providers
v3 · public-demo · Gemini 3.1 Pro (Preview) · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:google-gemini-3-1-pro-preview
{
"provider": "Google",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "google-gemini-3-1-pro-preview",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "google-gemini-3-1-pro-preview",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 2213.53,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · Gemini 3.1 Pro (Preview) · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:google-gemini-3-1-pro-preview
{
"provider": "Google",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "google-gemini-3-1-pro-preview",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "google-gemini-3-1-pro-preview",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 2213.53,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · Gemini 3.1 Pro (Preview) · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:google-gemini-3-1-pro-preview
{
"provider": "Google",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "google-gemini-3-1-pro-preview",
"modelNotes": null,
"modelsEtag": "W/\"cfc9b87c645d3ef2103e359fd0f9f521\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"0d65f6e0efe0d5cae15e8e2fe5a0994b\"",
"upstreamModelId": "google-gemini-3-1-pro-preview",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 2213.53,
"providerModelIdPublished": false
}Evidence observed 2026-07-30
v3 · public-demo · Gemini 3.1 Pro (Preview) · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:google-gemini-3-1-pro-preview
{
"provider": "Google",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "google-gemini-3-1-pro-preview",
"modelNotes": null,
"modelsEtag": "W/\"bbdf5725ef7a703a7f0970e913262b6f\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"6529094085f9ca7ce5f3c2e1957d3b9c\"",
"upstreamModelId": "google-gemini-3-1-pro-preview",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 2213.53,
"providerModelIdPublished": false
}Evidence observed 2026-07-24
v2026.06 · official-100-task · Gemini 3.1 Pro (high) · harness mini-swe-agent · effort high · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider google/gemini-3.1-pro-preview · record gemini-3-1-pro-mini-swe · run e7a084b8bf4fbf7e4723f412d7fc0b621bc5db20fd0e61b5014f602fa22d436e
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gemini-3.1-pro-preview",
"basicPassAt1": 9.473684210526317,
"basicPassAt3": 24.210526315789473,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 2.1052631578947367,
"tastefulPassAt3": 8.421052631578947,
"agentDescription": "Google Gemini 3.1 Pro via mini-swe-agent harness (Portkey→Google)",
"privateTaskCount": 50,
"upstreamProvider": "google",
"upstreamRunCount": 50,
"averageAgentSteps": 107.73684210526316,
"averageOutputTokens": 17277.894736842107,
"averageTotalCostUsd": 1.3306002509473684,
"averageOutputCostUsd": 0.2073347368421053,
"basicAllThreePassRate": 5.263157894736842,
"tastefulAllThreePassRate": 0
}Evidence observed 2026-07-29
v2026.06 · official-100-task · Gemini 3.1 Pro (high) · harness mini-swe-agent · effort high · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider google/gemini-3.1-pro-preview · record gemini-3-1-pro-mini-swe · run 3018be1dee8e4b352d3aa9260d805ee298040ab383dec290a16294f9afd8472d
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gemini-3.1-pro-preview",
"basicPassAt1": 26.136363636363637,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 6.8181818181818175,
"agentDescription": "Google Gemini 3.1 Pro via mini-swe-agent harness (Portkey→Google)",
"privateTaskCount": 50,
"upstreamProvider": "google",
"upstreamRunCount": 50,
"averageAgentSteps": 89.52272727272727,
"averageOutputTokens": 19415.81818181818,
"averageTotalCostUsd": 0.8407021872727273,
"averageOutputCostUsd": 0.23298981818181816
}Evidence observed 2026-06-30
vcontinuous-leaderboard · tasks-created:2026-02-01:2026-05-15 · Gemini 3.1 Pro Preview · harness swe-rebench-react@tools · 5 attempts · pass@1 · swe-rebench:standardized:128k-or-model-limit · provider Gemini 3.1 Pro Preview__tools · record Gemini 3.1 Pro Preview__tools:1769904000000:1778803200000
{
"passAt5": 69.46107784431138,
"developer": "google",
"instanceType": "model",
"contextPolicy": "128k unless the model supports less",
"attemptsPerTask": 5,
"totalTokenUsage": 1502695.5944015582,
"modelReleaseDate": "2026-02-19",
"scoreStandardError": 0.9239067816830353,
"cachedTokenPercentage": 80.60600910081673,
"modelReleaseTimestamp": 1771459200000,
"standardContextTokens": 128000,
"averageInstanceCostUsd": 0.7208578944116585,
"potentialContamination": true,
"aggregateTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1769904000000
},
"publishedTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1769904000000
}
}Evidence observed 2026-05-15
v2.1 · official-leaderboard · Gemini 3.1 Pro (high) · harness terminus-2@2.0.0 · effort high · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider gemini/gemini-3.1-pro-preview · record leaderboard/submissions/2026-05-05-gemini-gemini-3-1-pro-preview-high-terminus-2.json · run 42cd19c9-42ad-5d79-b033-adf4f879423d
{
"passAt2": 0.7775,
"passAt3": 0.8225,
"passAt4": 0.8472,
"passAt5": 0.8652,
"taskCount": 89,
"actualTokens": {
"output": 12935831,
"cachedInput": 96199940,
"uncachedInput": 27525560
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/69",
"agentDisplayUrl": "https://www.tbench.ai/news/terminus",
"modelDisplayUrl": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/",
"actualTrialCount": 445,
"agentOrganization": "Terminal-Bench",
"modelOrganization": "Google",
"actualTotalCostUsd": 229.99,
"rewardHacksPercent": 0.45,
"accuracyStandardError": 1.65,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-05-gemini-gemini-3-1-pro-preview-high-terminus-2.json",
"disqualifiedTrialCount": 2,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "high",
"actualAverageTrialDurationSeconds": 672.8
}Evidence observed 2026-05-05
v2.1 · official-leaderboard · Gemini 3.1 Pro (high) · harness gemini-cli@0.40.0 · effort high · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider gemini/gemini-3.1-pro-preview · record leaderboard/submissions/2026-05-05-gemini-gemini-3-1-pro-preview-high-gemini-cli.json · run 42cd19c9-42ad-5d79-b033-adf4f879423d
{
"passAt2": 0.782,
"passAt3": 0.8315,
"passAt4": 0.8584,
"passAt5": 0.8764,
"taskCount": 89,
"actualTokens": {
"output": 6123596,
"cachedInput": 366583353,
"uncachedInput": 44843158
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/68",
"agentDisplayUrl": "https://github.com/google-gemini/gemini-cli",
"modelDisplayUrl": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/",
"actualTrialCount": 445,
"agentOrganization": "Google",
"modelOrganization": "Google",
"actualTotalCostUsd": 236.49,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.67,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-05-gemini-gemini-3-1-pro-preview-high-gemini-cli.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "high",
"actualAverageTrialDurationSeconds": 652.9
}Evidence observed 2026-05-05