Human Frontier
—
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$4.50/M
Input Price
$2.00/M
Output Price
$12.00/M
Speed
132 tok/s
TTFT
75.09s
Axes
Filters
Providers
v3 · public-demo · GPT-5.6 Terra (Max) · effort max · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-6-terra-max
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-6-terra",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "openai-gpt-5-6-terra-max",
"environmentCount": 25,
"modelReleaseDate": "2026-07-09T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 7918.31,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · GPT-5.6 Terra (Max) · effort max · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-6-terra-max
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-6-terra",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "openai-gpt-5-6-terra-max",
"environmentCount": 25,
"modelReleaseDate": "2026-07-09T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 7918.31,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · GPT-5.6 Terra (Max) · effort max · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-6-terra-max
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-6-terra",
"modelNotes": null,
"modelsEtag": "W/\"cfc9b87c645d3ef2103e359fd0f9f521\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"0d65f6e0efe0d5cae15e8e2fe5a0994b\"",
"upstreamModelId": "openai-gpt-5-6-terra-max",
"environmentCount": 25,
"modelReleaseDate": "2026-07-09T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 7918.31,
"providerModelIdPublished": false
}Evidence observed 2026-07-30
v3 · public-demo · GPT-5.6 Terra (Max) · effort max · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-6-terra-max
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-6-terra",
"modelNotes": null,
"modelsEtag": "W/\"bbdf5725ef7a703a7f0970e913262b6f\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"6529094085f9ca7ce5f3c2e1957d3b9c\"",
"upstreamModelId": "openai-gpt-5-6-terra-max",
"environmentCount": 25,
"modelReleaseDate": "2026-07-09T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 7918.31,
"providerModelIdPublished": false
}Evidence observed 2026-07-24
v2.1 · official-leaderboard · GPT-5.6 Terra (max) · harness codex@0.144.1 · effort max · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/gpt-5.6-terra · record leaderboard/submissions/2026-07-11-openai-gpt-5-6-terra-max-codex.json · run 84f460e2-f7f8-5249-8e63-d58b197968c7
{
"passAt2": 0.8539,
"passAt3": 0.8753,
"passAt4": 0.8876,
"passAt5": 0.8989,
"taskCount": 89,
"actualTokens": {
"output": 8707506,
"cachedInput": 864130644,
"uncachedInput": 29803660
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/115",
"agentDisplayUrl": "https://openai.com/codex/",
"modelDisplayUrl": "https://developers.openai.com/api/docs/models/gpt-5.6-terra",
"actualTrialCount": 445,
"agentOrganization": "OpenAI",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 421.15,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.25,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-07-11-openai-gpt-5-6-terra-max-codex.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "max",
"actualAverageTrialDurationSeconds": 432.8
}Evidence observed 2026-07-11
v2.1 · official-leaderboard · GPT-5.6 Terra (max) · harness codex@0.144.0 · effort max · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider gpt-5.6-terra · record leaderboard/submissions/2026-07-10-gpt-5-6-terra-max-codex.json · run 622b427f-0ddc-54db-b64b-90960667e6be
{
"passAt2": 0.8494,
"passAt3": 0.8899,
"passAt4": 0.9101,
"passAt5": 0.9213,
"taskCount": 89,
"actualTokens": {
"output": 8273026,
"cachedInput": 791614561,
"uncachedInput": 31612623
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/106",
"agentDisplayUrl": "https://openai.com/codex/",
"modelDisplayUrl": "https://developers.openai.com/api/docs/models/gpt-5.6-terra",
"actualTrialCount": 445,
"agentOrganization": "OpenAI",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 401.03,
"rewardHacksPercent": 7.19,
"accuracyStandardError": 1.54,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-07-10-gpt-5-6-terra-max-codex.json",
"disqualifiedTrialCount": 32,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "max",
"actualAverageTrialDurationSeconds": 421.6
}Evidence observed 2026-07-10