Human Frontier
87.7
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$5.63/M
Input Price
$2.50/M
Output Price
$15.00/M
Speed
—
TTFT
—
Axes
Filters
Providers
v3 · public-demo · GPT-5.4 (High) · effort high · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-4-2026-03-05-high
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-4-2026-03-05-thinking",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "openai-gpt-5-4-2026-03-05-high",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 5187.41,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · GPT-5.4 (High) · effort high · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-4-2026-03-05-high
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-4-2026-03-05-thinking",
"modelNotes": null,
"modelsEtag": "W/\"2fc19b6caba8b52765ca17eab04fc437\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"9485c7ef206d9b12cdfdec6a631df56b\"",
"upstreamModelId": "openai-gpt-5-4-2026-03-05-high",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 5187.41,
"providerModelIdPublished": false
}Evidence observed 2026-07-31
v3 · public-demo · GPT-5.4 (High) · effort high · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-4-2026-03-05-high
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-4-2026-03-05-thinking",
"modelNotes": null,
"modelsEtag": "W/\"cfc9b87c645d3ef2103e359fd0f9f521\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"0d65f6e0efe0d5cae15e8e2fe5a0994b\"",
"upstreamModelId": "openai-gpt-5-4-2026-03-05-high",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 5187.41,
"providerModelIdPublished": false
}Evidence observed 2026-07-30
v3 · public-demo · GPT-5.4 (High) · effort high · 1 attempt · 5x-human-baseline-median-per-level · arc-agi-3:public-demo · record v3_Semi_Private:openai-gpt-5-4-2026-03-05-high
{
"provider": "OpenAI",
"modelType": "CoT",
"modelsUrl": "https://arcprize.org/media/data/models.json",
"modelGroup": "openai-gpt-5-4-2026-03-05-thinking",
"modelNotes": null,
"modelsEtag": "W/\"bbdf5725ef7a703a7f0970e913262b6f\"",
"scoreMetric": "relative-human-action-efficiency",
"evaluationsUrl": "https://arcprize.org/media/data/evaluations.json",
"evaluationsEtag": "W/\"6529094085f9ca7ce5f3c2e1957d3b9c\"",
"upstreamModelId": "openai-gpt-5-4-2026-03-05-high",
"environmentCount": 25,
"modelReleaseDate": "2026-03-05T00:00:00.000Z",
"upstreamDatasetId": "v3_Semi_Private",
"actionBudgetPolicy": "5x-human-baseline-median-per-level",
"technicalReportUrl": "https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf",
"catalogMatchAliases": [],
"agentHarnessPublished": false,
"verificationAuthority": "ARC Prize Foundation",
"upstreamRunIdPublished": false,
"actualEvaluationCostUsd": 5187.41,
"providerModelIdPublished": false
}Evidence observed 2026-07-24
v2026.06 · official-100-task · GPT-5.4 (xhigh) · harness mini-swe-agent · effort xhigh · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider openai/gpt-5.4 · record gpt-5-4-mini-swe · run c243aeb40c0c89716ec5a6e2056652f84b289975286619d6e25927d25cbb69c6
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gpt-5.4",
"basicPassAt1": 41.05263157894737,
"basicPassAt3": 54.736842105263165,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 16.842105263157894,
"tastefulPassAt3": 27.368421052631582,
"agentDescription": "OpenAI GPT-5.4 via mini-swe-agent harness (Portkey→OpenAI)",
"privateTaskCount": 50,
"upstreamProvider": "openai",
"upstreamRunCount": 50,
"averageAgentSteps": 86.26315789473684,
"averageOutputTokens": 53854.221052631576,
"averageTotalCostUsd": 3.071602650526316,
"averageOutputCostUsd": 0.8078133157894736,
"basicAllThreePassRate": 24.210526315789473,
"tastefulAllThreePassRate": 6.315789473684211
}Evidence observed 2026-07-22
v2026.06 · official-100-task · GPT-5.4 (xhigh) · harness mini-swe-agent · effort xhigh · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider openai/gpt-5.4 · record gpt-5-4-mini-swe · run 90509a67fed6a6131978e82ddf4b66f2848116a98bd228326ce0482485a2feb3
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gpt-5.4",
"basicPassAt1": 48.86363636363637,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 13.636363636363635,
"agentDescription": "OpenAI GPT-5.4 via mini-swe-agent harness (Portkey→OpenAI)",
"privateTaskCount": 50,
"upstreamProvider": "openai",
"upstreamRunCount": 50,
"averageAgentSteps": 81.7840909090909,
"averageOutputTokens": 50491.568181818184,
"averageTotalCostUsd": 2.9705425000000005,
"averageOutputCostUsd": 0.7573735227272728
}Evidence observed 2026-06-30