Human Frontier
90.2
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$11.25/M
Input Price
$5.00/M
Output Price
$30.00/M
Speed
—
TTFT
—
Axes
Filters
Providers
v2026.06 · official-100-task · GPT-5.5 (xhigh) · harness mini-swe-agent · effort xhigh · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider openai/gpt-5.5 · record gpt-5-5-mini-swe · run a165e24cf1b9c072a876b82730459f2c240ba89568b769933669b4d2303dea36
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gpt-5.5",
"basicPassAt1": 56.81818181818182,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 15.909090909090908,
"agentDescription": "OpenAI GPT-5.5 via mini-swe-agent harness (Portkey→OpenAI)",
"privateTaskCount": 50,
"upstreamProvider": "openai",
"upstreamRunCount": 78,
"averageAgentSteps": 88.32954545454545,
"averageOutputTokens": 35910.045454545456,
"averageTotalCostUsd": 4.934496786363637,
"averageOutputCostUsd": 1.0773013636363638
}Evidence observed 2026-06-30
vcontinuous-leaderboard · tasks-created:2026-03-01:2026-05-15 · gpt-5.5-2026-04-23-xhigh · harness swe-rebench-react@tools · effort xhigh · 5 attempts · pass@1 · swe-rebench:standardized:128k-or-model-limit · provider gpt-5.5-2026-04-23-xhigh__tools · record gpt-5.5-2026-04-23-xhigh__tools:1772323200000:1778803200000
{
"passAt5": 70,
"developer": "openai",
"instanceType": "model",
"contextPolicy": "128k unless the model supports less",
"attemptsPerTask": 5,
"totalTokenUsage": 2120660.0327272727,
"modelReleaseDate": "2026-04-23",
"scoreStandardError": 0.9090909090909094,
"cachedTokenPercentage": 90.03088404558557,
"modelReleaseTimestamp": 1776902400000,
"standardContextTokens": 128000,
"averageInstanceCostUsd": 2.245956852727273,
"potentialContamination": true,
"aggregateTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1772323200000
},
"publishedTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1772323200000
}
}Evidence observed 2026-05-15
v2.1 · official-leaderboard · GPT-5.5 (xhigh) · harness terminus-2@2.0.0 · effort xhigh · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/gpt-5.5 · record leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-terminus-2.json · run 10e2e56b-ed31-5f65-a489-69f78b902adf
{
"passAt2": 0.8461,
"passAt3": 0.864,
"passAt4": 0.8719,
"passAt5": 0.8764,
"taskCount": 89,
"actualTokens": {
"output": 10768129,
"cachedInput": 0,
"uncachedInput": 81469069
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/47",
"agentDisplayUrl": "https://www.tbench.ai/news/terminus",
"modelDisplayUrl": "https://openai.com/index/introducing-gpt-5-5/",
"actualTrialCount": 445,
"agentOrganization": "Terminal-Bench",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 493.85,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.22,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-terminus-2.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "xhigh",
"actualAverageTrialDurationSeconds": 726.7
}Evidence observed 2026-05-01
v2.1 · official-leaderboard · GPT-5.5 (xhigh) · harness codex@0.125.0 · effort xhigh · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/gpt-5.5 · record leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-codex.json · run 10e2e56b-ed31-5f65-a489-69f78b902adf
{
"passAt2": 0.8888,
"passAt3": 0.9135,
"passAt4": 0.9303,
"passAt5": 0.9438,
"taskCount": 89,
"actualTokens": {
"output": 5966373,
"cachedInput": 392433664,
"uncachedInput": 336797311
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/45",
"agentDisplayUrl": "https://openai.com/codex/",
"modelDisplayUrl": "https://openai.com/index/introducing-gpt-5-5/",
"actualTrialCount": 445,
"agentOrganization": "OpenAI",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 2059.19,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.13,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-codex.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "xhigh",
"actualAverageTrialDurationSeconds": 482.6
}Evidence observed 2026-05-01