Human Frontier
85.6
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$2.00/M
Input Price
$1.25/M
Output Price
$4.25/M
Speed
146 tok/s
TTFT
1.57s
Axes
Filters
Providers
v2.1 · official-leaderboard · Muse Spark 1.1 (xhigh) · harness mini-swe-agent@2.4.5 · effort xhigh · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/muse-spark-1.1 · record leaderboard/submissions/2026-07-09-openai-muse-spark-1-1-xhigh-mini-swe-agent.json · run e15e18db-c8c1-5e9f-9064-1d68975b3c91
{
"passAt2": 0.8292,
"passAt3": 0.8697,
"passAt4": 0.8966,
"passAt5": 0.9101,
"taskCount": 89,
"actualTokens": {
"output": 13679953,
"cachedInput": 932239373,
"uncachedInput": 60996
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/94",
"agentDisplayUrl": "https://github.com/SWE-agent/mini-swe-agent",
"modelDisplayUrl": "https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/",
"actualTrialCount": 445,
"agentOrganization": "Princeton",
"modelOrganization": "Meta",
"actualTotalCostUsd": 198.05,
"rewardHacksPercent": 0,
"accuracyStandardError": 1.23,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-07-09-openai-muse-spark-1-1-xhigh-mini-swe-agent.json",
"disqualifiedTrialCount": 0,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "xhigh",
"actualAverageTrialDurationSeconds": 687
}Evidence observed 2026-07-09