Human Frontier
88.3
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$4.50/M
Input Price
$2.00/M
Output Price
$12.00/M
Speed
—
TTFT
—
Axes
Filters
Providers
v2.1 · official-leaderboard · Gemini 3 Pro (high) · harness gemini-cli@0.40.0 · effort high · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider gemini/gemini-3-pro-preview · record leaderboard/submissions/2026-05-01-gemini-gemini-3-pro-preview-high-gemini-cli.json · run fd8707bb-51e8-56fa-8e46-769a82a531ae
{
"passAt2": 0.7427,
"passAt3": 0.7831,
"passAt4": 0.8067,
"passAt5": 0.8202,
"taskCount": 89,
"actualTokens": {
"output": 7219388,
"cachedInput": 329123284,
"uncachedInput": 47653156
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/66",
"agentDisplayUrl": "https://github.com/google-gemini/gemini-cli",
"modelDisplayUrl": "https://blog.google/products-and-platforms/products/gemini/gemini-3/",
"actualTrialCount": 445,
"agentOrganization": "Google",
"modelOrganization": "Google",
"actualTotalCostUsd": 247.76,
"rewardHacksPercent": 0.45,
"accuracyStandardError": 1.38,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-gemini-gemini-3-pro-preview-high-gemini-cli.json",
"disqualifiedTrialCount": 2,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "high",
"actualAverageTrialDurationSeconds": 436.6
}Evidence observed 2026-05-01
v2.1 · official-leaderboard · Gemini 3 Pro (high) · harness terminus-2@2.0.0 · effort high · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider gemini/gemini-3-pro-preview · record leaderboard/submissions/2026-05-01-gemini-gemini-3-pro-preview-high-terminus-2.json · run 10e2e56b-ed31-5f65-a489-69f78b902adf
{
"passAt2": 0.8135,
"passAt3": 0.8472,
"passAt4": 0.8652,
"passAt5": 0.8764,
"taskCount": 89,
"actualTokens": {
"output": 12862730,
"cachedInput": 89495525,
"uncachedInput": 26094316
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/48",
"agentDisplayUrl": "https://www.tbench.ai/news/terminus",
"modelDisplayUrl": "https://blog.google/products-and-platforms/products/gemini/gemini-3/",
"actualTrialCount": 445,
"agentOrganization": "Terminal-Bench",
"modelOrganization": "Google",
"actualTotalCostUsd": 224.44,
"rewardHacksPercent": 0.45,
"accuracyStandardError": 1.29,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-gemini-gemini-3-pro-preview-high-terminus-2.json",
"disqualifiedTrialCount": 2,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "high",
"actualAverageTrialDurationSeconds": 547.8
}Evidence observed 2026-05-01