ProgramBench task detail

rvben__rumdl.2d75c4d

Task-level results for this Codex /goal scaffold. ProgramBench baseline context is cached from the official task page; Codex scored tests are after active-branch and ignored-test filtering.

3322generated behavioral tests
48.6%official best score
46.3%Codex best score
3Codex result rows

Codex Results by Model

#ModelRunAgentModeScoreEvalTestsEst. costCallsWallEvidence
1 GPT 5.5 (xhigh) 20260519T215046Z Codex /goal Paper prompt + Goal contract no internet 46.3% ok 1538/3322 $6.81 67 0.27h not exported
2 GPT 5.5 (xhigh) 20260517T094700Z Codex /goal Mini-SWE-compatible no internet 45.5% ok 1510/3322 $5.98 76 0.24h manifest · eval json · eval summary · usage audit
3 GPT 5.5 (xhigh) 20260518T232006Z Codex /goal Paper prompt + /goal no internet 2.7% warn 1 91/3323 $4.96 56 0.25h manifest · eval json · eval summary · agent summary · usage audit

Why Scores Differ

Official ProgramBench rows are the public mini-SWE-agent submissions. GoalBench rows are separate Codex /goal submissions. Same model label does not mean the same agent, prompt, tool loop, or generated implementation. A GoalBench row is resolved only when the ProgramBench-scored pass rate is exactly 100%.

GPT 5.5 (xhigh) · 20260519T215046Z

Public eval evidence has not been exported for this row yet.

GPT 5.5 (xhigh) · 20260517T094700Z

45.5% from 1510/3322 ProgramBench-scored tests. Raw public eval statuses: failure: 2042, passed: 2601, skipped: 29.

Agent trace summary unavailable.

Likely miss class: behavioral mismatch, exact version/output mismatch.

  • e5d3d967093e eval.tests.test_additional_rules.test_rule_with_custom_config (failure)
  • e5d3d967093e eval.tests.test_additional_features.test_completions_fish (failure)
  • e5d3d967093e eval.tests.test_additional_features.test_check_with_config_file (failure)
  • e5d3d967093e eval.tests.test_additional_rules.test_md061_forbidden_terms (failure)
  • e5d3d967093e eval.tests.test_check_command.test_check_statistics_flag (failure)
  • e5d3d967093e eval.tests.test_check_command.test_check_nonexistent_file (failure)

manifest · eval json · eval summary · usage audit

GPT 5.5 (xhigh) · 20260518T232006Z

2.7% from 91/3323 ProgramBench-scored tests. Raw public eval statuses: error: 1, failure: 3584, not_run: 18, passed: 1036, skipped: 30.

Agent trace: 112 shell command(s), 72 executable-observation command(s), 5 build command(s), 2 blocked attempt(s). Raw Codex logs are not published.

Likely miss class: behavioral mismatch, exact version/output mismatch.

  • e5d3d967093e eval.tests.test_additional_rules.test_fix_with_specific_rules (failure)
  • e5d3d967093e eval.tests.test_all_rules_comprehensive.test_multiple_files_with_different_violations (failure)
  • e5d3d967093e eval.tests.test_additional_features.test_check_show_full_path (failure)
  • e5d3d967093e eval.tests.test_advanced_rules.test_statistics_output (failure)
  • e5d3d967093e eval.tests.test_all_rules_comprehensive.test_md010_hard_tabs (failure)
  • e5d3d967093e eval.tests.test_advanced_rules.test_md047_single_trailing_newline (failure)

manifest · eval json · eval summary · agent summary · usage audit

Official ProgramBench Results by Model

#ModelProviderScoreCostCalls
1 GPT 5.5 (high) OpenAI 48.6% $4.29 32
2 GPT 5.5 (xhigh) OpenAI 48.2% $9.73 63
3 Claude Opus 4.6 Anthropic 40.7% $8.20 206
4 GPT 5.5 OpenAI 37.9% $1.37 16
5 Claude Opus 4.7 (xhigh) Anthropic 34.1% $3.78 98
6 Gemini 3 Flash Google 25.9% $0.34 77
7 Gemini 3.1 Pro Google 23.5% $1.22 66
8 Claude Opus 4.7 Anthropic 14.7% $1.36 41
9 GPT 5.4 OpenAI 10.8% $0.36 7
10 GPT 5 mini OpenAI 4.9% $0.04 21
11 Claude Sonnet 4.6 Anthropic 2.8% $63.87 785
12 Claude Haiku 4.5 Anthropic 1.4% $0.60 88
13 GPT 5.4 mini OpenAI 0.0% $0.06 13