{"model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai", "model_family": "gpt-5-2", "parameter_count_b": null, "context_length": 400000, "homepage_url": null, "hf_model_id": null, "openrouter_id": "openai/gpt-5.2", "card_summary": "openai GPT-5.2 on SWE-bench Verified leaderboards.", "is_rl_checkpoint": false, "score_count": 10, "best_success_rate": 89.0, "input_price_per_million": 1.75, "output_price_per_million": 14.0}, "scores": [{"success_rate": 89.0, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "HAL reliability composite (mean of 4 dimension aggregates)", "source": "hal_reliability_site", "source_url": "https://hal.cs.princeton.edu/reliability/benchmark/taubench_airline/", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "hal-reliability-tau-bench-airline", "name": "HAL Reliability \u2014 \u03c4-bench Airline (clean)"}}, {"success_rate": 83.5, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "HAL reliability composite (mean of 4 dimension aggregates)", "source": "hal_reliability_site", "source_url": "https://hal.cs.princeton.edu/reliability/benchmark/taubench_airline_original/", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "hal-reliability-tau-bench-airline-original", "name": "HAL Reliability \u2014 \u03c4-bench Airline (original)"}}, {"success_rate": 80.0, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "HAL reliability composite (mean of 4 dimension aggregates)", "source": "hal_reliability_site", "source_url": "https://hal.cs.princeton.edu/reliability/benchmark/gaia/", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "hal-reliability-gaia", "name": "HAL Reliability \u2014 GAIA"}}, {"success_rate": 74.6, "resolved_count": null, "total_count": null, "cost_usd": 0.86, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.8.3", "source": "openhands_index", "source_url": "https://index.openhands.dev/", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "openhands-swe-bench", "name": "SWE-bench (OpenHands Index)"}}, {"success_rate": 73.2, "resolved_count": null, "total_count": null, "cost_usd": 0.56, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.8.3", "source": "openhands_index", "source_url": "https://index.openhands.dev/", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "swt-bench", "name": "SWT-Bench"}}, {"success_rate": 69.0, "resolved_count": 345, "total_count": 500, "cost_usd": 0.2696674974, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench bash-only (mini-SWE-agent)", "source": "swe_bench_site", "source_url": "https://platform.openai.com/docs/models/", "observed_at": "2025-12-11T00:00:00+00:00", "harness": {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-bash-only", "name": "SWE-bench Verified (bash-only)"}}, {"success_rate": 69.0, "resolved_count": 345, "total_count": 500, "cost_usd": 0.2696674974, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 16, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://mini-swe-agent.com/latest/", "observed_at": "2025-12-11T00:00:00+00:00", "harness": {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 65.5, "resolved_count": null, "total_count": null, "cost_usd": 0.48, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.8.3", "source": "openhands_index", "source_url": "https://index.openhands.dev/", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "gaia", "name": "GAIA"}}, {"success_rate": 50.0, "resolved_count": null, "total_count": null, "cost_usd": 4.7, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.8.3", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/c343765e-1fdd-494f-96b7-de843c272a36", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "commit0", "name": "Commit0"}}, {"success_rate": 30.9, "resolved_count": null, "total_count": null, "cost_usd": 2.77, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.8.3", "source": "openhands_index", "source_url": "https://index.openhands.dev/", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-2", "name": "GPT-5.2", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-multimodal", "name": "SWE-bench Multimodal (OpenHands Index)"}}], "harnesses": [{"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": "https://github.com/princeton-pli/hal-harness", "openrouter_icon_url": null}, {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": "https://github.com/All-Hands-AI/OpenHands", "openrouter_icon_url": "https://www.all-hands.dev/favicon.ico"}, {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": "https://github.com/SWE-agent/mini-swe-agent", "openrouter_icon_url": null}]}