{"model": {"slug": "gpt-5", "name": "GPT-5", "vendor": "openai", "model_family": "gpt-5", "parameter_count_b": null, "context_length": 400000, "homepage_url": null, "hf_model_id": null, "openrouter_id": "openai/gpt-5", "card_summary": "OpenAI GPT-5 flagship model for frontier coding agent benchmarks.", "is_rl_checkpoint": false, "score_count": 3, "best_success_rate": 71.8, "input_price_per_million": 1.25, "output_price_per_million": 10.0}, "scores": [{"success_rate": 71.8, "resolved_count": 359, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://all-hands.dev/", "observed_at": "2025-08-07T00:00:00+00:00", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5", "name": "GPT-5", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 71.2, "resolved_count": 356, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://euni.ai/", "observed_at": "2025-09-29T00:00:00+00:00", "harness": {"slug": "prometheus-v1-2", "name": "Prometheus V1 2", "vendor": "EuniAI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5", "name": "GPT-5", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 35.11, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-09-26T00:00:00+00:00", "harness": {"slug": "rd-agent", "name": "R&D Agent", "vendor": "Microsoft", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5", "name": "GPT-5", "vendor": "openai"}, "benchmark": {"slug": "mle-bench", "name": "MLE-bench"}}], "harnesses": [{"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": "https://github.com/All-Hands-AI/OpenHands", "openrouter_icon_url": "https://www.all-hands.dev/favicon.ico"}, {"slug": "prometheus-v1-2", "name": "Prometheus V1 2", "vendor": "EuniAI", "repo_url": "https://github.com/GAIR-NLP/Prometheus", "openrouter_icon_url": null}, {"slug": "rd-agent", "name": "R&D Agent", "vendor": "Microsoft", "repo_url": "https://github.com/microsoft/RD-Agent", "openrouter_icon_url": null}]}