{"model": {"slug": "gpt-4-1-20250414", "name": "GPT-4.1 (2025-04-14)", "vendor": "OpenAI", "model_family": "gpt-4-1", "parameter_count_b": null, "context_length": 400000, "homepage_url": null, "hf_model_id": null, "openrouter_id": null, "card_summary": "OpenAI GPT-4.1 (2025-04-14) on SWE-bench Verified leaderboards.", "is_rl_checkpoint": false, "score_count": 4, "best_success_rate": 51.58, "input_price_per_million": null, "output_price_per_million": null}, "scores": [{"success_rate": 51.58, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-rebench resolved rate (best rolling window)", "source": "swe_rebench_site", "source_url": "https://swe-rebench.com/", "observed_at": null, "harness": {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1-20250414", "name": "GPT-4.1 (2025-04-14)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-rebench", "name": "SWE-rebench"}}, {"success_rate": 39.58, "resolved_count": 198, "total_count": 500, "cost_usd": 0.146313124, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench bash-only (mini-SWE-agent)", "source": "swe_bench_site", "source_url": "https://platform.openai.com/docs/models/gpt-4.1", "observed_at": "2025-07-26T00:00:00+00:00", "harness": {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1-20250414", "name": "GPT-4.1 (2025-04-14)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-bash-only", "name": "SWE-bench Verified (bash-only)"}}, {"success_rate": 39.58, "resolved_count": 198, "total_count": 500, "cost_usd": 0.146313124, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 20, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://mini-swe-agent.com/latest/", "observed_at": "2025-07-26T00:00:00+00:00", "harness": {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1-20250414", "name": "GPT-4.1 (2025-04-14)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 31.14, "resolved_count": 161, "total_count": 517, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Multimodal public submission", "source": "swe_bench_site", "source_url": "https://sites.google.com/view/guirepair", "observed_at": "2025-05-31T00:00:00+00:00", "harness": {"slug": "guirepair", "name": "GUIRepair", "vendor": "GUIRepair", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1-20250414", "name": "GPT-4.1 (2025-04-14)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-multimodal-site", "name": "SWE-bench Multimodal (site)"}}], "harnesses": [{"slug": "guirepair", "name": "GUIRepair", "vendor": "GUIRepair", "repo_url": null, "openrouter_icon_url": null}, {"slug": "mini-swe-agent", "name": "mini-SWE-agent", "vendor": "anthropic", "repo_url": "https://github.com/SWE-agent/mini-swe-agent", "openrouter_icon_url": null}]}