{"model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI", "model_family": "gpt-4o", "parameter_count_b": null, "context_length": 128000, "homepage_url": null, "hf_model_id": null, "openrouter_id": null, "card_summary": "OpenAI GPT-4o snapshot (May 2024) widely used on early SWE-bench runs.", "is_rl_checkpoint": false, "score_count": 18, "best_success_rate": 72.9, "input_price_per_million": null, "output_price_per_million": null}, "scores": [{"success_rate": 72.9, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "Aider edit leaderboard", "source": "aider_leaderboard", "source_url": "https://aider.chat/docs/leaderboards/", "observed_at": "2024-05-13T00:00:00+00:00", "harness": {"slug": "aider", "name": "Aider", "vendor": "Aider", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "aider-edit", "name": "Aider Edit"}}, {"success_rate": 38.8, "resolved_count": 194, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://github.com/OpenAutoCoder/Agentless", "observed_at": "2024-10-28T00:00:00+00:00", "harness": {"slug": "agentless-lite", "name": "Agentless Lite", "vendor": "OpenAutoCoder", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 38.4, "resolved_count": 192, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://autocoderover.dev/", "observed_at": "2024-06-28T00:00:00+00:00", "harness": {"slug": "autocoderover-v20240620", "name": "Autocoderover V20240620", "vendor": "AutoCodeRover", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 38.0, "resolved_count": 114, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://mentat.ai/blog/mentatbot-sota-coding-agent", "observed_at": "2024-06-27T00:00:00+00:00", "harness": {"slug": "abanteai-mentatbot", "name": "Abanteai Mentatbot", "vendor": "AbanteAI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 34.0, "resolved_count": 102, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://www.marscode.com/", "observed_at": "2024-07-23T00:00:00+00:00", "harness": {"slug": "bytedance-marscode-agent", "name": "Bytedance Marscode Agent", "vendor": "ByteDance", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 31.33, "resolved_count": 94, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://github.com/WisdomShell/codeshell", "observed_at": "2024-11-11T00:00:00+00:00", "harness": {"slug": "codeshelltester", "name": "CodeShellTester", "vendor": "Wisdomshell", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 30.67, "resolved_count": 92, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://autocoderover.dev/", "observed_at": "2024-06-21T00:00:00+00:00", "harness": {"slug": "autocoderover-v20240620", "name": "Autocoderover V20240620", "vendor": "AutoCodeRover", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 27.67, "resolved_count": 83, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://github.com/swe-bench/experiments/tree/main/evaluation/lite/20240706_sima_gpt4o", "observed_at": "2024-07-06T00:00:00+00:00", "harness": {"slug": "sima", "name": "SIMA", "vendor": "Swe Bench", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 27.33, "resolved_count": 82, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://masai-dev-agent.github.io/", "observed_at": "2024-06-12T00:00:00+00:00", "harness": {"slug": "masai", "name": "Masai", "vendor": "Masai", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 27.33, "resolved_count": 82, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://github.com/OpenAutoCoder/Agentless", "observed_at": "2024-06-30T00:00:00+00:00", "harness": {"slug": "agentless-lite", "name": "Agentless Lite", "vendor": "OpenAutoCoder", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 26.2, "resolved_count": 131, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://appmap.io/navie", "observed_at": "2024-06-15T00:00:00+00:00", "harness": {"slug": "appmap-navie", "name": "Appmap Navie", "vendor": "AppMap", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 24.67, "resolved_count": 74, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://github.com/aorwall/moatless-tools", "observed_at": "2024-06-17T00:00:00+00:00", "harness": {"slug": "moatless-tools", "name": "Moatless Tools", "vendor": "Aorwall", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 23.2, "resolved_count": 116, "total_count": 500, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Verified public submission", "source": "swe_bench_site", "source_url": "https://github.com/SWE-agent/SWE-agent", "observed_at": "2024-07-28T00:00:00+00:00", "harness": {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-verified", "name": "SWE-bench Verified"}}, {"success_rate": 21.67, "resolved_count": 65, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://appmap.io/navie", "observed_at": "2024-06-15T00:00:00+00:00", "harness": {"slug": "appmap-navie", "name": "Appmap Navie", "vendor": "AppMap", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 18.83, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Test public submission", "source": "swe_bench_site", "source_url": "https://autocoderover.dev/", "observed_at": "2024-06-28T00:00:00+00:00", "harness": {"slug": "autocoderover-v20240620", "name": "Autocoderover V20240620", "vendor": "AutoCodeRover", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-test", "name": "SWE-bench Test"}}, {"success_rate": 18.33, "resolved_count": 55, "total_count": 300, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Lite public submission", "source": "swe_bench_site", "source_url": "https://github.com/SWE-agent/SWE-agent", "observed_at": "2024-07-28T00:00:00+00:00", "harness": {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-lite", "name": "SWE-bench Lite"}}, {"success_rate": 14.6, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Test public submission", "source": "swe_bench_site", "source_url": "https://appmap.io/navie", "observed_at": "2024-06-15T00:00:00+00:00", "harness": {"slug": "appmap-navie", "name": "Appmap Navie", "vendor": "AppMap", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-test", "name": "SWE-bench Test"}}, {"success_rate": 11.99, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "SWE-bench Test public submission", "source": "swe_bench_site", "source_url": "https://github.com/SWE-agent/SWE-agent", "observed_at": "2024-07-28T00:00:00+00:00", "harness": {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4o-20240513", "name": "GPT-4o (2024-05-13)", "vendor": "OpenAI"}, "benchmark": {"slug": "swe-bench-test", "name": "SWE-bench Test"}}], "harnesses": [{"slug": "abanteai-mentatbot", "name": "Abanteai Mentatbot", "vendor": "AbanteAI", "repo_url": "https://github.com/AbanteAI/mentat", "openrouter_icon_url": null}, {"slug": "agentless-lite", "name": "Agentless Lite", "vendor": "OpenAutoCoder", "repo_url": "https://github.com/OpenAutoCoder/Agentless", "openrouter_icon_url": null}, {"slug": "aider", "name": "Aider", "vendor": "Aider", "repo_url": "https://github.com/Aider-AI/aider", "openrouter_icon_url": "https://aider.chat/favicon.ico"}, {"slug": "appmap-navie", "name": "Appmap Navie", "vendor": "AppMap", "repo_url": "https://github.com/applandeo/appmap", "openrouter_icon_url": null}, {"slug": "autocoderover-v20240620", "name": "Autocoderover V20240620", "vendor": "AutoCodeRover", "repo_url": "https://github.com/nus-apr/auto-code-rover", "openrouter_icon_url": null}, {"slug": "bytedance-marscode-agent", "name": "Bytedance Marscode Agent", "vendor": "ByteDance", "repo_url": "https://github.com/bytedance/trae-agent", "openrouter_icon_url": null}, {"slug": "codeshelltester", "name": "CodeShellTester", "vendor": "Wisdomshell", "repo_url": "https://github.com/WisdomShell/codeshell", "openrouter_icon_url": null}, {"slug": "masai", "name": "Masai", "vendor": "Masai", "repo_url": null, "openrouter_icon_url": null}, {"slug": "moatless-tools", "name": "Moatless Tools", "vendor": "Aorwall", "repo_url": "https://github.com/aorwall/moatless-tools", "openrouter_icon_url": null}, {"slug": "sima", "name": "SIMA", "vendor": "Swe Bench", "repo_url": "https://github.com/swe-bench/experiments/tree/main/evaluation/lite/20240706_sima_gpt4o", "openrouter_icon_url": null}, {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": "https://github.com/SWE-agent/SWE-agent", "openrouter_icon_url": null}]}