{"benchmark": {"slug": "mle-bench", "name": "MLE-bench", "description": "MLE-bench measures ML engineering agents on 75 Kaggle competitions with Low/Medium/High complexity splits. Catalog ingests the **All (%)** any-medal column from the openai/mle-bench README leaderboard table (`mle_bench_site` source).\n\nHarness\u00d7model matrix (AIDE, OpenHands, R&D-Agent, Famou-Agent, etc.) \u2014 not software issue-fixing. Canonical setup: 24h runtime, 36 vCPUs, A10 GPU (see paper). Leaderboard submissions paused Apr 2026 per maintainer notice.", "category": "eval", "split": null, "language": null, "task_count": 75, "homepage_url": "https://mlebench.com/leaderboard", "paper_url": "https://arxiv.org/abs/2410.07095", "hf_dataset_id": null, "official_leaderboard_url": "https://mlebench.com/leaderboard", "is_public_leaderboard": true, "harness_count": 19, "model_count": 15, "score_count": 25, "best_success_rate": 64.44}, "protocol": {"eval_protocol": "MLE-bench All split any_medal_percentage", "temperature": null, "max_turns": null, "context_budget_tokens": null, "n": 25}, "rankings": {"benchmark": {"slug": "mle-bench", "name": "MLE-bench", "description": "MLE-bench measures ML engineering agents on 75 Kaggle competitions with Low/Medium/High complexity splits. Catalog ingests the **All (%)** any-medal column from the openai/mle-bench README leaderboard table (`mle_bench_site` source).\n\nHarness\u00d7model matrix (AIDE, OpenHands, R&D-Agent, Famou-Agent, etc.) \u2014 not software issue-fixing. Canonical setup: 24h runtime, 36 vCPUs, A10 GPU (see paper). Leaderboard submissions paused Apr 2026 per maintainer notice.", "category": "eval", "split": null, "language": null, "task_count": 75, "homepage_url": "https://mlebench.com/leaderboard", "paper_url": "https://arxiv.org/abs/2410.07095", "hf_dataset_id": null, "official_leaderboard_url": "https://mlebench.com/leaderboard", "is_public_leaderboard": true, "harness_count": null, "model_count": null, "score_count": null, "best_success_rate": null}, "sort": "success_rate", "rows": [{"rank": 1, "harness": {"slug": "famou-agent-2-0", "name": "Famou Agent 2.0", "vendor": "Baidubce", "scaffold_code": null, "repo_url": "https://github.com/baidubce/FM-Agent", "homepage_url": "https://github.com/baidubce/FM-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-pro-preview", "name": "Gemini 3 Pro Preview", "vendor": "Google"}, "success_rate": 64.44, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2026-02-23T00:00:00+00:00"}, {"rank": 2, "harness": {"slug": "aibuildai", "name": "AIBuildAI", "vendor": "Aibuildai", "scaffold_code": null, "repo_url": "https://github.com/aibuildai/AI-Build-AI", "homepage_url": "https://github.com/aibuildai/AI-Build-AI", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "claude-4-6-opus", "name": "Claude 4.6 Opus", "vendor": "Anthropic"}, "success_rate": 63.11, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2026-03-06T00:00:00+00:00"}, {"rank": 3, "harness": {"slug": "mlevolve", "name": "MLEvolve", "vendor": "Internscience", "scaffold_code": null, "repo_url": "https://github.com/InternScience/MLEvolve", "homepage_url": "https://github.com/InternScience/MLEvolve", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-pro-preview", "name": "Gemini 3 Pro Preview", "vendor": "Google"}, "success_rate": 61.33, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2026-02-14T00:00:00+00:00"}, {"rank": 4, "harness": {"slug": "famou-agent-2-0", "name": "Famou Agent 2.0", "vendor": "Baidubce", "scaffold_code": null, "repo_url": "https://github.com/baidubce/FM-Agent", "homepage_url": "https://github.com/baidubce/FM-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-2-5-pro", "name": "Gemini 2.5 Pro", "vendor": "google"}, "success_rate": 59.56, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-12-27T00:00:00+00:00"}, {"rank": 5, "harness": {"slug": "ml-master-2-0", "name": "ML Master 2.0", "vendor": "Sjtu Sai Agents", "scaffold_code": null, "repo_url": "https://github.com/sjtu-sai-agents/ML-Master", "homepage_url": "https://github.com/sjtu-sai-agents/ML-Master", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "deepseek-v3-2-speciale", "name": "Deepseek V3.2 Speciale", "vendor": "DeepSeek"}, "success_rate": 56.44, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-12-16T00:00:00+00:00"}, {"rank": 6, "harness": {"slug": "cair-mars", "name": "Cair Mars", "vendor": "Google", "scaffold_code": null, "repo_url": null, "homepage_url": "https://research.google/teams/cloud-ai-research/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-pro-preview", "name": "Gemini 3 Pro Preview", "vendor": "Google"}, "success_rate": 56.0, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2026-01-25T00:00:00+00:00"}, {"rank": 7, "harness": {"slug": "pievolve", "name": "PiEvolve", "vendor": "Fractalairesearchlabs", "scaffold_code": null, "repo_url": "https://github.com/FractalAIResearchLabs/PiEvolve", "homepage_url": "https://github.com/FractalAIResearchLabs/PiEvolve", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-pro-preview", "name": "Gemini 3 Pro Preview", "vendor": "Google"}, "success_rate": 52.0, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2026-01-05T00:00:00+00:00"}, {"rank": 8, "harness": {"slug": "leeroo", "name": "Leeroo", "vendor": "Leeroo Ai", "scaffold_code": null, "repo_url": "https://github.com/Leeroo-AI/kapso", "homepage_url": "https://github.com/Leeroo-AI/kapso", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-pro-preview", "name": "Gemini 3 Pro Preview", "vendor": "Google"}, "success_rate": 50.67, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-12-07T00:00:00+00:00"}, {"rank": 9, "harness": {"slug": "thesis", "name": "Thesis", "vendor": "Thesis Labs", "scaffold_code": null, "repo_url": null, "homepage_url": "https://thesislabs.ai", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-codex", "name": "GPT-5 codex", "vendor": "OpenAI"}, "success_rate": 48.44, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-11-10T00:00:00+00:00"}, {"rank": 10, "harness": {"slug": "famou-agent", "name": "Famou Agent", "vendor": "Baidubce", "scaffold_code": null, "repo_url": "https://github.com/baidubce/FM-Agent", "homepage_url": "https://github.com/baidubce/FM-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-2-5-pro", "name": "Gemini 2.5 Pro", "vendor": "google"}, "success_rate": 43.56, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-10-10T00:00:00+00:00"}, {"rank": 11, "harness": {"slug": "operand", "name": "Operand", "vendor": "Operand", "scaffold_code": null, "repo_url": null, "homepage_url": "https://operand.com", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-low", "name": "GPT-5 (low)", "vendor": "OpenAI"}, "success_rate": 39.56, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-10-06T00:00:00+00:00"}, {"rank": 12, "harness": {"slug": "cair", "name": "Cair", "vendor": "Google", "scaffold_code": null, "repo_url": null, "homepage_url": "https://research.google/teams/cloud-ai-research/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-2-5-pro", "name": "Gemini 2.5 Pro", "vendor": "google"}, "success_rate": 38.67, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-11-03T00:00:00+00:00"}, {"rank": 13, "harness": {"slug": "internagent", "name": "InternAgent", "vendor": "Alpha Innovator", "scaffold_code": null, "repo_url": "https://github.com/Alpha-Innovator/InternAgent/", "homepage_url": "https://github.com/Alpha-Innovator/InternAgent/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "deepseek-r1", "name": "Deepseek R1", "vendor": "deepseek"}, "success_rate": 36.44, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-09-12T00:00:00+00:00"}, {"rank": 14, "harness": {"slug": "rd-agent", "name": "R&D Agent", "vendor": "Microsoft", "scaffold_code": null, "repo_url": "https://github.com/microsoft/RD-Agent", "homepage_url": "https://github.com/microsoft/RD-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5", "name": "GPT-5", "vendor": "openai"}, "success_rate": 35.11, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-09-26T00:00:00+00:00"}, {"rank": 15, "harness": {"slug": "neo", "name": "Neo", "vendor": "Neo", "scaffold_code": null, "repo_url": null, "homepage_url": "https://heyneo.so/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "undisclosed", "name": "undisclosed", "vendor": "Undisclosed"}, "success_rate": 34.22, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-07-28T00:00:00+00:00"}, {"rank": 16, "harness": {"slug": "aira-dojo", "name": "AIRA Dojo", "vendor": "Facebookresearch", "scaffold_code": null, "repo_url": "https://github.com/facebookresearch/aira-dojo/", "homepage_url": "https://github.com/facebookresearch/aira-dojo/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "o3", "name": "o3", "vendor": "openai"}, "success_rate": 31.6, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-05-15T00:00:00+00:00"}, {"rank": 17, "harness": {"slug": "rd-agent", "name": "R&D Agent", "vendor": "Microsoft", "scaffold_code": null, "repo_url": "https://github.com/microsoft/RD-Agent", "homepage_url": "https://github.com/microsoft/RD-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "ensemble-o3-gpt-4-1", "name": "Ensemble (o3, GPT-4.1)", "vendor": "OpenAI"}, "success_rate": 30.22, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-08-15T00:00:00+00:00"}, {"rank": 18, "harness": {"slug": "ml-master", "name": "ML Master", "vendor": "Zeroxleo", "scaffold_code": null, "repo_url": "https://github.com/zeroxleo/ML-Master", "homepage_url": "https://github.com/zeroxleo/ML-Master", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "deepseek-r1", "name": "Deepseek R1", "vendor": "deepseek"}, "success_rate": 29.33, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-06-17T00:00:00+00:00"}, {"rank": 19, "harness": {"slug": "rd-agent", "name": "R&D Agent", "vendor": "Microsoft", "scaffold_code": null, "repo_url": "https://github.com/microsoft/RD-Agent", "homepage_url": "https://github.com/microsoft/RD-Agent", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "o1-preview", "name": "o1 preview", "vendor": "OpenAI"}, "success_rate": 22.4, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2025-05-14T00:00:00+00:00"}, {"rank": 20, "harness": {"slug": "aide", "name": "AIDE", "vendor": "Wecoai", "scaffold_code": null, "repo_url": "https://github.com/wecoai/aideml", "homepage_url": "https://github.com/wecoai/aideml", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "o1-preview", "name": "o1 preview", "vendor": "OpenAI"}, "success_rate": 17.12, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}, {"rank": 21, "harness": {"slug": "aide", "name": "AIDE", "vendor": "Wecoai", "scaffold_code": null, "repo_url": "https://github.com/wecoai/aideml", "homepage_url": "https://github.com/wecoai/aideml", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-4o-20240806", "name": "GPT-4o (2024-08-06)", "vendor": "OpenAI"}, "success_rate": 8.63, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}, {"rank": 22, "harness": {"slug": "aide", "name": "AIDE", "vendor": "Wecoai", "scaffold_code": null, "repo_url": "https://github.com/wecoai/aideml", "homepage_url": "https://github.com/wecoai/aideml", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "claude-3-5-sonnet-20240620", "name": "Claude 3.5 Sonnet (2024-06-20)", "vendor": "Anthropic"}, "success_rate": 7.56, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}, {"rank": 23, "harness": {"slug": "openhands", "name": "OpenHands (legacy)", "vendor": "All Hands AI", "scaffold_code": "oh", "repo_url": "https://github.com/All-Hands-AI/OpenHands", "homepage_url": "https://github.com/All-Hands-AI/OpenHands", "openrouter_icon_url": null, "leaderboard_icon_url": "https://www.swebench.com/img/logos/20240725_opendevin_codeact_v1.8_claude35sonnet.png"}, "model": {"slug": "gpt-4o-20240806", "name": "GPT-4o (2024-08-06)", "vendor": "OpenAI"}, "success_rate": 4.89, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}, {"rank": 24, "harness": {"slug": "aide", "name": "AIDE", "vendor": "Wecoai", "scaffold_code": null, "repo_url": "https://github.com/wecoai/aideml", "homepage_url": "https://github.com/wecoai/aideml", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "llama-3-1-405b-instruct", "name": "Llama 3.1 405b Instruct", "vendor": "Meta"}, "success_rate": 3.33, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}, {"rank": 25, "harness": {"slug": "mlab", "name": "Mlab", "vendor": "MLAB", "scaffold_code": null, "repo_url": null, "homepage_url": "https://github.com/mlab-ai", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-4o-20240806", "name": "GPT-4o (2024-08-06)", "vendor": "OpenAI"}, "success_rate": 1.6, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "MLE-bench All split any_medal_percentage", "source": "mle_bench_site", "source_url": "https://github.com/openai/mle-bench", "observed_at": "2024-10-08T00:00:00+00:00"}]}}