{"model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai", "model_family": "gpt-4-1", "parameter_count_b": null, "context_length": 1047576, "homepage_url": null, "hf_model_id": null, "openrouter_id": "openai/gpt-4.1", "card_summary": "openai GPT-4.1 on SWE-bench Verified leaderboards.", "is_rl_checkpoint": false, "score_count": 19, "best_success_rate": 52.4, "input_price_per_million": 2.0, "output_price_per_million": 8.0}, "scores": [{"success_rate": 52.4, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "Aider polyglot leaderboard", "source": "aider_leaderboard", "source_url": "https://aider.chat/docs/leaderboards/", "observed_at": "2025-04-14T00:00:00+00:00", "harness": {"slug": "aider", "name": "Aider", "vendor": "Aider", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "aider-polyglot", "name": "Aider Polyglot"}}, {"success_rate": 50.3, "resolved_count": null, "total_count": null, "cost_usd": 0.6659, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 165, "is_harnessrl_measured": false, "eval_protocol": "HAL GAIA (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/gaia", "observed_at": null, "harness": {"slug": "hf-open-deep-research", "name": "HF Open Deep Research", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-gaia", "name": "GAIA (HAL)"}}, {"success_rate": 49.7, "resolved_count": null, "total_count": null, "cost_usd": 0.4496, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 165, "is_harnessrl_measured": false, "eval_protocol": "HAL GAIA (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/gaia", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-gaia", "name": "GAIA (HAL)"}}, {"success_rate": 44.95, "resolved_count": null, "total_count": null, "cost_usd": 0.2081, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 135, "is_harnessrl_measured": false, "eval_protocol": "HAL USACO (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/usaco", "observed_at": null, "harness": {"slug": "usaco-episodic-semantic", "name": "USACO Episodic + Semantic", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-usaco", "name": "USACO (HAL)"}}, {"success_rate": 44.0, "resolved_count": null, "total_count": null, "cost_usd": 8.0337, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 49, "is_harnessrl_measured": false, "eval_protocol": "HAL SWE-bench Verified Mini (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/swebench_verified_mini", "observed_at": null, "harness": {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-swe-bench-verified-mini", "name": "SWE-bench Verified Mini (HAL)"}}, {"success_rate": 36.33, "resolved_count": null, "total_count": null, "cost_usd": 0.7887, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 300, "is_harnessrl_measured": false, "eval_protocol": "HAL Online Mind2Web (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/online_mind2web", "observed_at": null, "harness": {"slug": "browser-use", "name": "Browser-Use", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-online-mind2web", "name": "Online Mind2Web (HAL)"}}, {"success_rate": 36.0, "resolved_count": null, "total_count": null, "cost_usd": 0.1636, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 50, "is_harnessrl_measured": false, "eval_protocol": "HAL TAU-bench Airline (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/taubench_airline", "observed_at": null, "harness": {"slug": "tau-bench-tool-calling", "name": "TAU-bench Tool Calling", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-tau-bench-airline", "name": "TAU-bench Airline (HAL)"}}, {"success_rate": 33.33, "resolved_count": null, "total_count": null, "cost_usd": 2.3858, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 45, "is_harnessrl_measured": false, "eval_protocol": "HAL CORE-Bench Hard (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/corebench_hard", "observed_at": null, "harness": {"slug": "core-agent", "name": "CORE-Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-corebench-hard", "name": "CORE-Bench Hard (HAL)"}}, {"success_rate": 30.33, "resolved_count": null, "total_count": null, "cost_usd": 0.9041, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 300, "is_harnessrl_measured": false, "eval_protocol": "HAL Online Mind2Web (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/online_mind2web", "observed_at": null, "harness": {"slug": "seeact", "name": "SeeAct", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-online-mind2web", "name": "Online Mind2Web (HAL)"}}, {"success_rate": 25.41, "resolved_count": null, "total_count": null, "cost_usd": 1.4617, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 135, "is_harnessrl_measured": false, "eval_protocol": "HAL USACO (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/usaco", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-usaco", "name": "USACO (HAL)"}}, {"success_rate": 24.51, "resolved_count": null, "total_count": null, "cost_usd": 0.0727, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 102, "is_harnessrl_measured": false, "eval_protocol": "HAL ScienceAgentBench (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/scienceagentbench", "observed_at": null, "harness": {"slug": "sab-self-debug", "name": "SAB Self Debug", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-scienceagentbench", "name": "ScienceAgentBench (HAL)"}}, {"success_rate": 22.22, "resolved_count": null, "total_count": null, "cost_usd": 1.296, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 45, "is_harnessrl_measured": false, "eval_protocol": "HAL CORE-Bench Hard (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/corebench_hard", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-corebench-hard", "name": "CORE-Bench Hard (HAL)"}}, {"success_rate": 17.39, "resolved_count": null, "total_count": null, "cost_usd": 0.4717, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 30, "is_harnessrl_measured": false, "eval_protocol": "HAL AssistantBench (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/assistantbench", "observed_at": null, "harness": {"slug": "browser-use", "name": "Browser-Use", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-assistantbench", "name": "AssistantBench (HAL)"}}, {"success_rate": 16.0, "resolved_count": null, "total_count": null, "cost_usd": 0.357, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 50, "is_harnessrl_measured": false, "eval_protocol": "HAL TAU-bench Airline (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/taubench_airline", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-tau-bench-airline", "name": "TAU-bench Airline (HAL)"}}, {"success_rate": 6.86, "resolved_count": null, "total_count": null, "cost_usd": 0.676, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 102, "is_harnessrl_measured": false, "eval_protocol": "HAL ScienceAgentBench (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/scienceagentbench", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-scienceagentbench", "name": "ScienceAgentBench (HAL)"}}, {"success_rate": 6.15, "resolved_count": null, "total_count": null, "cost_usd": 0.0352, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 80, "is_harnessrl_measured": false, "eval_protocol": "HAL SciCode (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/scicode", "observed_at": null, "harness": {"slug": "scicode-zero-shot-agent", "name": "Scicode Zero Shot Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-scicode", "name": "SciCode (HAL)"}}, {"success_rate": 2.0, "resolved_count": null, "total_count": null, "cost_usd": 1.0571, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 49, "is_harnessrl_measured": false, "eval_protocol": "HAL SWE-bench Verified Mini (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/swebench_verified_mini", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-swe-bench-verified-mini", "name": "SWE-bench Verified Mini (HAL)"}}, {"success_rate": 1.54, "resolved_count": null, "total_count": null, "cost_usd": 0.9234, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 80, "is_harnessrl_measured": false, "eval_protocol": "HAL SciCode (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/scicode", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-scicode", "name": "SciCode (HAL)"}}, {"success_rate": 1.54, "resolved_count": null, "total_count": null, "cost_usd": 0.8674, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 80, "is_harnessrl_measured": false, "eval_protocol": "HAL SciCode (HAL) accuracy", "source": "hal_site", "source_url": "https://hal.cs.princeton.edu/scicode", "observed_at": null, "harness": {"slug": "scicode-tool-calling-agent", "name": "Scicode Tool Calling Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-4-1", "name": "GPT-4.1", "vendor": "openai"}, "benchmark": {"slug": "hal-scicode", "name": "SciCode (HAL)"}}], "harnesses": [{"slug": "aider", "name": "Aider", "vendor": "Aider", "repo_url": "https://github.com/Aider-AI/aider", "openrouter_icon_url": "https://aider.chat/favicon.ico"}, {"slug": "browser-use", "name": "Browser-Use", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "core-agent", "name": "CORE-Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": "https://github.com/princeton-pli/hal-harness", "openrouter_icon_url": null}, {"slug": "hf-open-deep-research", "name": "HF Open Deep Research", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "sab-self-debug", "name": "SAB Self Debug", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "swe-agent", "name": "SWE-agent", "vendor": "SWE-agent", "repo_url": "https://github.com/SWE-agent/SWE-agent", "openrouter_icon_url": null}, {"slug": "scicode-tool-calling-agent", "name": "Scicode Tool Calling Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "scicode-zero-shot-agent", "name": "Scicode Zero Shot Agent", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "seeact", "name": "SeeAct", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "tau-bench-tool-calling", "name": "TAU-bench Tool Calling", "vendor": null, "repo_url": null, "openrouter_icon_url": null}, {"slug": "usaco-episodic-semantic", "name": "USACO Episodic + Semantic", "vendor": null, "repo_url": null, "openrouter_icon_url": null}]}