{"model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai", "model_family": "gpt-5-4", "parameter_count_b": null, "context_length": 1050000, "homepage_url": null, "hf_model_id": null, "openrouter_id": "openai/gpt-5.4", "card_summary": "openai GPT-5.4 on SWE-bench Verified leaderboards.", "is_rl_checkpoint": false, "score_count": 9, "best_success_rate": 82.4, "input_price_per_million": 2.5, "output_price_per_million": 15.0}, "scores": [{"success_rate": 82.4, "resolved_count": null, "total_count": null, "cost_usd": 0.61, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.13.0", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/9eaf668d-bfbe-4525-a0f3-d29cb6479a98", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "gaia", "name": "GAIA"}}, {"success_rate": 75.6, "resolved_count": null, "total_count": null, "cost_usd": 0.63, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.13.0", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/5f6faa00-117b-4471-b635-5d830fcac6d5", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "openhands-swe-bench", "name": "SWE-bench (OpenHands Index)"}}, {"success_rate": 70.4, "resolved_count": null, "total_count": null, "cost_usd": 0.47, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.13.0", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/90cebe80-49bb-40c1-b65b-78f5e40461f9", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "swt-bench", "name": "SWT-Bench"}}, {"success_rate": 56.8, "resolved_count": null, "total_count": null, "cost_usd": 0.57, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 60, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null, "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "wildclawbench", "name": "WildClawBench"}}, {"success_rate": 56.2, "resolved_count": null, "total_count": null, "cost_usd": 4.04, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.13.0", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/04c309cc-564d-465f-8e84-e0b114044609", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "commit0", "name": "Commit0"}}, {"success_rate": 50.7, "resolved_count": null, "total_count": null, "cost_usd": 0.44, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 60, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null, "harness": {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "wildclawbench", "name": "WildClawBench"}}, {"success_rate": 50.3, "resolved_count": null, "total_count": null, "cost_usd": 0.33, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 60, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "wildclawbench", "name": "WildClawBench"}}, {"success_rate": 48.4, "resolved_count": null, "total_count": null, "cost_usd": 0.61, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 60, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null, "harness": {"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "wildclawbench", "name": "WildClawBench"}}, {"success_rate": 36.8, "resolved_count": null, "total_count": null, "cost_usd": 1.45, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.13.0", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/b8e55418-a747-461b-92b8-2981612e5650", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-multimodal", "name": "SWE-bench Multimodal (OpenHands Index)"}}], "harnesses": [{"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "repo_url": "https://github.com/anthropics/claude-code", "openrouter_icon_url": "https://claude.ai/favicon.ico"}, {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "repo_url": "https://github.com/openai/codex", "openrouter_icon_url": "https://openai.com/favicon.ico"}, {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "repo_url": "https://github.com/NousResearch/hermes-agent", "openrouter_icon_url": null}, {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "repo_url": "https://github.com/openclaw/openclaw", "openrouter_icon_url": null}, {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": "https://github.com/All-Hands-AI/OpenHands", "openrouter_icon_url": "https://www.all-hands.dev/favicon.ico"}]}