{"model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai", "model_family": "gpt-5-5", "parameter_count_b": null, "context_length": 1050000, "homepage_url": null, "hf_model_id": null, "openrouter_id": "openai/gpt-5.5", "card_summary": "openai GPT-5.5 on SWE-bench Verified leaderboards.", "is_rl_checkpoint": false, "score_count": 10, "best_success_rate": 93.25, "input_price_per_million": 5.0, "output_price_per_million": 30.0}, "scores": [{"success_rate": 93.25, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "HAL reliability composite (mean of 4 dimension aggregates)", "source": "hal_reliability_site", "source_url": "https://hal.cs.princeton.edu/reliability/benchmark/taubench_airline/", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "hal-reliability-tau-bench-airline", "name": "HAL Reliability \u2014 \u03c4-bench Airline (clean)"}}, {"success_rate": 89.75, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "HAL reliability composite (mean of 4 dimension aggregates)", "source": "hal_reliability_site", "source_url": "https://hal.cs.princeton.edu/reliability/benchmark/gaia/", "observed_at": null, "harness": {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "hal-reliability-gaia", "name": "HAL Reliability \u2014 GAIA"}}, {"success_rate": 86.1, "resolved_count": null, "total_count": null, "cost_usd": 0.74, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.18.1", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/268dd4d4-e587-449f-ba49-c2a3b6405683", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "gaia", "name": "GAIA"}}, {"success_rate": 83.4, "resolved_count": null, "total_count": null, "cost_usd": 0.92, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.18.1", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/6eec49a3-ecfb-4081-8282-caf1e3e1dda0", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "swt-bench", "name": "SWT-Bench"}}, {"success_rate": 83.15, "resolved_count": null, "total_count": null, "cost_usd": 4.627393258426967, "input_tokens": 336797311, "output_tokens": 5966373, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 445, "is_harnessrl_measured": false, "eval_protocol": null, "source": "tbench_official", "source_url": "https://github.com/harbor-framework/terminal-bench-2-1/pull/45", "observed_at": "2026-05-01T00:00:00+00:00", "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "terminal-bench-2-1-official", "name": "Terminal-Bench 2.1 (official)"}}, {"success_rate": 78.2, "resolved_count": null, "total_count": null, "cost_usd": 1.52, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.18.1", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/0875da38-90b0-4b49-9d66-0cbac446fd85", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "openhands-swe-bench", "name": "SWE-bench (OpenHands Index)"}}, {"success_rate": 77.98, "resolved_count": null, "total_count": null, "cost_usd": 1.1097752808988766, "input_tokens": 81469069, "output_tokens": 10768129, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 445, "is_harnessrl_measured": false, "eval_protocol": null, "source": "tbench_official", "source_url": "https://github.com/harbor-framework/terminal-bench-2-1/pull/47", "observed_at": "2026-05-01T00:00:00+00:00", "harness": {"slug": "terminus-2", "name": "Terminus 2", "vendor": "Harbor", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "terminal-bench-2-1-official", "name": "Terminal-Bench 2.1 (official)"}}, {"success_rate": 58.2, "resolved_count": null, "total_count": null, "cost_usd": 0.63, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": 60, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "wildclawbench", "name": "WildClawBench"}}, {"success_rate": 43.8, "resolved_count": null, "total_count": null, "cost_usd": 5.56, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.18.1", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/bab0c2b3-3c08-442d-98e8-7f34bfd76ebd", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "commit0", "name": "Commit0"}}, {"success_rate": 38.2, "resolved_count": null, "total_count": null, "cost_usd": 2.81, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "harness_version": null, "trial_count": null, "is_harnessrl_measured": false, "eval_protocol": "OpenHands SDK v1.18.1", "source": "openhands_index", "source_url": "https://laminar.sh/shared/evals/55c33492-2ff8-4f59-ba0a-566bcdbb2cd4", "observed_at": "2026-07-31T11:38:58.577710", "harness": {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": null, "openrouter_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "benchmark": {"slug": "swe-bench-multimodal", "name": "SWE-bench Multimodal (OpenHands Index)"}}], "harnesses": [{"slug": "codex", "name": "Codex", "vendor": "OpenAI", "repo_url": "https://github.com/openai/codex", "openrouter_icon_url": "https://openai.com/favicon.ico"}, {"slug": "hal-generalist-agent", "name": "HAL Generalist Agent", "vendor": "Princeton PLI", "repo_url": "https://github.com/princeton-pli/hal-harness", "openrouter_icon_url": null}, {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "repo_url": "https://github.com/openclaw/openclaw", "openrouter_icon_url": null}, {"slug": "openhands-sdk", "name": "OpenHands SDK", "vendor": "All Hands AI", "repo_url": "https://github.com/All-Hands-AI/OpenHands", "openrouter_icon_url": "https://www.all-hands.dev/favicon.ico"}, {"slug": "terminus-2", "name": "Terminus 2", "vendor": "Harbor", "repo_url": "https://github.com/Elvin-Yiming-Du/harbor", "openrouter_icon_url": null}]}