{"benchmark": {"slug": "wildclawbench", "name": "WildClawBench", "description": "WildClawBench (InternLM, 2026) evaluates agents on 60 original long-horizon tasks inside a live OpenClaw environment: productivity, coding, social interaction, search, multimodal synthesis, and safety. The official README leaderboard is a harness\u00d7model matrix \u2014 OpenClaw plus Claude Code, Codex, and Hermes Agent on the same task suite (`source = wildclawbench_site`).\n\nCatalog rows use overall score (%). OpenClaw suite totals are stored as per-task cost. Harbor-format tasks are published as internlm/WildClawBench-Harbor. Distinct from SWE-bench issue-fixing boards.", "category": "eval", "split": null, "language": "multilingual", "task_count": 60, "homepage_url": "https://internlm.github.io/WildClawBench/", "paper_url": "https://arxiv.org/abs/2605.10912", "hf_dataset_id": "internlm/WildClawBench", "official_leaderboard_url": "https://internlm.github.io/WildClawBench/", "is_public_leaderboard": true, "harness_count": 4, "model_count": 34, "score_count": 46, "best_success_rate": 67.2}, "protocol": {"eval_protocol": "WildClawBench overall score (60 tasks)", "temperature": null, "max_turns": null, "context_budget_tokens": null, "n": 46}, "rankings": {"benchmark": {"slug": "wildclawbench", "name": "WildClawBench", "description": "WildClawBench (InternLM, 2026) evaluates agents on 60 original long-horizon tasks inside a live OpenClaw environment: productivity, coding, social interaction, search, multimodal synthesis, and safety. The official README leaderboard is a harness\u00d7model matrix \u2014 OpenClaw plus Claude Code, Codex, and Hermes Agent on the same task suite (`source = wildclawbench_site`).\n\nCatalog rows use overall score (%). OpenClaw suite totals are stored as per-task cost. Harbor-format tasks are published as internlm/WildClawBench-Harbor. Distinct from SWE-bench issue-fixing boards.", "category": "eval", "split": null, "language": "multilingual", "task_count": 60, "homepage_url": "https://internlm.github.io/WildClawBench/", "paper_url": "https://arxiv.org/abs/2605.10912", "hf_dataset_id": "internlm/WildClawBench", "official_leaderboard_url": "https://internlm.github.io/WildClawBench/", "is_public_leaderboard": true, "harness_count": null, "model_count": null, "score_count": null, "best_success_rate": null}, "sort": "success_rate", "rows": [{"rank": 1, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-6", "name": "GPT-5.6", "vendor": "OpenAI"}, "success_rate": 67.2, "resolved_count": null, "total_count": null, "cost_usd": 0.9463, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 2, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "claude-4-8-opus", "name": "Claude 4.8 Opus", "vendor": "Anthropic"}, "success_rate": 64.7, "resolved_count": null, "total_count": null, "cost_usd": 1.5992, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 3, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "claude-4-7-opus", "name": "Claude 4.7 Opus", "vendor": "Anthropic"}, "success_rate": 62.2, "resolved_count": null, "total_count": null, "cost_usd": 1.29, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 4, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "fable-5", "name": "Fable 5", "vendor": "Anthropic"}, "success_rate": 62.0, "resolved_count": null, "total_count": null, "cost_usd": 1.4618, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 5, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-5", "name": "GPT-5.5", "vendor": "openai"}, "success_rate": 58.2, "resolved_count": null, "total_count": null, "cost_usd": 0.63, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 6, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "grok-4-5", "name": "GROK 4.5", "vendor": "x-ai"}, "success_rate": 57.5, "resolved_count": null, "total_count": null, "cost_usd": 0.4738, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 7, "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "scaffold_code": null, "repo_url": "https://github.com/openai/codex", "homepage_url": "https://openai.com/codex", "openrouter_icon_url": "https://openai.com/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "success_rate": 56.8, "resolved_count": null, "total_count": null, "cost_usd": 0.57, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 8, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "qwen3-8-max", "name": "Qwen3.8 Max", "vendor": "Qwen"}, "success_rate": 56.2, "resolved_count": null, "total_count": null, "cost_usd": 0.4117, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 9, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "muse-spark-1-1", "name": "Muse Spark 1.1", "vendor": "meta"}, "success_rate": 54.8, "resolved_count": null, "total_count": null, "cost_usd": 0.3932, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 10, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "kimi-k3", "name": "KIMI K3", "vendor": "Moonshot"}, "success_rate": 54.5, "resolved_count": null, "total_count": null, "cost_usd": 0.668, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 11, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "glm-5-2", "name": "GLM 5 2", "vendor": "Zhipu"}, "success_rate": 54.2, "resolved_count": null, "total_count": null, "cost_usd": 0.285, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 12, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "claude-4-6-opus", "name": "Claude 4.6 Opus", "vendor": "Anthropic"}, "success_rate": 51.6, "resolved_count": null, "total_count": null, "cost_usd": 1.35, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 13, "harness": {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "scaffold_code": null, "repo_url": "https://github.com/NousResearch/hermes-agent", "homepage_url": "https://hermes-agent.nousresearch.com/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "success_rate": 50.7, "resolved_count": null, "total_count": null, "cost_usd": 0.44, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 14, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "success_rate": 50.3, "resolved_count": null, "total_count": null, "cost_usd": 0.33, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 15, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "hy3", "name": "Hy3", "vendor": "tencent"}, "success_rate": 49.7, "resolved_count": null, "total_count": null, "cost_usd": 0.0355, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 16, "harness": {"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "scaffold_code": "cc", "repo_url": "https://github.com/anthropics/claude-code", "homepage_url": "https://github.com/anthropics/claude-code", "openrouter_icon_url": "https://claude.ai/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "gpt-5-4", "name": "GPT-5.4", "vendor": "openai"}, "success_rate": 48.4, "resolved_count": null, "total_count": null, "cost_usd": 0.61, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 17, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "glm-5-1", "name": "GLM 5 1", "vendor": "Zhipu"}, "success_rate": 48.2, "resolved_count": null, "total_count": null, "cost_usd": 0.58, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 18, "harness": {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "scaffold_code": null, "repo_url": "https://github.com/NousResearch/hermes-agent", "homepage_url": "https://hermes-agent.nousresearch.com/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-pro", "name": "MiMo V2 Pro", "vendor": "Xiaomi"}, "success_rate": 48.1, "resolved_count": null, "total_count": null, "cost_usd": 0.26, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 19, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "qwen3-8-27b", "name": "Qwen3.8 27B", "vendor": "qwen"}, "success_rate": 48.0, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 20, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "muse-glimmer-30b", "name": "Muse Glimmer 30B", "vendor": "meta"}, "success_rate": 47.6, "resolved_count": null, "total_count": null, "cost_usd": 0.101, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 21, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "kimi-k2-7-code", "name": "KIMI K2.7 Code", "vendor": "moonshotai"}, "success_rate": 46.9, "resolved_count": null, "total_count": null, "cost_usd": 1.2052, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 22, "harness": {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "scaffold_code": null, "repo_url": "https://github.com/NousResearch/hermes-agent", "homepage_url": "https://hermes-agent.nousresearch.com/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "glm-5", "name": "GLM 5", "vendor": "z-ai"}, "success_rate": 46.4, "resolved_count": null, "total_count": null, "cost_usd": 0.44, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 23, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "intern-s2-preview-397b", "name": "Intern S2 Preview 397B", "vendor": "InternLM"}, "success_rate": 44.7, "resolved_count": null, "total_count": null, "cost_usd": null, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 24, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "deepseek-v4-pro", "name": "DeepSeek V4 Pro", "vendor": "deepseek"}, "success_rate": 43.7, "resolved_count": null, "total_count": null, "cost_usd": 0.2, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 25, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "qwen3-6-27b", "name": "Qwen3.6 27B", "vendor": "qwen"}, "success_rate": 43.2, "resolved_count": null, "total_count": null, "cost_usd": 0.3485, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 26, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-5-pro", "name": "MiMo V2.5 Pro", "vendor": "xiaomi"}, "success_rate": 43.0, "resolved_count": null, "total_count": null, "cost_usd": 0.21, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 27, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "glm-5", "name": "GLM 5", "vendor": "z-ai"}, "success_rate": 42.6, "resolved_count": null, "total_count": null, "cost_usd": 0.19, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 28, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemini-3-1-pro", "name": "Gemini 3.1 Pro", "vendor": "Google"}, "success_rate": 40.8, "resolved_count": null, "total_count": null, "cost_usd": 0.3, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 29, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-pro", "name": "MiMo V2 Pro", "vendor": "Xiaomi"}, "success_rate": 40.2, "resolved_count": null, "total_count": null, "cost_usd": 0.44, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 30, "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "scaffold_code": null, "repo_url": "https://github.com/openai/codex", "homepage_url": "https://openai.com/codex", "openrouter_icon_url": "https://openai.com/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "glm-5", "name": "GLM 5", "vendor": "z-ai"}, "success_rate": 38.9, "resolved_count": null, "total_count": null, "cost_usd": 0.13, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 31, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "gemma-4-31b-it", "name": "Gemma 4 31B IT", "vendor": "google"}, "success_rate": 37.6, "resolved_count": null, "total_count": null, "cost_usd": 0.0577, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 32, "harness": {"slug": "hermes-agent", "name": "Hermes Agent", "vendor": "Nous Research", "scaffold_code": null, "repo_url": "https://github.com/NousResearch/hermes-agent", "homepage_url": "https://hermes-agent.nousresearch.com/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "minimax-m2-7", "name": "MiniMax M2.7", "vendor": "minimax"}, "success_rate": 37.1, "resolved_count": null, "total_count": null, "cost_usd": 0.11, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 33, "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "scaffold_code": null, "repo_url": "https://github.com/openai/codex", "homepage_url": "https://openai.com/codex", "openrouter_icon_url": "https://openai.com/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "minimax-m2-7", "name": "MiniMax M2.7", "vendor": "minimax"}, "success_rate": 35.8, "resolved_count": null, "total_count": null, "cost_usd": 0.06, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 34, "harness": {"slug": "codex", "name": "Codex", "vendor": "OpenAI", "scaffold_code": null, "repo_url": "https://github.com/openai/codex", "homepage_url": "https://openai.com/codex", "openrouter_icon_url": "https://openai.com/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-pro", "name": "MiMo V2 Pro", "vendor": "Xiaomi"}, "success_rate": 35.3, "resolved_count": null, "total_count": null, "cost_usd": 0.15, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 35, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "qwen3-5-397b", "name": "Qwen3.5 397B", "vendor": "Qwen"}, "success_rate": 34.5, "resolved_count": null, "total_count": null, "cost_usd": 0.37, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 36, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "deepseek-v3-2", "name": "DeepSeek V3.2", "vendor": "deepseek"}, "success_rate": 34.0, "resolved_count": null, "total_count": null, "cost_usd": 0.19, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 37, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "glm-5-turbo", "name": "GLM 5 Turbo", "vendor": "z-ai"}, "success_rate": 33.9, "resolved_count": null, "total_count": null, "cost_usd": 0.25, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 38, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "minimax-m2-7", "name": "MiniMax M2.7", "vendor": "minimax"}, "success_rate": 33.8, "resolved_count": null, "total_count": null, "cost_usd": 0.12, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 39, "harness": {"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "scaffold_code": "cc", "repo_url": "https://github.com/anthropics/claude-code", "homepage_url": "https://github.com/anthropics/claude-code", "openrouter_icon_url": "https://claude.ai/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "minimax-m2-7", "name": "MiniMax M2.7", "vendor": "minimax"}, "success_rate": 32.0, "resolved_count": null, "total_count": null, "cost_usd": 0.09, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 40, "harness": {"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "scaffold_code": "cc", "repo_url": "https://github.com/anthropics/claude-code", "homepage_url": "https://github.com/anthropics/claude-code", "openrouter_icon_url": "https://claude.ai/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "glm-5", "name": "GLM 5", "vendor": "z-ai"}, "success_rate": 31.0, "resolved_count": null, "total_count": null, "cost_usd": 0.21, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 41, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "kimi-k2-5", "name": "KIMI K2.5", "vendor": "moonshotai"}, "success_rate": 30.8, "resolved_count": null, "total_count": null, "cost_usd": 0.11, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 42, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-flash", "name": "MiMo V2 Flash", "vendor": "Xiaomi"}, "success_rate": 30.8, "resolved_count": null, "total_count": null, "cost_usd": 0.17, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 43, "harness": {"slug": "claude-code", "name": "Claude Code", "vendor": "Anthropic", "scaffold_code": "cc", "repo_url": "https://github.com/anthropics/claude-code", "homepage_url": "https://github.com/anthropics/claude-code", "openrouter_icon_url": "https://claude.ai/favicon.ico", "leaderboard_icon_url": null}, "model": {"slug": "mimo-v2-pro", "name": "MiMo V2 Pro", "vendor": "Xiaomi"}, "success_rate": 29.9, "resolved_count": null, "total_count": null, "cost_usd": 0.15, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 44, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "minimax-m2-5", "name": "MiniMax M2.5", "vendor": "minimax"}, "success_rate": 27.1, "resolved_count": null, "total_count": null, "cost_usd": 0.16, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 45, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "step-3-5-flash", "name": "Step 3.5 Flash", "vendor": "stepfun"}, "success_rate": 26.7, "resolved_count": null, "total_count": null, "cost_usd": 0.11, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}, {"rank": 46, "harness": {"slug": "openclaw", "name": "OpenClaw", "vendor": "OpenClaw", "scaffold_code": null, "repo_url": "https://github.com/openclaw/openclaw", "homepage_url": "https://openclaw.ai/", "openrouter_icon_url": null, "leaderboard_icon_url": null}, "model": {"slug": "grok-4-20-beta", "name": "GROK 4.20 Beta", "vendor": "xAI"}, "success_rate": 19.3, "resolved_count": null, "total_count": null, "cost_usd": 0.16, "input_tokens": null, "output_tokens": null, "latency_ms": null, "temperature": null, "max_turns": null, "context_budget_tokens": null, "is_harnessrl_measured": false, "eval_protocol": "WildClawBench overall score (60 tasks)", "source": "wildclawbench_site", "source_url": "https://github.com/internlm/WildClawBench", "observed_at": null}]}}