Frontier LLM Meta-Benchmarks

August 2026

Multi-Domain Composite Evaluation across arena.ai, SWE-Pro, Autonomous OSWorld, and Unit Economics

← Back to Main

Arena.ai Code Elo Ratings

Arena.ai Live

SWE-Pro / DeepSWE Accuracy (%)

Software Engineering

Meta-Benchmark Matrix (arena.ai + SWE + Agentic)

Model & Family Arena.ai Agent Rank Arena Code Elo SWE-Pro / DeepSWE OSWorld / Agents Context Input / Output ($/1M) Primary Architectural Profile