Agent Benchmark Directory
A comprehensive directory of 70+ benchmarks for evaluating AI agents. Compare coding, web, tool-use, reasoning, and safety benchmarks. Find the right evaluation for your AI agent use case.
73
Benchmarks
10
Categories
—
Leaderboards
All
Coding
Web
Reasoning
General
Data Science
Tool Use
Computer Use
Safety
Domain
Multimodal
Multi-Agent
| Benchmark | Category | Tasks | Description | Year |
|---|
Click any row to expand details — what it measures, how, metrics, and links.