Agent Benchmark Directory
A comprehensive directory of 70+ benchmarks for evaluating AI agents. Compare coding, web, tool-use, reasoning, and safety benchmarks. Find the right evaluation for your AI agent use case.
73
Benchmarks
10
Categories
—
Leaderboards
All
Coding
Web
Reasoning
General
Data Science
Tool Use
Computer Use
Safety
Domain
Multimodal
Multi-Agent
| Benchmark | Category | Tasks | Description | Year |
|---|
Click any row to expand details — what it measures, how, metrics, and links.
Original data from HuggingFace, Arena and various public git repos.
Check out Ag3ntum — our secure, self-hosted AI agent for server management.
Release v20260328a