LLM EXPLORER 62,007 MODELS INDEXED

Agent Benchmark Directory

A comprehensive directory of 70+ benchmarks for evaluating AI agents. Compare coding, web, tool-use, reasoning, and safety benchmarks. Find the right evaluation for your AI agent use case.
73
Benchmarks
10
Categories
—
Leaderboards
All Coding Web Reasoning General Data Science Tool Use Computer Use Safety Domain Multimodal Multi-Agent
Benchmark Category Tasks Description Year
Click any row to expand details — what it measures, how, metrics, and links.