Scientific LLM Benchmarks
GitHub
← All benchmarks
Agentic· data-analysis

BLADE

University of Washington · 2024

Twelve datasets and research questions evaluating agents' analytical decisions against expert ground truth.

GitHub stars
Task type
agentic
Modality
code
Access
open
Size
12 items
License
ODC-By-1.0
Metrics
accuracy, F1, precision, coverage@k

Examples

No sample rows available for this dataset.