Scientific LLM Benchmarks
GitHub
← All benchmarks
Agentic· autonomous-discovery

Curie

University of Michigan · 2025

Framework and 46-question benchmark for rigorous, automated scientific experimentation across four CS domains.

GitHub stars
Task type
agentic
Modality
text
Access
open
Size
46 items
License
Apache-2.0
Metrics
accuracy

Examples

No sample rows available for this dataset.