University of Illinois Urbana-Champaign · 2026
Multimodal benchmark evaluating agent-oriented reasoning and critique over real research papers across seven domains via grounding, experimental interpretation, cross-source evidence, and critical-assessment tasks.
No sample rows available for this dataset.