ResearchGym: Evaluating Language Model Agents on Real-World AI Research Paper • 2602.15112 • Published Feb 16 • 22
DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs Paper • 2608.26119 • Published Jun 18 • 1
Rethinking Open-Vocabulary Segmentation of Radiance Fields in 3D Space Paper • 2408.07416 • Published Aug 14, 2024 • 7