RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation Paper ⢠2506.15455 ⢠Published Jun 18, 2025 ⢠5
Efficient Inference for Large Reasoning Models: A Survey Paper ⢠2503.23077 ⢠Published Mar 29, 2025 ⢠45
Expanding RL with Verifiable Rewards Across Diverse Domains Paper ⢠2503.23829 ⢠Published Mar 31, 2025 ⢠24
What, How, Where, and How Well? A Survey on Test-Time Scaling in Large Language Models Paper ⢠2503.24235 ⢠Published Mar 31, 2025 ⢠55
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model Paper ⢠2503.24290 ⢠Published Mar 31, 2025 ⢠62
DAPO: An Open-Source LLM Reinforcement Learning System at Scale Paper ⢠2503.14476 ⢠Published Mar 18, 2025 ⢠148
Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't Paper ⢠2503.16219 ⢠Published Mar 20, 2025 ⢠52
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models Paper ⢠2503.12545 ⢠Published Mar 16, 2025 ⢠7
Aligning Multimodal LLM with Human Preference: A Survey Paper ⢠2503.14504 ⢠Published Mar 18, 2025 ⢠26
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification Paper ⢠2503.12505 ⢠Published Mar 16, 2025 ⢠11
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization Paper ⢠2503.12937 ⢠Published Mar 17, 2025 ⢠30
BlobCtrl: A Unified and Flexible Framework for Element-level Image Generation and Editing Paper ⢠2503.13434 ⢠Published Mar 17, 2025 ⢠28
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning Paper ⢠2503.07459 ⢠Published Mar 10, 2025 ⢠16
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System Paper ⢠2503.09600 ⢠Published Mar 12, 2025 ⢠4
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL Paper ⢠2503.07536 ⢠Published Mar 10, 2025 ⢠89
Quantization for OpenAI's Whisper Models: A Comparative Analysis Paper ⢠2503.09905 ⢠Published Mar 12, 2025 ⢠7
Slamming: Training a Speech Language Model on One GPU in a Day Paper ⢠2502.15814 ⢠Published Feb 19, 2025 ⢠69
Can Community Notes Replace Professional Fact-Checkers? Paper ⢠2502.14132 ⢠Published Feb 19, 2025 ⢠6
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering? Paper ⢠2502.12115 ⢠Published Feb 17, 2025 ⢠46