Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding Paper • 2608.25356 • Published 15 days ago • 20
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers Paper • 2608.06867 • Published Aug 7 • 111
Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning Paper • 2608.02831 • Published Aug 3 • 15