Meera Joshi
mjoshi-01
ยท
AI & ML interests
self-play
Recent Activity
upvoted a paper about 21 hours ago
Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL upvoted a paper about 21 hours ago
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling upvoted a paper about 21 hours ago
Nereus: Adaptive Parallelism for LLM Post-TrainingOrganizations
None yet