Models from the paper "LaSeR: Reinforcement Learning with Last-Token Self-Rewarding"
Wenkai Yang
Keven16
AI & ML interests
None yet
Organizations
None yet
models 18
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step1200
4B • Updated • 64
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step300
4B • Updated • 99 • 1
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step1200
4B • Updated • 222
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step500
4B • Updated • 473 • 1
Keven16/Qwen2.5-7B-LaSeR
8B • Updated • 3
Keven16/OctoThinker-3B-Short-LaSeR
4B • Updated • 4
Keven16/ORZ-7B-LaSeR
8B • Updated • 4
Keven16/DeepCritic-7B-RL1.5-PRM800K
8B • Updated • 3
Keven16/DeepCritic-7B-RL1.5-Numina
8B • Updated • 5
Keven16/Qwen2.5-32B-TOPS-Iter-DPO-Preview
33B • Updated • 2
datasets 6
Keven16/OPSD-Example-Data
Viewer • Updated • 49.1k • 41
Keven16/G-OPD-Training-Data
Viewer • Updated • 134k • 535 • 3
Keven16/LaSeR_training_data
Viewer • Updated • 104k • 51 • 2
Keven16/TOPS-Data
Preview • Updated • 40
Keven16/DeepCritic-RL-Data
Viewer • Updated • 55k • 28
Keven16/DeepCritic-4.5K
Preview • Updated • 19