Kalman Delta Networks: Uncertainty-aware Associative Memory Paper • 2609.07816 • Published 4 days ago • 27
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation Paper • 2609.02998 • Published 9 days ago • 16
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation Paper • 2609.05295 • Published 7 days ago • 13
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 7 days ago • 20