Beam Search as Test-Time Self-Distillation via Counterfactual Contexts Paper • 2609.37041 • Published 12 days ago • 8
The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning Paper • 2610.00332 • Published 12 days ago • 10
Composable Decoding on the Probability Simplex: Theory and Implementation Paper • 2609.34992 • Published 13 days ago • 11
Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model Agents Paper • 2609.38536 • Published 12 days ago • 11
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers Paper • 2602.18292 • Published Feb 20 • 14
iSDFT: Information-Proximal Self-Distillation for Continual Learning in LLMs Paper • 2609.24646 • Published 20 days ago • 9
iSDFT: Info-Proximal Self-Distillation Fine-Tuning Collection iSDFT Trained Models • 66 items • Updated 18 days ago • 4
iSDFT: Info-Proximal Self-Distillation Fine-Tuning Collection iSDFT Trained Models • 66 items • Updated 18 days ago • 4
iSDFT: Info-Proximal Self-Distillation Fine-Tuning Collection iSDFT Trained Models • 66 items • Updated 18 days ago • 4