When Models Edit Too Much: On the Fidelity of Minimal Code Edits Paper • 2609.04061 • Published 5 days ago • 5
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems Paper • 2609.02750 • Published 6 days ago • 103
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 5 days ago • 168
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 5 days ago • 82
PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation Paper • 2609.02272 • Published 6 days ago • 6
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? Paper • 2608.31100 • Published 8 days ago • 38
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? Paper • 2609.01437 • Published 7 days ago • 256
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 6 days ago • 115
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills Paper • 2609.02749 • Published 6 days ago • 529
Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement Paper • 2609.01481 • Published 7 days ago • 17
CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents Paper • 2608.30147 • Published 8 days ago • 8
Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents Paper • 2608.31076 • Published 8 days ago • 20
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence Paper • 2608.31075 • Published 8 days ago • 28
Rubric-to-Code Credit Assignment for Reinforcement Learning Paper • 2608.27906 • Published 11 days ago • 7
Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities Paper • 2608.28122 • Published 11 days ago • 65