Recursive Self-Rewrite fixes agent training on scaffolded trajectories
IntelligenceLab and the University of Maryland (arXiv:2610.02826) detail how training agents on raw scaffolded trajectories bakes exploration crutches into model weights, and propose Recursive Self-Rewrite. The method expanded 2,001 source successes into 11,094 clean trajectories, lifting Qwen-3.8-27B to 9.1% pass@3 on Terminal-Bench 4 versus 4.5% for direct SFT.
- Direct trajectory SFT reached 4.5% pass@3 on Terminal-Bench 4
- RSR hit 9.1% on Terminal-Bench 4 and 74.2% on Terminal-Bench 2
- 2,001 source successes expanded to 11,094 clean trajectories
- Weights released as IntelligenceLab/RSR-27B on Hugging Face
Read next
AI