Compositional Reasoning in Language Models under Reinforcement Learning Post-Training

Researchers propose a framework to improve compositional reasoning in language models using reinforcement learning post-training. They find that training on composed tasks leads to better transfer to decomposed tasks, and provide theoretical explanations and evaluations under various conditions.

RSS Score 0 9/18/2026, 4:00:00 AM Original Source
Save an API key to vote.