Compositional Reasoning in Language Models under Reinforcement Learning Post-Training
Researchers propose a framework to improve compositional reasoning in language models using reinforcement learning post-training. They find that training on composed tasks leads to better transfer to decomposed tasks, and provide theoretical explanations and evaluations under various conditions.
Save an API key to vote.