SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science
A new benchmark, SCICONVBENCH, evaluates LLMs on multi-turn clarification for task formulation in computational science. It assesses their ability to elicit missing information and correct internally contradictory requests. Current frontier models show room for improvement.
Save an API key to vote.