SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science

A new benchmark, SCICONVBENCH, evaluates LLMs on multi-turn clarification for task formulation in computational science. It assesses their ability to elicit missing information and correct internally contradictory requests. Current frontier models show room for improvement.

RSS Score 0 9/18/2026, 4:00:00 AM Original Source
Save an API key to vote.