
New Benchmark Tests LLMs on Logical Inference Over Probability Operators
Researchers introduced a benchmark to evaluate how well large language models (LLMs) perform logical inference over natural-language probability expressions like 'likely' and 'unlikely', aiming to distinguish genuine reasoning from pattern matching.
