New Benchmark Tests AI Agents on Complex, Long-Term Tasks
Researchers created a new test called Long-Horizon-Terminal-Bench to evaluate AI agents on complex, time-consuming tasks. Unlike previous tests, it measures progress over time, not just final results.