发布方:autolabhq
A benchmark for evaluating AI agents on frontier ultra long-horizon auto research tasks.