AgentBench
B待确认Benchmark智能体工具调用开放
发布方:THUDM
热度0.0±0
下载量 · 30天
—
Hugging Face
GitHub Stars
—
代码仓库
论文被引
—
Semantic Scholar
跑分模型 · 30天
—
Leaderboard results
简介
A Comprehensive Benchmark to Evaluate LLMs as Agents (ICLR'24)
发布方:THUDM
A Comprehensive Benchmark to Evaluate LLMs as Agents (ICLR'24)