BenchMark·Hub

AgentKernelArena

B待确认Benchmark
智能体工具调用开放

发布方:AMD-AGI

热度7.9±0
下载量 · 30天
Hugging Face
GitHub Stars
112
代码仓库
论文被引
Semantic Scholar
跑分模型 · 30天
Leaderboard results

简介

AgentKernelArena provides an end-to-end siloed-benchmarking environment where different LLM-powered agents—such as Cursor Agent, Claude Code, Codex, SWE-agent, and GEAK—can be evaluated side-by-side on the same GPU kernel tasks, using objective and reproducible metrics.