BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
bigcodebench-perf
BigCodeBench
· bigcode
性能/成本
推理速度
B
待确认
6.6
28
—
—
ja-vicuna-qa-benchmark
· llm-book
语言/语义
通用问答
B
待确认
6.4
26
—
—
bigcodebench-domain
BigCodeBench
· bigcode
代码
代码生成
B
待确认
6.2
23
—
—
histone_modification_benchmark_v1
· DNA-LLM
垂直领域
生物
B
待确认
6.1
22
—
—
ade_benchmark_with_llm_reason
· jay0911
垂直领域
医疗
B
待确认
6.1
14
—
—
SimRelUz_semantic_evaluation_dataset
· elmurod1202
语言/语义
语义相似度
B
待确认
6.1
14
—
—
representational-collapse-llm-benchmark
· wu981526092
安全对齐
越狱攻防
B
待确认
6.0
21
—
—
cpg_methylation_benchmark_v1
· DNA-LLM
垂直领域
生物
B
待确认
6.0
21
—
—
LLM-Ribozyme-Kinetics-Golden-Benchmark
· jackkuo
垂直领域
生物
B
待确认
6.0
20
—
—
enhancer_annotations_benchmark_v1
· DNA-LLM
垂直领域
生物
B
待确认
5.8
19
—
—
chromatin_accessibility_benchmark_v1
· DNA-LLM
垂直领域
生物
B
待确认
5.7
17
—
—
maze-llm-benchmark-v1
· erdem-erdem
推理
游戏推理
B
待确认
5.7
17
—
—
DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK
· samliumay
智能体
工具调用
B
待确认
5.7
17
—
—
El-TARA_Spanish_LLM_Benchmark
· emre
推理
通用推理
B
待确认
5.1
8
—
—
bigcodebench-tool
BigCodeBench
· bigcode
代码
工具调用
B
待确认
5.1
8
—
—
SWE-bench Test
SWE-bench
· Princeton
代码
仓库级代码
A
已审核
5.1
—
—
—
Aider Refactor
Aider
· Aider
代码
代码生成
A
已审核
5.1
—
—
—
tabular-benchmark
· inria-soda
表格/结构化
表格机器学习
B
待确认
5.0
12
—
—
nigeria-livestock-llm-benchmark
· Fatika01
垂直领域
通用行业
B
待确认
5.0
12
—
—
SWE-bench Multilingual
SWE-bench
· Princeton
代码
仓库级代码
A
已审核
5.0
—
—
—
detoxic_benchmark
· d-llm
安全对齐
对齐安全
B
待确认
4.7
10
—
—
wikitext2-MIA-Benchmark
· mia-llm
安全对齐
数据污染
B
待确认
4.7
10
—
—
vizdoom-llm-inverse-dynamics-benchmark
· HiggsBoson
智能体
环境控制
B
待确认
4.7
10
—
—
Quad_benchmark_cqa_latest
· LLM-Beetle
知识问答
通用问答
B
待确认
4.1
7
—
—
persian-llm-eval
· heyparsadev
语言/语义
多语低资源
B
待确认
2.7
—
4
—
第 16 / 18 页
上一页
下一页