飙升榜 · 7 日增速
按最近 7 天热度变化幅度排序
全部 450 项
排名Benchmark信号7日变化
- 1code_contests代码52,933—引 2,445▲ 2.645.6
- 2form-field-v1-benchmark多模态65—引 —▲ 2.511.6
- 3DL3DV-Evaluation多模态648—引 —▲ 2.517.2
- 4turkish_political_position_benchmark语言/语义161—引 —▲ 2.313.8
- 5ref-annotation-benchmark垂直领域29—引 —▲ 1.310.1
- 6CPI-benchmark多模态266—引 2▲ 1.116.5
- 7MBPP代码324,267—引 4,345▲ 1.056.1
- 8TTS-Voice-Direction-Benchmark多模态132—引 —▲ 0.913.0
- 9manta-benchmark-questions安全对齐6—引 —▲ 0.87.7
- 10WikiProfile知识问答176—引 8▲ 0.720.5
- 11RoboDojo智能体192,843—引 —▲ 0.630.5
- 12GSM8K数学1,047,339—引 10,266▲ 0.660.4
- 13Aider Code Editing代码——引 —▲ 0.48.7
- 14IFEval写作对话198,711—引 1,060▲ 0.456.1
- 15LongRAG长上下文495—引 149▲ 0.425.5
- 16ClawBench智能体1,112597引 20▲ 0.431.1
- 17ai2_arc知识问答498,251—引 5,337▲ 0.454.7
- 18mrcr长上下文5,400—引 79▲ 0.335.9
- 19HumanEval+代码——引 —▲ 0.39.1
- 20code_generation代码5,812—引 —▲ 0.321.0
- 21xtreme语言/语义5,182—引 1,184▲ 0.338.8
- 22MathVista多模态15,752—引 1,840▲ 0.340.0
- 23AgentHarm安全对齐4,598—引 368▲ 0.232.9
- 24DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK智能体17—引 —▲ 0.25.7
- 25HealthBench垂直领域4,177—引 —▲ 0.222.4
- 26xyzibd多模态23,928—引 —▲ 0.221.6
- 27histone_modification_benchmark_v1垂直领域22—引 —▲ 0.26.1
- 28RSRCC多模态2,341—引 0▲ 0.219.5
- 29MMMU多模态62,127592引 2,521▲ 0.254.4
- 30llm-refusal-evaluation安全对齐201—引 615▲ 0.225.1
- 31BLINK多模态11,131—引 574▲ 0.135.3
- 32AARA_Azerbaijani_LLM_Benchmark推理52—引 —▲ 0.18.6
- 33nigeria-livestock-llm-benchmark垂直领域12—引 —▲ 0.15.0
- 34Instruction-Following-Evaluation-for-Large-Language-Models语言/语义53—引 1,060▲ 0.123.9
- 35BrowseCompLongContext长上下文3,214—引 —▲ 0.120.5
- 36art推理5,150—引 553▲ 0.131.8
- 37scrapinghub-article-extraction-benchmark垂直领域338—引 —▲ 0.111.4
- 38real-toxicity-prompts安全对齐48,191—引 1,818▲ 0.141.5
- 39AlGhafa-Arabic-LLM-Benchmark-Native语言/语义6,732—引 354▲ 0.131.0
- 40EnigmaEval多模态58—引 20▲ 0.115.2
- 41bigcodebench-hard-domain代码28—引 —▲ 0.17.4
- 42MMMU-Pro多模态20,771—引 531▲ 0.136.7
- 43MASK安全对齐8,910—引 —▲ 0.121.3
- 44mup写作对话95—引 —▲ 0.110.8
- 45MMEB-V2多模态3,332—引 99▲ 0.128.2
- 46SWE-bench Bash-only代码——引 —▲ 0.17.1
- 47Cultural-Evaluation-Kalahi垂直领域648—引 6▲ 0.116.5
- 48xtreme_s多模态1,373—引 27▲ 0.125.7
- 49MedQA垂直领域7,185—引 2,009▲ 0.138.2
- 50maze-llm-benchmark-v1推理17—引 —▲ 0.15.7
- 51ruNaturalScienceVQA多模态317—引 —▲ 0.111.3
- 52Aider Polyglot代码——引 —▲ 0.18.0
- 53Humanity's Last Exam知识问答37,519—引 376▲ 0.140.3
- 54arabic-acoustic-poetry-benchmark垂直领域19—引 —▲ 0.17.2
- 55enhancer_annotations_benchmark_v1垂直领域19—引 —▲ 0.15.8
- 56code_x_glue_cc_code_completion_token代码1,102—引 —▲ 0.116.4
- 57MultiBanana-Benchmark多模态7,050—引 6▲ 0.123.0
- 58LongICLBench长上下文161—引 389▲ 0.123.9
- 59TutorEval未分类45—引 —▲ 0.19.4
- 60IneqMath数学992—引 25▲ 0.123.0
- 61LongBench v2长上下文61,296—引 348▲ 0.137.7
- 62NexusRaven_API_evaluation智能体497—引 404▲ 0.127.3
- 63Gender_Bias_Evaluation_Set安全对齐154—引 476▲ 0.123.8
- 64bovine-embryo-video-evaluation多模态168—引 —▲ 0.110.0
- 65TruthfulQA知识问答117,833—引 3,810▲ 0.145.6
- 66peer_read垂直领域259—引 290▲ 0.125.0
- 67WMDP安全对齐26,532—引 515▲ 0.136.2
- 68CritPt垂直领域4,402—引 11▲ 0.125.2
- 69formal-grammar-llm-benchmark推理176—引 —▲ 0.110.1
- 70Bias-Evaluation-Turkish安全对齐213—引 742▲ 0.124.2
- 71swag推理6,203—引 797▲ 0.133.9
- 72Mantis-Eval多模态708—引 —▲ 0.115.1
- 73TTS-Voice-Design-Benchmark多模态32—引 —▲ 0.110.3
- 74llm_physical_safety_benchmark安全对齐82—引 —▲ 0.18.6
- 75SWE-MERA代码491—引 —▲ 0.015.1
- 76qasper知识问答7,478—引 579▲ 0.039.6
- 77TheoremQA数学2,389—引 253▲ 0.029.6
- 78code_x_glue_cc_code_to_code_trans代码830—引 1,585▲ 0.031.0
- 79TheoremExplainBench数学86—引 23▲ 0.019.0
- 80CharXiv多模态4,756—引 245▲ 0.032.0
- 81healthbench-professional垂直领域1,720—引 —▲ 0.019.4
- 82LLMs-Planning推理—472引 —▲ 0.010.3
- 83Mind2Web智能体—1,021引 —▲ 0.011.5
- 84Vision-DeepResearch多模态—677引 —▲ 0.010.8
- 85OpenLane-V2多模态—673引 —▲ 0.010.8
- 86harvey-labs垂直领域—1,266引 —▲ 0.011.9
- 87wiqa推理1,471—引 116▲ 0.025.5
- 88MATH数学——引 6,224±017.1
- 89FrontierMath数学——引 230±010.6
- 90Terminal-Bench智能体——引 —±00.0
- 91WebArena智能体——引 1,882±014.7
- 92OSWorld智能体—3,110引 1,075±027.0
- 93τ²-bench智能体——引 416±011.8
- 94Needle in a Haystack长上下文——引 —±00.0
- 95RULER长上下文——引 1,211±013.9
- 96StrongREJECT安全对齐——引 374±011.6
- 97HarmBench安全对齐——引 1,467±014.3
- 98SuperCLUE中文——引 —±00.0
- 99SimpleQA知识问答——引 —±00.0
- 100ARC-AGI-2推理——引 165±010.0
- 101ade_corpus_v2垂直领域1,250—引 —±018.2
- 102NLU-few-shot-benchmark-en-de语言/语义40—引 —±09.2
- 103llm-speed-benchmarks性能/成本47—引 —±07.6
- 104chromatin_accessibility_benchmark_v1垂直领域17—引 —±05.7
- 105ade_benchmark_with_llm_reason垂直领域14—引 —±06.1
- 106detoxic_benchmark安全对齐10—引 —±04.7
- 107Quad_benchmark_cqa_latest知识问答7—引 —±04.1
- 108NTEU_Multilingual_Evaluation_Dataset语言/语义157—引 —±010.7
- 109query2query_evaluation语言/语义10—引 —±06.8
- 110imagereward-evaluation多模态32—引 —±06.8
- 111LoraxBench语言/语义64—引 —±010.6
- 112Video-ChatGPT多模态—1,506引 —±012.2
- 113llm-colosseum其他—1,484引 —±012.2
- 114PIXIU垂直领域—884引 —±011.3
- 115codefuse-devops-eval垂直领域—656引 —±010.8
- 116meta-agents-research-environments智能体—547引 —±010.5
- 117EvaLearn推理—431引 —±010.1
- 118K12-KGraph垂直领域—348引 —±09.7
- 119UltraEval-Audio多模态—316引 —±09.6
- 120Frontier-CS代码—304引 —±09.5
- 121whichllm性能/成本—6,501引 —±014.6
- 122InferenceX性能/成本—1,571引 —±012.2
- 123arena-hard-auto写作对话—1,061引 —±011.6
- 124ATLAS推理—992引 —±011.5
- 125Julia-LLM-Leaderboard代码—86引 —±07.4
- 126persian-llm-eval语言/语义—4引 —±02.7
- 127chain-of-thought-hub推理—2,775引 —±013.2
- 128phyre推理—460引 —±010.2
- 129Visual-CoT多模态—446引 —±010.2
- 130elimination_game推理—298引 —±09.5
- 131ERQA推理—289引 —±09.4
- 132sweet_rl智能体—271引 —±09.3
- 133BALROG智能体—266引 —±09.3
- 134nyt-connections推理—239引 —±09.1
- 135DyCodeEval代码—225引 —±09.0
- 136BRIGHT长上下文—211引 —±08.9
- 137MedXpertQA垂直领域—174引 —±08.6
- 138DeepPHY多模态—172引 —±08.6
- 139LLM-RGB推理—164引 —±08.5
- 140visual-spatial-reasoning多模态—150引 —±08.3
- 141cladder推理—148引 —±08.3
- 142MME-CoT多模态—136引 —±08.2
- 143OlympicArena推理—106引 —±07.8
- 144clutrr推理—104引 —±07.7
- 145FunQA多模态—104引 —±07.7
- 146exploitgym安全对齐—842引 —±011.2
- 147mcpmark智能体—459引 —±010.2
- 148GateMem智能体—154引 —±08.4
- 149autolab智能体—164引 —±08.5
- 150HaluMem智能体—156引 —±08.4
- 151ScienceBoard智能体—137引 —±08.2
- 152AgentKernelArena智能体—112引 —±07.9
- 153BBH推理——引 —±010.0
- 154MATH Lvl 5数学——引 —±010.0
- 155GPQA推理——引 —±010.0
- 156MUSR推理——引 —±010.0
- 157Massive Text Embedding Benchmark语言/语义——引 —±010.0
- 158BrowseComp智能体——引 558±012.4
- 159τ²-bench智能体—1,892引 416±024.3
- 160BFCL (Berkeley Function Calling)智能体——引 —±00.0
- 161Needle in a Haystack长上下文——引 —±00.0
- 162SWE-Next代码330—引 5±015.7
- 163AgentBench智能体——引 —±00.0
- 164MingLi-Bench垂直领域——引 —±00.0
- 165beir语言/语义——引 —±00.0
- 166KernelBench代码——引 —±00.0
- 167yet-another-applied-llm-benchmark知识问答——引 —±00.0
- 168AICGSecEval安全对齐——引 —±00.0
- 169ParseBench多模态——引 —±00.0
- 170EnterpriseRAG-Bench垂直领域——引 —±00.0
- 171VibeSearchBench智能体——引 —±00.0
- 172SEED-Bench多模态——引 —±00.0
- 173android-bench代码——引 —±00.0
- 174SafetyBench安全对齐——引 —±00.0
- 175terminal-bench-1智能体——引 —±00.0
- 176SWELancer-Benchmark代码——引 —±00.0
- 177homebench性能/成本——引 —±00.0
- 178LLM-Game-Benchmark推理——引 —±00.0
- 179TwinRouterBench智能体——引 —±00.0
- 180pi-detector-bench安全对齐——引 —±00.0
- 181glossobench语言/语义——引 —±00.0
- 182trajrl-bench智能体——引 —±00.0
- 183HallusionBench多模态——引 —±00.0
- 184ChartVLM多模态——引 —±00.0
- 185MMAR多模态——引 —±00.0
- 186snapbench推理——引 —±00.0
- 187RISEBench多模态——引 —±00.0
- 188CUREBench垂直领域——引 —±00.0
- 189prism-bench多模态——引 —±00.0
- 190OneIG-Benchmark多模态——引 —±00.0
- 191MathNet多模态——引 —±00.0
- 192AssetOpsBench垂直领域——引 —±00.0
- 193VLABench智能体——引 —±00.0
- 194BrowseComp-Plus智能体——引 —±00.0
- 195EmbodiedBench智能体——引 —±00.0
- 196AutomationBench智能体——引 —±00.0
- 197merchantbench智能体——引 —±00.0
- 198MobilityBench智能体——引 —±00.0
- 199people-search-bench智能体——引 —±00.0
- 200Mind2Web-2智能体——引 —±00.0
- 201AgentRE-Bench智能体——引 —±00.0
- 202agentsocialbench安全对齐——引 —±00.0
- 203LiveMCPBench智能体——引 —±00.0
- 204PawBench性能/成本——引 —±00.0
- 205silicon-rider-bench智能体——引 —±00.0
- 206truthful_qa未分类——引 —±00.0
- 207bigbench推理1,255—引 2,615▼ 0.034.4
- 208LLMBar推理146—引 —▼ 0.011.7
- 209CMMLU中文39,347—引 527▼ 0.038.1
- 210MMIU-Benchmark多模态3,158—引 67▼ 0.026.9
- 211multi_lexsum垂直领域1,994—引 69▼ 0.027.1
- 212IDEAL-Scenes多模态2,185—引 —▼ 0.015.0
- 213movie_rationales语言/语义415—引 —▼ 0.013.9
- 214LLM-Enzyme-Kinetics-Golden-Benchmark垂直领域125—引 —▼ 0.09.4
- 215MMMLU知识问答16,994—引 9,293▼ 0.044.3
- 216LiveCodeBench代码105,302—引 2,032▼ 0.043.0
- 217Thai-Semantic-Textual-Similarity-Benchmark语言/语义43—引 —▼ 0.08.7
- 218llm-redactor-leak-benchmark安全对齐93—引 0▼ 0.08.9
- 219ArXivSQA知识问答641—引 —▼ 0.012.6
- 220seahorse_summarization_evaluation写作对话200—引 57▼ 0.020.2
- 221NLU-Evaluation-Data-en-de语言/语义44—引 307▼ 0.019.9
- 222xquad知识问答12,621—引 982▼ 0.036.4
- 223scicite垂直领域608—引 319▼ 0.025.7
- 224FinanceBench垂直领域2,939—引 292▼ 0.126.7
- 225llm-query-complexity-benchmark性能/成本103—引 2,070▼ 0.124.0
- 226combine-llm-security-benchmark安全对齐33—引 —▼ 0.18.8
- 227RLPR-Evaluation推理282—引 86▼ 0.121.4
- 228image_gen_ocr_evaluation_data多模态32—引 —▼ 0.16.8
- 229code_x_glue_cc_cloze_testing_maxmin代码221—引 4,239▼ 0.128.5
- 230humanevalpack代码9,304—引 223▼ 0.133.8
- 231GPQA Diamond知识问答117,207—引 3,206▼ 0.146.0
- 232genomics-long-range-benchmark垂直领域4,191—引 —▼ 0.119.6
- 233MPB_Missing-Premise-Benchmark推理98—引 0▼ 0.117.1
- 234wmt-sqm-human-evaluation语言/语义84—引 —▼ 0.19.5
- 235code_x_glue_tt_text_to_text代码484—引 1,585▼ 0.127.8
- 236IndicGenBench_crosssum_in语言/语义368—引 77▼ 0.122.8
- 237social_i_qa推理29,677—引 —▼ 0.124.2
- 238bigcodereward代码108—引 5▼ 0.114.0
- 239legal-llm-benchmark垂直领域418—引 —▼ 0.112.6
- 240bc-finance-llm-benchmark垂直领域73—引 —▼ 0.19.7
- 241equity_evaluation_corpus安全对齐73—引 —▼ 0.110.5
- 242code_x_glue_ct_code_to_text代码6,102—引 1,464▼ 0.136.5
- 243scitail推理4,922—引 —▼ 0.118.7
- 244bigcodebench-domain代码23—引 —▼ 0.16.2
- 245GenAI-Bench多模态585323引 90▼ 0.133.5
- 246MathVerse数学3,099—引 731▼ 0.133.7
- 247speech_commands多模态5,465—引 2,076▼ 0.136.6
- 248Video-MME多模态36,677789引 1,511▼ 0.151.4
- 249representational-collapse-llm-benchmark安全对齐21—引 —▼ 0.16.0
- 250LLM-Ribozyme-Kinetics-Golden-Benchmark垂直领域20—引 —▼ 0.16.0
- 251MERA中文2,893—引 —▼ 0.118.5
- 252climate-evaluation垂直领域459—引 79▼ 0.122.2
- 253code_evaluation_prompts代码63—引 —▼ 0.111.5
- 254code_x_glue_tc_nl_code_search_adv代码619—引 1,585▼ 0.129.9
- 255M-BEIR多模态3,158—引 197▼ 0.130.0
- 256VideoScore-Bench多模态164—引 201▼ 0.122.0
- 257VideoEval-Pro多模态1,276—引 19▼ 0.121.7
- 258frames-benchmark长上下文14,619—引 179▼ 0.135.5
- 259Video-MME-v2多模态7,287—引 29▼ 0.128.6
- 260STRABLE-benchmark表格/结构化2,389—引 2▼ 0.118.2
- 261cvdp-benchmark-dataset代码2,262—引 —▼ 0.119.3
- 262lm1b语言/语义1,801—引 1,214▼ 0.132.1
- 263LLM-ABAP-Code-Generation-Benchmark代码109—引 —▼ 0.19.2
- 264LLM_Benchmark语言/语义691,570引 —▼ 0.121.4
- 265humaine-evaluation-dataset安全对齐156—引 —▼ 0.112.2
- 266japanese-image-classification-evaluation-dataset多模态105—引 —▼ 0.111.7
- 267svq多模态4,816—引 —▼ 0.121.4
- 268simpleqa-verified知识问答5,646—引 39▼ 0.128.8
- 269VisPhyBench-Data多模态37—引 —▼ 0.17.1
- 270benchmark-research垂直领域3,580—引 —▼ 0.116.0
- 271local-llm-speed-benchmarks性能/成本55—引 36▼ 0.114.9
- 272aya_evaluation_suite写作对话3,038—引 225▼ 0.131.0
- 273fleurs多模态102,558—引 683▼ 0.148.6
- 274TACT推理16—引 9▼ 0.112.9
- 275csabstruct语言/语义155—引 151▼ 0.121.6
- 276LiveBench知识问答—1,295引 210▼ 0.128.7
- 277Food_Portion_Benchmark多模态2,734—引 2,271▼ 0.130.6
- 278IndicGenBench_xorqa_in知识问答552—引 77▼ 0.122.8
- 279MMLU-Pro知识问答181,130419引 2,070▼ 0.166.0
- 280hendrycks-MATH-benchmark数学14,562—引 6,224▼ 0.140.0
- 281pdfQA-Benchmark长上下文8,697—引 1▼ 0.121.0
- 282QZhou-Flowchart-QA-Benchmark多模态45—引 —▼ 0.17.5
- 283JobBERT-evaluation-dataset垂直领域282—引 56▼ 0.118.9
- 284bigcodebench-perf性能/成本28—引 —▼ 0.16.6
- 285SWE-bench Lite代码113,101—引 3,498▼ 0.149.9
- 286SWE-bench Multilingual代码——引 —▼ 0.15.0
- 287scitldr写作对话650—引 287▼ 0.128.0
- 288FinQA垂直领域2,919—引 —▼ 0.115.6
- 289BEAR-benchmark多模态2,163—引 —▼ 0.115.0
- 290LEXam垂直领域1,872—引 50▼ 0.127.0
- 291German-RAG-LLM-HARD-BENCHMARK长上下文127—引 448▼ 0.121.4
- 292Ko-LLM-Safety-Benchmark安全对齐25—引 —▼ 0.17.7
- 293ja-vicuna-qa-benchmark语言/语义26—引 —▼ 0.16.4
- 294WER_Evaluation_For_TTS多模态40—引 —▼ 0.17.3
- 295code_x_glue_cc_code_completion_line代码821—引 —▼ 0.115.4
- 296spiqa多模态860—引 107▼ 0.127.0
- 297aqua_rat数学40,162—引 1,032▼ 0.139.4
- 298pg19长上下文5,485—引 939▼ 0.135.1
- 299gooaq知识问答291—引 73▼ 0.122.1
- 300ropes推理19,107—引 126▼ 0.133.4
- 301MMLU知识问答507,665—引 9,293▼ 0.151.5
- 302finno-ugric-benchmark语言/语义136—引 —▼ 0.19.6
- 303TARA_Turkish_LLM_Benchmark推理58—引 —▼ 0.112.0
- 304autocodearena-v0代码115—引 5▼ 0.114.1
- 305HRVideoBench多模态384—引 17▼ 0.118.1
- 306PixelWorld多模态328—引 2▼ 0.115.8
- 307EditReward-Bench多模态218—引 51▼ 0.120.2
- 308DocVQA多模态30,338—引 1,627▼ 0.239.9
- 309llm-system-prompts-benchmark写作对话267—引 56▼ 0.222.4
- 310German-RAG-LLM-EASY-BENCHMARK长上下文81—引 448▼ 0.220.6
- 311llm-medical-reasoning-steps-benchmark垂直领域60—引 —▼ 0.28.8
- 312cpg_methylation_benchmark_v1垂直领域21—引 —▼ 0.26.0
- 313wikitext2-MIA-Benchmark安全对齐10—引 —▼ 0.24.7
- 314vizdoom-llm-inverse-dynamics-benchmark智能体10—引 —▼ 0.24.7
- 315NuosuBburma-OCR-Evaluation-Set多模态616—引 —▼ 0.213.4
- 316eka-medical-asr-evaluation-dataset多模态615—引 —▼ 0.215.7
- 317wmt-da-human-evaluation-long-context长上下文270—引 —▼ 0.213.4
- 318wmt-mqm-human-evaluation语言/语义206—引 —▼ 0.211.2
- 319hippocorpus写作对话158—引 —▼ 0.211.8
- 320wmt22_african语言/语义1,143—引 —▼ 0.215.9
- 321BigCodeBench代码91,668—引 648▼ 0.240.3
- 322GDPval智能体159,806—引 —▼ 0.237.6
- 323ruCommonVQA多模态320—引 —▼ 0.211.3
- 324frontierscience垂直领域70,173—引 —▼ 0.227.9
- 325code_x_glue_cc_clone_detection_big_clone_bench代码764—引 —▼ 0.216.7
- 326AIME25数学839—引 —▼ 0.214.5
- 327ImagenWorld多模态268—引 6▼ 0.217.6
- 328HELMET长上下文2,617—引 119▼ 0.227.6
- 329speculator_benchmarks性能/成本5,216—引 —▼ 0.218.6
- 330onprem-llm-benchmark性能/成本4,044—引 —▼ 0.217.1
- 331RAG-Evaluation-Dataset-KO垂直领域353—引 —▼ 0.217.1
- 332granola-entity-questions知识问答309—引 25▼ 0.220.6
- 333code_x_glue_cc_code_refinement代码931—引 1,585▼ 0.230.2
- 334Crab-role-playing-evaluation-benchmark写作对话1,329—引 —▼ 0.214.1
- 335reveal推理103—引 86▼ 0.222.1
- 336FACTS-grounding-public知识问答1,401—引 —▼ 0.218.7
- 337ConvApparel智能体139—引 1▼ 0.214.4
- 338VisPlotBench代码275—引 2▼ 0.214.4
- 339GAIA-2智能体12,056—引 25▼ 0.229.3
- 340narrativeqa_manual知识问答168—引 1,081▼ 0.225.8
- 341LLM-WikiRace-Benchmark推理34—引 1▼ 0.28.3
- 342El-TARA_Spanish_LLM_Benchmark推理8—引 —▼ 0.25.1
- 343narrativeqa长上下文8,557—引 1,081▼ 0.236.4
- 344social_bias_frames安全对齐585—引 —▼ 0.216.3
- 345DL3DV-Benchmark多模态57,982—引 —▼ 0.225.9
- 346music-off-policy-evaluation-benchmark垂直领域489—引 —▼ 0.212.1
- 347code_x_glue_tc_text_to_code代码755—引 191▼ 0.227.3
- 348mup-full写作对话41—引 —▼ 0.28.6
- 349ValuePrism安全对齐161—引 132▼ 0.223.2
- 350snips_built_in_intents语言/语义1,067—引 931▼ 0.230.2
- 351LLM-Sec-Evaluation安全对齐15—引 —▼ 0.27.1
- 352boolq知识问答63,759—引 2,640▼ 0.242.5
- 353IndicGenBench_flores_in语言/语义609—引 77▼ 0.223.9
- 354VideoFeedback2多模态277—引 30▼ 0.217.7
- 355Additive-Manufacturing-Benchmark垂直领域2,967—引 —▼ 0.216.9
- 356serbian-llm-benchmark语言/语义754—引 —▼ 0.215.6
- 357MMDocIR_Evaluation_Dataset长上下文476—引 52▼ 0.222.9
- 358novalad-evaluation垂直领域233—引 371▼ 0.222.2
- 359Entity-Imagen多模态125—引 265▼ 0.221.7
- 360StructEval推理795—引 35▼ 0.222.4
- 361test_generation代码2,295—引 —▼ 0.217.7
- 362cosmos_qa推理8,128—引 517▼ 0.234.0
- 363mslr2022垂直领域342—引 —▼ 0.214.8
- 364kazakhstan-sociology-llm-benchmark垂直领域59—引 —▼ 0.38.8
- 365BlindLoop-Evaluation多模态12—引 —▼ 0.38.4
- 366SimRelUz_semantic_evaluation_dataset语言/语义14—引 —▼ 0.36.1
- 367math_dataset数学10,195—引 527▼ 0.336.1
- 368soda写作对话1,804—引 222▼ 0.331.2
- 369bigcodebench-hard代码9,452—引 —▼ 0.319.5
- 370docci多模态448—引 137▼ 0.326.8
- 371curriculum_benchmark推理48—引 —▼ 0.38.4
- 372eu-cyber-llm-benchmark-prompts安全对齐34—引 —▼ 0.37.8
- 373code_x_glue_cc_clone_detection_poj104代码425—引 —▼ 0.314.6
- 374H2VU-Benchmark多模态2,745—引 —▼ 0.315.5
- 375lila数学9,485—引 —▼ 0.322.1
- 376coconot安全对齐2,155—引 111▼ 0.330.7
- 377AIME 2025数学35,525—引 —▼ 0.325.5
- 378CHML-real-ecp-local-llm-audit-benchmark垂直领域132—引 —▼ 0.39.6
- 379LogiTraj-Benchmark垂直领域2,018—引 —▼ 0.314.9
- 380llm-smartrouter-benchmark性能/成本69—引 —▼ 0.38.3
- 381Fraud-R1-LLM-Defense-Fraud-Benchmark安全对齐62—引 43▼ 0.317.6
- 382vllm_safety_evaluation安全对齐50—引 114▼ 0.318.9
- 383C-Eval中文93,348—引 916▼ 0.342.5
- 384llm-cold-start-benchmark性能/成本65—引 —▼ 0.39.0
- 385graphwalks推理1,658—引 —▼ 0.320.2
- 386MEGA-Bench多模态666—引 41▼ 0.323.8
- 387MBPP+代码——引 —▼ 0.38.5
- 388openai-moderation-api-evaluation安全对齐2,956—引 492▼ 0.332.1
- 389VideoFeedback多模态576—引 201▼ 0.327.0
- 390SWE-bench代码109,656—引 3,498▼ 0.344.5
- 391data-product-benchmark智能体3,802—引 1▼ 0.319.1
- 392coverbench推理15—引 7▼ 0.312.6
- 393prosocial-dialog安全对齐865—引 162▼ 0.328.8
- 394AIGC-Detection-Benchmark多模态1,737—引 —▼ 0.314.6
- 395qasc知识问答36,568—引 413▼ 0.336.1
- 396SWE-bench Test代码——引 —▼ 0.35.1
- 397Aider Refactor代码——引 —▼ 0.35.1
- 398HumanEval代码302,869—引 11,205▼ 0.361.5
- 399PDE_Inverse_Problem_Benchmarking垂直领域9,752—引 2▼ 0.321.7
- 400plant-genomic-benchmark垂直领域9,365—引 —▼ 0.321.0
- 401denoising-impact-evaluation-dataset多模态436—引 —▼ 0.311.9
- 402IndicGenBench_xquad_in知识问答601—引 77▼ 0.323.5
- 403hle-rolling知识问答558—引 —▼ 0.315.9
- 404zest推理350—引 99▼ 0.321.3
- 405code_x_glue_cc_cloze_testing_all代码285—引 4,239▼ 0.429.7
- 406mittens安全对齐68—引 —▼ 0.410.9
- 407winogrande推理225,670—引 —▼ 0.429.4
- 408quoref推理2,621—引 190▼ 0.428.5
- 409LegalBench垂直领域3,056628引 23▼ 0.436.0
- 410WEIRD多模态337—引 —▼ 0.412.2
- 411vlm_evaluation_v1.0多模态2,282—引 177▼ 0.425.2
- 412imagenet-o多模态142—引 —▼ 0.49.7
- 413bigcodebench-tool代码8—引 —▼ 0.45.1
- 414tabular-benchmark表格/结构化12—引 —▼ 0.45.0
- 415Chat2Workflow-Evaluation智能体772—引 1▼ 0.416.3
- 416break_data推理1,151—引 —▼ 0.415.4
- 417LitSearch垂直领域1,128—引 —▼ 0.417.5
- 418BeaverTails-Evaluation安全对齐708—引 1,030▼ 0.429.7
- 419MMEB-eval多模态1,967—引 231▼ 0.528.8
- 420sensory-awareness-benchmark推理58—引 —▼ 0.511.9
- 421turkish_cyber_security_controls_benchmark垂直领域127—引 —▼ 0.513.7
- 422lince语言/语义442—引 —▼ 0.515.1
- 423common_gen写作对话3,067—引 16▼ 0.525.3
- 424SWE-bench Multimodal代码6,588—引 —▼ 0.525.4
- 425civil_comments安全对齐13,462—引 631▼ 0.535.5
- 426ruCLEVR多模态318—引 —▼ 0.512.1
- 427SWE-QA-Pro-Bench代码649—引 6▼ 0.518.6
- 428deepsearchqa智能体28,194—引 —▼ 0.628.4
- 429GAIA智能体13,202—引 1,138▼ 0.646.2
- 430BFCL (Berkeley Function Calling)智能体——引 —▼ 0.68.9
- 431olmOCR-bench多模态40,965—引 124▼ 0.641.0
- 432wildjailbreak安全对齐7,006—引 221▼ 0.736.4
- 433tw-legal-benchmark-v2垂直领域74—引 —▼ 0.715.3
- 434MusicCaps多模态1,130—引 745▼ 0.935.2
- 435rag_instruct_benchmark_tester垂直领域121—引 —▼ 1.016.7
- 436miriad-benchmark-200k垂直领域14—引 10▼ 1.115.4
- 437SWE-bench Verified代码336,081—引 3,498▼ 1.258.9
- 438svg-benchmark多模态1,417—引 —▼ 1.223.6
- 439SenseNova-Vision-Benchmark多模态105—引 0▼ 1.213.0
- 440multilingual-queries-2026智能体168—引 —▼ 1.413.4
- 441prompt-injections-benchmark安全对齐831—引 —▼ 1.420.2
- 442chinese-writing-benchmark写作对话205—引 —▼ 1.613.8
- 443indic-queries-2026智能体247—引 —▼ 1.714.2
- 444ragu_benchmarks长上下文44—引 —▼ 1.710.9
- 445red-team-appsec-benchmark安全对齐115—引 —▼ 1.712.7
- 446quac知识问答712—引 920▼ 1.833.1
- 447cybersec-retrieval-benchmark垂直领域90—引 —▼ 1.812.2
- 448sciq知识问答151,006—引 921▼ 2.945.2
- 449joyo-kanji-yomi-benchmark-parakeet多模态502—引 1▼ 3.018.2
- 450WildBench知识问答1,890—引 248▼ 3.432.5