新发榜 · 近 120 天
近期新收录 benchmark,按收录时间排序
全部 52 项
排名Benchmark信号收录
- 1miriad-benchmark-200k垂直领域14—引 1008-26
- 2DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK智能体17—引 —08-26
- 3BlindLoop-Evaluation多模态12—引 —08-25
- 4form-field-v1-benchmark多模态65—引 —08-25
- 5MPB_Missing-Premise-Benchmark推理98—引 008-21
- 6tw-legal-benchmark-v2垂直领域74—引 —08-20
- 7llm-smartrouter-benchmark性能/成本69—引 —08-19
- 8CPI-benchmark多模态266—引 208-13
- 9joyo-kanji-yomi-benchmark-parakeet多模态502—引 108-12
- 10cybersec-retrieval-benchmark垂直领域90—引 —08-11
- 11red-team-appsec-benchmark安全对齐115—引 —08-09
- 12indic-queries-2026智能体247—引 —08-06
- 13multilingual-queries-2026智能体168—引 —08-06
- 14turkish_political_position_benchmark语言/语义161—引 —08-05
- 15TTS-Voice-Direction-Benchmark多模态132—引 —08-04
- 16homebench性能/成本——引 —08-03
- 17merchantbench智能体——引 —07-31
- 18turkish_cyber_security_controls_benchmark垂直领域127—引 —07-28
- 19TTS-Voice-Design-Benchmark多模态32—引 —07-28
- 20llm-cold-start-benchmark性能/成本65—引 —07-25
- 21LogiTraj-Benchmark垂直领域2,018—引 —07-24
- 22EnigmaEval多模态58—引 2007-23
- 23glossobench语言/语义——引 —07-23
- 24BEAR-benchmark多模态2,163—引 —07-17
- 25Food_Portion_Benchmark多模态2,734—引 2,27107-12
- 26music-off-policy-evaluation-benchmark垂直领域489—引 —07-09
- 27llm-speed-benchmarks性能/成本47—引 —07-08
- 28SenseNova-Vision-Benchmark多模态105—引 007-07
- 29benchmark-research垂直领域3,580—引 —07-06
- 30CHML-real-ecp-local-llm-audit-benchmark垂直领域132—引 —07-05
- 31bc-finance-llm-benchmark垂直领域73—引 —06-29
- 32pi-detector-bench安全对齐——引 —06-24
- 33svg-benchmark多模态1,417—引 —06-23
- 34NuosuBburma-OCR-Evaluation-Set多模态616—引 —06-21
- 35WikiProfile知识问答176—引 806-16
- 36GateMem智能体—154引 —06-16
- 37local-llm-speed-benchmarks性能/成本55—引 3606-10
- 38manta-benchmark-questions安全对齐6—引 —06-08
- 39RoboDojo智能体192,843—引 —06-07
- 40exploitgym安全对齐—842引 —06-02
- 41onprem-llm-benchmark性能/成本4,044—引 —05-29
- 42LLM_Benchmark语言/语义691,570引 —05-21
- 43VibeSearchBench智能体——引 —05-20
- 44llm-query-complexity-benchmark性能/成本103—引 2,07005-17
- 45PawBench性能/成本——引 —05-15
- 46ClawBench智能体1,112597引 2005-10
- 47IDEAL-Scenes多模态2,185—引 —05-07
- 48formal-grammar-llm-benchmark推理176—引 —05-06
- 49nigeria-livestock-llm-benchmark垂直领域12—引 —05-05
- 50persian-llm-eval语言/语义—4引 —05-05
- 51llm-medical-reasoning-steps-benchmark垂直领域60—引 —05-04
- 52bovine-embryo-video-evaluation多模态168—引 —05-02