BenchMark·Hub

新发榜 · 近 120 天

近期新收录 benchmark,按收录时间排序

全部 52
  1. 1
    miriad-benchmark-200k
    08-26
  2. 2
    DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK
    08-26
  3. 3
    BlindLoop-Evaluation
    08-25
  4. 4
    form-field-v1-benchmark
    08-25
  5. 5
    MPB_Missing-Premise-Benchmark
    08-21
  6. 6
    tw-legal-benchmark-v2
    08-20
  7. 7
    llm-smartrouter-benchmark
    08-19
  8. 8
    CPI-benchmark
    08-13
  9. 9
    joyo-kanji-yomi-benchmark-parakeet
    08-12
  10. 10
    cybersec-retrieval-benchmark
    08-11
  11. 11
    red-team-appsec-benchmark
    08-09
  12. 12
    indic-queries-2026
    08-06
  13. 13
    multilingual-queries-2026
    08-06
  14. 14
    turkish_political_position_benchmark
    08-05
  15. 15
    TTS-Voice-Direction-Benchmark
    08-04
  16. 16
    homebench
    08-03
  17. 17
    merchantbench
    07-31
  18. 18
    turkish_cyber_security_controls_benchmark
    07-28
  19. 19
    TTS-Voice-Design-Benchmark
    07-28
  20. 20
    llm-cold-start-benchmark
    07-25
  21. 21
    LogiTraj-Benchmark
    07-24
  22. 22
    EnigmaEval
    07-23
  23. 23
    glossobench
    07-23
  24. 24
    BEAR-benchmark
    07-17
  25. 25
    Food_Portion_Benchmark
    07-12
  26. 26
    music-off-policy-evaluation-benchmark
    07-09
  27. 27
    llm-speed-benchmarks
    07-08
  28. 28
    SenseNova-Vision-Benchmark
    07-07
  29. 29
    benchmark-research
    07-06
  30. 30
    CHML-real-ecp-local-llm-audit-benchmark
    07-05
  31. 31
    bc-finance-llm-benchmark
    06-29
  32. 32
    pi-detector-bench
    06-24
  33. 33
    svg-benchmark
    06-23
  34. 34
    NuosuBburma-OCR-Evaluation-Set
    06-21
  35. 35
    WikiProfile
    06-16
  36. 36
    GateMem
    06-16
  37. 37
    local-llm-speed-benchmarks
    06-10
  38. 38
    manta-benchmark-questions
    06-08
  39. 39
    RoboDojo
    06-07
  40. 40
    exploitgym
    06-02
  41. 41
    onprem-llm-benchmark
    05-29
  42. 42
    LLM_Benchmark
    05-21
  43. 43
    VibeSearchBench
    05-20
  44. 44
    llm-query-complexity-benchmark
    05-17
  45. 45
    PawBench
    05-15
  46. 46
    ClawBench
    05-10
  47. 47
    IDEAL-Scenes
    05-07
  48. 48
    formal-grammar-llm-benchmark
    05-06
  49. 49
    nigeria-livestock-llm-benchmark
    05-05
  50. 50
    persian-llm-eval
    05-05
  51. 51
    llm-medical-reasoning-steps-benchmark
    05-04
  52. 52
    bovine-embryo-video-evaluation
    05-02