Pith. sign in

← back to paper

Review history

arxiv: 2509.07135 · 2 revisions

MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    100140 ms 13789 in 11922 out 2026-08-15T16:12:45.279463+00:00
  2. 2026-08-04 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    144546 ms 13763 in 13871 out 2026-08-04T22:46:57.537527+00:00