Pith. sign in

← back to paper

Review history

arxiv: 2509.08777 · 2 revisions

Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    107631 ms 17095 in 13703 out 2026-08-15T15:59:14.726633+00:00
  2. 2026-08-04 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    158716 ms 17099 in 16940 out 2026-08-04T20:10:57.609109+00:00