Pith. sign in

← back to paper

Review history

arxiv: 2508.13757 · 2 revisions

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    103903 ms 24181 in 11149 out 2026-08-15T17:10:51.352058+00:00
  2. 2026-08-05 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    95303 ms 24157 in 9908 out 2026-08-05T18:54:24.316040+00:00