Pith. sign in

← back to paper

Review history

arxiv: 2607.27405 · 2 revisions

Benchmarking LLM Competence on Logical Inference over Probability Operators

  1. 2026-08-03 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    143782 ms 34564 in 15211 out 2026-08-03T01:38:34.775976+00:00
  2. 2026-08-01 CONDITIONAL MODERATE v1.3.0-daily-deepseek novelty 6.0
    200321 ms 34309 in 19960 out 2026-08-01T07:53:46.937288+00:00