Pith. sign in

Paper Citation Record · LEDGER

JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2501.14851.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.14851 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 11 of 11 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:44:31.930407Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T08:36:48.288216Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 72b29544-c055-4143-ac7c-1ea19c030df1 · inbound

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models cites this paper.

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 90

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:40:41.838340Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T08:40:40.910461Z digest=sha256:07a66edea456ad25859af1bd04ca5d139921fc9c41618a76619b0dcecd565f98

Observation 9d8e7afd-0c1b-42ec-ad31-7d2a76d554fc · inbound

Improving Large Language Models with Concept-Aware Fine-Tuning cites this paper.

Improving Large Language Models with Concept-Aware Fine-Tuning JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:28:23.828084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:28:23.828084Z digest=sha256:3864741aa888d8fc603b8e250cfed11b17e94349db3b2007c434a13df336d409

Observation f1e03c3c-9570-4a0d-85d8-caa872750e2a · inbound

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data cites this paper.

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T18:08:39.208031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:08:39.208031Z digest=sha256:fdc6feb21f9b3d7a4d3adbce5acd716913f54acefd8372b27318e21a5a9db0a9

Observation c3056f3b-8e04-49fa-acf3-cd2deee7a1bb · inbound

Logical Reasoning with Outcome Reward Models for Test-Time Scaling cites this paper.

Logical Reasoning with Outcome Reward Models for Test-Time Scaling JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T15:26:52.732798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T15:26:52.732798Z digest=sha256:b5a4015d43a582d838e4d394e2343ad70a611496a4eb3b2cb60dd9f166d87a87

Observation 69fdc157-bbdc-465c-b495-18e1571d5675 · inbound

Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL cites this paper.

Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T04:42:05.339231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T04:42:05.339231Z digest=sha256:2c86f654fd7aa7fe210513a5dbf3a0cd457e938410aa855d402294ad94e53406

Observation 6cc57450-3bb8-4c04-b73b-577b89f2e726 · inbound

Deductive Logic in Language Models: Horizontal vs Vertical Reasoning cites this paper.

Deductive Logic in Language Models: Horizontal vs Vertical Reasoning JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T10:40:26.129286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:40:26.129286Z digest=sha256:5a94a61114d2ac02b923aae28ed0cecd6ef78236ffadda5f24b2d54c0d4f5f79

Observation 7362ad27-72dd-4ec8-85fb-8925dfdd4e3e · inbound

ReportLogic: Evaluating Logical Quality in Deep Research Reports cites this paper.

ReportLogic: Evaluating Logical Quality in Deep Research Reports JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T07:39:36.528740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T07:39:36.528740Z digest=sha256:e28fe7c62de157cf6ba4cffc13a81b2806c03c294125c472d475668709782f13

Observation 84285226-067d-4eb5-a01d-f02e4098194e · inbound

DeonticBench: A Benchmark for Reasoning over Rules cites this paper.

DeonticBench: A Benchmark for Reasoning over Rules JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-10T22:00:48.119873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T20:22:03.956227Z digest=sha256:365d3827c197ae44a9b73647fd8fc73f338a0b503835a4fdd7e930260556afee

Observation 87594534-a9fd-4b10-aec1-ec25d04af57c · inbound

DAR: Deontic Reasoning with Agentic Harnesses cites this paper.

DAR: Deontic Reasoning with Agentic Harnesses JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 34

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T08:36:48.289884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-28T05:55:19.924704Z digest=sha256:34dc5aa17ea3a20f213e27909a045eef77062e7bc755b8de91847d74896b1a3a

Observation 50bfcbe8-7b85-4fea-a663-fddc2a596235 · inbound

Abductive Corroboration of Probabilistic AI Models for Forensic Synthetic Media Detection cites this paper.

Abductive Corroboration of Probabilistic AI Models for Forensic Synthetic Media Detection JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-12T03:54:48.803944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T03:54:48.803944Z digest=sha256:f9376dd975ffe35739abaf4c250d14ab7149dbd76ce18fdf970107312b1d6cdf

Observation 1d6aa5bc-2a07-47f9-8374-28c6e9e277b0 · inbound

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) cites this paper.

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T12:44:31.930407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:44:31.930407Z digest=sha256:0910877ff91d22d9cf451f7f5523b7614d3cd2b8001bce6584d57e293fb55977