Pith. sign in

Paper Citation Record · LEDGER

ARB: Advanced Reasoning Benchmark for Large Language Models

As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2307.13692.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2307.13692 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 18 of 18 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 18 of 18 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T10:12:00.034552Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T01:56:41.097417Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation f2058707-e7d7-4b86-976d-889788035bcc · inbound

Detecting Language Model Attacks with Perplexity cites this paper.

Detecting Language Model Attacks with Perplexity ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-15T14:02:26.857050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-15T14:02:26.784965Z digest=sha256:87d498a493db8d62862902edccbf38a1dbaa3f5da3afcbaace8574032f80fe40

Observation 9365706e-e03e-4c69-8796-0422d7affbf6 · inbound

Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models cites this paper.

Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 169

Resolution
unresolved
no resolver link, observed 2026-08-11T22:57:01.963459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T22:57:01.963459Z digest=sha256:62543cb8985c5f56ca8cdef5ce9beed35334adfccfeb2542d0e8688ebca72630

Observation bdd9c261-5c0f-47b3-9e8b-1f8b9dd6a8cd · inbound

Evaluating LLM Reasoning in the Operations Research Domain with ORQA cites this paper.

Evaluating LLM Reasoning in the Operations Research Domain with ORQA ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T06:01:13.384978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T06:01:13.384978Z digest=sha256:c0acecbdb3a9962c3f26a9f6281d00d28c3c2ebe1b921713b4157bc6fe74761a

Observation 2fec6879-7eae-47da-bfaf-03cf1df0df6b · inbound

Reasoning Language Models: A Blueprint cites this paper.

Reasoning Language Models: A Blueprint ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 133

Resolution
unresolved
no resolver link, observed 2026-08-10T18:36:55.014869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:36:55.014869Z digest=sha256:a948afc36968b804e06de41b091dee6aa3c06dcc1d26231177bd29f85676be1d

Observation a62da953-c012-46cd-b23b-03e4c61b2995 · inbound

An Empirically-grounded tool for Automatic Prompt Linting and Repair: A Case Study on Bias, Vulnerability, and Optimization in Developer Prompts cites this paper.

An Empirically-grounded tool for Automatic Prompt Linting and Repair: A Case Study on Bias, Vulnerability, and Optimization in Developer Prompts ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T17:14:06.587621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T17:14:06.587621Z digest=sha256:f8df8da05c5eafcad0bbbe656e553858cedd414077370a49d47e71c55171fbfa

Observation a04b347e-d478-4343-b1ed-9b7462e7188f · inbound

SocratiQ: A Generative AI-Powered Learning Companion for Personalized Education and Broader Accessibility cites this paper.

SocratiQ: A Generative AI-Powered Learning Companion for Personalized Education and Broader Accessibility ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T19:25:37.095855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:25:37.095855Z digest=sha256:3b426bbe991d946076a9d49601d9a209640198f5c8f442fdc4ace29b8ef7e452

Observation 0e41dd37-4f01-4642-af08-75b949cb48c4 · inbound

Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks cites this paper.

Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-16T10:12:00.034552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T10:12:00.034552Z digest=sha256:7289c7e90ff1fbc8f7f18544f858422e8913e3bee80f3151d27aa92db654f7a4

Observation c3a730d9-c725-4bc4-88f4-b69bed9b600c · inbound

BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models cites this paper.

BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T22:23:46.452978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:23:46.452978Z digest=sha256:14faeefecb12901e5ee1e5910ef9c107310ca39bc8cd86740d05a84156c4c6b2

Observation 2ddfcd57-75ca-4207-9e38-a0d6000b9420 · inbound

KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning cites this paper.

KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:27:41.219116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T21:27:41.219116Z digest=sha256:00e6d6fbf44d232e3c3e50eb73c5ebf088c4b0212f8d763c68d6edfd66e573fd

Observation 71978b6d-7305-4d4a-95f7-927506635be7 · inbound

HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class cites this paper.

HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:53:11.249482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:53:11.249482Z digest=sha256:2de1f804301cfe6642b86905e4f14541b17f1cf8eaa23a16d518395dfb95bffd

Observation d217b324-4312-4423-b330-978c7bc4eca3 · inbound

Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems cites this paper.

Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:29:08.957582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:29:08.957582Z digest=sha256:47cd5238c75763ba683ba20dbda4d7cdc86609725dd39d4355eeedd3d719d77f

Observation 713c670a-8be1-4f03-a533-2e3109cfedac · inbound

THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models cites this paper.

THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T13:20:14.608540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:20:14.608540Z digest=sha256:0fae0d30e5927373308b6c312d439c4f640ad5b6c358af06c84d38d66757bde3

Observation f2f73ece-5076-413d-b766-10a0d00a3fdb · inbound

Reasoning Beyond the Obvious: Evaluating Divergent and Convergent Thinking in LLMs for Financial Scenarios cites this paper.

Reasoning Beyond the Obvious: Evaluating Divergent and Convergent Thinking in LLMs for Financial Scenarios ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T18:19:47.342334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T18:19:47.342334Z digest=sha256:b457bd57220919332a7109ff7d9e2c06cda3f1bf3daef7f942ec13291e553154

Observation 236f06f4-efe4-481d-83c1-c01f2fa18c0e · inbound

Riemann-Bench: A Benchmark for Moonshot Mathematics cites this paper.

Riemann-Bench: A Benchmark for Moonshot Mathematics ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T05:36:00.833404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T18:02:42.607682Z digest=sha256:b717e0b8899f25d0fc80bdfbdc3371976a1d5df8e39cc6a946079482680eb6f3

Observation a78118aa-5ec1-40c9-9f45-7da00f8df489 · inbound

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions cites this paper.

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:21:53.062833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-08T02:52:55.120013Z digest=sha256:846667ecd824244f1ac4205a6b1e81a4be10133e43ed9a8379180168fc165a7e

Observation c0790a13-6418-497b-b1df-7576b9e60d7d · inbound

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models cites this paper.

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T04:06:34.710311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T09:30:15.567469Z digest=sha256:8d612bdf1a17d4f079a625e8bcad0a90ad0ea0a029442a06e4538248c8d0bd97

Observation 5ae35c9f-b0aa-4b13-909b-cdc6fb1d7b19 · inbound

Invariant Gradient Alignment for Robust Reasoning Distillation cites this paper.

Invariant Gradient Alignment for Robust Reasoning Distillation ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 24

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T07:26:46.028131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T06:56:05.310135Z digest=sha256:cb9a714858c69ef5aaec25752c4ff4c4de6d60f8bf16f6a19fd45a8693023219

Observation dab7f507-b1f7-4945-8eb1-7cdbacbf7332 · inbound

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation cites this paper.

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation ARB: Advanced Reasoning Benchmark for Large Language Models

Reference 34

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T01:56:41.098691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-07-10T01:51:14.922841Z digest=sha256:c63ed20171a4569f0f2a09117e6a4edc514867ec9c1209cd2a8b56b96ca43aeb