{"as_of":"2026-08-21T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a299c9e851deca0adec7e36f11f4d99c68be4a79bba5542d59e5534aa61419b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:12:00.034552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:56:41.097417Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-15T14:02:26.784965Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2308.14132"},"observation_digest":"sha256:87d498a493db8d62862902edccbf38a1dbaa3f5da3afcbaace8574032f80fe40","observation_id":"f2058707-e7d7-4b86-976d-889788035bcc","resolution":{"observed_at":"2026-05-15T14:02:26.857050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-11T22:57:01.963459Z","title":"Nay, Kshitij Gupta, and Aran Komatsuzaki","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.963459Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:62543cb8985c5f56ca8cdef5ce9beed35334adfccfeb2542d0e8688ebca72630","observation_id":"9365706e-e03e-4c69-8796-0422d7affbf6","resolution":{"observed_at":"2026-08-11T22:57:01.963459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-11T06:01:13.384978Z","title":"J.; Gupta, K.; and Komatsuzaki, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17874","last_updated":"2025-02-09T16:39:50Z","snapshot_observed_at":"2026-08-16T23:58:19.700639Z","submitted_at":"2024-12-22T09:10:34Z","title":"Evaluating LLM Reasoning in the Operations Research Domain with ORQA","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T06:01:13.384978Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2412.17874"},"observation_digest":"sha256:c0acecbdb3a9962c3f26a9f6281d00d28c3c2ebe1b921713b4157bc6fe74761a","observation_id":"bdd9c261-5c0f-47b3-9e8b-1f8b9dd6a8cd","resolution":{"observed_at":"2026-08-11T06:01:13.384978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-10T18:36:55.014869Z","title":"Sawada, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11223","last_updated":"2025-06-11T13:19:22Z","snapshot_observed_at":"2026-08-17T14:20:07.900972Z","submitted_at":"2025-01-20T02:16:19Z","title":"Reasoning Language Models: A Blueprint","version":4},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-10T18:36:55.014869Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2501.11223"},"observation_digest":"sha256:a948afc36968b804e06de41b091dee6aa3c06dcc1d26231177bd29f85676be1d","observation_id":"2fec6879-7eae-47da-bfaf-03cf1df0df6b","resolution":{"observed_at":"2026-08-10T18:36:55.014869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-10T17:14:06.587621Z","title":"Arb: Advanced reasoning benchmark for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12521","last_updated":"2025-01-21T22:24:03Z","snapshot_observed_at":"2026-08-13T10:08:12.836488Z","submitted_at":"2025-01-21T22:24:03Z","title":"An Empirically-grounded tool for Automatic Prompt Linting and Repair: A Case Study on Bias, Vulnerability, and Optimization in Developer Prompts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:14:06.587621Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2501.12521"},"observation_digest":"sha256:f8df8da05c5eafcad0bbbe656e553858cedd414077370a49d47e71c55171fbfa","observation_id":"a62da953-c012-46cd-b23b-03e4c61b2995","resolution":{"observed_at":"2026-08-10T17:14:06.587621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-09T19:25:37.095855Z","title":"Arb: Advanced reasoning benchmark for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00341","last_updated":"2025-02-01T06:59:54Z","snapshot_observed_at":"2026-08-19T06:16:37.703145Z","submitted_at":"2025-02-01T06:59:54Z","title":"SocratiQ: A Generative AI-Powered Learning Companion for Personalized Education and Broader Accessibility","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:25:37.095855Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2502.00341"},"observation_digest":"sha256:3b426bbe991d946076a9d49601d9a209640198f5c8f442fdc4ace29b8ef7e452","observation_id":"a04b347e-d478-4343-b1ed-9b7462e7188f","resolution":{"observed_at":"2026-08-09T19:25:37.095855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-16T10:12:00.034552Z","title":"ARB: advanced reasoning benchmark for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18838","last_updated":"2025-04-26T07:48:52Z","snapshot_observed_at":"2026-08-17T04:06:12.060099Z","submitted_at":"2025-04-26T07:48:52Z","title":"Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:12:00.034552Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2504.18838"},"observation_digest":"sha256:7289c7e90ff1fbc8f7f18544f858422e8913e3bee80f3151d27aa92db654f7a4","observation_id":"0e41dd37-4f01-4642-af08-75b949cb48c4","resolution":{"observed_at":"2026-08-16T10:12:00.034552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-15T22:23:46.452978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07360","last_updated":"2025-05-12T08:54:07Z","snapshot_observed_at":"2026-08-21T11:07:04.274484Z","submitted_at":"2025-05-12T08:54:07Z","title":"BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:46.452978Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.07360"},"observation_digest":"sha256:14faeefecb12901e5ee1e5910ef9c107310ca39bc8cd86740d05a84156c4c6b2","observation_id":"c3a730d9-c725-4bc4-88f4-b69bed9b600c","resolution":{"observed_at":"2026-08-15T22:23:46.452978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-15T21:27:41.219116Z","title":"arXiv:2307.13692","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09825","last_updated":"2025-06-03T15:11:26Z","snapshot_observed_at":"2026-08-19T06:15:14.689733Z","submitted_at":"2025-05-14T22:04:46Z","title":"KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:27:41.219116Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.09825"},"observation_digest":"sha256:00e6d6fbf44d232e3c3e50eb73c5ebf088c4b0212f8d763c68d6edfd66e573fd","observation_id":"2ddfcd57-75ca-4207-9e38-a0d6000b9420","resolution":{"observed_at":"2026-08-15T21:27:41.219116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-15T20:53:11.249482Z","title":"Arb: Advanced reasoning benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11774","last_updated":"2025-05-17T00:52:49Z","snapshot_observed_at":"2026-08-19T06:16:38.056532Z","submitted_at":"2025-05-17T00:52:49Z","title":"HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:11.249482Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.11774"},"observation_digest":"sha256:2de1f804301cfe6642b86905e4f14541b17f1cf8eaa23a16d518395dfb95bffd","observation_id":"71978b6d-7305-4d4a-95f7-927506635be7","resolution":{"observed_at":"2026-08-15T20:53:11.249482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-07T15:29:08.957582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15000","last_updated":"2025-05-21T01:07:00Z","snapshot_observed_at":"2026-08-14T02:16:34.541286Z","submitted_at":"2025-05-21T01:07:00Z","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:08.957582Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.15000"},"observation_digest":"sha256:47cd5238c75763ba683ba20dbda4d7cdc86609725dd39d4355eeedd3d719d77f","observation_id":"d217b324-4312-4423-b330-978c7bc4eca3","resolution":{"observed_at":"2026-08-07T15:29:08.957582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-07T13:20:14.608540Z","title":"p\\\" and the cost of a jumbo eraser \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-20T16:07:35.576418Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.608540Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0fae0d30e5927373308b6c312d439c4f640ad5b6c358af06c84d38d66757bde3","observation_id":"713c670a-8be1-4f03-a533-2e3109cfedac","resolution":{"observed_at":"2026-08-07T13:20:14.608540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-15T18:19:47.342334Z","title":"Nay, Kshitij Gupta, and Aran Komatsuzaki","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18368","last_updated":"2025-07-24T12:47:29Z","snapshot_observed_at":"2026-08-19T06:16:38.590899Z","submitted_at":"2025-07-24T12:47:29Z","title":"Reasoning Beyond the Obvious: Evaluating Divergent and Convergent Thinking in LLMs for Financial Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:19:47.342334Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2507.18368"},"observation_digest":"sha256:b457bd57220919332a7109ff7d9e2c06cda3f1bf3daef7f942ec13291e553154","observation_id":"f2f73ece-5076-413d-b766-10a0d00a3fdb","resolution":{"observed_at":"2026-08-15T18:19:47.342334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-08-15T01:52:40.673836Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:b717e0b8899f25d0fc80bdfbdc3371976a1d5df8e39cc6a946079482680eb6f3","observation_id":"236f06f4-efe4-481d-83c1-c01f2fa18c0e","resolution":{"observed_at":"2026-05-11T05:36:00.833404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2604.24621","last_updated":"2026-04-27T15:51:22Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:51:22Z","title":"Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T02:52:55.120013Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2604.24621"},"observation_digest":"sha256:846667ecd824244f1ac4205a6b1e81a4be10133e43ed9a8379180168fc165a7e","observation_id":"a78118aa-5ec1-40c9-9f45-7da00f8df489","resolution":{"observed_at":"2026-05-11T22:21:53.062833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2606.03858","last_updated":"2026-06-02T16:32:53Z","snapshot_observed_at":"2026-08-18T19:58:48.478451Z","submitted_at":"2026-06-02T16:32:53Z","title":"PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T09:30:15.567469Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2606.03858"},"observation_digest":"sha256:8d612bdf1a17d4f079a625e8bcad0a90ad0ea0a029442a06e4538248c8d0bd97","observation_id":"c0790a13-6418-497b-b1df-7576b9e60d7d","resolution":{"observed_at":"2026-07-02T04:06:34.710311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2606.05025","last_updated":"2026-06-03T15:48:52Z","snapshot_observed_at":"2026-08-16T10:35:03.954301Z","submitted_at":"2026-06-03T15:48:52Z","title":"Invariant Gradient Alignment for Robust Reasoning Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T06:56:05.310135Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2606.05025"},"observation_digest":"sha256:cb9a714858c69ef5aaec25752c4ff4c4de6d60f8bf16f6a19fd45a8693023219","observation_id":"5ae35c9f-b0aa-4b13-909b-cdc6fb1d7b19","resolution":{"observed_at":"2026-07-02T07:26:46.028131Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.13692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-07-10T01:56:41.097417Z","title":"2307.13692 , archivePrefix=","venue":"cs.CL","work_id":"995f76e8-f02d-4049-9ced-1a2a5e9e22ec","year":2023},"citing_paper":{"arxiv_id":"2607.08758","last_updated":"2026-07-09T17:55:53Z","snapshot_observed_at":"2026-08-16T22:51:26.694869Z","submitted_at":"2026-07-09T17:55:53Z","title":"Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T01:51:14.922841Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2607.08758"},"observation_digest":"sha256:c63ed20171a4569f0f2a09117e6a4edc514867ec9c1209cd2a8b56b96ca43aeb","observation_id":"dab7f507-b1f7-4945-8eb1-7cdbacbf7332","resolution":{"observed_at":"2026-07-10T01:56:41.098691Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.13692/citation-record","integrity":"/paper/2307.13692/integrity","json":"/paper/2307.13692/citation-record.json","paper":"/paper/2307.13692"},"outbound":[],"paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T19:59:31.697586Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2307.13692."}