{"as_of":"2026-08-07T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b647219a16bbd5b3e9498ae0206a3768f33095058d57fa4bd89d382fffa37a8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:51:30.691200Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T06:54:01.056295Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853","venue":null,"work_id":"3ea571fa-214a-4eb0-bfd7-cf727f89625a","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:183a4e318c5a3247913a219d188e5ceef826b40f0b8594426b5afe41a6e65ede","observation_id":"3c58cff3-de1e-4c63-b657-f717887b1988","resolution":{"observed_at":"2026-05-13T01:36:24.296155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-07T05:51:30.691200Z","title":"S2 r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06923","last_updated":"2025-06-07T21:23:00Z","snapshot_observed_at":"2026-08-07T05:43:58.731521Z","submitted_at":"2025-06-07T21:23:00Z","title":"Boosting LLM Reasoning via Spontaneous Self-Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:30.691200Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2506.06923"},"observation_digest":"sha256:992318ce305b230d566c01eb8f834c904cd08018d238c2586f941351b7f99c66","observation_id":"2d5e7b6f-4e1c-4faf-9f00-b351615363dd","resolution":{"observed_at":"2026-08-07T05:51:30.691200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-07T04:39:34.398292Z","title":"S2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-07T04:25:00.911965Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:34.398292Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2506.10406"},"observation_digest":"sha256:3f1c9056cca95a13c2134f686a2c6d664ffe2280c77fda76cc42f21c10b23726","observation_id":"e812ee5e-535c-40df-9a12-ddc265680545","resolution":{"observed_at":"2026-08-07T04:39:34.398292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-06T15:02:26.932292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-06T14:53:55.043979Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.932292Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:78be6183f2a70fe0a7ba0e53e51a955498d7aebcbb25c2a14a609f1ebd1448ff","observation_id":"31143d57-8403-4307-9567-3d65736b6bca","resolution":{"observed_at":"2026-08-06T15:02:26.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-04T12:41:42.687257Z","title":"S 2 r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02919","last_updated":"2026-05-29T16:16:27Z","snapshot_observed_at":"2026-08-04T12:41:41.436963Z","submitted_at":"2025-10-03T11:46:04Z","title":"Self-Reflective Generation at Test Time","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:41:42.687257Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2510.02919"},"observation_digest":"sha256:e7b6cf5694dbbf71aa1420d74a5b6526b7f3373ae2ed0506cc897ecea928e37d","observation_id":"686afce3-f261-4af1-b3ef-9204c8fdb512","resolution":{"observed_at":"2026-08-04T12:41:42.687257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-02T23:33:12.494748Z","title":"S 2rr: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13602","last_updated":"2026-05-30T00:19:02Z","snapshot_observed_at":"2026-08-02T23:33:07.026705Z","submitted_at":"2026-02-14T04:52:11Z","title":"Towards Sparse Video Understanding and Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T23:33:12.494748Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2602.13602"},"observation_digest":"sha256:4e4b0b0bc1897abf608cbefe0b8b7450762d38b53755ec6d01293ad5a11fa278","observation_id":"391e202b-2abc-490a-af25-b77342bd120f","resolution":{"observed_at":"2026-08-02T23:33:12.494748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853","venue":null,"work_id":"3ea571fa-214a-4eb0-bfd7-cf727f89625a","year":2025},"citing_paper":{"arxiv_id":"2604.10228","last_updated":"2026-05-28T16:26:54Z","snapshot_observed_at":"2026-08-02T18:56:30.478492Z","submitted_at":"2026-04-11T14:25:17Z","title":"SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:59:04.802241Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2604.10228"},"observation_digest":"sha256:cfb79427026a215b52bca0155f0fb004572dd73cdad5ff21f33c788a69663315","observation_id":"aa851a64-26fc-49e8-a29b-ea8e5102c6e2","resolution":{"observed_at":"2026-05-11T09:31:03.849486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-07-12T22:47:33.917420Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10228","last_updated":"2026-05-28T16:26:54Z","snapshot_observed_at":"2026-08-02T18:56:30.478492Z","submitted_at":"2026-04-11T14:25:17Z","title":"SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T22:47:33.917420Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2604.10228"},"observation_digest":"sha256:c289d0e9976d14efdc2d20a9a2212d3a438e594c9dd06cf8bb219ec293945659","observation_id":"f2f9c1d9-9e73-4d04-9ba7-3a2762563404","resolution":{"observed_at":"2026-07-12T22:47:33.917420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853","venue":null,"work_id":"3ea571fa-214a-4eb0-bfd7-cf727f89625a","year":2025},"citing_paper":{"arxiv_id":"2604.19567","last_updated":"2026-04-21T15:19:49Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:19:49Z","title":"Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:35:17.215879Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2604.19567"},"observation_digest":"sha256:b1b34592c9ad3e40755d2b5f614b964c47e73570ddd6d59583526a25592def91","observation_id":"e91f14a7-9f89-43fd-94ad-3a06bde8597e","resolution":{"observed_at":"2026-05-11T12:56:10.337177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853","venue":null,"work_id":"3ea571fa-214a-4eb0-bfd7-cf727f89625a","year":2025},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:7421bcc99927768921b2b4f8b67b4b1d77312f84be50840cc4026ab63e4e7e46","observation_id":"90a1b760-73b2-47f8-8e9b-649ec3c0717e","resolution":{"observed_at":"2026-05-10T06:31:31.255048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning.arXiv preprint arXiv:2502.12853","venue":null,"work_id":"3ea571fa-214a-4eb0-bfd7-cf727f89625a","year":2025},"citing_paper":{"arxiv_id":"2605.20745","last_updated":"2026-05-20T05:48:16Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:48:16Z","title":"The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T06:51:56.556213Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2605.20745"},"observation_digest":"sha256:d954a7ae8119ca64f7ff207600f51d2668d5a04919eac5a40ece88f86e62d653","observation_id":"68b6e2e8-4366-47fe-95da-e734b1f24516","resolution":{"observed_at":"2026-05-21T06:54:01.058137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-07-14T15:30:23.485228Z","title":"arXiv , author =:2502.12853v1 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09803","last_updated":"2026-07-09T17:52:16Z","snapshot_observed_at":"2026-08-06T03:03:16.058770Z","submitted_at":"2026-07-09T17:52:16Z","title":"Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T15:30:23.485228Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2607.09803"},"observation_digest":"sha256:eb262fa564e00155f1ee5a34149a2fd6ca0923161a7a7bbb9190c05ed0d205c3","observation_id":"b5942e9d-b718-4427-8708-efc52af0e119","resolution":{"observed_at":"2026-07-14T15:30:23.485228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.12853/citation-record","integrity":"/paper/2502.12853/integrity","json":"/paper/2502.12853/citation-record.json","paper":"/paper/2502.12853"},"outbound":[],"paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:38:34.150004Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2502.12853."}