{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c9c6987ac9386afc8ee3bf03d20f5b16ce0313e47aad949c3ddbae9c8c9e1b2","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:06:30.259347Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T14:03:01.974171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"cited_work":{"arxiv_id":"2511.16886","doi":"10.48550/arxiv.2511.16886","metadata_source":"pith","pith_arxiv_id":"2511.16886","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","venue":"cs.CL","work_id":"973d1be6-6c2d-494b-8330-e037238431fe","year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2511.16886","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:cd22a988d61ef64dab0995cdae2803a62255141a627031f570756a835b0f4c24","observation_id":"fa662205-7a44-4221-88c9-4e704fca57ba","resolution":{"observed_at":"2026-07-13T14:09:38.535527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.16886/citation-record","integrity":"/paper/2511.16886/integrity","json":"/paper/2511.16886/citation-record.json","paper":"/paper/2511.16886"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-03T21:06:29.296424Z","title":"Universal transformers.arXiv preprint arXiv:1807.03819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.296424Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:17e14e71d2025ad762fab8b4500a18a48838d35ab3a5242a4d827adc9605a4ee","observation_id":"ff9e43c3-9687-454e-ae99-7924ad2edec2","resolution":{"observed_at":"2026-08-03T21:06:29.296424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T21:06:29.717017Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.717017Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:ba1b8e0bf5477a0edd9365b182eafc0bd246cbe0a087d3c2b03605963a7df4df","observation_id":"faa93361-0335-4d8e-aeb3-ccb0b08bc471","resolution":{"observed_at":"2026-08-03T21:06:29.717017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07141","last_updated":"2023-05-11T21:06:39Z","snapshot_observed_at":"2026-07-06T15:26:14.741268Z","submitted_at":"2023-05-11T21:06:39Z","title":"The ConceptARC Benchmark: Evaluating Understanding and Generalization in the ARC Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07141","snapshot_observed_at":"2026-08-03T21:06:30.009675Z","title":"Oarga, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.009675Z"},"links":{"cited_paper":"/paper/2305.07141","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:3e0a9ac7d4b6d3b0ec0db65be303c92a7cd7970bba18e151f9e2cc96ab894705","observation_id":"d9965a2c-7799-4554-9e43-271b2abce97e","resolution":{"observed_at":"2026-08-03T21:06:30.009675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12424","last_updated":"2024-03-16T21:10:38Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T08:32:38Z","title":"Looped Transformers are Better at Learning Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12424","snapshot_observed_at":"2026-08-03T21:06:30.161963Z","title":"Looped transformers are better at learning learning al- gorithms.arXiv preprint arXiv:2311.12424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.161963Z"},"links":{"cited_paper":"/paper/2311.12424","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:0df0404b9e59c8aba520b2624aa9d0f42c53a72c9b22ecea385583cfc061530f","observation_id":"f05a28e1-9b46-4a09-90ea-5f15886d9229","resolution":{"observed_at":"2026-08-03T21:06:30.161963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:30.259347Z","title":"Alternative Improvement Generators.As described in §4.2, there are several viable methods to generate intermediate steps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.259347Z"},"links":{"citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:3609daeea213531e9ed6d76f1767e914562f602a0a3290205ace454020d17116","observation_id":"fd0c9e37-1de4-447d-8634-215537f7b208","resolution":{"observed_at":"2026-08-03T21:06:30.259347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21734","last_updated":"2025-08-04T08:45:08Z","snapshot_observed_at":"2026-08-06T13:55:12.607273Z","submitted_at":"2025-06-26T19:39:54Z","title":"Hierarchical Reasoning Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21734","snapshot_observed_at":"2026-08-03T21:06:30.093930Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.093930Z"},"links":{"cited_paper":"/paper/2506.21734","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:c1b606e6f9faffc13322751909ab44eee3a2b184e757d5740d3c0be0e837f528","observation_id":"21bcbd0d-a95d-42de-9a24-1c41b8f413f4","resolution":{"observed_at":"2026-08-03T21:06:30.093930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-03T21:06:29.597655Z","title":"Dream to control: Learning behaviors by latent imagination.arXiv preprint arXiv:1912.01603,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.597655Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:34bd10d7468e0782d8c608835bbe7f51da0305d18e4eaacdfcfc24b4f96ea582","observation_id":"22b9ddee-1aa1-49cd-a886-ee384d2d7b4a","resolution":{"observed_at":"2026-08-03T21:06:29.597655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T21:06:29.374560Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.374560Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:8d976ae43f335ac56b819785b81bc4d7b04a45ff1b119b74f3077dde4b02ca2b","observation_id":"21705f32-f9ce-49ff-a85b-0490e878683c","resolution":{"observed_at":"2026-08-03T21:06:29.374560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-03T21:06:29.227914Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.227914Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:aaf1819b3f2f572107791729c5909472c7984470febcfe711db9d70cd1e32155","observation_id":"4f18f9f3-50c1-426c-954e-c5937e77cede","resolution":{"observed_at":"2026-08-03T21:06:29.227914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04871","last_updated":"2025-10-06T14:58:08Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T14:58:08Z","title":"Less is More: Recursive Reasoning with Tiny Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04871","snapshot_observed_at":"2026-08-03T21:06:29.803009Z","title":"Less is more: Recursive reasoning with tiny networks.arXiv preprint arXiv:2510.04871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.803009Z"},"links":{"cited_paper":"/paper/2510.04871","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:ab5a05354c6d2be98b03bc62d88a317ce418c4c3c25c9a32627f66e151ed536e","observation_id":"883b64f5-5f91-4300-9ae1-1a2d68106f17","resolution":{"observed_at":"2026-08-03T21:06:29.803009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-03T21:06:29.486681Z","title":"Adaptive computation time for recurrent neural networks.arXiv preprint arXiv:1603.08983,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.486681Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:d3e3a037eb2156224f8d2a333183a9afbae0ac817e795c48bb6368113257fa97","observation_id":"53302236-baab-4592-86ae-5d7e6e2ac11a","resolution":{"observed_at":"2026-08-03T21:06:29.486681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-03T21:06:29.881012Z","title":"Discrete diffusion model- ing by estimating the ratios of the data distribution.arXiv preprint arXiv:2310.16834,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.881012Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:67fddb4b9fd5c8993c99115baa15a12ddd280d3f3f25bbbb2d5d3e2997494ce5","observation_id":"f10b11f9-6161-40e2-b920-75d1698c4166","resolution":{"observed_at":"2026-08-03T21:06:29.881012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T16:10:51.134282Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2511.16886."}