{"as_of":"2026-08-06T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bec7272229e6839616bc9ca5130db8773f0a0a917ec39fc1c974b8658043bd5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:44:02.317303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":39,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T17:54:02.217086Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2209.14375"},"observation_digest":"sha256:cefe3edf3cf1d3d04d98bc14645b16bd3112fcf377bda3fe9682d822f9680961","observation_id":"4debb08a-1c94-4462-82f0-c91fa6b6f80d","resolution":{"observed_at":"2026-05-14T17:54:02.295634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:a782ad8a1f6489c15bbb20019e899ba120138e70a8e3ebf3e42b46379f445275","observation_id":"f30a9262-2c2d-4d6c-b07d-5a5eaaed3143","resolution":{"observed_at":"2026-05-16T08:12:31.230429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T13:55:22.422923Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:1b52d4437d103d937f4386841898f3e277d86e0805b95dc350ed2a1ef700701f","observation_id":"c6cc8c3f-608c-48a1-b990-c82fdc6ef923","resolution":{"observed_at":"2026-05-11T18:46:10.322410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T09:02:28.407064Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:18fa4e76b3686240495dbfdfb71999372c0528e1ba7c9a7dac14e86f9795f70f","observation_id":"d1786848-5e9b-4e83-89f9-627c49c605bc","resolution":{"observed_at":"2026-05-21T09:04:04.534726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:54b4b8215bccd05eb449a6d19ad2f25d61b29a2f8f97e4af1e729886932fc311","observation_id":"f108616f-79d7-43ac-adf5-b3c5c05d03dc","resolution":{"observed_at":"2026-06-29T19:53:55.936626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.12238/citation-record","integrity":"/paper/1909.12238/integrity","json":"/paper/1909.12238/citation-record.json","paper":"/paper/1909.12238"},"outbound":[],"paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:1909.12238."}