{"as_of":"2026-08-08T16:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f0f959a5dc53c732c888cb1a798b5de0a09ef5d3987d798d17b5c16ff5a14be","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:44:57.195037Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T04:45:54.895043Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-07T13:44:57.195037Z","title":"D., Zhan, W., Oertell, O., Swamy, G., Brantley, K., Joachims, T., Bagnell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.195037Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:980525518922e86e6f960f3de5d37806522d33bcc36d9aa9ce988a56c36323bc","observation_id":"47c6f8f3-e850-427d-a039-f2b44a779a37","resolution":{"observed_at":"2026-08-07T13:44:57.195037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-06T14:13:07.149419Z","title":"Chang, Wenhao Zhan, Owen Oertell, Gokul Swamy, Kianté Brantley, Thorsten Joachims, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.149419Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:5eca9cd108d855dabed7817848d33eb3ed9a27780234897897b83cf4e1082646","observation_id":"bd99eeb9-8d0e-4a3d-9310-02ab785e3886","resolution":{"observed_at":"2026-08-06T14:13:07.149419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":"2404.16767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chang, Wenhao Zhan, Owen Oertell, Gokul Swamy, Kianté Brantley, Thorsten Joachims, J","venue":null,"work_id":"721e9b25-35b5-4039-a50f-71650c9b7ea9","year":2024},"citing_paper":{"arxiv_id":"2510.21060","last_updated":"2026-05-13T01:55:58Z","snapshot_observed_at":"2026-08-08T09:53:07.021031Z","submitted_at":"2025-10-24T00:21:38Z","title":"On the Sample Complexity of Differentially Private Policy Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T04:43:58.646419Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2510.21060"},"observation_digest":"sha256:884877b932566b73871d5638b248a82c55dfae93c6ffe438b634bdcf309e3ff0","observation_id":"bdb3b2cc-ab36-4992-85e8-d20e70146954","resolution":{"observed_at":"2026-05-18T04:45:54.898298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":"2404.16767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chang, Wenhao Zhan, Owen Oertell, Gokul Swamy, Kianté Brantley, Thorsten Joachims, J","venue":null,"work_id":"721e9b25-35b5-4039-a50f-71650c9b7ea9","year":2024},"citing_paper":{"arxiv_id":"2604.06159","last_updated":"2026-04-07T17:55:59Z","snapshot_observed_at":"2026-08-03T18:18:15.988189Z","submitted_at":"2026-04-07T17:55:59Z","title":"Target Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:21:37.744591Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2604.06159"},"observation_digest":"sha256:d8b256ce70294b5123f4a7257b18f7e4c2b3190b9119e457c4942a127277ffe2","observation_id":"64401bb4-50c1-4284-9ba8-529ec5fdd178","resolution":{"observed_at":"2026-05-10T23:05:48.547299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2404.16767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f56c1a905893f2d046090fd73e761df29ed019331c743b95167ce2db9cc0543a","observation_id":"ba279caa-04cb-408f-aeca-b17a6485f1ba","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-02T08:40:39.691665Z","title":"arXiv preprint arXiv:2404.16767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.691665Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ae15b1df90636bbcd3512e4f451a728538702681a2c4ca3227c8058d30f9a7cb","observation_id":"053ca9e2-88b8-4a03-8e0f-f300343c83cb","resolution":{"observed_at":"2026-08-02T08:40:39.691665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.16767/citation-record","integrity":"/paper/2404.16767/integrity","json":"/paper/2404.16767/citation-record.json","paper":"/paper/2404.16767"},"outbound":[],"paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2404.16767."}