{"as_of":"2026-08-24T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce948d56f3411ff7d32e720ca1cbd8fea9d29cc27820fe0cff7c20946e9cc383","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":1,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:06:22.768128Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.02585","last_updated":"2024-04-30T21:05:21Z","snapshot_observed_at":"2026-08-16T15:10:58.024224Z","submitted_at":"2023-08-03T18:03:44Z","title":"PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02585","snapshot_observed_at":"2026-08-03T06:06:22.768128Z","title":"Parl: A unified framework for policy alignment in reinforcement learning from human feedback.arXiv preprint arXiv:2308.02585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.768128Z"},"links":{"cited_paper":"/paper/2308.02585","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:488ed2eb709eaa0fe7be5e48da0f9b14d5199e75bca91cfcb43e56d654c88080","observation_id":"259c1238-4e92-4686-b67a-8bcbf4f5ffce","resolution":{"observed_at":"2026-08-03T06:06:22.768128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.02585/citation-record","integrity":"/paper/2308.02585/integrity","json":"/paper/2308.02585/citation-record.json","paper":"/paper/2308.02585"},"outbound":[],"paper":{"arxiv_id":"2308.02585","last_updated":"2024-04-30T21:05:21Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T15:10:58.024224Z","submitted_at":"2023-08-03T18:03:44Z","title":"PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 1 inbound Pith citation observation for arXiv:2308.02585."}