{"as_of":"2026-08-09T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b77135641f1730ad599b3a343af8724cd039b44fcd9b137ab427218b417a5e18","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:32:44.291764Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T05:56:01.759090Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":"2012.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- derstanding learned reward functions","venue":null,"work_id":"cf6a0c6a-7f00-4baf-84d8-1cd166d5ccc5","year":2012},"citing_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-18T00:46:56.664582Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2304.06767"},"observation_digest":"sha256:4b0045f6dbed4772f7115fceec0ebe38a72ef6d857c37b3b46e06d7a060ed0c3","observation_id":"e96acce3-4665-415c-9753-e3a6fbe10e02","resolution":{"observed_at":"2026-05-18T00:46:56.829477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":"2012.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- derstanding learned reward functions","venue":null,"work_id":"cf6a0c6a-7f00-4baf-84d8-1cd166d5ccc5","year":2012},"citing_paper":{"arxiv_id":"2310.15288","last_updated":"2026-05-07T22:20:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-23T18:54:43Z","title":"Active teacher selection for reward learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T05:54:43.873174Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2310.15288"},"observation_digest":"sha256:90db3771bd22def371e9a49a283bc032959e016f019121ff112b47c7f35e5595","observation_id":"8cb72ddc-32ef-4ce5-8ef5-6d952a873e5c","resolution":{"observed_at":"2026-05-24T05:56:01.762123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-08-08T13:32:44.291764Z","title":"Understanding learned reward functions,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07211","last_updated":"2025-02-11T03:09:45Z","snapshot_observed_at":"2026-08-08T13:25:06.682684Z","submitted_at":"2025-02-11T03:09:45Z","title":"Improve the Training Efficiency of DRL for Wireless Communication Resource Allocation: The Role of Generative Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:32:44.291764Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2502.07211"},"observation_digest":"sha256:753a7f0ca3f4d150f4e81fc77c1c12d9b68de9c72d9a15283382b9a26bfb1e02","observation_id":"80e47365-ef4f-4799-a910-e53086418e9a","resolution":{"observed_at":"2026-08-08T13:32:44.291764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":"2012.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- derstanding learned reward functions","venue":null,"work_id":"cf6a0c6a-7f00-4baf-84d8-1cd166d5ccc5","year":2012},"citing_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-07-06T22:23:00.681940Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-21T22:38:57.833414Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2509.03403"},"observation_digest":"sha256:511694c5054336eee34be42301b4d41cef5aad273a5ce360d501768ab442db55","observation_id":"c6a1849f-7f15-4fbf-93f7-6ee490ec18ea","resolution":{"observed_at":"2026-05-21T22:40:43.277433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2012.05862 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f41562f2485e26a3cbcf8d5406de5a532d73cbb3cbf08a66305479822731c23b","observation_id":"4b3466da-ceb1-46c1-be74-f78d98521990","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05862","snapshot_observed_at":"2026-08-02T08:40:52.536159Z","title":"arXiv preprint arXiv:2012.05862 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:52.536159Z"},"links":{"cited_paper":"/paper/2012.05862","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:813c5ecb6b2675dc335dd588ccd4f4c2ac776afa027b7ad58226db61d06c3930","observation_id":"befe4177-5313-4b75-bd0f-69694ed8f6a9","resolution":{"observed_at":"2026-08-02T08:40:52.536159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.05862/citation-record","integrity":"/paper/2012.05862/integrity","json":"/paper/2012.05862/citation-record.json","paper":"/paper/2012.05862"},"outbound":[],"paper":{"arxiv_id":"2012.05862","last_updated":"2020-12-10T18:19:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:28:38.257081Z","submitted_at":"2020-12-10T18:19:48Z","title":"Understanding Learned Reward Functions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2012.05862."}