{"as_of":"2026-08-07T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8f34266052f0eff1e471c04daf3c388a6ee2fbc3ec6fd66050c324a0c4e1a63","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:24.865596Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:32:27.300616Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-07-06T12:36:08.031641Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-08-07T14:56:24.865596Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17359","last_updated":"2025-05-23T00:30:53Z","snapshot_observed_at":"2026-08-07T14:46:15.053018Z","submitted_at":"2025-05-23T00:30:53Z","title":"Towards VM Rescheduling Optimization Through Deep Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:24.865596Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2505.17359"},"observation_digest":"sha256:f9b5ffed3a015b6f0ab720912c4ed97c96d1fffc1de51231a479b592b4c1720e","observation_id":"331db90b-2b4a-4eca-a020-5fd6092ffc97","resolution":{"observed_at":"2026-08-07T14:56:24.865596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-07-06T12:36:08.031641Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-08-06T16:40:04.178553Z","title":"Reinforcement learning with sparse rewards using guidance from offline demonstra- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12911","last_updated":"2025-08-20T06:32:37Z","snapshot_observed_at":"2026-08-07T05:29:00.542532Z","submitted_at":"2025-07-17T08:58:24Z","title":"LaViPlan : Language-Guided Visual Path Planning with RLVR","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:04.178553Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2507.12911"},"observation_digest":"sha256:68eadeea0fd1ed9c4693fd1b0c3772e2e5f7905ad54ee0444da287217d9cae2e","observation_id":"005feb40-46b3-4527-97ce-533f5247ca9b","resolution":{"observed_at":"2026-08-06T16:40:04.178553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-07-06T12:36:08.031641Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":"2202.04628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with sparse re- wards using guidance from offline demonstration.arXiv preprint arXiv:2202.04628","venue":null,"work_id":"6de06e46-2af6-4ceb-be68-86eefe15546a","year":null},"citing_paper":{"arxiv_id":"2602.07906","last_updated":"2026-05-07T09:44:38Z","snapshot_observed_at":"2026-07-06T22:45:00.816348Z","submitted_at":"2026-02-08T10:55:03Z","title":"AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T06:32:22.038300Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2602.07906"},"observation_digest":"sha256:4befe00eae6c17d956aa5e704e647f3a11a3f1c4b65f4f6ae3bc39114c30a2e9","observation_id":"4387cb75-0f5b-465d-b19b-f235d378633f","resolution":{"observed_at":"2026-05-16T06:32:27.303173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-07-06T12:36:08.031641Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-08-01T07:56:33.684912Z","title":"Reinforcement learning with sparse rewards using guidance from offline demonstration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21302","last_updated":"2026-07-27T12:47:41Z","snapshot_observed_at":"2026-08-05T01:34:45.123663Z","submitted_at":"2026-07-23T13:26:57Z","title":"Expert Behavior Prior Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:56:33.684912Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2607.21302"},"observation_digest":"sha256:1e1c317cf34a49033f8e8c8f2ccec9c83680d5074af5ff8be6add0ef0211d9c1","observation_id":"dba72cb6-62df-4dd0-96f0-98af582b032c","resolution":{"observed_at":"2026-08-01T07:56:33.684912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2202.04628/citation-record","integrity":"/paper/2202.04628/integrity","json":"/paper/2202.04628/citation-record.json","paper":"/paper/2202.04628"},"outbound":[],"paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T12:36:08.031641Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2202.04628."}