{"as_of":"2026-08-08T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:353521fcf1986b7f95b1ff9ea71058c625b19a8d0557336d0fba4d8347234254","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:37:46.402936Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:43.858412Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T05:12:05.250025Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-02T06:26:17.199293Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:13d15c5b6b05ab0a87b32ef1275acaeb0ae3d246869244393b3dab30fbcb8009","observation_id":"f7f7acb0-042e-4fab-b930-ab01711ff06d","resolution":{"observed_at":"2026-05-19T05:12:05.252079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-08-04T11:01:27.929388Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:27.929388Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:f4d77f55298b72c13a31634ea821ab0e0d75f5f11726367853f1b235c0d7395f","observation_id":"912f030f-4650-4d47-b137-548db7d98738","resolution":{"observed_at":"2026-08-04T11:01:27.929388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:40.836234Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2603.13842"},"observation_digest":"sha256:a0ceffc8d40e29c773ddeefa6e225ef2a72341eae6639e0d9b2536f08eb80d65","observation_id":"73bb73d3-8468-4d6c-b222-9bd2e736b647","resolution":{"observed_at":"2026-05-15T11:59:59.505114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-07-13T00:08:52.364953Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:48:36.372298Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:c4e13298366cd96bb68675ce9f72babe7cf7857875a55a2bf43ec2680cc4544a","observation_id":"740ec016-c10b-4d8c-b869-42282c0b9244","resolution":{"observed_at":"2026-05-11T06:05:57.992073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-07-13T00:08:53.253285Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-07-13T00:08:52.364953Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T00:08:53.253285Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:716bb15df693ad3ed62287a29899ccf850bc807307ed73a2472e48260c7dacc9","observation_id":"510bd843-417c-4782-93d9-602cb0adf3fb","resolution":{"observed_at":"2026-07-13T00:08:53.253285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2604.19730","last_updated":"2026-04-21T17:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:52:17Z","title":"FASTER: Value-Guided Sampling for Fast RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:47:36.475845Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.19730"},"observation_digest":"sha256:ae295d281dfdd23db39869ea189c4f6ef7a083609ce80bfead290b810ce60978","observation_id":"2eee268b-bfe8-4404-b5b0-805b788a900a","resolution":{"observed_at":"2026-05-10T02:48:27.234174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-07-30T11:06:22.032376Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T23:09:39.358796Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:22.032376Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:89b7710e7836056f1338637aeabff03db2d2e09d6a473ea8e0c83631f61af322","observation_id":"6dc67857-44d7-4bbf-85f2-b9e352933bc6","resolution":{"observed_at":"2026-07-30T11:06:22.032376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-08-05T04:27:43.858412Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T23:09:39.358796Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.858412Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:196e9b31669af399c13c863da12cdbdbbd2f86f87832c3398595e9c6bf1b84a5","observation_id":"49b28c9e-8205-4ea0-b167-2c60e716a353","resolution":{"observed_at":"2026-08-05T04:27:43.858412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07505/citation-record","integrity":"/paper/2506.07505/integrity","json":"/paper/2506.07505/citation-record.json","paper":"/paper/2506.07505"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-07-06T14:48:56.286312Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-07T05:37:46.315134Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.315134Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:98514d551e241c53c2bbbc261adb826aed9aefbc7baadce3131adb6862a39438","observation_id":"54098eb7-f739-4b53-b9d7-90eaa0d274cc","resolution":{"observed_at":"2026-08-07T05:37:46.315134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.647556Z","title":"epochs per update","venue":null,"work_id":"417a4ff3-9c05-46d3-914b-a2559fd36725","year":2023},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.399321Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:3ee0f521d482cccdc37a342384d841853e663d08de4aaf7a8cb36b63c815cc75","observation_id":"c0c7ca42-7fe9-4e31-b0ba-49f239dff920","resolution":{"observed_at":"2026-08-07T05:37:46.651015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.636320Z","title":"worse\", which are successful demonstrations collected by inexperienced operators to incorporate additional diversity. Note that even though it is labeled","venue":null,"work_id":"0ae13500-2613-487f-a458-121c0d601167","year":2000},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.402936Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:5b5cf816b5858c3f2cdccc5849d3c73ea74b3f004afdcafd835b6f65a8ddac2a","observation_id":"fe3a2452-6743-4417-a163-f222b9a72661","resolution":{"observed_at":"2026-08-07T05:37:46.640381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-07-06T16:42:53.513439Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-07T05:37:46.332349Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.332349Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:d2385401fcf0ebecafc02a62cd841e81dda5c8d06e37a997d16ea7810bfc27fb","observation_id":"532c19c2-6b0f-4037-997e-8780c6c955fc","resolution":{"observed_at":"2026-08-07T05:37:46.332349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T05:37:46.336559Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.336559Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:d2312332a62231f002caac1db6329d7fe2741d7446ed2ef2083c498d32c5357e","observation_id":"06c7343a-0aec-4818-8248-c1f59cbebcfd","resolution":{"observed_at":"2026-08-07T05:37:46.336559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08558","last_updated":"2023-10-12T17:50:09Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:50:09Z","title":"Offline Retraining for Online RL: Decoupled Policy Learning to Mitigate Exploration Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08558","snapshot_observed_at":"2026-08-07T05:37:46.344696Z","title":"Offline retraining for online rl: Decoupled policy learning to mitigate exploration bias","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.344696Z"},"links":{"cited_paper":"/paper/2310.08558","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:21d2e7a3c112ed150a5bfbe68aed9383fccd04aa705764f9985cfd5544c8a2e4","observation_id":"b2329927-ac49-4b9c-b574-274bd0fd61ed","resolution":{"observed_at":"2026-08-07T05:37:46.344696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.669243Z","title":"Over- coming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"8e13171d-ccec-4ccf-b1e4-93dbcf4e1bff","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.349077Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:d1b339b40b5f54e2df591c71365c2ca86c72a7c6c01aa209b454c9e6a1bca770","observation_id":"a13b6330-ea3a-4e6e-8793-87762ccd29da","resolution":{"observed_at":"2026-08-07T05:37:46.673242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10546","last_updated":"2018-06-18T10:29:41Z","snapshot_observed_at":"2026-07-06T06:25:54.451916Z","submitted_at":"2018-02-28T17:28:25Z","title":"Computational Theories of Curiosity-Driven Learning","version":2},"cited_work":{"arxiv_id":"1802.10546","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10546","snapshot_observed_at":"2026-08-07T05:37:46.537054Z","title":"Computational Theories of Curiosity-Driven Learning","venue":"cs.AI","work_id":"7b75f335-af32-47db-a5b8-5086209a3f81","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.356660Z"},"links":{"cited_paper":"/paper/1802.10546","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:cce9b2d25cb93384df171702cb9cb1043d7a509490f6d4a745e051635866c4a9","observation_id":"2d76a449-f55e-45b6-9a25-4fe50f74881b","resolution":{"observed_at":"2026-08-07T05:37:46.541101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T05:37:46.368469Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.368469Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:99defd13f78e8835fc194f26295573fb53280e42611d3a5a7406ee74f0c9a124","observation_id":"aeaa12dd-e2cd-41c4-8703-41c978fb7710","resolution":{"observed_at":"2026-08-07T05:37:46.368469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.658344Z","title":"Schmidhuber","venue":null,"work_id":"31a52349-f632-4f18-9c1c-224db8998fcc","year":1990},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.376056Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:0023f9d34d59e037287b9007052781884f50fa201cdfcdc0513084953f479b01","observation_id":"8a60e0dd-1666-43bd-8c84-0e5cc8d313af","resolution":{"observed_at":"2026-08-07T05:37:46.661903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-07-06T10:16:10.292063Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-08-07T05:37:46.379573Z","title":"Parrot: Data-driven behavioral priors for reinforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.379573Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:1c3fabb536885c80d63c6d6a2199fa295bc02bd4673dc48e5f846ce94e8148ab","observation_id":"13036d68-8079-4468-a573-ac508a627241","resolution":{"observed_at":"2026-08-07T05:37:46.379573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T05:37:46.383535Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.383535Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:998649d9defe1145ed866aa1cdaad690f9d66b69da559a3cb18b784bb3468eab","observation_id":"0b408ba0-19b1-410c-bd43-e0e121d4bbbf","resolution":{"observed_at":"2026-08-07T05:37:46.383535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-07T05:37:46.387296Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards.arXiv preprint arXiv:1707.08817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.387296Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:43ce6b73abf327df25c032f4bfebe70fa40aff89e06dcd250d583b1deca1e435","observation_id":"4474229d-0083-4b59-87ee-9d01368b8b76","resolution":{"observed_at":"2026-08-07T05:37:46.387296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12621","last_updated":"2019-05-27T09:25:16Z","snapshot_observed_at":"2026-07-06T07:56:30.864880Z","submitted_at":"2019-05-27T09:25:16Z","title":"Learning latent state representation for speeding up exploration","version":1},"cited_work":{"arxiv_id":"1905.12621","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.12621","snapshot_observed_at":"2026-08-07T05:37:46.444474Z","title":"Learning latent state representation for speeding up exploration","venue":"cs.LG","work_id":"4ca53657-76f4-4690-ad30-cc8e11cf4340","year":2019},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.391312Z"},"links":{"cited_paper":"/paper/1905.12621","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:36d066ee13ba5c894fd78985476b2ae905af32df7d04ac5223d9d32f1f82f43b","observation_id":"0066d2d0-370f-462f-b277-9688d2779557","resolution":{"observed_at":"2026-08-07T05:37:46.450428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-07T05:37:46.395221Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.395221Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:cfffd4b8e99eafc1434236c61d263b39ed9992d1321b7863111fe368d24a94d0","observation_id":"5da8b341-7bea-4905-9769-d2ff68f8c0dd","resolution":{"observed_at":"2026-08-07T05:37:46.395221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T05:37:46.319807Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.319807Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:1c9eaccec30ed5e3468a54cdaf7f57b5703c320f0a5fb49b47c83a0f986e9797","observation_id":"14ab7d25-fb58-442a-b0b2-d46ed3aa6d56","resolution":{"observed_at":"2026-08-07T05:37:46.319807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10567","last_updated":"2018-02-28T18:15:49Z","snapshot_observed_at":"2026-08-07T13:41:55.598365Z","submitted_at":"2018-02-28T18:15:49Z","title":"Learning by Playing - Solving Sparse Reward Tasks from Scratch","version":1},"cited_work":{"arxiv_id":"1802.10567","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10567","snapshot_observed_at":"2026-08-07T05:37:46.491963Z","title":"Learning by Playing - Solving Sparse Reward Tasks from Scratch","venue":"cs.LG","work_id":"c742fa3c-4289-4e74-b043-c16b28b31447","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.372311Z"},"links":{"cited_paper":"/paper/1802.10567","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:07f9a070f338f31863551edc5312522d3834823e595276c42b7a85b7b747c4ac","observation_id":"fd8c01a0-028f-4001-ae53-4883703f0cc9","resolution":{"observed_at":"2026-08-07T05:37:46.496733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T05:37:46.352606Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.352606Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:41285d2dc7d492fad47e91b187615809abaaa63f6e61a890d7399dac75656c82","observation_id":"4197caaf-9d9d-41ea-b2dc-43b242038ebc","resolution":{"observed_at":"2026-08-07T05:37:46.352606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04161","last_updated":"2019-06-10T17:58:32Z","snapshot_observed_at":"2026-07-06T07:59:19.943467Z","submitted_at":"2019-06-10T17:58:32Z","title":"Self-Supervised Exploration via Disagreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04161","snapshot_observed_at":"2026-08-07T05:37:46.364579Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.364579Z"},"links":{"cited_paper":"/paper/1906.04161","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:40340df2b066c2230ee9d9743260f50a3e28a992385d52bbab7ccfedb0d5c5f0","observation_id":"084fe3ea-9951-45c1-9f97-44b59aa7afea","resolution":{"observed_at":"2026-08-07T05:37:46.364579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-07T05:37:46.323819Z","title":"Go-explore: a new approach for hard-exploration problems","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.323819Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:7ab6bbf893832bef79d4f8db1ea53309f7aba0998145c2243475d507f265a9d2","observation_id":"18e26509-53b6-4ac0-a579-ec7add5f2be0","resolution":{"observed_at":"2026-08-07T05:37:46.323819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-07-06T07:59:54.501936Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-07T05:37:46.340669Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.340669Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:6ce8ed3bd4101dbfc0e68e36cadc3a0771ad04f26991d432bd22d89399935e9f","observation_id":"59835236-da50-444b-87cb-09f63dc28f21","resolution":{"observed_at":"2026-08-07T05:37:46.340669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-07-06T08:18:49.576574Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01387","snapshot_observed_at":"2026-08-07T05:37:46.360602Z","title":"Making efficient use of demonstrations to solve hard exploration problems","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.360602Z"},"links":{"cited_paper":"/paper/1909.01387","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:4f26d67518cd87632ab7277f66595f45aab3471794121c0b5a6bd531f289fb7e","observation_id":"88953db2-4e1a-4aa0-8f4b-bd80c719fd01","resolution":{"observed_at":"2026-08-07T05:37:46.360602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05698","last_updated":"2022-12-12T04:28:50Z","snapshot_observed_at":"2026-07-06T14:29:20.607029Z","submitted_at":"2022-12-12T04:28:50Z","title":"MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05698","snapshot_observed_at":"2026-08-07T05:37:46.328115Z","title":"Modem: Accelerating visual model-based reinforcement learning with demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.328115Z"},"links":{"cited_paper":"/paper/2212.05698","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:6fba81e2e8296df506ce3db3875e10ccdb708650aeff2851b77813dbc57636df","observation_id":"88e13b0c-c32f-4da1-9331-d149b31a9721","resolution":{"observed_at":"2026-08-07T05:37:46.328115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 8 inbound Pith citation observations for arXiv:2506.07505."}