{"as_of":"2026-08-11T08:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f2b2fccae71fea8538a79b9569793e3d427464e72c7215d5868b49e7fbe4f2f","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:04:31.896668Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:15:08.304150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.723680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"cited_work":{"arxiv_id":"2501.12627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12627","snapshot_observed_at":"2026-07-04T08:09:40.723680Z","title":null,"venue":null,"work_id":"8d057077-836f-4a44-8bfb-959881c9058a","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2501.12627","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:beff26c11f15179ca17d2c2140acddd608c7d8610f09685ae3ef4bbb69c09ad7","observation_id":"ea666f1f-983f-42cd-9966-94b2d78a1c1d","resolution":{"observed_at":"2026-07-04T08:09:40.724925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12627/citation-record","integrity":"/paper/2501.12627/integrity","json":"/paper/2501.12627/citation-record.json","paper":"/paper/2501.12627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.666812Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"93958470-6bcd-4837-a1a1-fe3d5e067712","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.664680Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:66af52788a13db5b122470639ac0d65c60a19f6a2d48b8a82f73929128bf4def","observation_id":"bd12ae0c-9e7c-47c1-ba72-949a942c50d9","resolution":{"observed_at":"2026-08-10T17:04:32.671849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.650017Z","title":"Atari-5: Distilling the arcade learning environment down to five games","venue":null,"work_id":"b64f9600-e9af-4dcc-9878-4d46147d57d5","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.670067Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:450fb4c556a023aafda8c1d456b70ff149958f055c3928e561d0b49ec7653333","observation_id":"777d5ba1-acf0-467c-9d2e-420e08bb6f61","resolution":{"observed_at":"2026-08-10T17:04:32.655050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.634720Z","title":"Existence, relatedness, and growth: Human needs in organizational settings","venue":null,"work_id":"dbd5445d-295f-4ec6-89d7-490e179a3814","year":1972},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.674886Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:91b9f5f9194a7c4eb6f11519b5f5cc035506f78e77b984b5a13258102ed7c05a","observation_id":"b025b990-4e9d-4136-91ad-7e30cf51b870","resolution":{"observed_at":"2026-08-10T17:04:32.639893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.619002Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":"e3fa6223-e5be-4ae9-8607-91cdd7171444","year":2002},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.679787Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:8f617b01bccfa1bbf2b59dc2c7605ca8a6bc03f6424c8b0244b70cf894a7b2be","observation_id":"fab2e43a-96cf-48ae-900d-3b37447c7a19","resolution":{"observed_at":"2026-08-10T17:04:32.624106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.603658Z","title":"Never give up: Learning directed exploration strategies","venue":null,"work_id":"7a4efe84-4771-44d4-9c9a-80bd976d190f","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.684579Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:d16ec687f84a73550b108713245c4984872376e8b0d47b35a7a9fc039c1bc85a","observation_id":"42f52b22-413a-4239-ac7e-ae3ce297336c","resolution":{"observed_at":"2026-08-10T17:04:32.608864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.588462Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":"b06b3c50-3d94-41a1-b823-1d0b74e5bfee","year":2013},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.689560Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:02b52fe0605d7746c5324b7cfc3b5b6765f0de6a245d75fcf5d4d423ae40a29b","observation_id":"dc46cc3b-895d-4b3d-8121-fd8c24dbfd99","resolution":{"observed_at":"2026-08-10T17:04:32.593250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.573419Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"e8f679ad-290f-4c3e-9146-b5947cca4757","year":2016},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.694801Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:dfce7dc47b37586d5163fb90f08872bc3140215465d3ffb67c409f35a75a3a3a","observation_id":"1553f4ef-748c-4999-a2d7-b454bfa9b33e","resolution":{"observed_at":"2026-08-10T17:04:32.578496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.557565Z","title":"A markovian decision process","venue":null,"work_id":"3d6c9877-4ad1-4e04-a1c7-f2a4a319703c","year":1957},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.699397Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:7f8c68bd2e9eb1e80bef6c8a4288756f54e5a1bed270c223ad83b395f4fa8f44","observation_id":"29042ab4-e56a-47ea-a5dc-495eafe0d9fc","resolution":{"observed_at":"2026-08-10T17:04:32.562582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.541629Z","title":"Exploration by random network distillation","venue":null,"work_id":"6f34784e-9f41-41af-882b-6e136f5ceac0","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.705179Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:358fde5a3deb6b1be201f1d4b048128823d6aa0389a92d3f7c0cf4f5d90a34a2","observation_id":"9d1afa23-e649-41e7-83cf-a20d2800927d","resolution":{"observed_at":"2026-08-10T17:04:32.546712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.526131Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"454182ae-6c87-42f5-8d0f-6b1fb7c6cf30","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.710552Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:42b8abfa3735d634e99643222643bebf2de720435bcea29e63e1741228559f42","observation_id":"80fddff9-f795-4460-b351-96a5501b9a18","resolution":{"observed_at":"2026-08-10T17:04:32.531059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.508248Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":"95d193f0-258d-4de8-9011-83374dbf5ebc","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.715540Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:49cb879e080d014392ba298aa586d1d9c940cd6df2ee91e3226a16cbb9b96292","observation_id":"10b4dfd5-e1dd-453f-95c2-e8e02292dbfc","resolution":{"observed_at":"2026-08-10T17:04:32.514663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.491437Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"45762b78-f0d0-4b3f-8ee4-8da65cdbaf31","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.720712Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:326401cc0a7b0c2e5363f7848cb40e26d2df8a999e061a1131c478c4acda14dc","observation_id":"85ba021e-a615-4c9e-9059-04ffd982424a","resolution":{"observed_at":"2026-08-10T17:04:32.497491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.474747Z","title":"Stochastic linear optimization under bandit feedback","venue":null,"work_id":"9a925aa2-8f14-4dd8-9dae-3a351066546e","year":2008},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.725530Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:84367d31fec6c693f944e5b57ee430bd3e7ea42e7dce438dac6cb3891cb37a41","observation_id":"b48be9ad-2e89-446a-857f-a7f686b64864","resolution":{"observed_at":"2026-08-10T17:04:32.479715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.459445Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"4a097f27-783d-4f6b-96b5-963cadbfb52a","year":2018},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.730698Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f3eb16102d99c1cd15cfe75d627bd665d9424216cf00ff859b5a024a5b5fc41d","observation_id":"0dabe982-1812-4302-9b1a-383c4fc6b0af","resolution":{"observed_at":"2026-08-10T17:04:32.464273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.443182Z","title":"Adversarially guided actor-critic","venue":null,"work_id":"2a5971fe-aa57-4834-96f4-c2ba0499d80b","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.735368Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:8bd6e411082b7bd5fdee113d2859902131051db2daf31ef793806cb4103d6763","observation_id":"d996408c-e6e1-41f5-9480-c491fba766b4","resolution":{"observed_at":"2026-08-10T17:04:32.448723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-10T17:04:31.740034Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.740034Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:94efcb574b690df94bc1944ac0520b82618d3f696207620ee71c8c8e2395c61a","observation_id":"c02a526d-a851-4081-a54a-850e1efcf554","resolution":{"observed_at":"2026-08-10T17:04:31.740034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.426131Z","title":"Fast task inference with variational intrinsic successor features","venue":null,"work_id":"24b09000-c662-4bf3-a033-d9a0449ba71b","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.745680Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3bae35586d4331e0d8263cec0b3a5596fad85ef71fba5dfdac8e1e613f150244","observation_id":"02f8d2c1-69c4-40ef-b290-4a966b455c1f","resolution":{"observed_at":"2026-08-10T17:04:32.432093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.408553Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"bdff6243-74f8-4786-af0b-1b0cc9a1999f","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.750439Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:1de58d1c432f6d0131bee7cecd4377870aac984330090a42eeea6bd604708fdb","observation_id":"40c39387-4a1a-4ff8-a700-7ce1765cfaae","resolution":{"observed_at":"2026-08-10T17:04:32.414030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.391561Z","title":"Exploration via elliptical episodic bonuses","venue":null,"work_id":"1ee21914-2dfa-488a-82a3-8b2dbfcff714","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.755324Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:3849b8056cb020b73e3673cc84241bac9835a36825ca974274780bb25794e7dc","observation_id":"6c77159e-7fab-45ef-a465-6146559a7f82","resolution":{"observed_at":"2026-08-10T17:04:32.396886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03236","last_updated":"2023-06-05T20:45:30Z","snapshot_observed_at":"2026-07-06T15:38:54.127539Z","submitted_at":"2023-06-05T20:45:30Z","title":"A Study of Global and Episodic Bonuses for Exploration in Contextual MDPs","version":1},"cited_work":{"arxiv_id":"2306.03236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03236","snapshot_observed_at":"2026-08-10T17:04:32.003686Z","title":"A Study of Global and Episodic Bonuses for Exploration in Contextual MDPs","venue":"cs.AI","work_id":"de895682-d243-4c93-b2e6-072034ff0879","year":2023},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.760641Z"},"links":{"cited_paper":"/paper/2306.03236","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:b9e1a5f1a523e87abbe2bd62f035c14c6d30ca66c4f3dbc0205eda9aa8a7330b","observation_id":"ecdcb10c-28dd-4b67-8e33-85840a9f89e1","resolution":{"observed_at":"2026-08-10T17:04:32.011275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.375483Z","title":"Planning and acting in partially observable stochastic domains","venue":null,"work_id":"584ea4e9-f3ba-4368-9d93-cdb50483d698","year":1998},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.765980Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:de02a741d975fd64a662496fefd29febf44f47154e05c74b3e08ebb31006915a","observation_id":"726615b0-541b-47b7-85c3-e284cc80958b","resolution":{"observed_at":"2026-08-10T17:04:32.380601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.359974Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"7f71fe10-64ee-4c70-87d4-13f491163431","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.770736Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:55c62cc18e44ff407ca6dfc7af4bf27a06c464767b6e8d997234a3041a0b8593","observation_id":"bb2441da-0e0b-4c45-b9b7-92c3c81f1039","resolution":{"observed_at":"2026-08-10T17:04:32.365128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.343798Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":"d3ff571d-705e-4864-b746-1bc07259db36","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.775401Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:08a503c453cc097763a4be7708250ab22b673c8ebd5adbce5c4e551adcf6f65e","observation_id":"2b80cb0b-265f-46b1-a407-77add88a25d5","resolution":{"observed_at":"2026-08-10T17:04:32.349486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.327874Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"3a3b9cff-d37c-406a-952c-ab8059da8e2a","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.780024Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:8cd4717cad52a352abc07acb4185dec87efb0495d267e58e15cd5068744fa5ea","observation_id":"0b57d581-455a-4b5d-9b79-286e760ea403","resolution":{"observed_at":"2026-08-10T17:04:32.333107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.785023Z","title":"A contextual-bandit approach to personalized news article recommendation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.785023Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:76844bb24a9312ae479c0a2b53f8a94dcf7abd41ae688d445a65dfe7b391bb60","observation_id":"fbfafc83-6a9c-4275-aec1-51134eeed3cd","resolution":{"observed_at":"2026-08-10T17:04:31.785023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.301109Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"f2fb2f97-dbf4-48d1-9149-45b0a7b994f4","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.789842Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:1af808c51d2d92462e15d1e6652adfbf5424bae1035d3b7174a1251d3ca4c962","observation_id":"586a0342-e2ce-4c97-a19a-f321767e38ac","resolution":{"observed_at":"2026-08-10T17:04:32.305952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.285427Z","title":"Count-based exploration with the successor representation","venue":null,"work_id":"98d7127f-5422-457a-bd0a-a38093ef5591","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.794533Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:a977850e314273a499a7679ff3f07c9babe1f106206d11597b0e6ecee88254bc","observation_id":"f9c13c34-23d2-40fa-9e4e-a9a9e1d6d75e","resolution":{"observed_at":"2026-08-10T17:04:32.290227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.269858Z","title":"A dynamic theory of human motivation","venue":null,"work_id":"732cacc0-8c66-4f1f-b934-88163cf14a23","year":1958},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.801075Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:457fb6c85c5a15ddd569252ae1cd95ff37b3838a021a026892fa52bb946ed544","observation_id":"167bf6db-1c33-49a3-a2db-506bafe739d2","resolution":{"observed_at":"2026-08-10T17:04:32.274824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.253324Z","title":"Improving intrinsic exploration with language abstractions","venue":null,"work_id":"ef89b63c-ad09-426b-b743-9698ccfade29","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.806136Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:5164b03a2c49fd5711ad3fba7f1f2afdd8b5bc564022fb6b324a3daef9d2a214","observation_id":"3e37be31-db05-4499-93aa-fec1ee4c345b","resolution":{"observed_at":"2026-08-10T17:04:32.258772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.237503Z","title":"Count-based exploration with neural density models","venue":null,"work_id":"7b23bf1a-1cc2-43ce-8873-17d6c77baf8b","year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.811005Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:f7197451d0af8edf170d7aa2cc163710bf301b1f0ecdb341ff7c94da649980b8","observation_id":"f0e6ea44-e187-4119-b82d-106f8e2f4acb","resolution":{"observed_at":"2026-08-10T17:04:32.242416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00914","last_updated":"2022-02-08T07:34:26Z","snapshot_observed_at":"2026-08-09T14:57:38.077331Z","submitted_at":"2022-02-02T08:29:04Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00914","snapshot_observed_at":"2026-08-10T17:04:31.816155Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.816155Z"},"links":{"cited_paper":"/paper/2202.00914","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:64f710733bdd1e05f5ae307e4bd133c9687af7114676a7d46c6d9a7dc7fe60d0","observation_id":"486ab38a-5025-4edb-b7e2-680f42fbb893","resolution":{"observed_at":"2026-08-10T17:04:31.816155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.820821Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.820821Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:230cdfc80c2ec4812becd77b7eb0dfd193185d45c314aca1d63d49d73aaae018","observation_id":"d051dbc2-2728-4121-bad0-cf8043d7f72c","resolution":{"observed_at":"2026-08-10T17:04:31.820821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.211119Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":"a31839ab-b0b6-4a26-a082-6d14f89a597c","year":2019},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.825285Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:893ba4d78045001f8cd5465f31e4954806681b97a4e39d0baa56e0545c70cc2c","observation_id":"dae2e2b5-728e-483f-a7c1-cdf48f88d5ec","resolution":{"observed_at":"2026-08-10T17:04:32.216136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.194107Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":"02d5206f-f09a-48b1-87eb-e39935f9b6a0","year":2020},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.829753Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:2d619802d6f7b8fae5da356c6a66d2fef9ea3fed76fe9d34276d782fe890bf75","observation_id":"c253f65d-1884-4552-b4aa-34d7aeb1d127","resolution":{"observed_at":"2026-08-10T17:04:32.199778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.176829Z","title":"Minihack the planet: A sandbox for open-ended reinforcement learning research","venue":null,"work_id":"bafb0b20-a270-4e1a-8fab-f5aabdbcf02f","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.834609Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:0fcb4e3e03cdfa20d9780e823fb15f2be4bffd1d842514f3939559cb117bd26e","observation_id":"e7f619b6-92d2-4171-836b-d697f8a232cb","resolution":{"observed_at":"2026-08-10T17:04:32.182309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T17:04:31.839875Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.839875Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:54dfbac9b3559d2221953752b391b19554a0a180b3b05bf16a04bb65072fda8c","observation_id":"51ccc0d7-1fd0-4e2b-b73b-846d65d96fa9","resolution":{"observed_at":"2026-08-10T17:04:31.839875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.160896Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"017e5b8f-6a86-4ff8-8d29-1f16b5a895fa","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.845382Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:c6da6ec8943ca8c846cf0a4d4322bdedcdefa24ce4a12ad26fc0a152b34b8070","observation_id":"e019307f-01e9-42f1-9754-8ce787f3b7cb","resolution":{"observed_at":"2026-08-10T17:04:32.166131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-01T13:17:26.224723Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-10T17:04:31.850563Z","title":"Incentivizing exploration in reinforcement learning with deep predictive models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.850563Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:a55e09c8bc15f2a5b0306325ce8cec09b5ab0f0884837cb636a20b5a40a5b96e","observation_id":"3bd73490-d8c9-4f91-baf4-0b9fe55ed8fc","resolution":{"observed_at":"2026-08-10T17:04:31.850563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.855932Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.855932Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:6a8bc61f43482c5fd97804a9db50633aa2a1b2f272d1a0d05a51a5634923e8cb","observation_id":"d7c5f284-6475-4019-b3f9-cefc29542115","resolution":{"observed_at":"2026-08-10T17:04:31.855932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.860690Z","title":"\\# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.860690Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:a38e3a474efe303e8a816c220451683b6ab06f37fcd94321c8b6072b54af25c7","observation_id":"2cef02a3-edf5-43c6-9fc8-4a27ada1fc55","resolution":{"observed_at":"2026-08-10T17:04:31.860690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.122187Z","title":"Reinforcement learning with prototypical representations","venue":null,"work_id":"559d89cc-f060-4806-b680-9c7ed52f196d","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.865517Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:8f3779355b0dc283e79bfba097ff0edf938be91524e78f9939db814b3c1e14bb","observation_id":"b2bcbb78-6710-494f-8f9a-a84688d5851a","resolution":{"observed_at":"2026-08-10T17:04:32.127782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.100065Z","title":"Rewarding episodic visitation discrepancy for exploration in reinforcement learning","venue":null,"work_id":"4404058e-e483-4374-815f-b45ab49e77fc","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.870168Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:78de6fa6a0c45a6af4e383b35b905651ef0cfea3bde113bde96cf4c57fbe7502","observation_id":"ce6a0bb6-ad98-4bdf-8008-b911a70e1984","resolution":{"observed_at":"2026-08-10T17:04:32.105311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.083871Z","title":"R \\'e nyi state entropy maximization for exploration acceleration in reinforcement learning","venue":null,"work_id":"e4bfb54f-87d0-42f1-b370-d8d30a7f3091","year":2022},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.874687Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:500af915fc01b442c8d7757d14c73467913530a8e35ce6172a97216e7de2ef71","observation_id":"3f4e8c4b-f613-45e3-8860-13a13a60dd75","resolution":{"observed_at":"2026-08-10T17:04:32.089219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19548","last_updated":"2025-04-25T01:53:37Z","snapshot_observed_at":"2026-07-06T18:22:18.644161Z","submitted_at":"2024-05-29T22:23:20Z","title":"RLeXplore: Accelerating Research in Intrinsically-Motivated Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19548","snapshot_observed_at":"2026-08-10T17:04:31.880479Z","title":"Rlexplore: Accelerating research in intrinsically-motivated reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.880479Z"},"links":{"cited_paper":"/paper/2405.19548","citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:52803d536da366eec5dcc470831973dbcf5adeda0caeef0a23519cd32ca69f5e","observation_id":"f3e1a87a-8f8a-406a-abc1-4777764238e2","resolution":{"observed_at":"2026-08-10T17:04:31.880479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.067798Z","title":"Rllte: Long-term evolution project of reinforcement learning","venue":null,"work_id":"4ad00d90-151c-4ebd-be51-a635ba4b3138","year":2025},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.886926Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:767ea09c33aaa47f6dfcc44c8d7d24ad55cecd802e786e1a1bfe7bfbf8afc197","observation_id":"892dd3d4-1673-431a-b114-762c796b0303","resolution":{"observed_at":"2026-08-10T17:04:32.072848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:32.052146Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"78c5412f-f9d2-4342-b29b-be2232b4d53a","year":2021},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.891809Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:7036b3a8799e2add4fa44b12fe2fb3fab2557bd9846ffe5351af9745314a0532","observation_id":"c9f54259-2184-4fac-8134-bcbf9206621d","resolution":{"observed_at":"2026-08-10T17:04:32.057202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:31.896668Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T17:04:31.896668Z"},"links":{"citing_paper":"/paper/2501.12627"},"observation_digest":"sha256:dcf61e2f85b4d5d3096e7e936adf0820c9111321ccdd6acfdff0d661aaad4994","observation_id":"a0e2ef72-6f7e-4268-8b52-866ea9ee5639","resolution":{"observed_at":"2026-08-10T17:04:31.896668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12627","last_updated":"2025-01-22T04:22:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T16:56:32.522856Z","submitted_at":"2025-01-22T04:22:13Z","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2501.12627."}