{"as_of":"2026-08-07T04:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb37da933570ed43a51604fa9f0b0c23e165089c166df803a4cdcaa2110996bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:54.730532Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-06T21:21:54.730532Z","title":"A survey of exploration methods in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00518","last_updated":"2025-07-01T07:32:54Z","snapshot_observed_at":"2026-08-06T21:10:45.993395Z","submitted_at":"2025-07-01T07:32:54Z","title":"Exploring Large Action Sets with Hyperspherical Embeddings using von Mises-Fisher Sampling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:54.730532Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2507.00518"},"observation_digest":"sha256:3a9c70918c6ad770d6709a3f78d111c353d9a6078c9896059e3e17e3763d4b6c","observation_id":"7e36c451-4f03-4bec-af1c-54f73c8859ec","resolution":{"observed_at":"2026-08-06T21:21:54.730532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-06T18:14:16.231424Z","title":"A survey of exploration methods in reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09117","last_updated":"2025-07-12T02:22:55Z","snapshot_observed_at":"2026-08-06T18:01:28.283842Z","submitted_at":"2025-07-12T02:22:55Z","title":"Towards Human-level Dexterity via Robot Learning","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:16.231424Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2507.09117"},"observation_digest":"sha256:890ed51a94eede9f7a7e6d335a2592a6539194eee9952bffead8b82125fbb07a","observation_id":"3cd80d02-d104-44df-a2c3-ee39a4cb426c","resolution":{"observed_at":"2026-08-06T18:14:16.231424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T20:21:04.419668Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.419668Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8a38a74f6b4f4d105ebea8a37de811ac3d600bb5a20883783e20374dc39bdeee","observation_id":"62f72c5a-6235-4654-bc26-fe632c7dce51","resolution":{"observed_at":"2026-08-05T20:21:04.419668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-04T18:53:02.597599Z","title":"A survey of exploration methods in reinforcement learning.arXiv preprint arXiv:2109.00157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-05T18:07:02.542367Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.597599Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f9f7628396265e7afd4b646501ca08ba57f3780e0255e571b1c6d891f01c7cd2","observation_id":"7c8d4574-d36e-4a66-9513-d4dc796d50d7","resolution":{"observed_at":"2026-08-04T18:53:02.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2601.22235","last_updated":"2026-04-13T14:52:09Z","snapshot_observed_at":"2026-08-02T23:54:22.534610Z","submitted_at":"2026-01-29T19:06:33Z","title":"Smart Walkers in Discrete Space","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T09:19:47.050591Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2601.22235"},"observation_digest":"sha256:49f716bf7ac89ee244c5a95b17e332afbe3c2e0793d8ee297b8a1e45e87e890a","observation_id":"877220da-97a2-4565-9c7a-a2f10d61f3a2","resolution":{"observed_at":"2026-05-16T09:20:47.682510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.05820","last_updated":"2026-07-14T09:49:12Z","snapshot_observed_at":"2026-07-17T23:18:01.233145Z","submitted_at":"2026-04-07T12:53:42Z","title":"SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:10.718673Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.05820"},"observation_digest":"sha256:1a3510096cb19c5023ba9dc107c7da23d81df6d02943213b699d39319f0b5f8d","observation_id":"0ae1acbb-c158-48d9-bb24-f7539e748d95","resolution":{"observed_at":"2026-05-10T23:30:50.844784Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.12645","last_updated":"2026-06-03T11:53:00Z","snapshot_observed_at":"2026-08-05T18:51:59.981377Z","submitted_at":"2026-04-14T12:16:56Z","title":"Contextual Multi-Task Reinforcement Learning for Autonomous Reef Monitoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:13:16.406160Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.12645"},"observation_digest":"sha256:7727ff052e12db50056f1c8d798a51d045b045a14694e68f5c235ff5d1896ea3","observation_id":"3413dc2e-46f0-4972-9d79-0f866fc922a9","resolution":{"observed_at":"2026-05-10T15:15:31.460106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-07-12T21:15:13.179473Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.12645","last_updated":"2026-06-03T11:53:00Z","snapshot_observed_at":"2026-08-05T18:51:59.981377Z","submitted_at":"2026-04-14T12:16:56Z","title":"Contextual Multi-Task Reinforcement Learning for Autonomous Reef Monitoring","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T21:15:13.179473Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.12645"},"observation_digest":"sha256:d824208320d6eca80d69380d46be43d1c46a9653964fd1857feef539286f336e","observation_id":"2864721b-faa5-461b-a298-3e582951cbdf","resolution":{"observed_at":"2026-07-12T21:15:13.179473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2604.15614","last_updated":"2026-04-17T01:41:52Z","snapshot_observed_at":"2026-08-04T05:59:07.745295Z","submitted_at":"2026-04-17T01:41:52Z","title":"Flexible Empowerment at Reasoning with Extended Best-of-N Sampling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T09:39:29.875977Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2604.15614"},"observation_digest":"sha256:9d3a0b320caea0ddbf120030b907f1baa32f5466217fc6bb948c7469fd16caeb","observation_id":"6fbaf575-13ae-449d-af90-d33c5b0a82b7","resolution":{"observed_at":"2026-05-10T09:43:49.278744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2605.04207","last_updated":"2026-05-05T18:47:08Z","snapshot_observed_at":"2026-07-06T23:16:59.568304Z","submitted_at":"2026-05-05T18:47:08Z","title":"Optimal Semiparametric Dynamic Pricing with Feature Diversity","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T17:34:49.811590Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2605.04207"},"observation_digest":"sha256:4ef6a9b01129e8b5175e4d499aee210155bc68325bc6ec46f7dc59cc32931baa","observation_id":"c62a7275-2b45-4015-8da9-98638dbab921","resolution":{"observed_at":"2026-05-11T17:26:06.944659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2109.00157","doi":"10.48550/arxiv.2109.00157","metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Exploration Methods in Reinforcement Learning","venue":"arXiv (Cornell University)","work_id":"66dafe38-40cf-4975-916e-6a1489255123","year":2021},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:9c1cd1eeeec697b258c87cbddd130872c48d4bd36ad5f79996984799179aa963","observation_id":"768a09fc-41e6-4135-8ef3-2afd43b35674","resolution":{"observed_at":"2026-07-04T07:59:40.653383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-03T04:39:32.089880Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-06T05:11:44.921639Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.089880Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:ab7b3db2d8590f2fea2b490a402fb519fe1405c143365caee8b0f1ed7b0e40a2","observation_id":"5e0b398b-60e6-4157-aa44-89cf8ebba0e2","resolution":{"observed_at":"2026-08-03T04:39:32.089880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2109.00157/citation-record","integrity":"/paper/2109.00157/integrity","json":"/paper/2109.00157/citation-record.json","paper":"/paper/2109.00157"},"outbound":[],"paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2109.00157."}