{"as_of":"2026-08-09T13:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f64d01ae25410f21bd6a7f9dc9c54026133442e6c63666e9ae317fe39482c49","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:15:34.171120Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.10430/citation-record","integrity":"/paper/2602.10430/integrity","json":"/paper/2602.10430/citation-record.json","paper":"/paper/2602.10430"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-03T01:15:34.032799Z","title":"Offline reinforce- ment learning with implicit q-learning.arXiv preprint arXiv:2110.06169,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.032799Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:eb1a18294095d9a8fb823033dd587e36af516aebba1b8fab889e82c445595e30","observation_id":"6ad4a4d7-f1d9-4796-8719-14434d4850b0","resolution":{"observed_at":"2026-08-03T01:15:34.032799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:15:34.053776Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.053776Z"},"links":{"citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:e3bd3552be7d0eecef80f1628ccaba31f7e129e6674add669fda17cdc5af917d","observation_id":"83bc6591-6b4e-4530-b722-a8094896a2ec","resolution":{"observed_at":"2026-08-03T01:15:34.053776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:15:34.171120Z","title":"distance","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.171120Z"},"links":{"citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:a0dc96e91dc9dcc2a48eecd8cf64fab944161e922c19e350131c7d38b7d3f5ea","observation_id":"7b3c89b5-be99-4db9-8d38-498586d393a3","resolution":{"observed_at":"2026-08-03T01:15:34.171120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-03T01:15:34.114225Z","title":"B., Kumar, A., et al","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.114225Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:f92b3ced094fa5565d77702fac7799a7a32652cc91581a845ec2b111d4597516","observation_id":"6497b1d8-f591-47bf-aa17-ca92aa9af79a","resolution":{"observed_at":"2026-08-03T01:15:34.114225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T01:15:34.153829Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.153829Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:6aab607dfb6ffbd2b2300b5b5026edb1c7fc82e4cee3cbfb54b1a7491d06a6e2","observation_id":"b826cf13-c41b-45c7-a675-389fb0854b74","resolution":{"observed_at":"2026-08-03T01:15:34.153829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05659","last_updated":"2019-08-13T00:43:41Z","snapshot_observed_at":"2026-07-06T08:14:39.851659Z","submitted_at":"2019-08-13T00:43:41Z","title":"Distributionally Robust Optimization: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05659","snapshot_observed_at":"2026-08-03T01:15:34.132881Z","title":"and Mehrotra, S","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.132881Z"},"links":{"cited_paper":"/paper/1908.05659","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:1daf8624427f1e7b39e6ff986f4bb8abe1c70e34448ea6bb3ddd97eb1e5910f4","observation_id":"f6fa7d71-6ba3-4732-a4be-74379d801690","resolution":{"observed_at":"2026-08-03T01:15:34.132881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:15:34.015793Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2052},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.015793Z"},"links":{"citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:4fa76c698af8d1db761ec3615d29d002ebaaa8b514b31e75c757482372191b7b","observation_id":"9725de26-8f99-4fb8-b5a5-917649045b7a","resolution":{"observed_at":"2026-08-03T01:15:34.015793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.07679","last_updated":"2016-04-04T11:27:36Z","snapshot_observed_at":"2026-08-03T08:37:56.722087Z","submitted_at":"2015-12-24T01:31:40Z","title":"Deep Reinforcement Learning in Large Discrete Action Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.07679","snapshot_observed_at":"2026-08-03T01:15:34.005106Z","title":"Deep reinforcement learning in large discrete action spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.005106Z"},"links":{"cited_paper":"/paper/1512.07679","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:eeb3292c86b685cc0c93d8b33de4acd2727d62a94a946908c23843d0f1586366","observation_id":"5d9f9913-7643-4257-a1b3-559f15af8fc1","resolution":{"observed_at":"2026-08-03T01:15:34.005106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-03T01:15:34.097009Z","title":"Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.097009Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:45f091e01ac73dc01c9cfdfeeee1eb85976246b798451965be2ec675af18f57c","observation_id":"2edceb6d-9274-41de-b5e9-dcaf79eb5a4a","resolution":{"observed_at":"2026-08-03T01:15:34.097009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T01:15:34.075775Z","title":"Offline re- inforcement learning: Tutorial, review, and perspectives","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.075775Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:fe1ff45283c756e9df41d7b4039f46e3ed92f7f58ada344bc395613f3349b17d","observation_id":"65a9af51-c76e-4870-9f5f-d7ca59236381","resolution":{"observed_at":"2026-08-03T01:15:34.075775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T04:19:08.496134Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2602.10430."}