{"as_of":"2026-08-08T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b896c7561b5574bc6ee4d2cbfffdeb60af9e4355be5e3481a776ec69d510e75e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:47.489929Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19923/citation-record","integrity":"/paper/2505.19923/integrity","json":"/paper/2505.19923/citation-record.json","paper":"/paper/2505.19923"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1116.71139","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:47.715911Z","title":"The mean-wise best results among algorithms are highlighted in bold","venue":null,"work_id":"f0f4c5de-35ad-4a06-8124-72d87c1f766c","year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.489929Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:65748eeb8d3ebfb77d162fb4917f35c402027a9b381073945ec76a2979f8939f","observation_id":"893f724a-cc24-4fe6-b9fd-1cd62d354734","resolution":{"observed_at":"2026-08-07T14:14:47.818399Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10751","last_updated":"2022-05-11T03:17:44Z","snapshot_observed_at":"2026-08-02T17:34:08.290568Z","submitted_at":"2021-12-20T18:55:16Z","title":"RvS: What is Essential for Offline RL via Supervised Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10751","snapshot_observed_at":"2026-08-07T14:14:45.370476Z","title":"Rvs: What is essential for offline rl via supervised learn- ing?arXiv preprint arXiv:2112.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.370476Z"},"links":{"cited_paper":"/paper/2112.10751","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:fc08ad1aad56aa915359bb706f5c140ef5dd0d249b5215bd98145f61cb10b474","observation_id":"7dfa7fc1-3245-47dd-9d6d-545b04214591","resolution":{"observed_at":"2026-08-07T14:14:45.370476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T14:14:45.440249Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.440249Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:f53d6351debf15ba286048b0c7ef5792a644d915baaced0037db92109e65b119","observation_id":"58fe6bdf-e92c-4148-80d2-f214ac4ea121","resolution":{"observed_at":"2026-08-07T14:14:45.440249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-07T14:14:45.772661Z","title":"B., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.772661Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:eb0740da78d4d9ed2f8e83d1401261c27e209612839a1c60913ceeff18f3057c","observation_id":"cf2ca248-7508-4b23-8b16-305983013a7a","resolution":{"observed_at":"2026-08-07T14:14:45.772661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T14:14:45.838651Z","title":"Of- fline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.838651Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:4a00fd23cbee4747f57a0812727e3111a3d37b41e0055f4b230e9d590a117db7","observation_id":"771cf11e-2c94-4336-a504-57a71276bbda","resolution":{"observed_at":"2026-08-07T14:14:45.838651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05422","last_updated":"2023-10-09T05:37:58Z","snapshot_observed_at":"2026-07-06T16:29:36.087733Z","submitted_at":"2023-10-09T05:37:58Z","title":"Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2310.05422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05422","snapshot_observed_at":"2026-08-07T14:14:48.168307Z","title":"Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning","venue":"cs.LG","work_id":"113aac1d-d031-4406-b1f9-03f453f6476a","year":2023},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.930801Z"},"links":{"cited_paper":"/paper/2310.05422","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:5a35ca10c502d63666776726ec2cc30441789c672246bdf9cec812830659a944","observation_id":"56770b7a-9f6a-4c27-a856-48e770a0cb14","resolution":{"observed_at":"2026-08-07T14:14:48.307564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:50.201623Z","title":"S., Ghadirzadeh, A., Chen, X., and Finn, C","venue":null,"work_id":"219dd860-489a-4c90-ad08-a27d1a219c54","year":2022},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.017316Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:8a5ecde3616faf51d10d5ff6c10e7504bfee14dd99e1c3c4ba30309364ef24d6","observation_id":"9e633d48-ad30-4a98-b584-8c13f7e19791","resolution":{"observed_at":"2026-08-07T14:14:50.287789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T14:14:46.091351Z","title":"Awac: Accel- erating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.091351Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:7f7bd4d89e7c8b1d64698922fb3bcc1ee358fb630fd42aa7f084676a2506ef34","observation_id":"4b5041e9-8924-418a-a0bb-aa938abaf12b","resolution":{"observed_at":"2026-08-07T14:14:46.091351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11092","last_updated":"2023-01-30T11:30:19Z","snapshot_observed_at":"2026-07-06T14:20:54.903780Z","submitted_at":"2022-11-20T21:48:25Z","title":"Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11092","snapshot_observed_at":"2026-08-07T14:14:46.138209Z","title":"Q-ensemble for offline rl: Don’t scale the ensemble, scale the batch size.arXiv preprint arXiv:2211.11092,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.138209Z"},"links":{"cited_paper":"/paper/2211.11092","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:ed541e48ff7919584b2926ea8fbfb2f4706ea54d19915b9682d841251fcdf72e","observation_id":"4abe55e6-075f-41d3-b5de-45378bc73e6d","resolution":{"observed_at":"2026-08-07T14:14:46.138209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09055","last_updated":"2020-07-17T15:30:38Z","snapshot_observed_at":"2026-08-02T00:32:54.352911Z","submitted_at":"2020-07-17T15:30:38Z","title":"Hyperparameter Selection for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09055","snapshot_observed_at":"2026-08-07T14:14:46.200212Z","title":"L., Paduraru, C., Michi, A., Gulcehre, C., Zolna, K., Novikov, A., Wang, Z., and de Freitas, N","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.200212Z"},"links":{"cited_paper":"/paper/2007.09055","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:dc961b7f3a493c1d0efee31a2ccbe808e7015abc9304a814a1819b861c3c4674","observation_id":"4f965292-2506-4043-9daa-6e2b00cb5c13","resolution":{"observed_at":"2026-08-07T14:14:46.200212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T14:14:46.292149Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.292149Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:b162ea51063c1b25c6f82e44569c5c7cbac394004a807b4b6f435deee8d5fbc4","observation_id":"8dbaed76-6543-4524-a810-85d8bc47c469","resolution":{"observed_at":"2026-08-07T14:14:46.292149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T14:14:46.345569Z","title":"J., and Zhou, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.345569Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:8aa1237894e1a790c0399c9d537f8cd7b65dcc56c358e0d6e4767591b29e9ca6","observation_id":"7a33a587-91c8-495d-a991-4a2389b37c28","resolution":{"observed_at":"2026-08-07T14:14:46.345569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T14:14:46.427182Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.427182Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:10a0a82c464095c41518dd3f456c381af1e97f1389ee514c09316d41fc7d794c","observation_id":"5795690e-4847-4996-ba18-6a6adf07d008","resolution":{"observed_at":"2026-08-07T14:14:46.427182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-07T14:14:46.513693Z","title":"Policy expansion for bridging offline-to-online reinforcement learning.arXiv preprint arXiv:2302.00935,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.513693Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:9ff296615f63a7439887dcc55f9dba545141da119e495820a6530e101d897ba8","observation_id":"d018c99c-319e-49f4-b0e0-a31927ab0fdf","resolution":{"observed_at":"2026-08-07T14:14:46.513693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06871","last_updated":"2024-07-21T14:49:35Z","snapshot_observed_at":"2026-07-06T15:41:24.976531Z","submitted_at":"2023-06-12T05:10:10Z","title":"ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06871","snapshot_observed_at":"2026-08-07T14:14:46.601651Z","title":"Ensemble- based offline-to-online reinforcement learning: From pes- simistic learning to optimistic exploration.arXiv preprint arXiv:2306.06871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.601651Z"},"links":{"cited_paper":"/paper/2306.06871","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:6af2f7f43d049ebf704577d35a49b80e1cef9f33e8c5df0b5f28049be0334d1e","observation_id":"5cd06e8b-3fc1-415c-8cfe-fe4537e8cdc8","resolution":{"observed_at":"2026-08-07T14:14:46.601651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13846","last_updated":"2022-10-25T09:08:26Z","snapshot_observed_at":"2026-07-06T14:10:04.619778Z","submitted_at":"2022-10-25T09:08:26Z","title":"Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13846","snapshot_observed_at":"2026-08-07T14:14:46.698844Z","title":"Adaptive behavior cloning regularization for stable offline-to-online reinforcement learning.arXiv preprint arXiv:2210.13846,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.698844Z"},"links":{"cited_paper":"/paper/2210.13846","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:883338511b474d7439fc88a2688ad58cc67bda11b99da043d3bfd998d912b5ee","observation_id":"9772347e-cd21-4d34-833d-ee2ba45afc40","resolution":{"observed_at":"2026-08-07T14:14:46.698844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:49.814294Z","title":null,"venue":null,"work_id":"1f355931-433c-4747-a293-44f4bf53a791","year":2021},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.935078Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:ff4d6fabf86c47d3a8dff8498befe8709ae21c1356f9526c8e3d14ab0e6c04f0","observation_id":"e191725b-0487-48e2-a856-c8c480519051","resolution":{"observed_at":"2026-08-07T14:14:49.903609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:49.324412Z","title":"Recent works focus on explicit policy constraints for stochastic policies (Wu et al., 2022; Nair et al.,","venue":null,"work_id":"1faa9dd3-60d2-4f28-95d7-8db59b1b513e","year":2018},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.118568Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:6341a10754c854cb126ec8ba3cdce21c74701593975476ea7278ab3001a16532","observation_id":"9d17ed07-74aa-4a4a-80e6-e2d3388bac09","resolution":{"observed_at":"2026-08-07T14:14:49.457619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:49.117884Z","title":null,"venue":null,"work_id":"156ed107-5853-45ff-8864-d2700c41b552","year":2024},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.219318Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:ee384c8c3ec9d777f48a6a096d7af54596181bc38061825f5f833fb5e7745718","observation_id":"68cea97c-3af2-4c50-b1e8-c77a93ac0da6","resolution":{"observed_at":"2026-08-07T14:14:49.244395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:48.881376Z","title":"Moreover, the coefficients are updated by maximizing Q-values, lacking the interpretability offered by our method","venue":null,"work_id":"96711965-6023-4a9e-b40c-9ae4691681c8","year":2022},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.318561Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:0982e41b07d12b69671ace6b8f7a60ef90c8957e65a45e5b5de9b4ac4205e656","observation_id":"521b3951-9399-427c-96d8-c02efa20145c","resolution":{"observed_at":"2026-08-07T14:14:48.972316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:48.665548Z","title":null,"venue":null,"work_id":"b047d52e-b499-4a36-bb6c-19aeac957f0b","year":2022},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.389710Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:d07fa0fcfd6c6d4b7354e294ea3126dd985c527a9a36af561872d636deba5edc","observation_id":"cd96905c-98d3-4dec-860b-916782727a32","resolution":{"observed_at":"2026-08-07T14:14:48.759894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:50.417570Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"b5b30054-7c98-4241-b29a-9f6c01bc19dc","year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.559317Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:c91264f87ab634578c97507e3c82fdf07e0f7ef0fc5ded096e475a516ef62c66","observation_id":"41d6a292-3654-4631-86a1-08c3242581f0","resolution":{"observed_at":"2026-08-07T14:14:50.543479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T14:14:45.632354Z","title":"Extreme q-learning: Maxent rl without entropy.arXiv preprint arXiv:2301.02328,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.632354Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:7f0ad93ec2c2ec6a607ca781d39f19d7737b90e8e0fbc603cdfad6f2796353c4","observation_id":"202fe6ac-af03-4756-8236-36e4ef3b38c3","resolution":{"observed_at":"2026-08-07T14:14:45.632354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:49.578436Z","title":"Various CQL variants adjust the constraints or modify the regularizer to avoid excessive pessimism (Lyu et al., 2022; Nakamoto et al., 2024; Mao et al., 2024; Yu et al., 2021)","venue":null,"work_id":"cbab4a7b-503e-485f-b8c2-6f43d660aa64","year":2022},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.021956Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:0150e95dc034812b361cb8ba0d26d0a2e467f7b4cfde3968a5719348a99d363e","observation_id":"05b7370f-d2b3-493b-ab10-8219106b87b3","resolution":{"observed_at":"2026-08-07T14:14:49.690918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-07T08:10:41.731546Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-07T14:14:45.120978Z","title":"Pessimistic bootstrapping for uncertainty- driven offline reinforcement learning.arXiv preprint arXiv:2202.11566,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.120978Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:40dd75564d595f6b2f28a797944b37ac81841062c6e4b8a642f963fce30011e9","observation_id":"e614c14e-8003-4cc3-a08d-0ac9dc9f223a","resolution":{"observed_at":"2026-08-07T14:14:45.120978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-07-06T14:48:56.286312Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-07T14:14:45.188595Z","title":"J., Smith, L., Kostrikov, I., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.188595Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:a255c3399e050af2f98f41e0b4c26cd751c9ea505369a2c05fe136810d780175","observation_id":"9ca01919-e7c7-4a62-9b55-695b0f199b9b","resolution":{"observed_at":"2026-08-07T14:14:45.188595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-07T21:15:26.031417Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-07T14:14:45.273426Z","title":"and Montana, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.273426Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:1fb05910c531110635d935af83c6f28c431d230d00e51ef84a3aebb228cab906","observation_id":"563b4579-5f45-48bf-9108-6c2930b0c1e2","resolution":{"observed_at":"2026-08-07T14:14:45.273426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T14:14:45.701272Z","title":"G., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.701272Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:2dd106f4875b89d1da4fad0f23c4e04e5307cff35d59f26892694ebfe901ae07","observation_id":"4c8ab753-1a18-465f-a148-48665a553261","resolution":{"observed_at":"2026-08-07T14:14:45.701272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:50.022763Z","title":null,"venue":null,"work_id":"7b9fc901-4fab-4fa7-a34b-1d95a83676d8","year":2019},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.808770Z"},"links":{"citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:e4a1e0a8e0c10f768b5829cf3b699250d6f58f1ecc3fa110e0081eb06ea5e26b","observation_id":"28a30096-fa6c-4025-92f7-9aca61919fcd","resolution":{"observed_at":"2026-08-07T14:14:50.114624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2505.19923."}