{"as_of":"2026-08-18T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbb9df832a0de080ac4db06377d8a87364b001d48079c05e66350c2f3b63300c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:46:08.077256Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00503/citation-record","integrity":"/paper/2505.00503/integrity","json":"/paper/2505.00503/citation-record.json","paper":"/paper/2505.00503"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:46:07.965220Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.965220Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:1a5f4f63a45771197a08515526fd6f6e69eb1a426823006b65b083b5607a4b15","observation_id":"9ef48b7a-14cd-479f-ab2e-d0d3145028b2","resolution":{"observed_at":"2026-08-16T04:46:07.965220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.397196Z","title":"Learning markov state abstractions for deep reinforcement learning","venue":null,"work_id":"0e3af4f4-7084-42e3-bdd6-0c7a81ea9ef1","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.969768Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:464d303c84c007c3661620181930b1276f8ae9e4f356074a442b44a244fb6304","observation_id":"99096310-b63b-46a7-a373-48b63db62b94","resolution":{"observed_at":"2026-08-16T04:46:08.400482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.388180Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"18d57bd7-555c-4153-868d-735a7b38aef2","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.973100Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3c96e5f9d74679bf6de20aac4c6df4b6b73b68f1a59d180fdd752caa9fc42da7","observation_id":"31367436-eaa5-4c53-b449-1d95c54811b9","resolution":{"observed_at":"2026-08-16T04:46:08.391492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.378303Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":"519c5102-3f47-4abc-a8bf-bf0b191e531f","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.976836Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:db2ec2ce427f409fbd67ca2d0b05c074536628f8c0491cf364b73fdbf35e391c","observation_id":"dd567200-1253-42c1-9a0c-313ef739d610","resolution":{"observed_at":"2026-08-16T04:46:08.382105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.369099Z","title":"Label-noise robust logistic regression and its applications","venue":null,"work_id":"87344611-daf6-4866-924c-68ecdbbf262d","year":2012},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.980276Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:eda83ccee5c859aa14fb5731eea956601f9a89e362074955a431e15b0c8ba775","observation_id":"bc4da37b-efec-4f24-8847-de23489ccacf","resolution":{"observed_at":"2026-08-16T04:46:08.372433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.00519","last_updated":"2016-11-07T17:29:24Z","snapshot_observed_at":"2026-08-15T19:45:13.495404Z","submitted_at":"2015-09-01T22:33:13Z","title":"Importance Weighted Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.00519","snapshot_observed_at":"2026-08-16T04:46:07.983646Z","title":"Importance weighted autoencoders","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.983646Z"},"links":{"cited_paper":"/paper/1509.00519","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d90b8fd2ce16bf56832324ee9aa65821fcb303b32dec06eda2392e4d59f1615e","observation_id":"644e8d65-2e9b-424a-9f37-13d8059d9c18","resolution":{"observed_at":"2026-08-16T04:46:07.983646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05908","last_updated":"2021-01-03T16:56:46Z","snapshot_observed_at":"2026-08-14T21:52:07.048587Z","submitted_at":"2016-06-19T21:02:30Z","title":"Tutorial on Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05908","snapshot_observed_at":"2026-08-16T04:46:07.987957Z","title":"Tutorial on variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.987957Z"},"links":{"cited_paper":"/paper/1606.05908","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:6e407e26b49bef45b5b314716f20bcc5f770296043e414d46832401e3144c8a1","observation_id":"c74fccd9-e3bd-4b09-a8ff-dffe82f11d8f","resolution":{"observed_at":"2026-08-16T04:46:07.987957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-16T04:46:07.991451Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.991451Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:1a5927a85697176f01d1835c1d83f1e414455917ffd64a2a845087777ebb72aa","observation_id":"77265d7d-19f6-4a15-a776-b59715b6960a","resolution":{"observed_at":"2026-08-16T04:46:07.991451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.359089Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"e50d1c34-b7e5-45e1-ab1d-01952d78e4c0","year":2019},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.994764Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:02267c87a19bb578b33ce9252aa994167b0e44b62f36f668c30f1f25d5a149f7","observation_id":"e17f339a-c7d0-449b-8255-1e612dc0fda8","resolution":{"observed_at":"2026-08-16T04:46:08.362697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:07.998083Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:07.998083Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:ac1350c5e3952fe3d24e856b3dcb99413742bae82a52491fc03160671b119562","observation_id":"aee7d1f4-b677-4eb2-892e-53ce6e4efd57","resolution":{"observed_at":"2026-08-16T04:46:07.998083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.001245Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.001245Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:bcb5b00af369cb9acc0d3b01a40a75d5da935c4cd8cd04d70b7dbbabe719cca3","observation_id":"05514fed-c6af-47bf-bfc3-e0f6155478a2","resolution":{"observed_at":"2026-08-16T04:46:08.001245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-17T05:09:53.121073Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-16T04:46:08.008559Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.008559Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:b4ab1d0769e2ab4b2f35abbec2acdb4cbae0829398d02f80370e416f2419f1f7","observation_id":"fc48874b-b5b7-4575-aec1-3c9f4866fadb","resolution":{"observed_at":"2026-08-16T04:46:08.008559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.339044Z","title":"Recovering from out-of-sample states via inverse dynamics in offline reinforcement learning","venue":null,"work_id":"0a27e1aa-c105-4866-9e58-e424a843ddef","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.012362Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:95b2099a18cb937e889b1b149af8e32f776dc311c0656da7aca4480646f26493","observation_id":"d3e7bd93-c663-4fc8-8a28-9a4b8ed1cabb","resolution":{"observed_at":"2026-08-16T04:46:08.342922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.329400Z","title":null,"venue":null,"work_id":"b14027d3-e64a-4772-9513-0b337888b877","year":2021},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.015471Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:bbfa5d91aed3112d7f63125c14bf6f46f0c47e2b6294524498f07dd5435a9aec","observation_id":"7a0d9678-f707-4c44-ba55-1a10b9a9fca4","resolution":{"observed_at":"2026-08-16T04:46:08.332759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.319784Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"db975ed6-a703-47a8-99a2-77283474a326","year":2018},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.018719Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:1af28cea3fa7593bd8a60fc562064f2c35a0e9b67f7dfa37db779044007656b0","observation_id":"cc2807a4-8eb1-4fe9-9019-3ca614338c95","resolution":{"observed_at":"2026-08-16T04:46:08.323263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.309240Z","title":"Lyapunov density models: Constraining distribution shift in learning-based control","venue":null,"work_id":"78d8589a-ed5e-4e80-bce3-934929c40469","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.021758Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:e75a147771d32cce7f6473da42cea689d400bc5a0368338ee104910d34f64ab7","observation_id":"8fd905cf-c544-4936-8ada-8068da5e5e3c","resolution":{"observed_at":"2026-08-16T04:46:08.313028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.024790Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.024790Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:e214e3e1a51d7409475032dd211efaee7ecaaeb15eb1909475a86f37aece44d5","observation_id":"23404f0f-5c81-45da-8c2f-ba52a23a7863","resolution":{"observed_at":"2026-08-16T04:46:08.024790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.293706Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"5f6e59d3-4e2c-4159-b12d-33188ba87a6d","year":2020},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.027953Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:81884988745ea78335ae173d714077d890ec5165d56c6f7efc8b607f5420c2b9","observation_id":"85b7faeb-8dbe-47b5-8987-fdfc68a02a9c","resolution":{"observed_at":"2026-08-16T04:46:08.297346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.030931Z","title":"Batch reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.030931Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:69f4b55db5cca166ae39e3db5aa168bdbc7b1104d9e1173644d088a013330b83","observation_id":"397c65bb-9786-48bd-899d-038cbc8dda7c","resolution":{"observed_at":"2026-08-16T04:46:08.030931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.277277Z","title":"Supported value regularization for offline reinforcement learning","venue":null,"work_id":"6fbdcad6-0dbb-4a0b-a967-140ee51282b6","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.034368Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:ee20666fa13db25964b365ed7e14c7a1663a372e10affe358cf9dd6c26a75b76","observation_id":"c9ada6e4-f5ef-48db-9be9-6964eee85dc7","resolution":{"observed_at":"2026-08-16T04:46:08.280727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19400","last_updated":"2024-11-01T07:20:10Z","snapshot_observed_at":"2026-08-17T15:19:17.052487Z","submitted_at":"2024-10-25T09:01:37Z","title":"Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression","version":4},"cited_work":{"arxiv_id":"2410.19400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19400","snapshot_observed_at":"2026-08-16T04:46:08.140064Z","title":"Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression","venue":"cs.LG","work_id":"8b91fa75-8231-403a-bab6-dad43cbe5669","year":2024},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.037469Z"},"links":{"cited_paper":"/paper/2410.19400","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3f6d885638040dad6bb044e1cdda4e249acbcab445488526b291c48e6eaa24cc","observation_id":"0aae39b5-9e6a-454d-94cf-706f7adb7df4","resolution":{"observed_at":"2026-08-16T04:46:08.144011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.040956Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.040956Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:e98ca37baf0177a29f99b78e0d0b526c46414fcdda3de0d21a9704732ba0379e","observation_id":"2e559b6e-9885-4097-9294-ffad781c7a30","resolution":{"observed_at":"2026-08-16T04:46:08.040956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.261797Z","title":"Deeploco: Dynamic locomotion skills using hierarchical deep reinforcement learning","venue":null,"work_id":"b9a8fcca-437f-4a34-a522-84305a738aa0","year":2017},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.043948Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:59b27ba4d3b626431ad833400725b93286eefc894a4dfd3211b9b6bce4fdeefb","observation_id":"092274a0-d39b-42ab-a467-a2bc360b27fc","resolution":{"observed_at":"2026-08-16T04:46:08.265226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.046845Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.046845Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:6db49ffc4ecf16d14d02294d8a126d4ad4d97663903ea11d93697ddaa6f2dcd0","observation_id":"e98c70ba-ad82-4ed3-b7b0-01ac023280e3","resolution":{"observed_at":"2026-08-16T04:46:08.046845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:46:08.049612Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.049612Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:a395fc3191069a18257a39cf29728bf5b6df92bf1c6c36c26ac37c6f9bef2ff1","observation_id":"34534397-3fd8-466f-b144-d77d96c76e07","resolution":{"observed_at":"2026-08-16T04:46:08.049612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.245881Z","title":"Robust distance metric learning in the presence of label noise","venue":null,"work_id":"fabbe078-a1e7-4166-a7ad-e0bffa1dbb87","year":2014},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.052689Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:878e221a3969cc118961024a0f8c16a2c834006bc5cf9ffc9e0181ac6cb40ad7","observation_id":"0d1d9d1b-7911-43d5-bc75-7ddcca1d3607","resolution":{"observed_at":"2026-08-16T04:46:08.249511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.235802Z","title":null,"venue":null,"work_id":"fcfef02a-dd0a-45fa-8c26-2fe12ec7e1a2","year":1992},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.055612Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:0b6bdde8fd00edde9416e5678a7a148f0634c3add3b78e3dc18427660f791808","observation_id":"83c57b72-b982-4f67-bfa2-35f8d884eb2f","resolution":{"observed_at":"2026-08-16T04:46:08.238963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-16T04:46:08.058685Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.058685Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:dcad0ef5acadc53ca95d86b4e1980baef72377edcf16c504928a3de03aaf2122","observation_id":"43b9d0b8-28e4-46c7-aa6e-fba8f1034228","resolution":{"observed_at":"2026-08-16T04:46:08.058685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.224935Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"462784a6-1838-442e-8d6f-4a09c0f9c6c6","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.061838Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:e6028a4e2e2eb53d08a4d414b689b79c9715e69a1ffbf07cf3d39b37299d7372","observation_id":"13475ed8-4071-40a5-bbb8-dbfd4fe2687d","resolution":{"observed_at":"2026-08-16T04:46:08.229077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02829","last_updated":"2022-10-22T10:09:17Z","snapshot_observed_at":"2026-08-16T16:54:57.434304Z","submitted_at":"2022-06-06T18:07:41Z","title":"RORL: Robust Offline Reinforcement Learning via Conservative Smoothing","version":3},"cited_work":{"arxiv_id":"2206.02829","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02829","snapshot_observed_at":"2026-08-16T04:46:08.107085Z","title":"RORL: Robust Offline Reinforcement Learning via Conservative Smoothing","venue":"cs.LG","work_id":"1ad74a5b-82e2-4bc3-a2a9-9f27a92bc746","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.064871Z"},"links":{"cited_paper":"/paper/2206.02829","citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:d5bba4a5efe2133b5b11d0b5d9abf79d28615b6101463085e09307aa0abd5ed1","observation_id":"1999d70c-3f12-4a5c-b282-7d01cecce048","resolution":{"observed_at":"2026-08-16T04:46:08.113098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.214951Z","title":"An implicit trust region approach to behavior regularized offline reinforcement learning","venue":null,"work_id":"574607fd-95ae-4524-a9d7-2ea9ee3e2110","year":2024},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.068085Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:3f2f21617f66c163fb36c5643da09bbcdf360923320569bbb26bd8b72ef74793","observation_id":"a879cd6a-38f7-4ccf-a223-a454c0989d89","resolution":{"observed_at":"2026-08-16T04:46:08.218677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.205528Z","title":"State deviation correction for offline reinforcement learning","venue":null,"work_id":"665bca39-3903-4d5d-895a-f339650611ae","year":2022},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.071301Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:f78e9907f4ffa83286e2e2d84f0d2620d1a8f5afd16e4cb5f47e845cabd27a8a","observation_id":"4ea89976-a352-4dfa-b40c-aba3d976a6fe","resolution":{"observed_at":"2026-08-16T04:46:08.208816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.195938Z","title":"Constrained policy optimization with explicit behavior density for offline reinforcement learning","venue":null,"work_id":"4c86c634-3e35-4450-82d4-49b5e163fb46","year":2023},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.074192Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:bde0fb404e7c999d929846f5a6635e8d008a0875e7838eadb4d330d44005ed11","observation_id":"9840f7b5-c279-4ecf-aa8d-79d284f69b90","resolution":{"observed_at":"2026-08-16T04:46:08.199344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:46:08.077256Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:46:08.077256Z"},"links":{"citing_paper":"/paper/2505.00503"},"observation_digest":"sha256:0eae7528065ac7e34328e035bc8228a50e2e239c34a179b1d6817bbf5835e22d","observation_id":"85c0bc90-d052-4f8d-b25f-85ed27f8bca7","resolution":{"observed_at":"2026-08-16T04:46:08.077256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00503","last_updated":"2025-07-08T03:38:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:38:06.934549Z","submitted_at":"2025-05-01T13:14:07Z","title":"Variational OOD State Correction for Offline Reinforcement Learning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2505.00503."}