{"as_of":"2026-08-07T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34c643e8683ebb232edda63ee2725b829a53daa8424d87e9f33c6ee7ec1844ca","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:27.299725Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.940883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:ef8e9aa1df7473105be8e138a7a4b289cf5d93bd2bc5d891da03a1da569184fb","observation_id":"369249ae-67b4-40de-85d7-24c8df8067e2","resolution":{"observed_at":"2026-05-13T13:48:36.611406Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:224261ff9c1f22f35db0efcf043ebb4d34569229a58d31a09aaf666945efe04e","observation_id":"0c67fefc-1819-42ba-9415-5af47f1e6ea1","resolution":{"observed_at":"2026-05-19T10:52:15.285443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T05:22:27.299725Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.299725Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:50fc9bb8cd8b153f72071c609d05b88668b4376f70acdf809e9c70fc71c8e60d","observation_id":"a73e2a5f-1b28-4238-8d50-5f4e3eb823c2","resolution":{"observed_at":"2026-08-07T05:22:27.299725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization.arXiv preprint arXiv:2303.15810, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-06T17:26:04.405292Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:9005b39c8cde0d01a7feb215bc7e064d8f50916b7b5312f41dbed30065e1ad84","observation_id":"c79745c4-080c-4a8b-9206-447d4de34d79","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:f8337e7793230549dcac0775fd606dff7f3c9610928581c1c79395177a4b4bc2","observation_id":"93f16d80-24d1-46ed-b157-e537401a1850","resolution":{"observed_at":"2026-05-10T13:20:25.622646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:5f094b578d5b8b8fdcd8eaebb9063681f496eba600cfd0cb17adf5c3f41887fa","observation_id":"9b03b8b9-acfa-4d1a-92c4-483729c5c34a","resolution":{"observed_at":"2026-05-10T06:51:46.618145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:07d420b962c173f85ef035d37929319f3cf3363179e35e3561e879e16383aba8","observation_id":"48544bef-20c6-44af-af27-d789c3d80a4b","resolution":{"observed_at":"2026-05-11T08:56:00.631554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:503c5f5e4fe03564d8227a7d0f787fea03b3f869989f23340b7be879bfae33af","observation_id":"38d69b95-3dee-4ae3-ae56-96d2a6576225","resolution":{"observed_at":"2026-07-01T14:25:45.840469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2605.27877","last_updated":"2026-05-27T02:53:41Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T02:53:41Z","title":"SPAR: Support-Preserving Action Rectification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T14:34:39.094753Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2605.27877"},"observation_digest":"sha256:ab986f76a27e333ca57e8080dfaf258ac319d192d7902598b763e346b234665b","observation_id":"8b6381b3-ad22-4a49-82f8-610a1812c1e6","resolution":{"observed_at":"2026-06-29T14:43:30.990694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":"2303.15810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-07-03T04:17:36.940883Z","title":"-A\"), 1e6 (","venue":null,"work_id":"d99b71bd-b62c-4f1a-95a3-bd753cb9c7f1","year":2023},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:264114f042070aae8b2f45fba04e1243469f1ce969dfeb916df2820bea7fd431","observation_id":"1cf9ae9f-5987-4cd4-9237-5260c287e35d","resolution":{"observed_at":"2026-07-03T04:17:36.942518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.15810/citation-record","integrity":"/paper/2303.15810/integrity","json":"/paper/2303.15810/citation-record.json","paper":"/paper/2303.15810"},"outbound":[],"paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T15:08:49.727355Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2303.15810."}