{"as_of":"2026-08-20T16:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba4da670cccf870985cc7616d1adf785fb7e7b1197d99708e01bae4e50cc3804","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:59:15.129557Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.29033/citation-record","integrity":"/paper/2605.29033/integrity","json":"/paper/2605.29033/citation-record.json","paper":"/paper/2605.29033"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":"Score regu- larized policy optimization through diffusion behavior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:06928d005f0495c81e8a3cf02d84fa645627d86a1ba2404ade6d161514a6cbe9","observation_id":"d3cbcfda-024a-432e-abcb-1fa65839b20a","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":"and Jin, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:2df73b4200ef9a0b82e83a0d9f6f1646f4a3dd27bd62b01b2c3d9c70e0e7f65c","observation_id":"1d3ea25e-6648-4279-bc7a-49a5993ffd87","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:c4daf70cb59d524e4944b083878a681d47698ddd38f3fa80cc4fdc7267828f05","observation_id":"b788c922-b7e2-4a6d-a903-ae6077005163","resolution":{"observed_at":"2026-06-29T14:03:29.519483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:13ad8e8bb7ca7411fe791025b00ca393d1a12ba33fb726070e3b4e90f86922cc","observation_id":"e824a373-5e9e-4654-b8c9-398813ec4fb9","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:c90527de433ca65e8f3535b06d48417aac579c93515167441d73e729d6e0fece","observation_id":"32d5b99c-9913-4b88-b533-9c8fcdc60581","resolution":{"observed_at":"2026-06-29T14:03:29.524633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:455da52f452a3a466efa3e5d8f6081f869966be3005edafa69a31f201cdca12c","observation_id":"9d239daf-13e9-404e-a100-7ee9f0e3f5e9","resolution":{"observed_at":"2026-06-29T14:03:29.521776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09122","last_updated":"2021-04-19T08:21:56Z","snapshot_observed_at":"2026-08-16T18:30:37.649705Z","submitted_at":"2021-04-19T08:21:56Z","title":"Probabilistic Mixture-of-Experts for Efficient Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2104.09122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09122","snapshot_observed_at":"2026-06-29T14:03:29.510145Z","title":"Janner, M.; Fu, J.; Zhang, M.; and Levine, S","venue":null,"work_id":"11062be1-263d-496d-b7ce-e68bae5db606","year":2019},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/2104.09122","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:96d5ed704d9aae6984190158d968f259e09cd31091ba5938fa64466a49b9488c","observation_id":"0b15a8b1-b9e7-4dbb-b601-533ec584e0e5","resolution":{"observed_at":"2026-06-29T14:03:29.511711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":"Dual rl: Unification and new methods for reinforcement and imi- tation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:e23f3b6123dace033f3f2e287d90e5f1720d27519a448e9fb0a753916a0b2ae2","observation_id":"229c3701-4bb0-419e-929e-5f588b897012","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:858663e7dd68cd3c1a5c1c271e6dbb5d7be8c6a843a9ff5fe69f96289727c9e2","observation_id":"05cedd8c-31bb-45df-be99-54218ed861b2","resolution":{"observed_at":"2026-06-29T14:03:29.524174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:2cdb163fe7dd7cf919c833484c6c2233331164b678656c464d0a89d9811ee84c","observation_id":"647f13be-8ac4-4238-b722-e56c9f627a42","resolution":{"observed_at":"2026-06-29T14:03:29.519731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-08-16T14:41:09.188831Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":"2311.13443","doi":"10.48550/arxiv.2311.13443","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Guided flows for generative modeling and decision making","venue":"arXiv (Cornell University)","work_id":"859f7281-90e7-40bb-b2d7-f16669348ec6","year":2023},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:2bbb58286f67d2a45ec39c0f47536e95e05c1f59f2cf0098c45b88b461182f5c","observation_id":"e393612f-f376-44aa-a384-df90d79a1d15","resolution":{"observed_at":"2026-06-29T14:03:29.517424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":"Theorems and Derivations A.1","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:bd15194f3928ef7576d738a08629bbf5dc3f8fbd7443c6634549693bef21d29f","observation_id":"4cfea853-383a-4ed2-aaa7-f82927954d10","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:59:15.129557Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:5a46c2574a883f4880081a98a54c42b19ab250162ee92b5db6f6ddbcd3d7069b","observation_id":"4856f8d9-1de4-4dd7-8112-6964da80cf83","resolution":{"observed_at":"2026-06-29T13:59:15.129557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T14:28:13.129854Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2605.29033."}