{"as_of":"2026-08-15T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70f9a9a3925eb1d784bdf8c4f9e7df8d606ad6b1888fbb4524a98bef277f02b6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:00:44.592129Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.937596Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:444df2ce5387b7b0f95a47f5dddebdb29bfcf839480da3e58021145aabcfcaf5","observation_id":"16c179a2-3336-4052-94c8-4f91798adf1a","resolution":{"observed_at":"2026-05-16T08:48:14.975258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-12T14:48:30.730504Z","title":"Learning a diffu- sion model policy from rewards via q-score matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-15T04:19:42.201060Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.730504Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:511050e1893f32977460ebbf4dd245dacae7aaef68836cab64adf991c08ad773","observation_id":"07e6a49b-df04-46df-a177-0ec39454bb38","resolution":{"observed_at":"2026-08-12T14:48:30.730504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-11T05:49:35.453168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17162","last_updated":"2024-12-22T21:02:36Z","snapshot_observed_at":"2026-08-13T19:31:15.762845Z","submitted_at":"2024-12-22T21:02:36Z","title":"Generative Diffusion Modeling: A Practical Handbook","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:49:35.453168Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2412.17162"},"observation_digest":"sha256:da0152dd0927d92b84570b6ada34e2bc642a6e160805b55338c42220eaab836f","observation_id":"b399cbd0-d316-495e-9e4b-ca909ce2e3a7","resolution":{"observed_at":"2026-08-11T05:49:35.453168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-09T19:28:41.908138Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-10T07:59:12.895663Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T19:28:41.908138Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.00361"},"observation_digest":"sha256:a03cfaf3dd1b5b118f5170a76ef1ff033fb9c413379087ec3c7e08c6edbae2fc","observation_id":"f5b3d552-8eee-4bcf-b728-92f8aaadc188","resolution":{"observed_at":"2026-08-09T19:28:41.908138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-08T15:40:16.106279Z","title":"Learning a diffusion model policy from rewards via Q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06401","last_updated":"2025-02-10T12:40:32Z","snapshot_observed_at":"2026-08-14T10:44:05.360407Z","submitted_at":"2025-02-10T12:40:32Z","title":"Habitizing Diffusion Planning for Efficient and Effective Decision Making","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T15:40:16.106279Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.06401"},"observation_digest":"sha256:6cf31b969b0be1c5d0396feb5c8eb3be96c06e255f2a39c4d9ce2047a5c4101a","observation_id":"26c18d38-9d6d-48d8-8cfc-eb8af3de670c","resolution":{"observed_at":"2026-08-08T15:40:16.106279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-08T13:21:18.374992Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.374992Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:5ea59794076804f1a5e781a31588b048ced683267888ee55aaa118bab2b1d920","observation_id":"42042865-f0ce-403b-a6f5-260f47240610","resolution":{"observed_at":"2026-08-08T13:21:18.374992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-07T20:09:51.254192Z","title":"Learning a diffusion model policy from rewards via q-score matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09918","last_updated":"2025-02-14T05:06:46Z","snapshot_observed_at":"2026-08-09T16:04:03.730730Z","submitted_at":"2025-02-14T05:06:46Z","title":"Dual Control for Interactive Autonomous Merging with Model Predictive Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:09:51.254192Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.09918"},"observation_digest":"sha256:15df16f760381ff30ab5e998c3ac5ffed2dc5df73383f73798bcad19ccfcbd3e","observation_id":"cb614448-9894-4ff5-914d-2d667dd83192","resolution":{"observed_at":"2026-08-07T20:09:51.254192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-15T22:00:44.592129Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08376","last_updated":"2025-05-13T09:21:45Z","snapshot_observed_at":"2026-08-15T21:54:02.679725Z","submitted_at":"2025-05-13T09:21:45Z","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:44.592129Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2505.08376"},"observation_digest":"sha256:9794104917eea1adf4acf4655e2329b5751eec7f20e59185ecc0af7e4dc252e3","observation_id":"2821fadf-5e2e-48bb-86da-83d8fda249a7","resolution":{"observed_at":"2026-08-15T22:00:44.592129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-15T20:13:00.346736Z","title":"Learning a diffusion model policy from rewards via q-score matching.arXiv preprint arXiv:2312.11752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-15T20:04:33.352567Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.346736Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:8cd528e1af3f9be30a0dfb6c2a488a6a4ad1f2c29097977fb5924247727b1fba","observation_id":"3724894e-8df1-46c4-b523-f13dc4af0a9a","resolution":{"observed_at":"2026-08-15T20:13:00.346736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:6df260b8319b3d5eb734d168b3b9b1074a475d3b7bb6bd4fff8dc2935c3459af","observation_id":"856d2f9c-7937-4712-9664-e6fde3acddc0","resolution":{"observed_at":"2026-05-17T21:55:46.490841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:0bacd5789a7b6097a3fa9a219aeb5976bee25b5b6afd233d7f1f73fa200491e3","observation_id":"f35fc052-b97b-48f5-a52d-0b7a802fb943","resolution":{"observed_at":"2026-05-19T05:12:05.226296Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-06T13:07:09.645809Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-14T04:52:19.396797Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.645809Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:bddb7699297b0da276b9accee3e6d539d2ec04190b44d7b8e4283405b33c29bc","observation_id":"307a410a-5ad7-4481-83ff-e91af1ade30c","resolution":{"observed_at":"2026-08-06T13:07:09.645809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-04T10:44:09.827237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09222","last_updated":"2026-06-01T11:49:06Z","snapshot_observed_at":"2026-08-13T22:42:53.111880Z","submitted_at":"2025-10-10T10:08:10Z","title":"FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:09.827237Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2510.09222"},"observation_digest":"sha256:adaf652dcd4c10f1b587faadf6231cb5d356e9df58c9d3c2afa3f55ab60e352e","observation_id":"a7318975-2a5e-4318-ba51-97ae2e6af7ab","resolution":{"observed_at":"2026-08-04T10:44:09.827237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-08-14T19:18:59.626671Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:1de156ab7220bc5fbf4d190405c8353e72ffba8f80f3fae21fbdff4b2ff53eed","observation_id":"47c4faa7-5cc4-4405-9729-7c73890d20fd","resolution":{"observed_at":"2026-05-16T07:57:33.094604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Learning a diffusion model policy from rewards via q-score matching.arXiv preprint arXiv:2312.11752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-14T23:45:17.615269Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:6072a145d37f8048d4add63eba85b5da2989944343e431c70e54f72196d6db7d","observation_id":"65ae67e8-1760-4953-a541-4addab9581ab","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-08-15T02:53:18.322914Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:00132df99d74e319a60256f70bad20a1ac81a1b23a0f6d8dd3e4b78e184afa07","observation_id":"7ba5bfc9-19c5-4378-97af-882b25215429","resolution":{"observed_at":"2026-05-10T13:20:25.680725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2605.07101","last_updated":"2026-05-08T01:29:42Z","snapshot_observed_at":"2026-08-15T16:47:19.159408Z","submitted_at":"2026-05-08T01:29:42Z","title":"Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:08:17.624506Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2605.07101"},"observation_digest":"sha256:1e1626b5816b89fac979bf9c136f7cf953a1796f06abc014d9db98374d44fa39","observation_id":"cdef4ab6-d0d9-4680-9c2b-775c94be44c3","resolution":{"observed_at":"2026-05-11T04:45:55.078354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2605.16520","last_updated":"2026-05-15T18:14:38Z","snapshot_observed_at":"2026-08-14T17:20:11.417213Z","submitted_at":"2026-05-15T18:14:38Z","title":"Global Convergence of Sampling-Based Nonconvex Optimization through Diffusion-Style Smoothing","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-05-20T20:15:44.030714Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2605.16520"},"observation_digest":"sha256:47f8f81fc66838f731baa7869aa19e2d2cc7c67fd5e204bee10669ee6fa58d6a","observation_id":"35a20015-daaf-4adc-843d-4d1405965043","resolution":{"observed_at":"2026-05-20T20:18:59.880117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2605.26282","last_updated":"2026-05-25T19:06:51Z","snapshot_observed_at":"2026-08-12T20:48:47.003300Z","submitted_at":"2026-05-25T19:06:51Z","title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T22:46:27.179341Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2605.26282"},"observation_digest":"sha256:af9ddc3c0dcb96b4d7d94e69632ac6d0d5879f471e15a3d0b3c8553495f7721c","observation_id":"7782a234-9094-4d3b-9cda-6b1745b293cf","resolution":{"observed_at":"2026-06-29T22:54:01.348420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2605.27095","last_updated":"2026-06-01T11:46:42Z","snapshot_observed_at":"2026-08-15T14:38:02.645451Z","submitted_at":"2026-05-26T14:38:03Z","title":"Adversarial Dual On-Policy Distillation from Expressive Teacher","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:23.777484Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2605.27095"},"observation_digest":"sha256:8d9fd88324f8fc2a1e258bdbfcf8ac2f78746de5cc32144c96c7beba3e46e0b9","observation_id":"da7e45d9-72c8-4795-bf24-8f1fcf9b86a8","resolution":{"observed_at":"2026-06-29T19:03:51.524120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2605.30056","last_updated":"2026-05-28T15:07:50Z","snapshot_observed_at":"2026-08-07T01:38:25.069332Z","submitted_at":"2026-05-28T15:07:50Z","title":"Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:21:56.382343Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2605.30056"},"observation_digest":"sha256:507802f0fd0665dec6f3c2f0ff41af5c6b69a23d840ad39cb5b3261833149047","observation_id":"1ba195ea-06a1-4644-a323-f277eed15319","resolution":{"observed_at":"2026-06-29T07:23:12.577987Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2606.06967","last_updated":"2026-06-05T06:54:09Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T06:54:09Z","title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T22:47:10.062975Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2606.06967"},"observation_digest":"sha256:c2060bc6a719d969f8a35d2cf6b6da7c5beeafe125c22d80b8673839b574f29f","observation_id":"1114145b-2ae2-47de-a7e7-4574ea8f6ad3","resolution":{"observed_at":"2026-07-02T16:27:08.545297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:214d4b1f697ea6a90c1ad404a6ff8fefa57f4c5b2ccd71cfb280430202871232","observation_id":"6886e5a8-f91d-4a62-829d-c7acab63fbe4","resolution":{"observed_at":"2026-07-03T04:17:36.939467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-14T08:30:10.584105Z","title":"Learning a diffusion model policy from rewards via q-score matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10892","last_updated":"2026-07-12T19:48:46Z","snapshot_observed_at":"2026-08-14T12:27:15.889948Z","submitted_at":"2026-07-12T19:48:46Z","title":"A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T08:30:10.584105Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2607.10892"},"observation_digest":"sha256:929c3d0570ebe84a1d3aaf362fcba7efe4a5e4be298471e6e46853e8543d986f","observation_id":"560ffcdb-62ca-4960-95ce-b0b3da32b78b","resolution":{"observed_at":"2026-07-14T08:30:10.584105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-02T05:44:30.881499Z","title":"Learning a diffusion model policy from rewards via q-score matching.arXiv preprint arXiv:2312.11752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.881499Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:3981e594c04326e17fbaafd43a86eef2f7e318cf9ba2a35a4480a61f28f97f2f","observation_id":"131fc597-58d5-4fb6-a993-89847e6b741a","resolution":{"observed_at":"2026-08-02T05:44:30.881499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.11752/citation-record","integrity":"/paper/2312.11752/integrity","json":"/paper/2312.11752/citation-record.json","paper":"/paper/2312.11752"},"outbound":[],"paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2312.11752."}