{"as_of":"2026-08-09T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c7375a09d652cb0a9f9098cb3541480b6b62e6faa0392ba351cb9b2c2c523db","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:50:32.825035Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05084/citation-record","integrity":"/paper/2608.05084/integrity","json":"/paper/2608.05084/citation-record.json","paper":"/paper/2608.05084"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.13129","last_updated":"2022-09-19T15:13:47Z","snapshot_observed_at":"2026-07-06T12:12:10.536267Z","submitted_at":"2021-11-25T15:36:11Z","title":"Robot Skill Adaptation via Soft Actor-Critic Gaussian Mixture Models","version":2},"cited_work":{"arxiv_id":"2111.13129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.13129","snapshot_observed_at":"2026-08-06T05:50:32.950630Z","title":"Robot Skill Adaptation via Soft Actor-Critic Gaussian Mixture Models","venue":"cs.RO","work_id":"8d617ed8-9f0d-4eb0-abab-39634664779b","year":2021},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.772675Z"},"links":{"cited_paper":"/paper/2111.13129","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:317e7958f23573665278207b513bc5edb7e849ef2e5affedbd7ee161f9fea695","observation_id":"1d6fe352-65b3-4fc9-a831-d405f70baa40","resolution":{"observed_at":"2026-08-06T05:50:32.959913Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T05:50:32.777893Z","title":"Progressive distillation for fast sampling of diffusion models.arXiv preprint arXiv:2202.00512,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.777893Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:a472a31a5e209f724b87e9a229725e389f5c26dfaa8e97872a4aefd57b79b844","observation_id":"aec1490e-e744-4695-8222-7d85c8b81fc2","resolution":{"observed_at":"2026-08-06T05:50:32.777893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T05:50:32.782847Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.782847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:baf8ecb14a2477d6995d6e4b933fee6da0d8b719aceab132966825119a839b12","observation_id":"c58f4d21-ee59-48bb-8465-c6e5955f8c29","resolution":{"observed_at":"2026-08-06T05:50:32.782847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T05:50:32.787581Z","title":"Yang Song, Prafulla Dhariwal, Mark Chen, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.787581Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:bd803cca74b13bd4cdffc7b2afa7aa6da72a822281f9c384a830d2aeb85a2aee","observation_id":"8bc2b8c3-8f39-4b8d-9e48-ce42806e35a5","resolution":{"observed_at":"2026-08-06T05:50:32.787581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15177","last_updated":"2024-12-21T02:23:41Z","snapshot_observed_at":"2026-07-06T18:19:04.614208Z","submitted_at":"2024-05-24T03:23:27Z","title":"Diffusion Actor-Critic with Entropy Regulator","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15177","snapshot_observed_at":"2026-08-06T05:50:32.792214Z","title":"Zhendong Wang, Jonathan J Hunt, and Mingyuan Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.792214Z"},"links":{"cited_paper":"/paper/2405.15177","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:610c57d1430a323d12137ddf22c316e2deaede6fea476ccb2ebfda912b1145d7","observation_id":"8c8e7c4d-e0a2-4592-8bee-573369f9246b","resolution":{"observed_at":"2026-08-06T05:50:32.792214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06804","last_updated":"2025-08-09T03:27:21Z","snapshot_observed_at":"2026-08-05T22:37:36.438660Z","submitted_at":"2025-08-09T03:27:21Z","title":"D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06804","snapshot_observed_at":"2026-08-06T05:50:32.796809Z","title":"Shlomo Zilberstein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.796809Z"},"links":{"cited_paper":"/paper/2508.06804","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:7f986cd489005a24f45a2474bbf7beb6b7ae8f40154219d5473cd54aa913cce2","observation_id":"f86f061b-1113-4748-8b5d-c12bbe3b94c6","resolution":{"observed_at":"2026-08-06T05:50:32.796809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:33.110486Z","title":null,"venue":null,"work_id":"b97f95a5-516e-4fba-991c-7766dbd9d834","year":2026},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.806731Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:0841b1ca39cae82f41fed24cd2b6ebe3cb19e7a030f1e95ed9117cb56893d61e","observation_id":"039b18b9-b8b4-43cf-8529-8f76ffed2b58","resolution":{"observed_at":"2026-08-06T05:50:33.115174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:33.094073Z","title":"distill toK ′=5","venue":null,"work_id":"d9bffa07-d6c2-4575-8302-a981a3a535e5","year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.811378Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:7faaaf44244db6a276b5cc3d00b6429f9509449ad40d96c8e22240aa29c12705","observation_id":"10bd7a1f-1fa2-4a8a-90a1-661a50480be0","resolution":{"observed_at":"2026-08-06T05:50:33.099910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:33.078566Z","title":"(5) with ¯h(t) = Eh∼H[h(t)]","venue":null,"work_id":"59a6d091-52bb-44f3-9fe3-c64f870cf7e2","year":2018},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.815906Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:171d7ccda897ecce82d7583458abfc9fcc48752a5a85d96484bc5029a4e46eff","observation_id":"4cfb098c-6bbc-4262-b812-fb744fdd4d1e","resolution":{"observed_at":"2026-08-06T05:50:33.083329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:33.063277Z","title":"•Diffusion-QL: Diffusion policy withQ-weighted behavioral cloning loss (Wang et al., 2022)","venue":null,"work_id":"6ae4ed47-01cf-41e9-a968-dcf8d285ae72","year":2025},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.820519Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:e78bdb0b7c713c943dc3d541b76b8b6ca7567f5d32a35fbce518eecb32f064a2","observation_id":"c400fc68-4903-4464-b5a9-5ad237fc9371","resolution":{"observed_at":"2026-08-06T05:50:33.068241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:32.801772Z","title":"URLhttps://ojs.aaai.org/aimagazine/ index.php/aimagazine/article/view/1232","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.801772Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:bf785b744d775096070d760615d0293f9315a32866d78ef41a4a11fba5bb889a","observation_id":"80532993-068c-4edc-ab2d-e0ad91274796","resolution":{"observed_at":"2026-08-06T05:50:32.801772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-06T05:50:32.761485Z","title":"Planning with diffusion for flexible behavior synthesis.arXiv preprint arXiv:2205.09991,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.761485Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:4d570b63986acc78530e78f8758ec073a758637061353ecf02d2a19622f899b6","observation_id":"4d0613af-ee6b-4e8a-af83-0e58defe5d01","resolution":{"observed_at":"2026-08-06T05:50:32.761485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-06T05:50:32.756288Z","title":"Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.756288Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:48676d553bcb6360c0f8e8b08bcfc2f07c8a5a248cfa1a2ba285d721e2a2d573","observation_id":"f80ad7ee-1301-4306-b5b5-7ba0be90dc70","resolution":{"observed_at":"2026-08-06T05:50:32.756288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13264","last_updated":"2022-01-05T18:45:18Z","snapshot_observed_at":"2026-08-09T12:42:37.599526Z","submitted_at":"2021-08-30T14:23:48Z","title":"Deep Reinforcement Learning at the Edge of the Statistical Precipice","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13264","snapshot_observed_at":"2026-08-06T05:50:32.745229Z","title":"Andrea Banino, Jan Balaguer, and Charles Blundell","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.745229Z"},"links":{"cited_paper":"/paper/2108.13264","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:627630d2367472d4b3014d536f792ebc4e9dcf7fecb3e955495bca2b5d778093","observation_id":"e3a32a21-b656-4168-8f59-49706f80350a","resolution":{"observed_at":"2026-08-06T05:50:32.745229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:50:33.046452Z","title":"•FQL: FlowQ-learning (Wildberger et al., 2023); the flow-based policy is trained with a reflow objective to enable one-step action generation","venue":null,"work_id":"18787b00-429d-4919-bc69-74298dab746e","year":2022},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.825035Z"},"links":{"citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:8b022cd09b6c6cb172e1e136a469821e5a4d3b90cbc3b2cb778a7e6f9231e8ad","observation_id":"9b4be681-ab94-4d11-9827-346af1a173db","resolution":{"observed_at":"2026-08-06T05:50:33.052308Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-06T05:50:32.751225Z","title":"Shutong Ding, Ke Hu, Zhenhao Zhang, Kan Ren, Weinan Zhang, Jingyi Yu, Jingya Wang, and Ye Shi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.751225Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:acfa493f91e4f8e31195eb35160b6ca3e5ec2af9e39573961bbcea76f7776ec6","observation_id":"d165c37c-29ca-4fdb-aedb-e34e36565f09","resolution":{"observed_at":"2026-08-06T05:50:32.751225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01381","last_updated":"2025-07-11T03:34:59Z","snapshot_observed_at":"2026-08-08T15:34:59.587782Z","submitted_at":"2025-07-02T05:50:10Z","title":"Distributional Soft Actor-Critic with Diffusion Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01381","snapshot_observed_at":"2026-08-06T05:50:32.767520Z","title":"Haitong Ma, Tianyi Chen, Kai Wang, Na Li, and Bo Dai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T05:50:32.767520Z"},"links":{"cited_paper":"/paper/2507.01381","citing_paper":"/paper/2608.05084"},"observation_digest":"sha256:fc57f5e9e9f72c12623a2cff2c642b373a64373a81f692088155b1a986db17fc","observation_id":"15117198-4f4d-479b-8af2-c7be9bf41625","resolution":{"observed_at":"2026-08-06T05:50:32.767520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05084","last_updated":"2026-08-05T17:24:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:13:58.046265Z","submitted_at":"2026-08-05T17:24:55Z","title":"Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2608.05084."}