{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:939711feda191f466b4f0607873e9c04f867f079ecf8492bce979a062dae419c","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:06:28.426709Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.13795/citation-record","integrity":"/paper/2606.13795/integrity","json":"/paper/2606.13795/citation-record.json","paper":"/paper/2606.13795"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:68bf842a674cb50f77856c53c03dd49f12d5ba0e844c21f4ce82948b14746a60","observation_id":"960b7e7c-b54b-4f7f-bbee-41bc7b37dc36","resolution":{"observed_at":"2026-07-03T14:18:22.946121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:6f574d0a12aa8069a9dfd8e24dc4541ec910e7e3987f3e5739da07cff39bd6c3","observation_id":"a22fbede-cd96-4da3-a2c9-e8bb06fef7f0","resolution":{"observed_at":"2026-07-03T14:18:22.928069Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06036","last_updated":"2026-05-28T09:13:25Z","snapshot_observed_at":"2026-08-03T04:09:50.707111Z","submitted_at":"2026-02-05T18:59:30Z","title":"DFlash: Block Diffusion for Flash Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2602.06036","doi":"10.48550/arxiv.2602.06036","metadata_source":"pith","pith_arxiv_id":"2602.06036","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2602.06036 , year=","venue":"cs.CL","work_id":"860ff726-6feb-4917-a25f-95159b43dd49","year":2026},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2602.06036","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:52ef391fcab6409fceed053ae2d3e937bfed57ae88c6d237639bce9274dcfca0","observation_id":"dfaa3aec-2983-4e79-b3b5-12ef839f308b","resolution":{"observed_at":"2026-07-03T14:18:22.982158Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:73ef6329b274fff40402bbe988dc8450ae9e8afa74ffe96a45be5f77f1dc45cd","observation_id":"107974ec-2f41-4bf2-a137-1ae970526c6f","resolution":{"observed_at":"2026-07-03T14:18:22.925727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"cited_work":{"arxiv_id":"2507.07986","doi":"10.48550/arxiv.2507.07986","metadata_source":"pith","pith_arxiv_id":"2507.07986","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","venue":"cs.LG","work_id":"9d0d5260-497c-4e71-8714-2a6320a486d6","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2507.07986","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:98ef89a0b5f61569a59fbac80745e63f3b339e7254ac0c81daa95219f0901cd0","observation_id":"aa89b0eb-d069-4902-a6f1-8c0dbf805984","resolution":{"observed_at":"2026-07-03T14:18:22.979890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2304.10573","doi":"10.1007/978-3-658-09994-7","metadata_source":"pith","pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","venue":"cs.LG","work_id":"913326e6-9ea4-4974-b2d7-ff53984b387f","year":2023},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:0f9a3f04ed75eb4b851d3b2f10cd190cc78a619dea7f169530fc883d4e2b0423","observation_id":"f34234b6-1274-43aa-baf0-8d82665e6cc1","resolution":{"observed_at":"2026-07-03T14:18:22.965715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:4efd2433a3d143b7a567a89137c68f7605db30dfff2ed9ab3a17dc8c6928b292","observation_id":"7016376a-1395-4f43-a273-9b4b3513c35c","resolution":{"observed_at":"2026-07-03T14:18:22.968033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14234","last_updated":"2026-05-18T22:43:56Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T18:45:34Z","title":"Q-learning with Adjoint Matching","version":4},"cited_work":{"arxiv_id":"2601.14234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14234","snapshot_observed_at":"2026-07-08T11:44:51.136563Z","title":"Q-learning with adjoint matching","venue":"cs.LG","work_id":"dbb69860-e53f-44be-b07b-d0d014ff8d2d","year":2026},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2601.14234","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:6029c72488e2e94e18a9617d8a12423966e97bc1e32f431c62b8808a73afa942","observation_id":"2b29a6f0-c9f7-4fef-beb7-ffc3689111d0","resolution":{"observed_at":"2026-07-03T14:18:22.970338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":"2507.07969","doi":"10.48550/arxiv.2507.07969","metadata_source":"pith","pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Action Chunking","venue":"cs.LG","work_id":"d9b89a8b-b7ed-44cb-8c55-09d4c2b6e8a5","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:27aa3851b9f4f2a2130efb1849093c8bd2a8013dc2c763b71da99541e61d72cd","observation_id":"c4e80b62-0b03-4115-ba8e-966dfc9001e4","resolution":{"observed_at":"2026-07-03T14:18:22.963367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:007def3baca3fe551fcf5b64c18150a3377af60ebaac662ad9d1b557155ce53b","observation_id":"bf5b6a4e-37b3-4eb4-9983-2349a56664a5","resolution":{"observed_at":"2026-07-03T14:18:22.948665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:24bb4892ac27869e18e87cce5c773711aa02689fe62bac1c7c196ffec5559e62","observation_id":"644ab85c-d687-4f57-9b97-ce1248b4bbbe","resolution":{"observed_at":"2026-07-03T14:18:22.932973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:f0bc2cade4a50d7fd36feaab87d86fdd780cf03851b7cd70af5aeaac9af00fe1","observation_id":"2b9f8ef1-dd90-43e7-bad7-8bb15d3e9c48","resolution":{"observed_at":"2026-07-03T14:18:22.961036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:bddefd6e2501b8fd21af4a56c89094f8e5f75af63fcf17986db894cf6c89fc50","observation_id":"9f694d9c-246a-488f-b50c-04c35aba46ff","resolution":{"observed_at":"2026-07-03T14:18:22.958694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:e84bcf14c5462efd5989bba9784edf09bbacfb1a4f1e0d454dd9b30160bb75e2","observation_id":"741582ff-527d-43e1-a9b0-30a634f53803","resolution":{"observed_at":"2026-07-03T14:18:22.977532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:a59c33facdb78a8948d16d71f853034c3771fe1cf1adcc2a18aa4decd238ebaf","observation_id":"7c3e0754-8852-4ef0-911e-0011faceacf9","resolution":{"observed_at":"2026-07-03T14:18:22.975130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-08-10T23:47:48.049527Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.10024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-07-10T16:47:24.453726Z","title":"arXiv preprint arXiv:2011.10024 , year=","venue":"cs.LG","work_id":"0432c5f9-f5c2-4b3d-a73d-ba49bc67b43d","year":2020},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:0b33d893ac02b024ce296a3db3f537dbe65d7d064c24ef113d6c3cc4ec3a14bd","observation_id":"0490dc30-4fa1-46f9-9922-76ad4b0bb0d1","resolution":{"observed_at":"2026-07-03T14:18:22.938679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:43fa433cc3bb04765a915d114969894bb8ed511417dff0cc1d78bbc7b9419753","observation_id":"c428be7f-c122-4f48-b4a8-844c4293810c","resolution":{"observed_at":"2026-07-03T14:18:22.972624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-07-06T22:07:21.387432Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":"2508.02193","doi":"10.48550/arxiv.2508.02193","metadata_source":"pith","pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","venue":"cs.CL","work_id":"7412f5f3-8e71-41c1-9c69-d4ca250b18fa","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:44948c18a2bc58e325933bd722532f80698b8b6591dd48317cf480e5be8bd7d8","observation_id":"b47c0824-bb87-4ed6-b25d-44a113ac9537","resolution":{"observed_at":"2026-07-03T14:18:22.930438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08838","doi":"10.48550/arxiv.2507.08838","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"wd1: Weighted policy optimization for reasoning in diffusion language models.arXiv preprint arXiv:2507.08838","venue":"ArXiv.org","work_id":"127e8eef-f734-4f65-bb7d-83a8835bc6f4","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:90818de8e958a5abaa7e36ad48727c9f4b6eee154e7e8cd9ba28e596edb2ee0a","observation_id":"eb61d956-522b-4463-9064-0dda553ee36d","resolution":{"observed_at":"2026-07-03T14:18:22.936071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09541","last_updated":"2026-04-14T23:15:20Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T16:52:25Z","title":"SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2510.09541","doi":"10.48550/arxiv.2510.09541","metadata_source":"pith","pith_arxiv_id":"2510.09541","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models","venue":"cs.CL","work_id":"366411af-e093-43e9-b2d8-50fddef593a5","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2510.09541","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:7804a3d35618958522f74ce3bc6ba8029659e2f300b46981b87e39ab79efd87c","observation_id":"7c67e3c6-2da7-41d7-bd19-863e76a4da89","resolution":{"observed_at":"2026-07-03T14:18:22.956407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-11T03:52:00.293732Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"cited_work":{"arxiv_id":"2509.01142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01142","snapshot_observed_at":"2026-07-11T03:07:52.385541Z","title":"Dream-coder 7b: An open diffusion language model for code.arXiv preprint arXiv:2509.01142","venue":"cs.CL","work_id":"8a7c9708-6012-4156-8cca-f10969908d10","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2509.01142","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:d6d484ffd9c12a3a46b7b0fa81532acf90e697e34d978136aeadfdd0cd22a9da","observation_id":"705f7fe2-ec23-4009-b52d-3b27e673a867","resolution":{"observed_at":"2026-07-03T14:18:22.941284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:05a0638f649c6585a2a73dd7705c05a6fba85c77d9cf97e96017b0819e6f099c","observation_id":"95866b58-e1d8-4d40-9303-159209c7b898","resolution":{"observed_at":"2026-07-03T14:18:22.943777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:18:22.949906Z","title":"Flow policy gradients for robot control","venue":null,"work_id":"d1e248f4-3884-4203-ac1c-e33d7c3c4537","year":2026},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:e3542c5d787a0ddda3a0dfb48fab44450fa3036eb91c3559d58e16da50281b92","observation_id":"32b5ea62-73c1-44c0-8797-b94df4ebc65b","resolution":{"observed_at":"2026-07-03T14:18:22.951369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-07T16:01:44.170215Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:dcd60c088585ac496f26a5502e6efc4d8282593f64d6720ee88d1449273ade94","observation_id":"0172605a-8bac-4417-a5f9-dfbc82e844bb","resolution":{"observed_at":"2026-07-03T14:18:22.953989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:163dcd0ada1d94f1209c97218566a5655498e67f6eb90ccb589598341e74d95a","observation_id":"f4a60010-8b8c-40e2-9770-f1d742b55638","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":"The environment transitions to state st+1 ∼P(·|s t, at), and gives the agent a reward rt =r(s t, at)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:bd75949be7a2a1ee17b2af5fa3b01ff6e4b21040874945d54e6780d0d86bf49d","observation_id":"ee9e2e89-74e5-42e6-b1c4-873b56624781","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":"SPG [Wang et al., 2025] obtains a practical EUBO surrogate for masked dLLMs by exploiting the special absorbing-mask forward process","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:9a4ef3a330a232a4c5901de36b57a7e00c32226b0a7ed1b1a2a476e20c2a5f78","observation_id":"e22934e3-26cb-4881-a589-4491db5d6669","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":"This proves Equation (26)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:12516aaf25e44afa67123b4153bd6dacf78439b15f49cbdf5a783cf4fa37fee0","observation_id":"74d6f7ac-cbfc-482d-a8f4-7f0b43bde1ca","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":"Algorithm implementation.We implement FPO by updating the model parameters according to Equation (4), and SPG by updating the model parameters according to Equation (5)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:1c08699e1517407aafbeb8b89b62b415d6f75c1772a57ac2c0b16bf7131fa079","observation_id":"340379b8-429d-46aa-937b-f9a255adaf79","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:06:28.426709Z","title":"Although SPG+DiPOD does not show a clear improvement at sequence lengths128 and 512, it is the only setting that reaches the near-100%regime in the zero-shot setting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:ea2864549f306b8c5f41c7cf19b807208203a7e6c2f3e506466f2ad3389e18b8","observation_id":"a6a5c6ae-62b7-4327-a5df-1e088123639c","resolution":{"observed_at":"2026-06-27T07:06:28.426709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.13795."}