{"as_of":"2026-08-13T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9cef7f33f2429dc81526d360b7dd01ced9582658817cba33e43958d64afba47","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:20:08.802604Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01717/citation-record","integrity":"/paper/2608.01717/integrity","json":"/paper/2608.01717/citation-record.json","paper":"/paper/2608.01717"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.201964Z","title":null,"venue":null,"work_id":"28d58438-3a9b-4f68-8aca-3b90f0a522b5","year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.662137Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:0b1546192942e3aa1e0b1b2b7fec1d253fae5e37806a902625708f5e15d598b0","observation_id":"e096106b-ccb8-4b44-8d88-e96efa60d70a","resolution":{"observed_at":"2026-08-04T22:20:09.205227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.190820Z","title":null,"venue":null,"work_id":"525545ec-345a-4278-be63-3569a90c3cae","year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.666455Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:92d8eac5839511f3414611e81497ce53110bf531bbd3206f0fb30754b7083cf1","observation_id":"d86cc0e2-1e6b-4020-97a5-d3422b44db29","resolution":{"observed_at":"2026-08-04T22:20:09.194915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.179105Z","title":null,"venue":null,"work_id":"e4a21287-3138-4138-b8e6-d4f635b95546","year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.670872Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:2ae4c832bd1ee919780ae51915ea85872f066e937138f378771bd45a363afccc","observation_id":"4f001faf-74fe-4b1c-9ffa-d3156560e08f","resolution":{"observed_at":"2026-08-04T22:20:09.183473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.169269Z","title":null,"venue":null,"work_id":"6ca818b9-ebe3-4509-ba3b-11fab3a12acf","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.674633Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:244b87ede0d6a76e70b319ea367cf62d7f7511ece414d4b12e572ca620bf361e","observation_id":"ec41f3b1-52f3-4a54-972e-7abf67bfe60f","resolution":{"observed_at":"2026-08-04T22:20:09.172824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.157193Z","title":null,"venue":null,"work_id":"42fcf08e-76ff-4507-8c74-6e79e1b263e9","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.678892Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:d72c90811a04f1f6278fa5901f2ca00976e364d2d182ebc31d1a60069f4d2357","observation_id":"57065abc-120d-4570-bf53-dca3a129b7cd","resolution":{"observed_at":"2026-08-04T22:20:09.161233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.146980Z","title":null,"venue":null,"work_id":"6560edba-2fdd-4766-9b0a-3cec84fa4dc5","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.683125Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:5ade00d856d7b963126dd5b2744b3b0040bdfd72f9e42813c0fb5ae6e7bd45f1","observation_id":"a104d9a5-d879-4362-a2cf-94fddf81b289","resolution":{"observed_at":"2026-08-04T22:20:09.150353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-04T22:20:08.688031Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.688031Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:4e51f8b38f2b64e64cc6cd4e1ef554d20f9df02e98c7f340ff57322774a02529","observation_id":"d1be0296-d4e7-4624-8f6a-988cc45148dd","resolution":{"observed_at":"2026-08-04T22:20:08.688031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.135006Z","title":null,"venue":null,"work_id":"42e3416b-5b50-424a-a023-669291ee2f4d","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.692135Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:0d8c4db484f836fb99f6b1c82e8c803d87409e5162894c1a17ce2295ec07b138","observation_id":"237041a8-3fd2-4a4f-8fcd-d6dd0d2e45be","resolution":{"observed_at":"2026-08-04T22:20:09.139351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.695571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.695571Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:253f6d4dc5d7e4c6bb748074e894a00f2a7c480322e0c669545d97a99b8a3e38","observation_id":"aca783a0-b0b8-4563-a630-46910f2a96fd","resolution":{"observed_at":"2026-08-04T22:20:08.695571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.699209Z","title":"Rojas, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.699209Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:cbd3fbc8ee7518f30ed53c3be5302aa6b8b6c2989e1be687f2c3b4087ecca95d","observation_id":"6f174b15-af9e-440a-a6a8-c0062e2d774e","resolution":{"observed_at":"2026-08-04T22:20:08.699209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09541","last_updated":"2026-04-14T23:15:20Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T16:52:25Z","title":"SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09541","snapshot_observed_at":"2026-08-04T22:20:08.702639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.702639Z"},"links":{"cited_paper":"/paper/2510.09541","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:08ae4d541d0d627572483c71f55d9ac29ca428b1f48c880a6c96694936ad04b8","observation_id":"adea863f-3067-4dcf-83c0-6a75b7824776","resolution":{"observed_at":"2026-08-04T22:20:08.702639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T22:20:08.707330Z","title":"Lambert, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.707330Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:d8cf13ec908f47510b1f8a2fdbef0cf5d0935b269bd2dbc0f203a29489723916","observation_id":"9e802747-b552-46e6-b3ef-2ab327fc7b73","resolution":{"observed_at":"2026-08-04T22:20:08.707330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T22:20:08.711501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.711501Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:9903e1fff887e6929685786ce91a7d2ed7bc826152551f0d7d17d2ebdcd3a33a","observation_id":"4a4ede1d-cbef-4856-88d1-37037bf52dc4","resolution":{"observed_at":"2026-08-04T22:20:08.711501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T22:20:08.715123Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.715123Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:603b886ab7346ad151c3e99ab82f02599028d23f3e11ba094f7444d2841b4f4b","observation_id":"1c04d651-2594-46fd-85ea-11af995948d6","resolution":{"observed_at":"2026-08-04T22:20:08.715123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.124114Z","title":null,"venue":null,"work_id":"e9a6aac9-666c-4648-89ca-0d769ba2ab3d","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.718494Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:192599fd1689797f775e07c9367ea0f960b7121a9972d059bbd29dff6a311926","observation_id":"dc1bb8a5-b3c2-4f92-8171-e11df334ee29","resolution":{"observed_at":"2026-08-04T22:20:09.127466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.114544Z","title":null,"venue":null,"work_id":"fe90a85f-01e0-41c3-842e-b9027eed3904","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.721767Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:bc42fc9a68cafb04e376a6dde11952a52c1c705689b249adcbd3d548cf5bc373","observation_id":"e1e6ac47-a1d4-45d5-b481-7419f0e18e4f","resolution":{"observed_at":"2026-08-04T22:20:09.117792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.103172Z","title":null,"venue":null,"work_id":"d4c5e351-21c9-400c-b758-ca871b4e7ecc","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.725274Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:7bf13394717ff97201d617714ed2eefebb8fda05a06c2a82e58223d7cdd492e9","observation_id":"d991f920-9f99-4080-aa22-a09209cc8c0d","resolution":{"observed_at":"2026-08-04T22:20:09.107695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.092680Z","title":"Lightman, V","venue":null,"work_id":"1c03da9d-945c-42ca-be51-7d32266f4305","year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.728491Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:9e45e0dcbf03fa63343075caa768e2448ab9230575eb968fa78724ab9c0dc625","observation_id":"2a798e5d-cb6e-4a04-9552-425726e7d84f","resolution":{"observed_at":"2026-08-04T22:20:09.096121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.082106Z","title":null,"venue":null,"work_id":"9aac5f03-3dca-43c2-b29c-97143d5d820d","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.731558Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:94eda304eeecf49d3c78205d894a612f30525f96948a0c0916e5644ac610bf5f","observation_id":"24c87849-2400-4ee0-936e-896596840f92","resolution":{"observed_at":"2026-08-04T22:20:09.085664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-04T22:20:08.735352Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.735352Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:a30545f4182ca942ec83b5e203bb3535d11db01f67f76fe7018385846a932d2d","observation_id":"e4895cd6-cebd-40c9-b749-ece181cdfb8b","resolution":{"observed_at":"2026-08-04T22:20:08.735352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T22:20:08.739938Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.739938Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:bc339c798af4b7858bb6a88624e8153f9f1a1abd36cdd24215727a93c6891068","observation_id":"6d711fa9-e3f3-4e83-a04e-2a99c6136159","resolution":{"observed_at":"2026-08-04T22:20:08.739938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.071479Z","title":null,"venue":null,"work_id":"e7e6c5f7-94d7-44c1-8166-ec7804331ece","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.743867Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:3e1ba00862943e43cfc5596788109c1f548d840fa6d79c35e6d42c894c541218","observation_id":"513cbfe5-4811-442a-b5f1-0ad45ee936e5","resolution":{"observed_at":"2026-08-04T22:20:09.075012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.060325Z","title":null,"venue":null,"work_id":"b0b4a37c-5b41-40eb-b70c-b37bc66ffc94","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.747038Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:156d2c2ae3ad6d5abc1e4e43f06cebd7b9bb366c515dba7d026b0606a46a3e19","observation_id":"1e453ca0-cb34-458f-9f89-eb0f03040060","resolution":{"observed_at":"2026-08-04T22:20:09.063600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.047790Z","title":null,"venue":null,"work_id":"c88576a4-825e-461a-b8c2-45023894fbc1","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.750162Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:fb1cd20a779dc0939a7169329357a0b7d39c0a0415f775520706067a41e500f0","observation_id":"720df068-b430-4be1-b754-bee7492f274d","resolution":{"observed_at":"2026-08-04T22:20:09.052684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.036218Z","title":"Arriola, A","venue":null,"work_id":"da829c8a-28f8-485a-b334-8b7cb480cede","year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.753457Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:a21a9d192dbb0f3c1591f9780ae14fedb44ad7f5cf86196daa5a27458a1aa694","observation_id":"4dc31006-ed98-48a3-9518-22812ce1d8f6","resolution":{"observed_at":"2026-08-04T22:20:09.039973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.756727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.756727Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:4a4aa0ad671d5d5d3c2f30c48256f883684c83e98869f5612963e5ad0a3c3fc6","observation_id":"d50e75eb-12d9-417b-9c14-2a49e892f2eb","resolution":{"observed_at":"2026-08-04T22:20:08.756727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-08-13T05:22:59.274069Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-08-04T22:20:08.760164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.760164Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:4f1cb09025c94deb318468402db29a6dd1c790b99085791685ec3c51eb0f2462","observation_id":"10406f89-3dfb-4774-a6fd-e8f1e0b5ad0f","resolution":{"observed_at":"2026-08-04T22:20:08.760164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.024221Z","title":null,"venue":null,"work_id":"fd7d5d14-f540-4721-8621-950fef55bc78","year":2024},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.764112Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:deb66b0077447ba23a1134da11d893a8c185409d0f494c6f28795fcc8a6b6243","observation_id":"af939b89-e9d0-4978-858c-0c7f00239991","resolution":{"observed_at":"2026-08-04T22:20:09.029010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-06T22:41:34.301841Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20639","snapshot_observed_at":"2026-08-04T22:20:08.768240Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.768240Z"},"links":{"cited_paper":"/paper/2506.20639","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:f97ccca1d7ebe90b43060597138b09daa754290d4cf624e0cc0c8fef1c655bf5","observation_id":"4ad35dd3-0b95-467f-9b14-95345db8f117","resolution":{"observed_at":"2026-08-04T22:20:08.768240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.772667Z","title":"Huang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.772667Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:284593029ea8b36450cc3bd5a0e199c96069968b9483a1accff201caa400d4a6","observation_id":"9800470a-af6c-4111-adcf-cae611f4a994","resolution":{"observed_at":"2026-08-04T22:20:08.772667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.776663Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.776663Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:a28a9eaeff5c4f58c90a21bb0c4b5bd12ec86dd7bad7b76262849068d171939f","observation_id":"543211e5-3723-4a51-9c8f-0a0dc9d70c27","resolution":{"observed_at":"2026-08-04T22:20:08.776663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10396","last_updated":"2025-09-12T16:44:31Z","snapshot_observed_at":"2026-08-12T01:25:18.465764Z","submitted_at":"2025-09-12T16:44:31Z","title":"Inpainting-Guided Policy Optimization for Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10396","snapshot_observed_at":"2026-08-04T22:20:08.780638Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.780638Z"},"links":{"cited_paper":"/paper/2509.10396","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:bc333b587f05b2d8691cf5bc42c358e180814ca1c4c5f883c12d2f17786b50e9","observation_id":"0b3b66b2-8bfd-47d4-815e-adb0f65f1061","resolution":{"observed_at":"2026-08-04T22:20:08.780638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T09:42:22.904224Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-04T22:20:08.784761Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.784761Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:a5057ae75a8b347567ff8a4d33191e65128f6b5ade75e57b7062fc5a5f6a2aa5","observation_id":"52a38966-a95b-4c64-8bcc-0026524ed239","resolution":{"observed_at":"2026-08-04T22:20:08.784761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T22:20:08.788734Z","title":"Team, ‘‘Qwen3 technical report,’’ 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.788734Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:cc26bef81bd1c9fbd1e2c858a384954451e1c222b73da9277b4ec23d165987d0","observation_id":"80e1e70d-e95f-4710-a360-df49cf06192f","resolution":{"observed_at":"2026-08-04T22:20:08.788734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T22:20:08.792490Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.792490Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:898cad14a96ed306f64eee751bf4c9b287e77a677117b932fa5fbfea7b42da41","observation_id":"99e55432-bda8-4b63-8efc-135d52b3891e","resolution":{"observed_at":"2026-08-04T22:20:08.792490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.013867Z","title":null,"venue":null,"work_id":"b9fa337b-d1fe-4928-ab8a-023ac7d7cfdc","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.796282Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:dacdc5de524d589504fe2cd1ca8d06100e966a095403c44d35b2bc09de9b7f40","observation_id":"5a4d79b0-2947-4878-98e7-95b7ba19befe","resolution":{"observed_at":"2026-08-04T22:20:09.017340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:08.989640Z","title":"24 PREPRINT, 2026","venue":null,"work_id":"dc003ab2-5926-47c2-b668-8e9ac304d537","year":2026},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.802604Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:e310f99e03b08633a4f93fbc42ab066ba2de9ddee5d11b328488d3b6ba0067c1","observation_id":"6c0f16d9-8304-4881-917d-e3dc654cfb6d","resolution":{"observed_at":"2026-08-04T22:20:08.994240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:20:09.001501Z","title":"degree in the Interdisciplinary Program in Artificial Intelli- gence at Seoul National University, Seoul, Korea","venue":null,"work_id":"69648017-84f5-4e58-acf2-2301e9d60692","year":2021},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.799404Z"},"links":{"citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:9270d8aa99d83aeab3e867fe17a5e4d1456731ffdcce14abf9d2353b6d329875","observation_id":"ebd7d880-1ef7-4521-a9c0-cf257f86a566","resolution":{"observed_at":"2026-08-04T22:20:09.006886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T17:40:25.149645Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.01717."}