{"as_of":"2026-08-23T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0e219b2a6361910e62961f028b20e5e8b0d3cb92d75737daa321f1e755a20a6","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:17.599925Z","state":"measured"},{"denominator":146,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":146,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":66,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:55:08.290104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:51.770001Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-07T13:05:27.735188Z","title":"D1: Scaling reasoning in diffusion large language models via reinforcement learning.arXiv [cs.CL], 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22756","last_updated":"2025-05-28T18:18:49Z","snapshot_observed_at":"2026-08-21T12:01:44.013708Z","submitted_at":"2025-05-28T18:18:49Z","title":"Decomposing Elements of Problem Solving: What \"Math\" Does RL Teach?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:05:27.735188Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2505.22756"},"observation_digest":"sha256:07abd6a8d9df4534425db0d70193389048a3dc407e88525ddeb496bb0eeb65ab","observation_id":"c273ed96-ece8-4163-bc0c-c5b15126e428","resolution":{"observed_at":"2026-08-07T13:05:27.735188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-07T05:30:27.225291Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-16T08:36:19.881596Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:27.225291Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2506.07963"},"observation_digest":"sha256:2dc15bddbd2436db13969f9300c5467bb982248aa282bc4726efb9d579d8d343","observation_id":"0b9288bf-20e8-44f4-9836-6d28f7abcf2e","resolution":{"observed_at":"2026-08-07T05:30:27.225291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-07T04:53:38.908197Z","title":"d1: Scaling reasoning in diffusion large lan- guage models via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-08-16T14:29:03.952266Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:38.908197Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2506.09477"},"observation_digest":"sha256:f93426267c8404358ee745a307247915bf826dd1220d28f00f807c5ada3194be","observation_id":"b2518048-a2e4-4371-aa52-f76b644542a7","resolution":{"observed_at":"2026-08-07T04:53:38.908197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-06T22:52:33.512057Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-19T21:26:16.218628Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:33.512057Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2506.20639"},"observation_digest":"sha256:547eee415e7b3aa45ac5b388e8c84279bba41e1e67efdafa7a4ade4522d6835b","observation_id":"3edbd26d-a14d-4fcf-a186-7929a40f4206","resolution":{"observed_at":"2026-08-06T22:52:33.512057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-06T19:14:34.187851Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-20T00:45:07.405584Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:34.187851Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:29949945855a08965e0199bcd04a03dee4b7fffed3d273743dd0a54949d090ec","observation_id":"19a8724e-48b8-41ce-90f1-fbb4acafa6b7","resolution":{"observed_at":"2026-08-06T19:14:34.187851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-06T19:30:03.962801Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08018","last_updated":"2025-07-07T21:18:54Z","snapshot_observed_at":"2026-08-19T16:50:14.563666Z","submitted_at":"2025-07-07T21:18:54Z","title":"Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:30:03.962801Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2507.08018"},"observation_digest":"sha256:9dc86294d0ebea96134318eebc4ccca6e619f0ab0ba239ffc950cd5bfc0d0836","observation_id":"3d18a6d1-3a90-43f4-9b80-b01d93858697","resolution":{"observed_at":"2026-08-06T19:30:03.962801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-05T20:15:16.982709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-17T15:24:08.119769Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:16.982709Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:14de29b20547789f3d3ad9e4a6ccf7907da43d37eb48b310fe032393d5148790","observation_id":"eb227c3a-102e-453a-a558-62853cc6711d","resolution":{"observed_at":"2026-08-05T20:15:16.982709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-05T13:20:05.318712Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-16T22:18:38.054720Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:20:05.318712Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.01025"},"observation_digest":"sha256:39c3a00409fd5560307866a52600fee5a960f7eb9fd61bf0a67deb0b9e549080","observation_id":"045f5a3e-1a77-486e-ad78-38fc1ad5c844","resolution":{"observed_at":"2026-08-05T13:20:05.318712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-05T13:52:07.560114Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04475","last_updated":"2025-08-30T03:09:07Z","snapshot_observed_at":"2026-08-13T11:18:23.204744Z","submitted_at":"2025-08-30T03:09:07Z","title":"ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:07.560114Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.04475"},"observation_digest":"sha256:a5763694d31ed57093056e6812fe6fc940149fc7032793e82a84297dab5f3b35","observation_id":"9df192f7-4d0f-4ebf-a9c7-98072d348ba8","resolution":{"observed_at":"2026-08-05T13:52:07.560114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T22:56:05.264871Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06949","last_updated":"2025-09-08T17:58:06Z","snapshot_observed_at":"2026-08-19T00:56:10.667555Z","submitted_at":"2025-09-08T17:58:06Z","title":"Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:56:05.264871Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.06949"},"observation_digest":"sha256:58f90e5b0dfc7839d26663c6d8c0771ea28ee943b772392b7cdd1554ba5ea254","observation_id":"092e5c71-68a6-4abd-9416-eda5d18239af","resolution":{"observed_at":"2026-08-04T22:56:05.264871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T17:57:47.060284Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10396","last_updated":"2025-09-12T16:44:31Z","snapshot_observed_at":"2026-08-12T01:25:18.465764Z","submitted_at":"2025-09-12T16:44:31Z","title":"Inpainting-Guided Policy Optimization for Diffusion Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:47.060284Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.10396"},"observation_digest":"sha256:f65af6bd1e480b15ff2310b770bfebf3ee4cd484e8ba9868c6662a43f559fa8a","observation_id":"649721c8-ba34-491e-b8c5-74c4f6654a65","resolution":{"observed_at":"2026-08-04T17:57:47.060284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2509.20863","last_updated":"2026-05-11T17:24:47Z","snapshot_observed_at":"2026-08-17T04:28:48.321725Z","submitted_at":"2025-09-25T07:55:58Z","title":"GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T14:49:08.081740Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.20863"},"observation_digest":"sha256:68061e04806b2f03fc206405297ed035896262f0ec362b48f439e73b9bc208c3","observation_id":"746db5cb-acfe-4e8f-8f4b-6893ed5b4162","resolution":{"observed_at":"2026-05-18T14:51:30.225921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-15T15:55:08.290104Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21474","last_updated":"2026-05-29T20:19:25Z","snapshot_observed_at":"2026-08-17T20:31:34.940921Z","submitted_at":"2025-09-25T19:40:36Z","title":"d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:55:08.290104Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.21474"},"observation_digest":"sha256:b00a63e8e67a0529e376d4c56e319a1ed5c27e735377392ddd5f66f057ac8504","observation_id":"aba1a0ea-dabe-4e8d-9a6c-1e472fb10393","resolution":{"observed_at":"2026-08-15T15:55:08.290104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-15T15:51:39.024676Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning.arXiv preprint arXiv:2504.12216, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21906","last_updated":"2026-05-26T14:58:03Z","snapshot_observed_at":"2026-08-16T09:28:28.504185Z","submitted_at":"2025-09-26T05:41:45Z","title":"Error Analysis of Discrete Flow with Generator Matching","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:51:39.024676Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.21906"},"observation_digest":"sha256:27c17f2c5493167a656c13d49a94bbd120dd77a9dfbebe509610abdac8b88353","observation_id":"95c45515-7d88-4f4f-81ad-aeb64f48c3e1","resolution":{"observed_at":"2026-08-15T15:51:39.024676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-16T03:45:38.134637Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:9094763efdb45d78d1acf7952ed92d2994dfc70ab9e7f560fbc3a0261a73f7d2","observation_id":"a5de9092-09f2-49dc-a7be-d917e547756a","resolution":{"observed_at":"2026-05-18T14:16:27.799777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T11:38:54.121332Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04019","last_updated":"2026-07-23T05:31:21Z","snapshot_observed_at":"2026-08-18T02:44:54.090545Z","submitted_at":"2025-10-05T03:53:16Z","title":"Simple Policy Gradients for Reasoning with Diffusion Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:54.121332Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2510.04019"},"observation_digest":"sha256:fddd47b443c48282859a564f53d36283661583549c76e6cab5a6cda2e40a1091","observation_id":"bb894fbc-d183-45f0-9476-45dd4fe5b6fe","resolution":{"observed_at":"2026-08-04T11:38:54.121332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T11:28:11.932474Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning.arXiv preprint arXiv:2504.12216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04767","last_updated":"2026-06-23T05:37:09Z","snapshot_observed_at":"2026-08-15T06:13:18.048398Z","submitted_at":"2025-10-06T12:41:31Z","title":"ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T11:28:11.932474Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2510.04767"},"observation_digest":"sha256:b2fc642671de00089efea56f3fe297dd70e60fd54b93a19e3a2a6480a735d049","observation_id":"135b062e-3761-46b2-b702-32adbdd337b1","resolution":{"observed_at":"2026-08-04T11:28:11.932474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T10:10:10.239795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.11683","last_updated":"2026-05-29T17:51:48Z","snapshot_observed_at":"2026-08-14T01:51:20.020970Z","submitted_at":"2025-10-13T17:47:50Z","title":"Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:10:10.239795Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2510.11683"},"observation_digest":"sha256:2537201a4e92575b14aad9b8a821a6b492268b898bb1edccad68afd923cbf8fa","observation_id":"5be6dcc2-60a7-4261-bfd7-ba2f1b8900cf","resolution":{"observed_at":"2026-08-04T10:10:10.239795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2512.14067","last_updated":"2026-04-29T20:52:08Z","snapshot_observed_at":"2026-08-13T02:27:38.752907Z","submitted_at":"2025-12-16T04:12:17Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T22:29:08.669964Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2512.14067"},"observation_digest":"sha256:d6fcd5a1843666e067855f4c052f74d89db5d97f882133e71034cc3499e77d82","observation_id":"95802dca-1915-49bf-95e9-75e2fdfa9e6f","resolution":{"observed_at":"2026-05-16T22:31:19.324196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-03T09:03:21.904756Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15165","last_updated":"2026-06-08T15:43:52Z","snapshot_observed_at":"2026-08-16T03:35:41.734035Z","submitted_at":"2026-01-21T16:41:58Z","title":"The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T09:03:21.904756Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2601.15165"},"observation_digest":"sha256:08847cbfa3f17a08b3fe7cae72ecdb2adee848235def42a1da3ac7fda63a7e85","observation_id":"c8d58ff0-d20e-4ca6-8362-27c7ea08720f","resolution":{"observed_at":"2026-08-03T09:03:21.904756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-03T08:14:37.405676Z","title":"d1: Scaling reasoning in diffusion large language models via rein- forcement learning.arXiv preprint arXiv:2504.12216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17917","last_updated":"2026-06-24T06:45:45Z","snapshot_observed_at":"2026-08-14T20:11:57.426013Z","submitted_at":"2026-01-25T17:36:04Z","title":"Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:37.405676Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2601.17917"},"observation_digest":"sha256:5e0f7e29b187c6418106133dace7c1ff1e1b115091d6072f02f83e198d915da1","observation_id":"008922e3-fc70-4ff2-8602-241dee5f854f","resolution":{"observed_at":"2026-08-03T08:14:37.405676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-15T15:47:07.940876Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22450","last_updated":"2026-06-02T21:39:29Z","snapshot_observed_at":"2026-08-15T21:32:49.201991Z","submitted_at":"2026-01-30T01:36:00Z","title":"Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:07.940876Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2601.22450"},"observation_digest":"sha256:00ff371c864b79f6d3b7490cc4e8fcb727d086c0207559d87544b2c2e4c2e07d","observation_id":"829c4aa9-9e56-4e5a-9a5a-9f4620b988f6","resolution":{"observed_at":"2026-08-15T15:47:07.940876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-02T23:50:38.177661Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12586","last_updated":"2026-05-27T16:01:59Z","snapshot_observed_at":"2026-08-15T07:57:20.327359Z","submitted_at":"2026-02-13T03:56:22Z","title":"Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T23:50:38.177661Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2602.12586"},"observation_digest":"sha256:f2f7750db7d6b6ec171d55aafc64c522e0918031d835f3cc6eb827bcb946f509","observation_id":"01373c77-85f0-4e11-9502-b8aea1c6ff96","resolution":{"observed_at":"2026-08-02T23:50:38.177661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-03T02:38:07.646818Z","title":"org/abs/2504.12216","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.13319","last_updated":"2026-07-31T03:04:43Z","snapshot_observed_at":"2026-08-19T13:30:53.693078Z","submitted_at":"2026-03-04T11:43:19Z","title":"LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:38:07.646818Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2603.13319"},"observation_digest":"sha256:0b832deb65e773a8e52ee5a3f38c99a1adf5b84ebf8b76f39baeb977bc2f1752","observation_id":"6cbe0675-721d-4b0f-9d84-b9fc1fab8da3","resolution":{"observed_at":"2026-08-03T02:38:07.646818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2603.26771","last_updated":"2026-04-18T12:29:02Z","snapshot_observed_at":"2026-08-17T10:07:52.693944Z","submitted_at":"2026-03-24T13:08:10Z","title":"LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T00:45:10.685812Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2603.26771"},"observation_digest":"sha256:e3ae51156c1de45b34acf411256fac1e13633f8390f25f94e87c5936fc8e2d4f","observation_id":"ecd4746f-30f2-48ea-94a7-a15f33f490b2","resolution":{"observed_at":"2026-05-15T00:48:25.026364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2604.06491","last_updated":"2026-04-07T21:49:29Z","snapshot_observed_at":"2026-08-16T12:36:55.088753Z","submitted_at":"2026-04-07T21:49:29Z","title":"Discrete Flow Matching Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:05.398716Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2604.06491"},"observation_digest":"sha256:f013d4f81e8012b121537394c765458b7712d1276cf7378df6c9cc6f82e7e8cd","observation_id":"ef021ff4-084b-4518-9e04-33c8f5f32563","resolution":{"observed_at":"2026-05-10T23:40:51.948250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:20d1fd57b95e4e412d7400809313fa36caf401d5196e45fb7d0714dcae418756","observation_id":"bcb2d663-7f03-4a2c-8b0a-599043483cea","resolution":{"observed_at":"2026-05-11T05:45:55.662895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:480b9b2323ba18666e686e0360679dc601faf84e19eac0aeadf8014366a7474e","observation_id":"bf78d367-87dc-4715-9df8-702544f8ccea","resolution":{"observed_at":"2026-05-19T16:47:40.268262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2604.11483","last_updated":"2026-04-13T13:49:23Z","snapshot_observed_at":"2026-08-17T01:33:30.731426Z","submitted_at":"2026-04-13T13:49:23Z","title":"CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:05.070462Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2604.11483"},"observation_digest":"sha256:b652a294f055c20a79795340745351d5d1c9cb2954cbcf6cf8a217651b019af4","observation_id":"91ab6570-e043-4ba3-a0cf-71800b2e7de7","resolution":{"observed_at":"2026-05-11T09:46:08.304715Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.02263","last_updated":"2026-05-27T00:04:34Z","snapshot_observed_at":"2026-08-13T01:30:07.790234Z","submitted_at":"2026-05-04T06:17:49Z","title":"Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T18:38:07.949718Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.02263"},"observation_digest":"sha256:d2f61b35439d2cd83129f7f552b28e338519cb14c55539866f480f5a257fafba","observation_id":"e8e19a53-fed5-49ae-8e60-3657a4156917","resolution":{"observed_at":"2026-05-09T06:15:39.695201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.02263","last_updated":"2026-05-27T00:04:34Z","snapshot_observed_at":"2026-08-13T01:30:07.790234Z","submitted_at":"2026-05-04T06:17:49Z","title":"Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:59:02.580783Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.02263"},"observation_digest":"sha256:4860bad87aff30c65fc28bda6253371c411f2ac43c39de647e125a7716cd3a06","observation_id":"d324d6d3-6529-43b6-a5cf-bef1d948b33e","resolution":{"observed_at":"2026-07-01T00:25:10.342986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-11T16:28:12.523302Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-08T16:06:47.108382Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:b5bfcf6cf183cd743fcfb7d4bff2c4e0fc09999786a1bfc8df2265ed09128ea1","observation_id":"b492a0da-1eb2-442e-9149-8b828358f3d6","resolution":{"observed_at":"2026-05-11T18:26:08.231181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-11T16:28:12.523302Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":2},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-13T01:48:36.105389Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:d4fdc3cacdf38c4dbfa33e868eab216fd40ace81fe99cc93f6d57280b8bd6c9d","observation_id":"aa7ebc25-e541-4844-a4ba-e03d2b854d86","resolution":{"observed_at":"2026-05-13T01:52:05.402267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.06548","last_updated":"2026-05-07T16:44:56Z","snapshot_observed_at":"2026-08-14T20:14:56.366023Z","submitted_at":"2026-05-07T16:44:56Z","title":"Continuous Latent Diffusion Language Model","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-08T10:04:09.646578Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.06548"},"observation_digest":"sha256:75215ba5941744285e3278e6aedd883ad29a1647ab4e5187d813753655f63785","observation_id":"71595bb9-060a-46a1-88b4-2766891b5934","resolution":{"observed_at":"2026-05-11T20:11:11.027880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.09291","last_updated":"2026-05-10T03:36:49Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:36:49Z","title":"dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T03:52:05.779559Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.09291"},"observation_digest":"sha256:2d8157db1fb28c6777a80b39dde3c384f04565ae5c03ba11558610d452eebe21","observation_id":"13fbf4fb-6809-4a55-889c-425d04698e0b","resolution":{"observed_at":"2026-05-12T06:51:29.785564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.09536","last_updated":"2026-05-10T13:38:53Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T13:38:53Z","title":"TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:03.570848Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.09536"},"observation_digest":"sha256:ba632aea3432505e26ed83fe56333e77740728e445f20a31eaf1aee74e4dadb1","observation_id":"b2fa284c-7fbb-4230-b0b8-81281968b923","resolution":{"observed_at":"2026-05-12T05:46:25.829169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.10218","last_updated":"2026-05-11T08:58:40Z","snapshot_observed_at":"2026-08-15T13:10:53.017112Z","submitted_at":"2026-05-11T08:58:40Z","title":"Relative Score Policy Optimization for Diffusion Language Models","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:42.196931Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.10218"},"observation_digest":"sha256:dd31912fc2d6f44f1c19592df0c464b5e26fb6d8b491062231a8d5b435036b7f","observation_id":"8055c6b4-1250-471a-bf0a-91d9a373dc56","resolution":{"observed_at":"2026-05-12T06:56:29.654677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.11854","last_updated":"2026-05-18T06:27:28Z","snapshot_observed_at":"2026-08-01T14:51:14.896942Z","submitted_at":"2026-05-12T09:39:06Z","title":"Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:51:27.920803Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.11854"},"observation_digest":"sha256:27e76c9f2d835ee329919893ca0ce69bcda6f098cdc358d00e66ba2ca386c014","observation_id":"c5e585f8-aaf9-4ed1-85a4-b7b2fe0f681b","resolution":{"observed_at":"2026-05-13T05:52:22.009936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.11854","last_updated":"2026-05-18T06:27:28Z","snapshot_observed_at":"2026-08-01T14:51:14.896942Z","submitted_at":"2026-05-12T09:39:06Z","title":"Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T22:59:53.100421Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.11854"},"observation_digest":"sha256:bae023106ea85e82064d75f22f14f33feb7c4b7b5d5ee5941ae9754ad02788f8","observation_id":"c30e4d21-cab1-445d-8072-e61f546b1df7","resolution":{"observed_at":"2026-05-20T23:03:50.842115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:a84cbff3f0c907232c263e53b1bcefee751b6a75bb9029d4ca887f8159104893","observation_id":"2ed526fd-673b-4177-b9cd-5df196a68392","resolution":{"observed_at":"2026-05-15T03:14:52.710028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.16842","last_updated":"2026-05-16T06:59:54Z","snapshot_observed_at":"2026-08-15T19:41:50.414367Z","submitted_at":"2026-05-16T06:59:54Z","title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:03.005508Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.16842"},"observation_digest":"sha256:fa08d01846ffbb0a7ba14739d1f3176d970f7f549e5d915ea601094b526c0b36","observation_id":"045966a3-6947-4a08-be20-0d284b7cb4ce","resolution":{"observed_at":"2026-05-19T21:22:48.533291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.16941","last_updated":"2026-05-16T11:27:40Z","snapshot_observed_at":"2026-08-16T04:35:29.037809Z","submitted_at":"2026-05-16T11:27:40Z","title":"Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T20:41:48.063871Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.16941"},"observation_digest":"sha256:4756154fb294d385aa88b9128d99144b97cecfdc54c03b23dc5e495952012479","observation_id":"82863feb-1c3b-4a03-8c7d-2eac0d71b230","resolution":{"observed_at":"2026-05-19T20:42:46.130915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.17174","last_updated":"2026-05-16T22:18:04Z","snapshot_observed_at":"2026-08-15T08:44:08.288511Z","submitted_at":"2026-05-16T22:18:04Z","title":"Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T14:03:45.869373Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.17174"},"observation_digest":"sha256:ccbe5777e807bb785a23f86e9a3a9a5cec0326ad7fda8a280bf67992a79f8ee8","observation_id":"85089373-950e-48ae-a8f3-c1b02776d4e3","resolution":{"observed_at":"2026-05-20T14:08:21.234593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.18165","last_updated":"2026-05-18T10:09:10Z","snapshot_observed_at":"2026-08-13T02:41:01.080646Z","submitted_at":"2026-05-18T10:09:10Z","title":"Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:05.695349Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.18165"},"observation_digest":"sha256:667116cb6cca0a6e2bca24112c4d17c86fa0fba22e16e2dd46da020905853332","observation_id":"e7825b23-071e-4e58-bd64-9b5d22ed667b","resolution":{"observed_at":"2026-05-20T13:13:17.890954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.23346","last_updated":"2026-05-22T08:06:52Z","snapshot_observed_at":"2026-08-19T06:30:08.833750Z","submitted_at":"2026-05-22T08:06:52Z","title":"Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-25T05:30:15.053277Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.23346"},"observation_digest":"sha256:2030a9f4c3972df505a21d87f043d8b2a8a83b6cb7b66b6f6fa33f819a8e4f1d","observation_id":"aa982a74-efe6-4c88-be30-2ad996f62d48","resolution":{"observed_at":"2026-05-25T05:30:22.378669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.25638","last_updated":"2026-06-05T03:07:08Z","snapshot_observed_at":"2026-08-19T21:16:35.893286Z","submitted_at":"2026-05-25T09:39:13Z","title":"Reinforcement Learning from Denoising Feedback","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T21:20:32.039699Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.25638"},"observation_digest":"sha256:a1f6a104f72dd5b9535f41873a5303ac8d2cd0155af07cd9eb7edd42786067bf","observation_id":"b96407f0-617f-4c14-8342-e1a05269d207","resolution":{"observed_at":"2026-06-29T21:23:58.875184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:94c7c267abe8440bf2f47cea0d25abcb084310f7e765f9332a515e8547daa7c7","observation_id":"effaf0ab-56ba-4012-9596-4bedd1f16d6f","resolution":{"observed_at":"2026-06-29T08:53:16.405730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.30753","last_updated":"2026-05-29T02:29:28Z","snapshot_observed_at":"2026-08-13T05:21:03.135780Z","submitted_at":"2026-05-29T02:29:28Z","title":"Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:51:36.013299Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.30753"},"observation_digest":"sha256:82e5a87f96ff9a934e72a3e04f4de1ee825e8e3fa6ad8af93b44bda4ada7695d","observation_id":"d901172b-d729-4545-af30-2f793b5f2ce2","resolution":{"observed_at":"2026-06-28T22:52:44.924892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:976fe45744ae004c8fc8b791b7e1967741891542cea4baeb9cdf1986f0a25b0e","observation_id":"e39905c6-0a80-403e-992b-40487d217b6b","resolution":{"observed_at":"2026-06-28T22:52:45.087047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.04027","last_updated":"2026-06-01T18:10:21Z","snapshot_observed_at":"2026-08-14T02:58:22.489089Z","submitted_at":"2026-06-01T18:10:21Z","title":"MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T13:43:51.171443Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.04027"},"observation_digest":"sha256:86078219eef0160f86dc3c564d1700095f9358996fb5bb3528484e1d1f5bfebb","observation_id":"a1c0a56b-9b80-4d2b-bd89-5292295bea58","resolution":{"observed_at":"2026-07-01T23:56:24.449776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.04535","last_updated":"2026-06-03T07:18:23Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T07:18:23Z","title":"Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-28T06:20:27.041099Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.04535"},"observation_digest":"sha256:3c57f5e4cbdc730b409cb407ff84a14036e6656be452dc791a38e3afd32a4a97","observation_id":"fdccb9c1-9013-4bf4-ba2b-1b9e00b442f7","resolution":{"observed_at":"2026-07-02T08:06:48.406548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.08501","last_updated":"2026-06-07T07:59:55Z","snapshot_observed_at":"2026-08-16T13:14:06.969431Z","submitted_at":"2026-06-07T07:59:55Z","title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:21.493677Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.08501"},"observation_digest":"sha256:ac0c8823521162b56a547a64120f343dd2588da58f65b207302257efe43252d8","observation_id":"5ea81465-96df-4296-bbc6-3c48fb0fb2c7","resolution":{"observed_at":"2026-07-02T22:57:26.600633Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.12232","last_updated":"2026-06-10T15:41:26Z","snapshot_observed_at":"2026-08-06T17:07:15.388910Z","submitted_at":"2026-06-10T15:41:26Z","title":"Re-evaluating Confidence Remasking in Masked Diffusion Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:25:09.995616Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.12232"},"observation_digest":"sha256:239f4c1f734d2e5e9546b2c14091ec3a4077ae2708b952900d016fb8705c1c54","observation_id":"ed32f20b-8433-4803-96e0-2d4069d3355d","resolution":{"observed_at":"2026-07-03T09:17:48.817887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.12273","last_updated":"2026-06-10T16:14:23Z","snapshot_observed_at":"2026-08-12T12:25:57.043879Z","submitted_at":"2026-06-10T16:14:23Z","title":"Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T09:34:02.484344Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.12273"},"observation_digest":"sha256:5731eec3c62378fdbb8ec92ac177ead257b69ebff4183b7fe55da03017878953","observation_id":"d2cde3bc-a340-434b-89c0-e95e3c97ec0c","resolution":{"observed_at":"2026-07-03T11:28:04.442327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-14T19:03:44.084753Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:1bd3923246b0844426b3cfbb156fddd05dd8a2782dc559e5d9c64254fcdd6986","observation_id":"0172605a-8bac-4417-a5f9-dfbc82e844bb","resolution":{"observed_at":"2026-07-03T14:18:22.953989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.18195","last_updated":"2026-06-25T16:08:43Z","snapshot_observed_at":"2026-08-20T13:57:11.348124Z","submitted_at":"2026-06-16T17:24:57Z","title":"Learning from the Self-future: On-policy Self-distillation for dLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:20:14.919054Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.18195"},"observation_digest":"sha256:7f14b4bdd6a8f08fccaae6f1c0817b48123c98fcdcc268a8bc34c88bdf45c3e8","observation_id":"885ff215-a1bb-4c53-9e2d-76a187028fef","resolution":{"observed_at":"2026-07-03T20:28:55.657214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.18394","last_updated":"2026-06-25T06:18:29Z","snapshot_observed_at":"2026-08-12T14:23:00.936362Z","submitted_at":"2026-06-16T18:37:32Z","title":"JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T00:42:52.485768Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.18394"},"observation_digest":"sha256:9b8f9436eede596d7e19e5cae96ebe213008b0df11d5993ad1e66ce7611147ef","observation_id":"5da9227b-31af-4665-9fb3-b6ef591817f8","resolution":{"observed_at":"2026-07-03T21:18:59.324057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2606.25331","last_updated":"2026-06-24T02:51:36Z","snapshot_observed_at":"2026-08-14T14:03:12.603128Z","submitted_at":"2026-06-24T02:51:36Z","title":"Improved Large Language Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-25T21:34:45.620481Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2606.25331"},"observation_digest":"sha256:82e4f4fcea91c6eb6d93dc401da2924249a4b6a451729a3e5c1617206970b665","observation_id":"b93a533f-2f28-471f-9e81-03cdc95ea587","resolution":{"observed_at":"2026-07-04T19:20:05.604715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-12T03:56:26.770729Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03236","last_updated":"2026-07-03T11:45:21Z","snapshot_observed_at":"2026-08-13T00:18:22.569383Z","submitted_at":"2026-07-03T11:45:21Z","title":"TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T03:56:26.770729Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.03236"},"observation_digest":"sha256:57b74a7b0aefdac76407ec1d95b68ce4868c52da4e874c22a1b73d6f0b654a16","observation_id":"34db73ff-5bea-4beb-9c8e-d6ebdfcdd98e","resolution":{"observed_at":"2026-07-12T03:56:26.770729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:34edf4c3cd4871fcddfc87e2a067d72b76dec9b1a2cea72dc84920f6b195281c","observation_id":"d68e3dd8-7361-4025-8fea-4b6ebb70d01c","resolution":{"observed_at":"2026-07-11T03:07:51.796395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-02T06:02:13.359209Z","title":"arXiv preprint arXiv:2504.12216 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13188","last_updated":"2026-07-14T18:39:29Z","snapshot_observed_at":"2026-08-15T08:38:16.056150Z","submitted_at":"2026-07-14T18:39:29Z","title":"Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-02T06:02:13.359209Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.13188"},"observation_digest":"sha256:210fa1d964cb37b821b2a9be79afb75d1e03fe557f5bce6d9fb7f000c24cbf61","observation_id":"e5d9661a-e64f-4502-905a-142f127982ae","resolution":{"observed_at":"2026-08-02T06:02:13.359209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-01T20:54:03.441397Z","title":"arXiv preprint arXiv:2504.12216 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16528","last_updated":"2026-07-17T22:09:01Z","snapshot_observed_at":"2026-08-18T01:38:13.939880Z","submitted_at":"2026-07-17T22:09:01Z","title":"Hierarchical Domain Generalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T20:54:03.441397Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.16528"},"observation_digest":"sha256:74c5ce57671af2977b5ed7810b5143e364cfaef104078bd5075ecf975056f56c","observation_id":"f14f2bef-06a2-4359-881b-ba19f5f745c7","resolution":{"observed_at":"2026-08-01T20:54:03.441397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-01T19:45:10.653622Z","title":"arXiv preprint arXiv:2504.12216 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16872","last_updated":"2026-07-18T16:25:17Z","snapshot_observed_at":"2026-08-15T15:17:55.732232Z","submitted_at":"2026-07-18T16:25:17Z","title":"Trace-Based On-Policy Distillation for Masked Diffusion Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T19:45:10.653622Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.16872"},"observation_digest":"sha256:15a724135106e3f525cf7af3886205d53d7cf8ba8f7dc6fcb8c822ebd3c64f06","observation_id":"c1fdbb62-14a8-4a64-b749-caff434a2fec","resolution":{"observed_at":"2026-08-01T19:45:10.653622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-01T14:25:39.226894Z","title":"arXiv preprint arXiv:2504.12216 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26504","last_updated":"2026-08-09T19:34:25Z","snapshot_observed_at":"2026-08-14T06:58:43.954033Z","submitted_at":"2026-07-29T06:09:12Z","title":"From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T14:25:39.226894Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.26504"},"observation_digest":"sha256:154ea906030fa9eb71efc9ec307441dbc1098206b0697b489cedef39bbf97a32","observation_id":"9519f0b2-c9e8-42f2-af52-d98a6fc5a3be","resolution":{"observed_at":"2026-08-01T14:25:39.226894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-05T00:36:13.011336Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00605","last_updated":"2026-08-01T11:48:25Z","snapshot_observed_at":"2026-08-15T23:38:51.680962Z","submitted_at":"2026-08-01T11:48:25Z","title":"Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:36:13.011336Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2608.00605"},"observation_digest":"sha256:4dcd7f48abab41a3c0695ef1015b70552e0a232cb004ed2bb37df37b068517ec","observation_id":"7e433f52-9bbe-44e5-b545-88135a8b4f41","resolution":{"observed_at":"2026-08-05T00:36:13.011336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-08-04T03:25:21.230481Z","title":"backCreating","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02602","last_updated":"2026-08-03T17:59:50Z","snapshot_observed_at":"2026-08-15T07:41:49.089433Z","submitted_at":"2026-08-03T17:59:50Z","title":"AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T03:25:21.230481Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2608.02602"},"observation_digest":"sha256:67a2716606683e7d0f855ae046cc24b839c013299488d7197ae99f5ffb5d08a5","observation_id":"dcbaa409-4c60-4516-91f6-2a0c9657e95d","resolution":{"observed_at":"2026-08-04T03:25:21.230481Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12216/citation-record","integrity":"/paper/2504.12216/integrity","json":"/paper/2504.12216/citation-record.json","paper":"/paper/2504.12216"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:40:17.180650Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.180650Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ed1db1b3f53aaaa0858487a4a8edf37bec0a56a1b0b10b101ee1041087aa0555","observation_id":"6381cf53-f991-4ef0-baa5-a36fd6f69ce0","resolution":{"observed_at":"2026-08-16T12:40:17.180650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-16T12:40:17.186603Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.186603Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:e77a2e41016e4092ae37f8a28b0b7bfdc2e9358cca40610651015398b7c51cf4","observation_id":"41c95ad5-111b-4485-81bc-33061805b29a","resolution":{"observed_at":"2026-08-16T12:40:17.186603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.912316Z","title":"Arel’s sudoku generator","venue":null,"work_id":"ad5775b0-3281-4022-9626-9ee29ff83c2b","year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.192201Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:dcee9475e7b6825d8545fc999dfc36e8ffc60a1b41b9c5a2844b4e2cba5cb20d","observation_id":"297a88e9-9bd5-477d-98fe-c6c2d3802edc","resolution":{"observed_at":"2026-08-16T12:40:18.917061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-14T13:55:40.999046Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-16T12:40:17.197304Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.197304Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:8f0566dd1a9af9be0514c759f12ec97b346b5bb31f87eaa483fc1ef8e717c326","observation_id":"86840d8a-b479-4822-9e47-bb87b75357c5","resolution":{"observed_at":"2026-08-16T12:40:17.197304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.202906Z","title":"Structured denoising diffusion models in discrete state-spaces.Advances in neural information processing systems, 34:17981–17993, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.202906Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c9af322aeb4f66362de0c77ee782a67c30a49dd92f28edd411d78868456bfa2e","observation_id":"d43724d7-8f52-4286-9629-296b750408cb","resolution":{"observed_at":"2026-08-16T12:40:17.202906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T12:40:17.208315Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.208315Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:68a1deb1a584be533c7859ab87cba98e2a6b6ca53a7789e2562aa2aa70ea6d47","observation_id":"3b7b51c4-446b-4aad-80fc-5994154c89ca","resolution":{"observed_at":"2026-08-16T12:40:17.208315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T12:40:17.214457Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.214457Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:95833c798047de20230b407a112ebd6f53a89c7c6754b67110a6d3e92427fc00","observation_id":"09327b48-f87b-4b02-bf27-8157489bdb79","resolution":{"observed_at":"2026-08-16T12:40:17.214457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T12:40:17.219583Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.219583Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c37b0a79dbc5be32a8fb69eed34a1c1f0fa1f650f13a40522549671aa4075f80","observation_id":"f4954ca3-bbd5-4b19-b915-7a7aa415bb3f","resolution":{"observed_at":"2026-08-16T12:40:17.219583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-16T12:40:17.224741Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.224741Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c6fb2540cfa6a36e388a8dca74e256e5bd2c9c6426bd07c2ea18c7ac73a22c18","observation_id":"f95a0137-19cb-4991-950d-80541c9d01e1","resolution":{"observed_at":"2026-08-16T12:40:17.224741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T12:40:17.229774Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.229774Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:64969d542efcd1ce5ee5efb5ffc0b40fc135dc7bf2ab2b5ee1c1c9f03f2ffa56","observation_id":"97f0e569-eb63-4dda-bd71-a0c032d4eeac","resolution":{"observed_at":"2026-08-16T12:40:17.229774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.235069Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.235069Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:3e482beaa45d02be0a4308cd0c63b733f88ddbe5fc0f8426f8b72f9aee2ade05","observation_id":"d2cb5f6a-76de-4c37-b3de-309b0729e9a2","resolution":{"observed_at":"2026-08-16T12:40:17.235069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.875175Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"0674d367-f25f-4749-8afb-45178341135a","year":2019},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.240025Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c2969fa2f995e355b3f6f30c52a3cab0168723ca69e7739dae6d93db885c8f75","observation_id":"9684b0a4-13b4-4edd-a669-0681b0806c74","resolution":{"observed_at":"2026-08-16T12:40:18.880614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:40:17.244881Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.244881Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:643cbb8c57db296f5ff8660a90020cef9b1e4ceb5b3c7498a92732e005e3748e","observation_id":"82c4f524-003b-486f-9924-86f0bb52b705","resolution":{"observed_at":"2026-08-16T12:40:17.244881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T12:40:17.249805Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.249805Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c1a584f9f7cc33700ee8779d6e2040d8c3ba7bc4982b9c711d016a32fd80c1c7","observation_id":"aed3e921-9a1d-4c03-862b-3803fd15b4a2","resolution":{"observed_at":"2026-08-16T12:40:17.249805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.254790Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.254790Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:b4b66eaa74a8848fb1f3545f8e6357538487981d4a53c0a9671041ec49154a83","observation_id":"338619f6-e7ac-42a5-81ad-0fbd1ae6d17f","resolution":{"observed_at":"2026-08-16T12:40:17.254790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.259800Z","title":"Likelihood-based diffusion language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.259800Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:42aef0aa7628fd516095fbd1b2602637ed0ed6902b9e63da221a1cbd2bc89c28","observation_id":"47a4dae1-f08e-4f1b-9533-9045010858d8","resolution":{"observed_at":"2026-08-16T12:40:17.259800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T12:40:17.265034Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.265034Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:edf91c731acbed519ed45e8d183571ce70814e7318cdbd31521370d1212180df","observation_id":"6723fde0-02a3-4090-b4b3-83ca4bfc4281","resolution":{"observed_at":"2026-08-16T12:40:17.265034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T12:40:17.270595Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.270595Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:69df88e497601d35efeef686239ae86bbab3eaec27edd482301aa025f2c25e46","observation_id":"f96cbd07-d1ee-432f-a643-bb3b6a750f4c","resolution":{"observed_at":"2026-08-16T12:40:17.270595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.275782Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.275782Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:b96959e09f003f1789c7629a6c5ace3c770dba9f128596d9134e497240efa431","observation_id":"0a042447-9413-4a95-80e9-4bc6460c3dbb","resolution":{"observed_at":"2026-08-16T12:40:17.275782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.826571Z","title":"Mercury: Ultra-fast language models based on diffusion","venue":null,"work_id":"6e008bd2-67b4-48a7-b055-4d5c056cf240","year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.281566Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:202c8b4bc873d4009dddc66cb156b3a8cb0bd6a263fe5c09a5631c4a412dbc75","observation_id":"6e943232-8d48-4f25-8838-9ed52417f60c","resolution":{"observed_at":"2026-08-16T12:40:18.831911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.810734Z","title":"Numina- math","venue":null,"work_id":"476c388e-d6db-4e5f-a624-4b50c35eda53","year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.287475Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:1a360bfa0afa87436daa5c3f5ecb7884ace1e9b3ff5b39068c98abba853e7d69","observation_id":"8bc39d61-55e2-47c6-9d32-43e6ee4e52ba","resolution":{"observed_at":"2026-08-16T12:40:18.815509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-19T17:31:23.637137Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-16T12:40:17.292838Z","title":"Remax: A simple, effective, and efficient reinforcement learning method for aligning large language models.arXiv preprint arXiv:2310.10505, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.292838Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:1caf0fdd0d8301a025a2177084d64906fd66f157b106a9e75eda71b106ea1df7","observation_id":"e0aff48d-c51c-4efb-a865-de44583af816","resolution":{"observed_at":"2026-08-16T12:40:17.292838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-16T12:40:17.298081Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.298081Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:5b66aa5a9b2d060e70afa7bb5b66ba3b002f0d8d7311696ca04c34f51fb6ae82","observation_id":"4662a7e3-c73c-4f43-ae7b-26fad1e489d1","resolution":{"observed_at":"2026-08-16T12:40:17.298081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-16T12:40:17.303344Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.303344Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:84371361b1c6bd0cece2bee74270c2fef0ded98ba80ccd3a198d27eb3b35a5ae","observation_id":"466fcac1-6e1e-4234-90bb-51e8681ccaf1","resolution":{"observed_at":"2026-08-16T12:40:17.303344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T12:40:17.308299Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.308299Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:8f796c06c6425aaf674f84bc335a1b7aff60d2b209f2376843a43fa3aaa9d3d0","observation_id":"20a14b4c-7804-4479-8283-411194561ef7","resolution":{"observed_at":"2026-08-16T12:40:17.308299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.794114Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":"21303c94-bf1b-4976-8102-3e238808c0b5","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.313755Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:2046b198f9085abab6bb7074b3aa1991589d2fa30ece2d0a9ad9706be86d2be2","observation_id":"a23b65a1-729d-40bd-96a5-207668787007","resolution":{"observed_at":"2026-08-16T12:40:18.799521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01054","last_updated":"2025-01-02T04:33:31Z","snapshot_observed_at":"2026-08-19T14:20:49.505172Z","submitted_at":"2025-01-02T04:33:31Z","title":"Dynamic Scaling of Unit Tests for Code Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01054","snapshot_observed_at":"2026-08-16T12:40:17.319000Z","title":"Dynamic scaling of unit tests for code reward modeling.arXiv preprint arXiv:2501.01054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.319000Z"},"links":{"cited_paper":"/paper/2501.01054","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ab69b2be25c43cdada41fbcffb5168dfa57826e892fb7d4e9c3804d7ce25b85d","observation_id":"04303571-57fc-47ca-9143-f04c6c1651cd","resolution":{"observed_at":"2026-08-16T12:40:17.319000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-16T12:40:17.323935Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.323935Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ef5596bfd192d5cd27871861f755c2fd6515abf39edb2a3f609579085aac1844","observation_id":"1445326c-c63e-4601-b6c7-63e2906dc7c6","resolution":{"observed_at":"2026-08-16T12:40:17.323935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-19T22:10:29.832011Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-16T12:40:17.329389Z","title":"Scaling up masked diffusion models on text.arXiv preprint arXiv:2410.18514, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.329389Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:269b345ae8f2baab67cc9a06a530a1c97e6ecf2c83aa5d2764edb5418ea69471","observation_id":"a3bd84b3-ae33-47d4-990d-bb405721cc1d","resolution":{"observed_at":"2026-08-16T12:40:17.329389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-22T07:09:34.819168Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-16T12:40:17.334629Z","title":"Large language diffusion models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.334629Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:2a38b9946b9f60e725b66919811d62c1ee358c32403e28b74a50e4aa56608765","observation_id":"3a713c4a-70f5-4a54-b072-aad0428fabd5","resolution":{"observed_at":"2026-08-16T12:40:17.334629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.339693Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.339693Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:b5b7d9a9ad9903a8d3c7adb48a6bfb0df5d749e4e5f875f056f47d7105176c62","observation_id":"dfd2c49f-b980-4ede-97db-647bb01a1c44","resolution":{"observed_at":"2026-08-16T12:40:17.339693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-16T12:40:17.344490Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.344490Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:bb181c44daf74e98b7ac3d1387eb4e8618a349d1b96a10d5b914f8007933df41","observation_id":"6b981c54-9763-40bd-b3ed-f1940f08ed31","resolution":{"observed_at":"2026-08-16T12:40:17.344490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.350007Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.350007Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:3b1d13e41e872a2cce2ec3b80a63a0a4cdd8d35299092a6ec719e4970f85d686","observation_id":"fafa3030-0956-46d6-a3a2-0a8aaf9dbab7","resolution":{"observed_at":"2026-08-16T12:40:17.350007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.354830Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.354830Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:a4152ebbb237844b5106711f68901974cd148c0f0e86fd377647e390dcfc65ee","observation_id":"4aa5b1c8-2d52-49b3-a03b-e8a2f8c4bf99","resolution":{"observed_at":"2026-08-16T12:40:17.354830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.359916Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.359916Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:34c30f3727fa205336f5333eb6e6ddac04860fc31c35012a6821bf8a770de713","observation_id":"661f411b-b526-4cad-877a-8e35b2d83515","resolution":{"observed_at":"2026-08-16T12:40:17.359916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.364560Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.364560Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:0bea386b056b9d4df735c20a5ee8742692757f0ddcf700cbe4ad4b2f3ca75540","observation_id":"6df3e1f3-6268-4ba4-8396-cf36daeec210","resolution":{"observed_at":"2026-08-16T12:40:17.364560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T12:40:17.369364Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.369364Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:62978bf9b0bfbeef440b6753acc9fae9b77ebbf72bc5b996353e114da1e68fca","observation_id":"5953b8ad-d60c-445f-9f4d-5a6865cacb27","resolution":{"observed_at":"2026-08-16T12:40:17.369364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T12:40:17.374163Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.374163Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:cd2aa5098486c0461de66903d9fe62284161657def1caff6e71e54fbf1f1e009","observation_id":"035ddd47-a8d0-417b-92e9-b5b59e4ac685","resolution":{"observed_at":"2026-08-16T12:40:17.374163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.378979Z","title":"Simplified and generalized masked diffusion for discrete data.Advances in neural information processing systems, 37:103131–103167, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.378979Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:f0b21a299b6176ea9f95dd75259c33832685d080bffdb49d6e13d68d098dfc8c","observation_id":"760fa881-1ade-4537-9e13-5d4cf4cc6016","resolution":{"observed_at":"2026-08-16T12:40:17.378979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.383902Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.383902Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:e7276d987bd1b039fd4bb3a3c6adb04297a7fd7b079ecc08ae44a7a78da9e4fc","observation_id":"05d97217-6205-4546-9c86-32c8a3731329","resolution":{"observed_at":"2026-08-16T12:40:17.383902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-16T12:40:17.388670Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.388670Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:f44af4ff50db9407201ccbfeac390abe067e3de17eadcdb15724c8565be469a5","observation_id":"bf36f640-7466-4da4-874c-361fe70e8214","resolution":{"observed_at":"2026-08-16T12:40:17.388670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.393652Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.393652Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:5007c072fa2bb10a828b370ca21e7772c086c9aa20b4a7cde3d13fa038802065","observation_id":"2363d779-efe3-49f6-880d-434be0f2981b","resolution":{"observed_at":"2026-08-16T12:40:17.393652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.695783Z","title":"Trl: Transformer reinforce- ment learning.https://github.com/huggingface/trl, 2020","venue":null,"work_id":"99dbf217-b1cd-45cd-945b-bd50bb0ae86f","year":2020},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.398643Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:72d726ed8a1ebb60dd119f9ceb8a75264d565d137f34d775a8e52326f6fa3c82","observation_id":"4ff689cb-05ca-4bf3-8696-3e672aa2b41a","resolution":{"observed_at":"2026-08-16T12:40:18.701065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.403290Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine learning, 8:229–256, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.403290Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:e1a3990ad94ec1f8eb360526349e2391fbe24610af84a087695f61f7cf5b8aa5","observation_id":"e7838f69-76e7-4f63-a88c-d82646333a98","resolution":{"observed_at":"2026-08-16T12:40:17.403290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-16T12:53:05.855883Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-16T12:40:17.407801Z","title":"Kodcode: A diverse, challenging, and verifiable synthetic dataset for coding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.407801Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:beabc9e1ba5dcfa8c326f09aac8baf5e12bf35b1cd79f4e35a53ecb5b464e843","observation_id":"006348a4-84bb-4d76-a353-8d1b19d0fe37","resolution":{"observed_at":"2026-08-16T12:40:17.407801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14157","last_updated":"2025-02-18T03:52:31Z","snapshot_observed_at":"2026-08-19T00:02:48.084540Z","submitted_at":"2024-10-18T03:48:53Z","title":"Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14157","snapshot_observed_at":"2026-08-16T12:40:17.412697Z","title":"Beyond autoregression: Discrete diffusion for complex reasoning and planning.arXiv preprint arXiv:2410.14157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.412697Z"},"links":{"cited_paper":"/paper/2410.14157","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:77147940521dc26e2f8cdd82d8577fb51ebb4d1845e3c6a531f581626b49daa7","observation_id":"de7b6fb5-3b49-4fca-a6c4-e5159b94a4ec","resolution":{"observed_at":"2026-08-16T12:40:17.412697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07754","last_updated":"2024-12-05T06:49:06Z","snapshot_observed_at":"2026-08-16T14:19:17.436998Z","submitted_at":"2024-02-12T16:23:28Z","title":"Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07754","snapshot_observed_at":"2026-08-16T12:40:17.417620Z","title":"Diffusion of thoughts: Chain-of-thought reasoning in diffusion language models.arXiv preprint arXiv:2402.07754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.417620Z"},"links":{"cited_paper":"/paper/2402.07754","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:805bc04db11f98599df24ac674cb3ad44b528e4eae30f4bfcde55f7f5758f27e","observation_id":"ac86e258-44d0-4dd0-8dfd-b4ceb5f9ef82","resolution":{"observed_at":"2026-08-16T12:40:17.417620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.667588Z","title":"Dream 7b, 2025","venue":null,"work_id":"b1d78aba-96bf-4701-b079-a4611d343c95","year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.422743Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:a13ab2d2a41c9c9ac779f90a2b22e165dc9157f8b5e16f70f3ddb7addadcf217","observation_id":"a3fd64f8-25e1-4b64-8c27-bc7da95116f0","resolution":{"observed_at":"2026-08-16T12:40:18.673081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-16T12:40:17.427252Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.427252Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ae1266a0a28d6947ffe8d736ad39f5e286e08d4992830daec4dc2829a5c8f848","observation_id":"4fea2688-ab01-4b89-9261-10e8d52d5b40","resolution":{"observed_at":"2026-08-16T12:40:17.427252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-13T10:57:13.012119Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-16T12:40:17.432213Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.432213Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:b3103f1c412d46edff1c7cab6352acd6d5e283f915961ecc4d8154dccb4cd94c","observation_id":"5b9c8bac-0899-4a33-8d84-64664c99f524","resolution":{"observed_at":"2026-08-16T12:40:17.432213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:17.437285Z","title":"Fine-tuning discrete diffusion models with policy gradient methods.arXiv preprint arXiv:2502.01384, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.437285Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:0af37621b36695f80298b43016e8deaa31100f268c117b41f190857753ba0acf","observation_id":"e1f7787c-cd72-4985-9064-bf3516b25a7c","resolution":{"observed_at":"2026-08-16T12:40:17.437285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.651663Z","title":"Lima: less is more for alignment","venue":null,"work_id":"29a3bb83-9f5d-48ce-b587-1011d84b1ed6","year":2023},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.441974Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:179a531b11398af3cdedb775addf75b58ba7ed2988547c0ab5f18e657d14a2bc","observation_id":"ddaa17c0-fd48-41e8-9179-b7e3d98c1fcc","resolution":{"observed_at":"2026-08-16T12:40:18.656973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.635317Z","title":"Simply put, at any timestep, the probability that a token transitions to the masked state isαt","venue":null,"work_id":"210cc3a5-b0f9-4b81-94ed-fb16731d214f","year":2000},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.447066Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:85367a96e8e74439e028d79cd753a8a72279342bc0d673e3b7154f64d15efa3a","observation_id":"620bcf72-3eca-4eaa-a1b9-eca5506ead84","resolution":{"observed_at":"2026-08-16T12:40:18.640770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.617952Z","title":null,"venue":null,"work_id":"dcc030b7-8f6e-484a-9286-600af500e0c5","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.452345Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:7b19523fe69ef7cb474d398a4faafb0f5e79ea070995d25f3696f61601c1f930","observation_id":"e43718b8-34ed-4969-9c56-8696e10cb7ed","resolution":{"observed_at":"2026-08-16T12:40:18.623968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.602258Z","title":"Let’s go through each step in detail:","venue":null,"work_id":"211314d3-9a8e-43bf-97b5-dbfc3e021d4d","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.457358Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:4045d846290516766110a9a9c3fd47c7d58715de04214148c77d1b4991d7315c","observation_id":"54dce162-5be9-4a55-9e50-9c7dd6442e6b","resolution":{"observed_at":"2026-08-16T12:40:18.607016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.539731Z","title":"Therefore, the number of stars in the 5-star rows is: 76−36 = 40","venue":null,"work_id":"ea1fb49c-cec2-43bc-9c0e-b0c1b5773093","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.478593Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:820ed04bc9bc96208b87e0f45232d93359dd6749ba2c1fed43fa73ebc2c48860","observation_id":"f6819624-3b62-44c0-8722-202622576a3f","resolution":{"observed_at":"2026-08-16T12:40:18.544732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.522094Z","title":"Two-thirds of the loaves are sold in the morning and half of what is left is sold equally in the afternoon and evening","venue":null,"work_id":"b2e7cfa8-9022-402b-add1-455ddf9ffe05","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.483884Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:7c01d2d145214cd12de076545756caa43f937899ab42e7fe3733fc42c6ffb96c","observation_id":"60a07723-08c0-44e8-ab7a-a155ac847e62","resolution":{"observed_at":"2026-08-16T12:40:18.527411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.507084Z","title":null,"venue":null,"work_id":"df482798-5502-4871-844f-b6fcf8161946","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.488892Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:41e84c5f17349cc22d6730937efacdf519dfa1f29300df4678e1cac72926d3fa","observation_id":"3b232858-f673-440d-8c7a-6356dfc00fde","resolution":{"observed_at":"2026-08-16T12:40:18.511792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.490875Z","title":null,"venue":null,"work_id":"0fa7649e-2ec0-4c46-baa6-483c604fe02f","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.493930Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c81e1ffb2f745cc0aafed6fcbc1cd7e1d7f8dde99390bb1daec708de879cdc33","observation_id":"c28e7d81-8807-4d40-9c5b-8dc9a7506c50","resolution":{"observed_at":"2026-08-16T12:40:18.495949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.475157Z","title":null,"venue":null,"work_id":"0ddf93cb-8357-4a05-b2ad-9c094d8562c6","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.499068Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:6ab28b61397448c9ab855a8ef8cc46e54bf8f74b86dade5be71980bb561164a4","observation_id":"d8b6e3d9-3d76-4eb6-a828-78d70510cfed","resolution":{"observed_at":"2026-08-16T12:40:18.480091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.459619Z","title":null,"venue":null,"work_id":"904d0603-b679-430e-ac5b-18bd4e26b993","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.503616Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:f4b21e86da7041502449a1b973faa795847a10c0db790f08627eab21ec28def0","observation_id":"819e5a0b-b8c3-4554-8fac-d74203d951a7","resolution":{"observed_at":"2026-08-16T12:40:18.464856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.441894Z","title":null,"venue":null,"work_id":"b7f08ccb-64fa-4116-95f5-0687519e1fcc","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.508336Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:020d80b984679ab2f2b2fb954b82b6e45bdbd5b2a3046a6844ee84f10a21f171","observation_id":"3a68ef4c-529b-4f1b-bb3a-dac5288a4b99","resolution":{"observed_at":"2026-08-16T12:40:18.447629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.426316Z","title":null,"venue":null,"work_id":"e52d9c48-28fa-4122-a153-507099112878","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.513263Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:7446b63465d1dde42a9d27b03a58307a026870972c2d316aaa31fc5e2777c2e0","observation_id":"f3288336-2e3a-403b-a3ba-1e79e57e628c","resolution":{"observed_at":"2026-08-16T12:40:18.431131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.410976Z","title":null,"venue":null,"work_id":"4e4ffe6d-43c6-40c3-8e66-1fa7373db6d0","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.518829Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:d1fff70588517520de6548205f08c1fd2f0f174fd91784296e8298e61c9188e3","observation_id":"fd5652e6-e659-4de5-8fca-7949b9e7370e","resolution":{"observed_at":"2026-08-16T12:40:18.415592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.396190Z","title":null,"venue":null,"work_id":"6a18b231-c29a-4ffd-9f46-b1fd17046d83","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.523757Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:3738c53790b486d9a08a11e061bb4e14d61e51e4070baa9043e10c228afed5c5","observation_id":"05fcd3f9-9214-4025-b1a1-26c600c8fe76","resolution":{"observed_at":"2026-08-16T12:40:18.400806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.379702Z","title":null,"venue":null,"work_id":"c26d6dce-2230-4a07-8cf1-b59baf754f99","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.528934Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:07f400750ba2333b65cd41715b8fa1594daf68bd7f6f2e38262197469b6a8703","observation_id":"ca99e707-a3a3-49fe-8d35-44e004ab2627","resolution":{"observed_at":"2026-08-16T12:40:18.385631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.363885Z","title":"Next, we need the total number of stars on the flag, which is 76","venue":null,"work_id":"4e800f21-2001-48e9-a46e-28c5455b1aff","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.533872Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:0d64816a205980eb46890adce0df3e38dc0bc837dd6db4dad98491d84a0d1deb","observation_id":"c804e250-1bd9-4957-8d88-38c0ad831053","resolution":{"observed_at":"2026-08-16T12:40:18.368872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.347870Z","title":null,"venue":null,"work_id":"87ef1835-9a87-42cb-84ea-c252ba6256c4","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.539246Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ce8ed7e806cbab750ad3407249aa58ac882ecacb0c3602678957c1e948eec972","observation_id":"590f105d-e73d-409c-a87f-b872fa43e158","resolution":{"observed_at":"2026-08-16T12:40:18.353312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.586933Z","title":null,"venue":null,"work_id":"67c5ca71-1ed3-4440-b647-7841e7f8c236","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.544003Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:a421b4fb6ddd18a4ccc481ae5f653940bed78442ea799c746401287c782602a9","observation_id":"57d2df92-0106-42d4-8983-c2cc3487f889","resolution":{"observed_at":"2026-08-16T12:40:18.591999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.571009Z","title":null,"venue":null,"work_id":"c5a3a6ae-7b37-4676-a1dd-74a3a581df15","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.549241Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:12752b81f1a6cbda3495baa6adf0c5589106c1cd44e873b88ed7178e1f0c7208","observation_id":"1ad2f604-4294-4761-9a30-1e3f4d331141","resolution":{"observed_at":"2026-08-16T12:40:18.576072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.556164Z","title":null,"venue":null,"work_id":"95217733-3005-46d2-adef-d430c5aae838","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.554024Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:12484ec8858904ed63439371035512f5ffe0aea44a79b1fd89a8c51f98eb9d19","observation_id":"e71d0a4b-3982-4dec-b272-88d78432cd21","resolution":{"observed_at":"2026-08-16T12:40:18.560749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.332462Z","title":null,"venue":null,"work_id":"d92cd0d3-fe28-4c54-8b0e-976772ea09bc","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.559070Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:f3304595a5096d3a0f221c76f72f500706d76b89a6467d13b9787fed7578663c","observation_id":"5a9a5635-4bd2-4ff5-acd8-d4deb34c1af7","resolution":{"observed_at":"2026-08-16T12:40:18.337290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.316009Z","title":"< /reasoning><answer>8 < /answer> 25 Question:Jennifer’s dog has 8 puppies 3 of which have spots","venue":null,"work_id":"ff9b9d9b-5c0f-4afe-a78a-c00963da99a9","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.563939Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c6375606b347783de3e37981d5b7a97dee5a41ac8ac727f9d8e68e2b5b8407c6","observation_id":"4b3e439f-69bc-46a6-a072-734a5d1f957e","resolution":{"observed_at":"2026-08-16T12:40:18.321652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.300046Z","title":null,"venue":null,"work_id":"83dcac42-4e12-461a-8f38-a8c38098439f","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.568987Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:e9fdb11348b95f84a31e51616cd9b0a92c0981b52ea1b8eee41c3f525644aeaa","observation_id":"e65c4cc1-da41-42e3-8f42-7133761336cc","resolution":{"observed_at":"2026-08-16T12:40:18.305144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.282370Z","title":null,"venue":null,"work_id":"14c7ce68-7f94-4962-9bb2-adb583d52278","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.573867Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:a803a5a1e6569f081cda08ab968b5dd34d17f57805ea9e2f5d9329b244ba04fd","observation_id":"74015850-e3e6-49d2-82d1-ef9e212f4e22","resolution":{"observed_at":"2026-08-16T12:40:18.287910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.263785Z","title":"First, let’s find the total number of puppies from both dogs: - Jennifer’s dog has 8 puppies","venue":null,"work_id":"86a6db13-66da-4495-956f-9256013740d8","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.578719Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:af8c9e3b0e1c31a009f1540164e623bf367536704ffd32a482131f8fd5ddba2e","observation_id":"afd7c678-33d7-4ed3-a64a-4d893462c67b","resolution":{"observed_at":"2026-08-16T12:40:18.269527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.247135Z","title":null,"venue":null,"work_id":"01e152a7-faa5-4c28-b552-51f2858068e1","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.583727Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:ad7e87bcd0d651dfe3408f3c12665f473d1d079e54a5b4bedfd872eb2013b42c","observation_id":"fb592529-9f81-4b4f-ab33-307816770739","resolution":{"observed_at":"2026-08-16T12:40:18.251960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.230645Z","title":null,"venue":null,"work_id":"d31bb2c8-cc19-4e6f-8958-3c6f5f51f7da","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.589907Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:494b0768e9a2ee0cf2ca3ccba784eddd689e2d40a18aae9ba9dfcc80a20b3ee8","observation_id":"431cc05e-a8d9-434c-81b1-d78e4fc21042","resolution":{"observed_at":"2026-08-16T12:40:18.235546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.214810Z","title":null,"venue":null,"work_id":"1ab29654-1304-4461-b4bb-e7df3480ff27","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.594872Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:1cc6c0b6e75e0f396df98fd9874f7963f588d82ca89db179067f467d1d0d61d3","observation_id":"2bc6f677-a7b4-4993-9001-91417240d2e3","resolution":{"observed_at":"2026-08-16T12:40:18.219592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:18.197316Z","title":null,"venue":null,"work_id":"63b8655f-b73c-46d0-b725-c903e698a257","year":null},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.599925Z"},"links":{"citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:9cf10c80f98d83f53c2440484b15fdb53ee115b73ff5eeb85b0f54578376ca0c","observation_id":"69f646d1-b3a3-4ebe-b22a-979957f1ad50","resolution":{"observed_at":"2026-08-16T12:40:18.203697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 66 inbound Pith citation observations for arXiv:2504.12216."}