Pith. sign in

Paper Citation Record · LEDGER

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

As of 23 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 66 inbound Pith citation observations for arXiv:2504.12216.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.12216 v2

Coverage vector

measured 80 of 80 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:40:17.599925Z

measured 146 of 146 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 66 of 66 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:55:08.290104Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-11T03:07:51.770001Z

Reference resolution

80 of 80 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6381cf53-f991-4ef0-baa5-a36fd6f69ce0 · outbound

This paper cites GPT-4 Technical Report.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.180650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.180650Z digest=sha256:ed1db1b3f53aaaa0858487a4a8edf37bec0a56a1b0b10b101ee1041087aa0555

Observation 41c95ad5-111b-4485-81bc-33061805b29a · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.186603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.186603Z digest=sha256:e77a2e41016e4092ae37f8a28b0b7bfdc2e9358cca40610651015398b7c51cf4

Observation 297a88e9-9bd5-477d-98fe-c6c2d3802edc · outbound

This paper cites Arel’s sudoku generator.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Arel’s sudoku generator

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.917061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.192201Z digest=sha256:dcee9475e7b6825d8545fc999dfc36e8ffc60a1b41b9c5a2844b4e2cba5cb20d

Observation 86840d8a-b479-4822-9e47-bb87b75357c5 · outbound

This paper cites Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.197304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.197304Z digest=sha256:8f0566dd1a9af9be0514c759f12ec97b346b5bb31f87eaa483fc1ef8e717c326

Observation d43724d7-8f52-4286-9629-296b750408cb · outbound

This paper cites Structured denoising diffusion models in discrete state-spaces.Advances in neural information processing systems, 34:17981–17993, 2021.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Structured denoising diffusion models in discrete state-spaces.Advances in neural information processing systems, 34:17981–17993, 2021

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.202906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.202906Z digest=sha256:c9af322aeb4f66362de0c77ee782a67c30a49dd92f28edd411d78868456bfa2e

Observation 3b7b51c4-446b-4aad-80fc-5994154c89ca · outbound

This paper cites Program Synthesis with Large Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Program Synthesis with Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.208315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.208315Z digest=sha256:68a1deb1a584be533c7859ab87cba98e2a6b6ca53a7789e2562aa2aa70ea6d47

Observation 09327b48-f87b-4b02-bf27-8157489bdb79 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.214457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.214457Z digest=sha256:95833c798047de20230b407a112ebd6f53a89c7c6754b67110a6d3e92427fc00

Observation f4954ca3-bbd5-4b19-b915-7a7aa415bb3f · outbound

This paper cites Evaluating Large Language Models Trained on Code.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Evaluating Large Language Models Trained on Code

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.219583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.219583Z digest=sha256:c37b0a79dbc5be32a8fb69eed34a1c1f0fa1f650f13a40522549671aa4075f80

Observation f95a0137-19cb-4991-950d-80541c9d01e1 · outbound

This paper cites SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.224741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.224741Z digest=sha256:c6fb2540cfa6a36e388a8dca74e256e5bd2c9c6426bd07c2ea18c7ac73a22c18

Observation 97f0e569-eb63-4dda-bd71-a0c032d4eeac · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Training Verifiers to Solve Math Word Problems

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.229774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.229774Z digest=sha256:64969d542efcd1ce5ee5efb5ffc0b40fc135dc7bf2ab2b5ee1c1c9f03f2ffa56

Observation d2cb5f6a-76de-4c37-b3de-309b0729e9a2 · outbound

This paper cites FlashAttention-2: Faster attention with better parallelism and work partitioning.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning FlashAttention-2: Faster attention with better parallelism and work partitioning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.235069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.235069Z digest=sha256:3e482beaa45d02be0a4308cd0c63b733f88ddbe5fc0f8426f8b72f9aee2ade05

Observation 9684b0a4-13b4-4edd-a669-0681b0806c74 · outbound

This paper cites BERT: Pre-training of deep bidirectional transformers for language understanding.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning BERT: Pre-training of deep bidirectional transformers for language understanding

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.880614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.240025Z digest=sha256:c2969fa2f995e355b3f6f30c52a3cab0168723ca69e7739dae6d93db885c8f75

Observation 82c4f524-003b-486f-9924-86f0bb52b705 · outbound

This paper cites The Llama 3 Herd of Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.244881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.244881Z digest=sha256:643cbb8c57db296f5ff8660a90020cef9b1e4ceb5b3c7498a92732e005e3748e

Observation aed3e921-9a1d-4c03-862b-3803fd15b4a2 · outbound

This paper cites RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.249805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.249805Z digest=sha256:c1a584f9f7cc33700ee8779d6e2040d8c3ba7bc4982b9c711d016a32fd80c1c7

Observation 338619f6-e7ac-42a5-81ad-0fbd1ae6d17f · outbound

This paper cites Scaling diffusion language models via adaptation from autoregressive models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Scaling diffusion language models via adaptation from autoregressive models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.254790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.254790Z digest=sha256:b4b66eaa74a8848fb1f3545f8e6357538487981d4a53c0a9671041ec49154a83

Observation 47a4dae1-f08e-4f1b-9533-9045010858d8 · outbound

This paper cites Likelihood-based diffusion language models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Likelihood-based diffusion language models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.259800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.259800Z digest=sha256:42aef0aa7628fd516095fbd1b2602637ed0ed6902b9e63da221a1cbd2bc89c28

Observation 6723fde0-02a3-4090-b4b3-83ca4bfc4281 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.265034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.265034Z digest=sha256:edf91c731acbed519ed45e8d183571ce70814e7318cdbd31521370d1212180df

Observation f96cbd07-d1ee-432f-a643-bb3b6a750f4c · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.270595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.270595Z digest=sha256:69df88e497601d35efeef686239ae86bbab3eaec27edd482301aa025f2c25e46

Observation 0a042447-9413-4a95-80e9-4bc6460c3dbb · outbound

This paper cites Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.275782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.275782Z digest=sha256:b96959e09f003f1789c7629a6c5ace3c770dba9f128596d9134e497240efa431

Observation 6e943232-8d48-4f25-8838-9ed52417f60c · outbound

This paper cites Mercury: Ultra-fast language models based on diffusion.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Mercury: Ultra-fast language models based on diffusion

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.831911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.281566Z digest=sha256:202c8b4bc873d4009dddc66cb156b3a8cb0bd6a263fe5c09a5631c4a412dbc75

Observation 8bc39d61-55e2-47c6-9d32-43e6ee4e52ba · outbound

This paper cites Numina- math.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Numina- math

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.815509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.287475Z digest=sha256:1a360bfa0afa87436daa5c3f5ecb7884ace1e9b3ff5b39068c98abba853e7d69

Observation e0aff48d-c51c-4efb-a865-de44583af816 · outbound

This paper cites ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.292838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.292838Z digest=sha256:1caf0fdd0d8301a025a2177084d64906fd66f157b106a9e75eda71b106ea1df7

Observation 4662a7e3-c73c-4f43-ae7b-26fad1e489d1 · outbound

This paper cites Let's Verify Step by Step.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Let's Verify Step by Step

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.298081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.298081Z digest=sha256:5b66aa5a9b2d060e70afa7bb5b66ba3b002f0d8d7311696ca04c34f51fb6ae82

Observation 466fcac1-6e1e-4234-90bb-51e8681ccaf1 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.303344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.303344Z digest=sha256:84371361b1c6bd0cece2bee74270c2fef0ded98ba80ccd3a198d27eb3b35a5ae

Observation 20a14b4c-7804-4479-8283-411194561ef7 · outbound

This paper cites Decoupled Weight Decay Regularization.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Decoupled Weight Decay Regularization

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.308299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.308299Z digest=sha256:8f796c06c6425aaf674f84bc335a1b7aff60d2b209f2376843a43fa3aaa9d3d0

Observation a23b65a1-729d-40bd-96a5-207668787007 · outbound

This paper cites Discrete diffusion modeling by estimating the ratios of the data distribution.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Discrete diffusion modeling by estimating the ratios of the data distribution

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.799521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.313755Z digest=sha256:2046b198f9085abab6bb7074b3aa1991589d2fa30ece2d0a9ad9706be86d2be2

Observation 04303571-57fc-47ca-9143-f04c6c1651cd · outbound

This paper cites Dynamic Scaling of Unit Tests for Code Reward Modeling.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Dynamic Scaling of Unit Tests for Code Reward Modeling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.319000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.319000Z digest=sha256:ab69b2be25c43cdada41fbcffb5168dfa57826e892fb7d4e9c3804d7ce25b85d

Observation 1445326c-c63e-4601-b6c7-63e2906dc7c6 · outbound

This paper cites s1: Simple test-time scaling.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning s1: Simple test-time scaling

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.323935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.323935Z digest=sha256:ef5596bfd192d5cd27871861f755c2fd6515abf39edb2a3f609579085aac1844

Observation a3bd84b3-ae33-47d4-990d-bb405721cc1d · outbound

This paper cites Scaling up Masked Diffusion Models on Text.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Scaling up Masked Diffusion Models on Text

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.329389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.329389Z digest=sha256:269b345ae8f2baab67cc9a06a530a1c97e6ecf2c83aa5d2764edb5418ea69471

Observation 3a713c4a-70f5-4a54-b072-aad0428fabd5 · outbound

This paper cites Large Language Diffusion Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Large Language Diffusion Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.334629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.334629Z digest=sha256:2a38b9946b9f60e725b66919811d62c1ee358c32403e28b74a50e4aa56608765

Observation dfd2c49f-b980-4ede-97db-647bb01a1c44 · outbound

This paper cites Learning to reason with llms, September 2024.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Learning to reason with llms, September 2024

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.339693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.339693Z digest=sha256:b5b7d9a9ad9903a8d3c7adb48a6bfb0df5d749e4e5f875f056f47d7105176c62

Observation 6b981c54-9763-40bd-b3ed-f1940f08ed31 · outbound

This paper cites Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.344490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.344490Z digest=sha256:bb181c44daf74e98b7ac3d1387eb4e8618a349d1b96a10d5b914f8007933df41

Observation fafa3030-0956-46d6-a3a2-0a8aaf9dbab7 · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.350007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.350007Z digest=sha256:3b1d13e41e872a2cce2ec3b80a63a0a4cdd8d35299092a6ec719e4970f85d686

Observation 4aa5b1c8-2d52-49b3-a03b-e8a2f8c4bf99 · outbound

This paper cites Tinyzero.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Tinyzero

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.354830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.354830Z digest=sha256:a4152ebbb237844b5106711f68901974cd148c0f0e86fd377647e390dcfc65ee

Observation 661f411b-b526-4cad-877a-8e35b2d83515 · outbound

This paper cites Openwebmath: An open dataset of high-quality mathematical web text, 2023.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Openwebmath: An open dataset of high-quality mathematical web text, 2023

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.359916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.359916Z digest=sha256:34c30f3727fa205336f5333eb6e6ddac04860fc31c35012a6821bf8a770de713

Observation 6df3e1f3-6268-4ba4-8396-cf36daeec210 · outbound

This paper cites Simple and effective masked diffusion language models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Simple and effective masked diffusion language models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.364560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.364560Z digest=sha256:0bea386b056b9d4df735c20a5ee8742692757f0ddcf700cbe4ad4b2f3ca75540

Observation 5953b8ad-d60c-445f-9f4d-5a6865cacb27 · outbound

This paper cites Proximal Policy Optimization Algorithms.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.369364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.369364Z digest=sha256:62978bf9b0bfbeef440b6753acc9fae9b77ebbf72bc5b996353e114da1e68fca

Observation 035ddd47-a8d0-417b-92e9-b5b59e4ac685 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.374163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.374163Z digest=sha256:cd2aa5098486c0461de66903d9fe62284161657def1caff6e71e54fbf1f1e009

Observation 760fa881-1ade-4537-9e13-5d4cf4cc6016 · outbound

This paper cites Simplified and generalized masked diffusion for discrete data.Advances in neural information processing systems, 37:103131–103167, 2024.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Simplified and generalized masked diffusion for discrete data.Advances in neural information processing systems, 37:103131–103167, 2024

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.378979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.378979Z digest=sha256:f0b21a299b6176ea9f95dd75259c33832685d080bffdb49d6e13d68d098dfc8c

Observation 05d97217-6205-4546-9c86-32c8a3731329 · outbound

This paper cites Score-based generative modeling through stochastic differential equations.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Score-based generative modeling through stochastic differential equations

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.383902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.383902Z digest=sha256:e7276d987bd1b039fd4bb3a3c6adb04297a7fd7b079ecc08ae44a7a78da9e4fc

Observation bf36f640-7466-4da4-874c-361fe70e8214 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.388670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.388670Z digest=sha256:f44af4ff50db9407201ccbfeac390abe067e3de17eadcdb15724c8565be469a5

Observation 2363d779-efe3-49f6-880d-434be0f2981b · outbound

This paper cites Open Thoughts.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Open Thoughts

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.393652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.393652Z digest=sha256:5007c072fa2bb10a828b370ca21e7772c086c9aa20b4a7cde3d13fa038802065

Observation 4ff689cb-05ca-4bf3-8696-3e672aa2b41a · outbound

This paper cites Trl: Transformer reinforce- ment learning.https://github.com/huggingface/trl, 2020.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Trl: Transformer reinforce- ment learning.https://github.com/huggingface/trl, 2020

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.701065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.398643Z digest=sha256:72d726ed8a1ebb60dd119f9ceb8a75264d565d137f34d775a8e52326f6fa3c82

Observation e7838f69-76e7-4f63-a88c-d82646333a98 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine learning, 8:229–256, 1992.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine learning, 8:229–256, 1992

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.403290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.403290Z digest=sha256:e1a3990ad94ec1f8eb360526349e2391fbe24610af84a087695f61f7cf5b8aa5

Observation 006348a4-84bb-4d76-a353-8d1b19d0fe37 · outbound

This paper cites KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.407801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.407801Z digest=sha256:beabc9e1ba5dcfa8c326f09aac8baf5e12bf35b1cd79f4e35a53ecb5b464e843

Observation de7b6fb5-3b49-4fca-a6c4-e5159b94a4ec · outbound

This paper cites Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.412697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.412697Z digest=sha256:77147940521dc26e2f8cdd82d8577fb51ebb4d1845e3c6a531f581626b49daa7

Observation ac86e258-44d0-4dd0-8dfd-b4ceb5f9ef82 · outbound

This paper cites Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.417620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.417620Z digest=sha256:805bc04db11f98599df24ac674cb3ad44b528e4eae30f4bfcde55f7f5758f27e

Observation a3fd64f8-25e1-4b64-8c27-bc7da95116f0 · outbound

This paper cites Dream 7b, 2025.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Dream 7b, 2025

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.673081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.422743Z digest=sha256:a13ab2d2a41c9c9ac779f90a2b22e165dc9157f8b5e16f70f3ddb7addadcf217

Observation 4fea2688-ab01-4b89-9261-10e8d52d5b40 · outbound

This paper cites LIMO: Less is More for Reasoning.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning LIMO: Less is More for Reasoning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.427252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.427252Z digest=sha256:ae1266a0a28d6947ffe8d736ad39f5e286e08d4992830daec4dc2829a5c8f848

Observation 5b9c8bac-0899-4a33-8d84-64664c99f524 · outbound

This paper cites MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.432213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.432213Z digest=sha256:b3103f1c412d46edff1c7cab6352acd6d5e283f915961ecc4d8154dccb4cd94c

Observation e1f7787c-cd72-4985-9064-bf3516b25a7c · outbound

This paper cites Fine-tuning discrete diffusion models with policy gradient methods.arXiv preprint arXiv:2502.01384, 2025.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Fine-tuning discrete diffusion models with policy gradient methods.arXiv preprint arXiv:2502.01384, 2025

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-16T12:40:17.437285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:40:17.437285Z digest=sha256:0af37621b36695f80298b43016e8deaa31100f268c117b41f190857753ba0acf

Observation ddaa17c0-fd48-41e8-9179-b7e3d98c1fcc · outbound

This paper cites Lima: less is more for alignment.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Lima: less is more for alignment

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.656973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.441974Z digest=sha256:179a531b11398af3cdedb775addf75b58ba7ed2988547c0ab5f18e657d14a2bc

Observation 620bcf72-3eca-4eaa-a1b9-eca5506ead84 · outbound

This paper cites Simply put, at any timestep, the probability that a token transitions to the masked state isαt.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Simply put, at any timestep, the probability that a token transitions to the masked state isαt

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.640770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.447066Z digest=sha256:85367a96e8e74439e028d79cd753a8a72279342bc0d673e3b7154f64d15efa3a

Observation e43718b8-34ed-4969-9c56-8696e10cb7ed · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.623968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.452345Z digest=sha256:7b19523fe69ef7cb474d398a4faafb0f5e79ea070995d25f3696f61601c1f930

Observation 54dce162-5be9-4a55-9e50-9c7dd6442e6b · outbound

This paper cites Let’s go through each step in detail:.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Let’s go through each step in detail:

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.607016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.457358Z digest=sha256:4045d846290516766110a9a9c3fd47c7d58715de04214148c77d1b4991d7315c

Observation f6819624-3b62-44c0-8722-202622576a3f · outbound

This paper cites Therefore, the number of stars in the 5-star rows is: 76−36 = 40.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Therefore, the number of stars in the 5-star rows is: 76−36 = 40

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.544732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.478593Z digest=sha256:820ed04bc9bc96208b87e0f45232d93359dd6749ba2c1fed43fa73ebc2c48860

Observation 60a07723-08c0-44e8-ab7a-a155ac847e62 · outbound

This paper cites Two-thirds of the loaves are sold in the morning and half of what is left is sold equally in the afternoon and evening.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Two-thirds of the loaves are sold in the morning and half of what is left is sold equally in the afternoon and evening

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.527411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.483884Z digest=sha256:7c01d2d145214cd12de076545756caa43f937899ab42e7fe3733fc42c6ffb96c

Observation 3b232858-f673-440d-8c7a-6356dfc00fde · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.511792Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.488892Z digest=sha256:41e84c5f17349cc22d6730937efacdf519dfa1f29300df4678e1cac72926d3fa

Observation c28e7d81-8807-4d40-9c5b-8dc9a7506c50 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.495949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.493930Z digest=sha256:c81e1ffb2f745cc0aafed6fcbc1cd7e1d7f8dde99390bb1daec708de879cdc33

Observation d8b6e3d9-3d76-4eb6-a828-78d70510cfed · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 63

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.480091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.499068Z digest=sha256:6ab28b61397448c9ab855a8ef8cc46e54bf8f74b86dade5be71980bb561164a4

Observation 819e5a0b-b8c3-4554-8fac-d74203d951a7 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.464856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.503616Z digest=sha256:f4b21e86da7041502449a1b973faa795847a10c0db790f08627eab21ec28def0

Observation 3a68ef4c-529b-4f1b-bb3a-dac5288a4b99 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 65

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.447629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.508336Z digest=sha256:020d80b984679ab2f2b2fb954b82b6e45bdbd5b2a3046a6844ee84f10a21f171

Observation f3288336-2e3a-403b-a3ba-1e79e57e628c · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.431131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.513263Z digest=sha256:7446b63465d1dde42a9d27b03a58307a026870972c2d316aaa31fc5e2777c2e0

Observation fd5652e6-e659-4de5-8fca-7949b9e7370e · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.415592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.518829Z digest=sha256:d1fff70588517520de6548205f08c1fd2f0f174fd91784296e8298e61c9188e3

Observation 05fcd3f9-9214-4025-b1a1-26c600c8fe76 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.400806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.523757Z digest=sha256:3738c53790b486d9a08a11e061bb4e14d61e51e4070baa9043e10c228afed5c5

Observation ca99e707-a3a3-49fe-8d35-44e004ab2627 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 69

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.385631Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.528934Z digest=sha256:07f400750ba2333b65cd41715b8fa1594daf68bd7f6f2e38262197469b6a8703

Observation c804e250-1bd9-4957-8d88-38c0ad831053 · outbound

This paper cites Next, we need the total number of stars on the flag, which is 76.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Next, we need the total number of stars on the flag, which is 76

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.368872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.533872Z digest=sha256:0d64816a205980eb46890adce0df3e38dc0bc837dd6db4dad98491d84a0d1deb

Observation 590f105d-e73d-409c-a87f-b872fa43e158 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.353312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.539246Z digest=sha256:ce8ed7e806cbab750ad3407249aa58ac882ecacb0c3602678957c1e948eec972

Observation 57d2df92-0106-42d4-8983-c2cc3487f889 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 72

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.591999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.544003Z digest=sha256:a421b4fb6ddd18a4ccc481ae5f653940bed78442ea799c746401287c782602a9

Observation 1ad2f604-4294-4761-9a30-1e3f4d331141 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 73

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.576072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.549241Z digest=sha256:12752b81f1a6cbda3495baa6adf0c5589106c1cd44e873b88ed7178e1f0c7208

Observation e71d0a4b-3982-4dec-b272-88d78432cd21 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 74

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.560749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.554024Z digest=sha256:12484ec8858904ed63439371035512f5ffe0aea44a79b1fd89a8c51f98eb9d19

Observation 5a9a5635-4bd2-4ff5-acd8-d4deb34c1af7 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 75

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.337290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.559070Z digest=sha256:f3304595a5096d3a0f221c76f72f500706d76b89a6467d13b9787fed7578663c

Observation 4b3e439f-69bc-46a6-a072-734a5d1f957e · outbound

This paper cites < /reasoning><answer>8 < /answer> 25 Question:Jennifer’s dog has 8 puppies 3 of which have spots.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning < /reasoning><answer>8 < /answer> 25 Question:Jennifer’s dog has 8 puppies 3 of which have spots

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.321652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.563939Z digest=sha256:c6375606b347783de3e37981d5b7a97dee5a41ac8ac727f9d8e68e2b5b8407c6

Observation e65c4cc1-da41-42e3-8f42-7133761336cc · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 77

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.305144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.568987Z digest=sha256:e9fdb11348b95f84a31e51616cd9b0a92c0981b52ea1b8eee41c3f525644aeaa

Observation 74015850-e3e6-49d2-82d1-ef9e212f4e22 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 78

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.287910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.573867Z digest=sha256:a803a5a1e6569f081cda08ab968b5dd34d17f57805ea9e2f5d9329b244ba04fd

Observation afd7c678-33d7-4ed3-a64a-4d893462c67b · outbound

This paper cites First, let’s find the total number of puppies from both dogs: - Jennifer’s dog has 8 puppies.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning First, let’s find the total number of puppies from both dogs: - Jennifer’s dog has 8 puppies

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:40:18.269527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.578719Z digest=sha256:af8c9e3b0e1c31a009f1540164e623bf367536704ffd32a482131f8fd5ddba2e

Observation fb592529-9f81-4b4f-ab33-307816770739 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 80

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.251960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.583727Z digest=sha256:ad7e87bcd0d651dfe3408f3c12665f473d1d079e54a5b4bedfd872eb2013b42c

Observation 431cc05e-a8d9-434c-81b1-d78e4fc21042 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 81

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.235546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.589907Z digest=sha256:494b0768e9a2ee0cf2ca3ccba784eddd689e2d40a18aae9ba9dfcc80a20b3ee8

Observation 2bc6f677-a7b4-4993-9001-91417240d2e3 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 82

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.219592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.594872Z digest=sha256:1cc6c0b6e75e0f396df98fd9874f7963f588d82ca89db179067f467d1d0d61d3

Observation 69f646d1-b3a3-4ebe-b22a-979957f1ad50 · outbound

This paper cites an unresolved cited work.

d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Unresolved cited work

Reference 83

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:40:18.203697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-16T12:40:17.599925Z digest=sha256:9cf10c80f98d83f53c2440484b15fdb53ee115b73ff5eeb85b0f54578376ca0c

Pith citing papers

Observation c273ed96-ece8-4163-bc0c-c5b15126e428 · inbound

Decomposing Elements of Problem Solving: What "Math" Does RL Teach? cites this paper.

Decomposing Elements of Problem Solving: What "Math" Does RL Teach? d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T13:05:27.735188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:05:27.735188Z digest=sha256:07abd6a8d9df4534425db0d70193389048a3dc407e88525ddeb496bb0eeb65ab

Observation 0b9288bf-20e8-44f4-9836-6d28f7abcf2e · inbound

SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards cites this paper.

SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:30:27.225291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:30:27.225291Z digest=sha256:2dc15bddbd2436db13969f9300c5467bb982248aa282bc4726efb9d579d8d343

Observation b2518048-a2e4-4371-aa52-f76b644542a7 · inbound

On a few pitfalls in KL divergence gradient estimation for RL cites this paper.

On a few pitfalls in KL divergence gradient estimation for RL d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:53:38.908197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:53:38.908197Z digest=sha256:f93426267c8404358ee745a307247915bf826dd1220d28f00f807c5ada3194be

Observation 3edbd26d-a14d-4fcf-a186-7929a40f4206 · inbound

DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation cites this paper.

DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T22:52:33.512057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T22:52:33.512057Z digest=sha256:547eee415e7b3aa45ac5b388e8c84279bba41e1e67efdafa7a4ade4522d6835b

Observation 19a8724e-48b8-41ce-90f1-fbb4acafa6b7 · inbound

A Survey on Latent Reasoning cites this paper.

A Survey on Latent Reasoning d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 138

Resolution
unresolved
no resolver link, observed 2026-08-06T19:14:34.187851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:14:34.187851Z digest=sha256:29949945855a08965e0199bcd04a03dee4b7fffed3d273743dd0a54949d090ec

Observation 3d18a6d1-3a90-43f4-9b80-b01d93858697 · inbound

Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation cites this paper.

Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T19:30:03.962801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:30:03.962801Z digest=sha256:9dc86294d0ebea96134318eebc4ccca6e619f0ab0ba239ffc950cd5bfc0d0836

Observation eb227c3a-102e-453a-a558-62853cc6711d · inbound

A Survey on Diffusion Language Models cites this paper.

A Survey on Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T20:15:16.982709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:15:16.982709Z digest=sha256:14de29b20547789f3d3ad9e4a6ccf7907da43d37eb48b310fe032393d5148790

Observation 045f5a3e-1a77-486e-ad78-38fc1ad5c844 · inbound

Any-Order Flexible Length Masked Diffusion cites this paper.

Any-Order Flexible Length Masked Diffusion d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T13:20:05.318712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T13:20:05.318712Z digest=sha256:39c3a00409fd5560307866a52600fee5a960f7eb9fd61bf0a67deb0b9e549080

Observation 9df192f7-4d0f-4ebf-a9c7-98072d348ba8 · inbound

ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute cites this paper.

ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-05T13:52:07.560114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T13:52:07.560114Z digest=sha256:a5763694d31ed57093056e6812fe6fc940149fc7032793e82a84297dab5f3b35

Observation 092e5c71-68a6-4abd-9416-eda5d18239af · inbound

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models cites this paper.

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T22:56:05.264871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T22:56:05.264871Z digest=sha256:58f90e5b0dfc7839d26663c6d8c0771ea28ee943b772392b7cdd1554ba5ea254

Observation 649721c8-ba34-491e-b8c5-74c4f6654a65 · inbound

Inpainting-Guided Policy Optimization for Diffusion Large Language Models cites this paper.

Inpainting-Guided Policy Optimization for Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T17:57:47.060284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T17:57:47.060284Z digest=sha256:f65af6bd1e480b15ff2310b770bfebf3ee4cd484e8ba9868c6662a43f559fa8a

Observation 746db5cb-acfe-4e8f-8f4b-6893ed5b4162 · inbound

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models cites this paper.

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T14:51:30.225921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T14:49:08.081740Z digest=sha256:68061e04806b2f03fc206405297ed035896262f0ec362b48f439e73b9bc208c3

Observation aba1a0ea-dabe-4e8d-9a6c-1e472fb10393 · inbound

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation cites this paper.

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T15:55:08.290104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:55:08.290104Z digest=sha256:b00a63e8e67a0529e376d4c56e319a1ed5c27e735377392ddd5f66f057ac8504

Observation 95c45515-7d88-4f4f-81ad-aeb64f48c3e1 · inbound

Error Analysis of Discrete Flow with Generator Matching cites this paper.

Error Analysis of Discrete Flow with Generator Matching d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T15:51:39.024676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:51:39.024676Z digest=sha256:27c17f2c5493167a656c13d49a94bbd120dd77a9dfbebe509610abdac8b88353

Observation a5de9092-09f2-49dc-a7be-d917e547756a · inbound

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching cites this paper.

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-18T14:16:27.799777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T14:13:48.523955Z digest=sha256:9094763efdb45d78d1acf7952ed92d2994dfc70ab9e7f560fbc3a0261a73f7d2

Observation bb894fbc-d183-45f0-9476-45dd4fe5b6fe · inbound

Simple Policy Gradients for Reasoning with Diffusion Language Models cites this paper.

Simple Policy Gradients for Reasoning with Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T11:38:54.121332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:38:54.121332Z digest=sha256:fddd47b443c48282859a564f53d36283661583549c76e6cab5a6cda2e40a1091

Observation 135b062e-3761-46b2-b702-32adbdd337b1 · inbound

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs cites this paper.

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T11:28:11.932474Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:28:11.932474Z digest=sha256:b2fc642671de00089efea56f3fe297dd70e60fd54b93a19e3a2a6480a735d049

Observation 5be6dcc2-60a7-4261-bfd7-ba2f1b8900cf · inbound

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models cites this paper.

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T10:10:10.239795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T10:10:10.239795Z digest=sha256:2537201a4e92575b14aad9b8a821a6b492268b898bb1edccad68afd923cbf8fa

Observation 95802dca-1915-49bf-95e9-75e2fdfa9e6f · inbound

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed cites this paper.

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-16T22:31:19.324196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-16T22:29:08.669964Z digest=sha256:d6fcd5a1843666e067855f4c052f74d89db5d97f882133e71034cc3499e77d82

Observation c8d58ff0-d20e-4ca6-8362-27c7ea08720f · inbound

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models cites this paper.

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T09:03:21.904756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T09:03:21.904756Z digest=sha256:08847cbfa3f17a08b3fe7cae72ecdb2adee848235def42a1da3ac7fda63a7e85

Observation 008922e3-fc70-4ff2-8602-241dee5f854f · inbound

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding cites this paper.

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T08:14:37.405676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T08:14:37.405676Z digest=sha256:5e0f7e29b187c6418106133dace7c1ff1e1b115091d6072f02f83e198d915da1

Observation 829c4aa9-9e56-4e5a-9a5a-9f4620b988f6 · inbound

Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity cites this paper.

Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T15:47:07.940876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:47:07.940876Z digest=sha256:00ff371c864b79f6d3b7490cc4e8fcb727d086c0207559d87544b2c2e4c2e07d

Observation 01373c77-85f0-4e11-9502-b8aea1c6ff96 · inbound

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models cites this paper.

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-02T23:50:38.177661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T23:50:38.177661Z digest=sha256:f2f7750db7d6b6ec171d55aafc64c522e0918031d835f3cc6eb827bcb946f509

Observation 6cbe0675-721d-4b0f-9d84-b9fc1fab8da3 · inbound

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning cites this paper.

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T02:38:07.646818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:38:07.646818Z digest=sha256:0b832deb65e773a8e52ee5a3f38c99a1adf5b84ebf8b76f39baeb977bc2f1752

Observation ecd4746f-30f2-48ea-94a7-a15f33f490b2 · inbound

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models cites this paper.

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-15T00:48:25.026364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-15T00:45:10.685812Z digest=sha256:e3ae51156c1de45b34acf411256fac1e13633f8390f25f94e87c5936fc8e2d4f

Observation ef021ff4-084b-4518-9e04-33c8f5f32563 · inbound

Discrete Flow Matching Policy Optimization cites this paper.

Discrete Flow Matching Policy Optimization d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:40:51.948250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T18:57:05.398716Z digest=sha256:f013d4f81e8012b121537394c765458b7712d1276cf7378df6c9cc6f82e7e8cd

Observation bcb2d663-7f03-4a2c-8b0a-599043483cea · inbound

DMax: Aggressive Parallel Decoding for dLLMs cites this paper.

DMax: Aggressive Parallel Decoding for dLLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 103

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:45:55.662895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T17:58:17.880199Z digest=sha256:20d1fd57b95e4e412d7400809313fa36caf401d5196e45fb7d0714dcae418756

Observation bf78d367-87dc-4715-9df8-702544f8ccea · inbound

DMax: Aggressive Parallel Decoding for dLLMs cites this paper.

DMax: Aggressive Parallel Decoding for dLLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 103

Resolution
verified exact
arxiv_id, observed 2026-05-19T16:47:40.268262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-19T16:46:56.743268Z digest=sha256:480b9b2323ba18666e686e0360679dc601faf84e19eac0aeadf8014366a7474e

Observation 91ab6570-e043-4ba3-a0cf-71800b2e7de7 · inbound

CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation cites this paper.

CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 9

Resolution
malformed identifier
arxiv_id, observed 2026-05-11T09:46:08.304715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T15:50:05.070462Z digest=sha256:b652a294f055c20a79795340745351d5d1c9cb2954cbcf6cf8a217651b019af4

Observation e8e19a53-fed5-49ae-8e60-3657a4156917 · inbound

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning cites this paper.

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:15:39.695201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-08T18:38:07.949718Z digest=sha256:d2f61b35439d2cd83129f7f552b28e338519cb14c55539866f480f5a257fafba

Observation d324d6d3-6529-43b6-a5cf-bef1d948b33e · inbound

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning cites this paper.

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:25:10.342986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-30T23:59:02.580783Z digest=sha256:4860bad87aff30c65fc28bda6253371c411f2ac43c39de647e125a7716cd3a06

Observation b492a0da-1eb2-442e-9149-8b828358f3d6 · inbound

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving cites this paper.

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 127

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:26:08.231181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-08T16:06:47.108382Z digest=sha256:b5bfcf6cf183cd743fcfb7d4bff2c4e0fc09999786a1bfc8df2265ed09128ea1

Observation aa7ebc25-e541-4844-a4ba-e03d2b854d86 · inbound

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving cites this paper.

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 127

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:52:05.402267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-13T01:48:36.105389Z digest=sha256:d4fdc3cacdf38c4dbfa33e868eab216fd40ace81fe99cc93f6d57280b8bd6c9d

Observation 71595bb9-060a-46a1-88b4-2766891b5934 · inbound

Continuous Latent Diffusion Language Model cites this paper.

Continuous Latent Diffusion Language Model d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 110

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:11:11.027880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-08T10:04:09.646578Z digest=sha256:75215ba5941744285e3278e6aedd883ad29a1647ab4e5187d813753655f63785

Observation 13fbf4fb-6809-4a55-889c-425d04698e0b · inbound

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models cites this paper.

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 36

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T06:51:29.785564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-12T03:52:05.779559Z digest=sha256:2d8157db1fb28c6777a80b39dde3c384f04565ae5c03ba11558610d452eebe21

Observation b2fa284c-7fbb-4230-b0b8-81281968b923 · inbound

TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM cites this paper.

TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-12T05:46:25.829169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-12T05:01:03.570848Z digest=sha256:ba632aea3432505e26ed83fe56333e77740728e445f20a31eaf1aee74e4dadb1

Observation 8055c6b4-1250-471a-bf0a-91d9a373dc56 · inbound

Relative Score Policy Optimization for Diffusion Language Models cites this paper.

Relative Score Policy Optimization for Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 102

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:56:29.654677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-12T03:47:42.196931Z digest=sha256:dd31912fc2d6f44f1c19592df0c464b5e26fb6d8b491062231a8d5b435036b7f

Observation c5e585f8-aaf9-4ed1-85a4-b7b2fe0f681b · inbound

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models cites this paper.

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:52:22.009936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-13T05:51:27.920803Z digest=sha256:27e76c9f2d835ee329919893ca0ce69bcda6f098cdc358d00e66ba2ca386c014

Observation c30e4d21-cab1-445d-8072-e61f546b1df7 · inbound

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models cites this paper.

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-20T23:03:50.842115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T22:59:53.100421Z digest=sha256:bae023106ea85e82064d75f22f14f33feb7c4b7b5d5ee5941ae9754ad02788f8

Observation 2ed526fd-673b-4177-b9cd-5df196a68392 · inbound

AIS: Adaptive Importance Sampling for Quantized RL cites this paper.

AIS: Adaptive Importance Sampling for Quantized RL d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T03:14:52.710028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-15T03:13:14.384567Z digest=sha256:a84cbff3f0c907232c263e53b1bcefee751b6a75bb9029d4ca887f8159104893

Observation 045966a3-6947-4a08-be20-0d284b7cb4ce · inbound

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models cites this paper.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.533291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:fa08d01846ffbb0a7ba14739d1f3176d970f7f549e5d915ea601094b526c0b36

Observation 82863feb-1c3b-4a03-8c7d-2eac0d71b230 · inbound

Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers cites this paper.

Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-19T20:42:46.130915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-19T20:41:48.063871Z digest=sha256:4756154fb294d385aa88b9128d99144b97cecfdc54c03b23dc5e495952012479

Observation 85089373-950e-48ae-a8f3-c1b02776d4e3 · inbound

Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation cites this paper.

Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:08:21.234593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T14:03:45.869373Z digest=sha256:ccbe5777e807bb785a23f86e9a3a9a5cec0326ad7fda8a280bf67992a79f8ee8

Observation e7825b23-071e-4e58-bd64-9b5d22ed667b · inbound

Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs cites this paper.

Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-20T13:13:17.890954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T13:13:05.695349Z digest=sha256:667116cb6cca0a6e2bca24112c4d17c86fa0fba22e16e2dd46da020905853332

Observation aa982a74-efe6-4c88-be30-2ad996f62d48 · inbound

Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion cites this paper.

Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 94

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:30:22.378669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-25T05:30:15.053277Z digest=sha256:2030a9f4c3972df505a21d87f043d8b2a8a83b6cb7b66b6f6fa33f819a8e4f1d

Observation b96407f0-617f-4c14-8342-e1a05269d207 · inbound

Reinforcement Learning from Denoising Feedback cites this paper.

Reinforcement Learning from Denoising Feedback d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-06-29T21:23:58.875184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-29T21:20:32.039699Z digest=sha256:a1f6a104f72dd5b9535f41873a5303ac8d2cd0155af07cd9eb7edd42786067bf

Observation effaf0ab-56ba-4012-9596-4bedd1f16d6f · inbound

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models cites this paper.

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:53:16.405730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-29T08:44:53.969301Z digest=sha256:94c7c267abe8440bf2f47cea0d25abcb084310f7e765f9332a515e8547daa7c7

Observation d901172b-d729-4545-af30-2f793b5f2ce2 · inbound

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation cites this paper.

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:52:44.924892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T22:51:36.013299Z digest=sha256:82e5a87f96ff9a934e72a3e04f4de1ee825e8e3fa6ad8af93b44bda4ada7695d

Observation e39905c6-0a80-403e-992b-40487d217b6b · inbound

dMoE: dLLMs with Learnable Block Experts cites this paper.

dMoE: dLLMs with Learnable Block Experts d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:52:45.087047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T22:50:51.900169Z digest=sha256:976fe45744ae004c8fc8b791b7e1967741891542cea4baeb9cdf1986f0a25b0e

Observation a1c0a56b-9b80-4d2b-bd89-5292295bea58 · inbound

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models cites this paper.

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-07-01T23:56:24.449776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T13:43:51.171443Z digest=sha256:86078219eef0160f86dc3c564d1700095f9358996fb5bb3528484e1d1f5bfebb

Observation fdccb9c1-9013-4bf4-ba2b-1b9e00b442f7 · inbound

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models cites this paper.

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 83

Resolution
verified exact
arxiv_id, observed 2026-07-02T08:06:48.406548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-28T06:20:27.041099Z digest=sha256:3c57f5e4cbdc730b409cb407ff84a14036e6656be452dc791a38e3afd32a4a97

Observation 5ea81465-96df-4296-bbc6-3c48fb0fb2c7 · inbound

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models cites this paper.

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T22:57:26.600633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-27T18:31:21.493677Z digest=sha256:ac0c8823521162b56a547a64120f343dd2588da58f65b207302257efe43252d8

Observation ed32f20b-8433-4803-96e0-2d4069d3355d · inbound

Re-evaluating Confidence Remasking in Masked Diffusion Language Models cites this paper.

Re-evaluating Confidence Remasking in Masked Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-07-03T09:17:48.817887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T10:25:09.995616Z digest=sha256:239f4c1f734d2e5e9546b2c14091ec3a4077ae2708b952900d016fb8705c1c54

Observation d2cde3bc-a340-434b-89c0-e95e3c97ec0c · inbound

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models cites this paper.

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T11:28:04.442327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-27T09:34:02.484344Z digest=sha256:5731eec3c62378fdbb8ec92ac177ead257b69ebff4183b7fe55da03017878953

Observation 0172605a-8bac-4417-a5f9-dfbc82e844bb · inbound

DiPOD: Diffusion Policy Optimization without Drifting Apart cites this paper.

DiPOD: Diffusion Policy Optimization without Drifting Apart d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-03T14:18:22.953989Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T07:06:28.426709Z digest=sha256:1bd3923246b0844426b3cfbb156fddd05dd8a2782dc559e5d9c64254fcdd6986

Observation 885ff215-a1bb-4c53-9e2d-76a187028fef · inbound

Learning from the Self-future: On-policy Self-distillation for dLLMs cites this paper.

Learning from the Self-future: On-policy Self-distillation for dLLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-03T20:28:55.657214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T01:20:14.919054Z digest=sha256:7f14b4bdd6a8f08fccaae6f1c0817b48123c98fcdcc268a8bc34c88bdf45c3e8

Observation 5da9227b-31af-4665-9fb3-b6ef591817f8 · inbound

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting cites this paper.

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-07-03T21:18:59.324057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T00:42:52.485768Z digest=sha256:9b8f9436eede596d7e19e5cae96ebe213008b0df11d5993ad1e66ce7611147ef

Observation b93a533f-2f28-471f-9e81-03cdc95ea587 · inbound

Improved Large Language Diffusion Models cites this paper.

Improved Large Language Diffusion Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:20:05.604715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-25T21:34:45.620481Z digest=sha256:82e4f4fcea91c6eb6d93dc401da2924249a4b6a451729a3e5c1617206970b665

Observation 34db73ff-5bea-4beb-9c8e-d6ebdfcdd98e · inbound

TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding cites this paper.

TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-12T03:56:26.770729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T03:56:26.770729Z digest=sha256:57b74a7b0aefdac76407ec1d95b68ce4868c52da4e874c22a1b73d6f0b654a16

Observation d68e3dd8-7361-4025-8fea-4b6ebb70d01c · inbound

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding cites this paper.

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 57

Resolution
verified exact
local_arxiv, observed 2026-07-11T03:07:51.796395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-07-11T03:04:12.500342Z digest=sha256:34edf4c3cd4871fcddfc87e2a067d72b76dec9b1a2cea72dc84920f6b195281c

Observation e5d9661a-e64f-4502-905a-142f127982ae · inbound

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes cites this paper.

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-02T06:02:13.359209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T06:02:13.359209Z digest=sha256:210fa1d964cb37b821b2a9be79afb75d1e03fe557f5bce6d9fb7f000c24cbf61

Observation f14f2bef-06a2-4359-881b-ba19f5f745c7 · inbound

Hierarchical Domain Generalization cites this paper.

Hierarchical Domain Generalization d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T20:54:03.441397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T20:54:03.441397Z digest=sha256:74c5ce57671af2977b5ed7810b5143e364cfaef104078bd5075ecf975056f56c

Observation c1fdbb62-14a8-4a64-b749-caff434a2fec · inbound

Trace-Based On-Policy Distillation for Masked Diffusion Language Models cites this paper.

Trace-Based On-Policy Distillation for Masked Diffusion Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T19:45:10.653622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T19:45:10.653622Z digest=sha256:15a724135106e3f525cf7af3886205d53d7cf8ba8f7dc6fcb8c822ebd3c64f06

Observation 9519f0b2-c9e8-42f2-af52-d98a6fc5a3be · inbound

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models cites this paper.

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T14:25:39.226894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T14:25:39.226894Z digest=sha256:154ea906030fa9eb71efc9ec307441dbc1098206b0697b489cedef39bbf97a32

Observation 7e433f52-9bbe-44e5-b545-88135a8b4f41 · inbound

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs cites this paper.

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T00:36:13.011336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T00:36:13.011336Z digest=sha256:4dcd7f48abab41a3c0695ef1015b70552e0a232cb004ed2bb37df37b068517ec

Observation dcbaa409-4c60-4516-91f6-2a0c9657e95d · inbound

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling cites this paper.

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 67

Resolution
malformed identifier
no resolver link, observed 2026-08-04T03:25:21.230481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T03:25:21.230481Z digest=sha256:67a2716606683e7d0f855ae046cc24b839c013299488d7197ae99f5ffb5d08a5