Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T10:56:37.506852Z
Paper Citation Record · LEDGER
As of 17 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 2 inbound Pith citation observations for arXiv:2510.08233.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T10:56:37.506852Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-06-29T08:44:53.969301Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-06-29T08:53:16.381851Z
13 of 13 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation a2275442-ded0-4c9d-8f81-94fc46f07913 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e94fbefa-5873-4bc4-9674-1e07bd982be5 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 648c90f4-5b15-4143-8eea-dd74947945f9 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization 4.Integer Answer Reward:+0.5if the retrieved answer parses as an integer
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2f868b88-6cd3-4e51-a4a0-5235dae69e9b · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization For example, Zhao et al
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 663bdffb-1f57-4408-9e7e-7e13d5b345b7 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization 2.Correctness Reward:+2when the correct answer is enclosed in\boxed{}
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c18679bf-6b34-4150-b48d-78ce5f066e68 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e285fee-842d-4fbb-8e58-beffbc16d515 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dd63e2c9-2307-407a-a86e-c8d5a5618721 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 66a8c30d-85da-4139-9a64-9acc53b85723 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Unresolved cited work
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f6a5bc56-8768-4632-aa82-6e69b21e14f0 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 2014
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 800ad2a0-9efb-41ed-8a19-d5fddc32a4b2 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
Reference 2016
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f79244c4-042e-42e9-bc96-c60ba0e329b4 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization We conduct fine-tuning on the train split and evaluate on the test split.3 The reward comprises
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7b1cadbe-872b-4225-999f-b31939406525 · outbound
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 25ec4d80-41c3-4696-be6c-f74ff3303283 · inbound
Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
Reference 99
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation 59cbdc2e-3637-451f-93fa-404888b64d89 · inbound
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
Reference 67
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.