{"as_of":"2026-08-18T01:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0572709aa0da4f825fae293b73991103ead84dea2b35e4af0209dc25c5ac97d","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:56:37.506852Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:44:53.969301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:53:16.381851Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"cited_work":{"arxiv_id":"2510.08233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08233","snapshot_observed_at":"2026-07-14T02:20:18.985734Z","title":"# 𝐱\"$𝐱\"% 𝐱","venue":null,"work_id":"6dd75473-5c92-411d-bd35-5a0a522fd507","year":2025},"citing_paper":{"arxiv_id":"2605.23346","last_updated":"2026-05-22T08:06:52Z","snapshot_observed_at":"2026-07-06T23:33:34.409634Z","submitted_at":"2026-05-22T08:06:52Z","title":"Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-25T05:30:15.053277Z"},"links":{"cited_paper":"/paper/2510.08233","citing_paper":"/paper/2605.23346"},"observation_digest":"sha256:29b29f2592034118f12cc19bd5c833676291b0c8c97a2a0d57c6c313f86f2f45","observation_id":"25ec4d80-41c3-4696-be6c-f74ff3303283","resolution":{"observed_at":"2026-07-14T02:20:18.985734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"cited_work":{"arxiv_id":"2510.08233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08233","snapshot_observed_at":"2026-07-14T02:20:18.985734Z","title":"# 𝐱\"$𝐱\"% 𝐱","venue":null,"work_id":"6dd75473-5c92-411d-bd35-5a0a522fd507","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2510.08233","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:8d141e1b9f73b68339ffebb09bf84ce1d07b81657fec378a31acf434aec12e29","observation_id":"59cbdc2e-3637-451f-93fa-404888b64d89","resolution":{"observed_at":"2026-07-14T02:20:18.985734Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.08233/citation-record","integrity":"/paper/2510.08233/integrity","json":"/paper/2510.08233/citation-record.json","paper":"/paper/2510.08233"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:36.895442Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.895442Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:63cbc2bcbf13d803c476ad84b47921f6faa6f5496c36db11be28eaecd36e40a8","observation_id":"a2275442-ded0-4c9d-8f81-94fc46f07913","resolution":{"observed_at":"2026-08-04T10:56:36.895442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:36.975282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.975282Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:1fa02263df9b54cf75b8d3b8750934ed56d36b80659d6de19f098444755cddc9","observation_id":"e94fbefa-5873-4bc4-9674-1e07bd982be5","resolution":{"observed_at":"2026-08-04T10:56:36.975282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.034856Z","title":"4.Integer Answer Reward:+0.5if the retrieved answer parses as an integer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.034856Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:d6d6e186a1657a42cd7f03e5bcbdce7463ef3ff3aee0c7b75ea8fa552dcee249","observation_id":"648c90f4-5b15-4143-8eea-dd74947945f9","resolution":{"observed_at":"2026-08-04T10:56:37.034856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:36.816166Z","title":"For example, Zhao et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.816166Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:0acdb7a8421a236400da32fc04566b3cdb61cf8892b356beb821aebfeb389f39","observation_id":"2f868b88-6cd3-4e51-a4a0-5235dae69e9b","resolution":{"observed_at":"2026-08-04T10:56:36.816166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.225635Z","title":"2.Correctness Reward:+2when the correct answer is enclosed in\\boxed{}","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.225635Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:04aa8df3e5db2009e85d833726e9743c955ac58bf44f80f76346388b0d39eb04","observation_id":"663bdffb-1f57-4408-9e7e-7e13d5b345b7","resolution":{"observed_at":"2026-08-04T10:56:37.225635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.302615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.302615Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:9f46266866459dab3bb30cc172f32a5ae6bbe8c741683083d2439428d1dd738b","observation_id":"c18679bf-6b34-4150-b48d-78ce5f066e68","resolution":{"observed_at":"2026-08-04T10:56:37.302615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.377963Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.377963Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:2a18950a38b7993987549d77bb6cccd9110c599d442d89ee6f075cf3f73170aa","observation_id":"7e285fee-842d-4fbb-8e58-beffbc16d515","resolution":{"observed_at":"2026-08-04T10:56:37.377963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.451660Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.451660Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:12680e99feca06799c53f1663e6e0121576e323a4bb30b00a96e1580616a8a07","observation_id":"dd63e2c9-2307-407a-a86e-c8d5a5618721","resolution":{"observed_at":"2026-08-04T10:56:37.451660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.506852Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.506852Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:6aea82de0fad63978404c3a95019d0f287d30ea15fa11e468fcde694d8bf1a79","observation_id":"66a8c30d-85da-4139-9a64-9acc53b85723","resolution":{"observed_at":"2026-08-04T10:56:37.506852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T10:56:36.699521Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.699521Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:a10f5081c800c21d5bccc7796b50b6f70610f4e9321749dca2e2e2daa64adbe5","observation_id":"f6a5bc56-8768-4632-aa82-6e69b21e14f0","resolution":{"observed_at":"2026-08-04T10:56:36.699521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06949","last_updated":"2025-09-08T17:58:06Z","snapshot_observed_at":"2026-08-14T20:38:08.942762Z","submitted_at":"2025-09-08T17:58:06Z","title":"Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06949","snapshot_observed_at":"2026-08-04T10:56:36.762055Z","title":"Leandro von Werra, Younes Belkada, Lewis Tunstall, Edward Beeching, Tristan Thrush, Nathan Lambert, Shengyi Huang, Kashif Rasul, and Quentin Gallouédec","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.762055Z"},"links":{"cited_paper":"/paper/2509.06949","citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:7edc2dadf244fc865e5a70a999ae893a5dee9a3d74b383d7004675c394d5addc","observation_id":"800ad2a0-9efb-41ed-8a19-d5fddc32a4b2","resolution":{"observed_at":"2026-08-04T10:56:36.762055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:56:37.116694Z","title":"We conduct fine-tuning on the train split and evaluate on the test split.3 The reward comprises","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:37.116694Z"},"links":{"citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:9d76d40854211843ca10523c72ff63377b25911f3ebe962795f45cc0780b15af","observation_id":"f79244c4-042e-42e9-bc96-c60ba0e329b4","resolution":{"observed_at":"2026-08-04T10:56:37.116694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-17T13:30:15.045823Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20639","snapshot_observed_at":"2026-08-04T10:56:36.658022Z","title":"Carles Domingo-Enrich, Michal Drozdzal, Brian Karrer, and Ricky T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:56:36.658022Z"},"links":{"cited_paper":"/paper/2506.20639","citing_paper":"/paper/2510.08233"},"observation_digest":"sha256:26750a4d8f5fb9e2bdc4b3625175ea5ae094fded6da8c641749a80c245333c23","observation_id":"7b1cadbe-872b-4225-999f-b31939406525","resolution":{"observed_at":"2026-08-04T10:56:36.658022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.08233","last_updated":"2026-07-12T05:47:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T21:49:45.820257Z","submitted_at":"2025-10-09T13:59:50Z","title":"Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 2 inbound Pith citation observations for arXiv:2510.08233."}