{"as_of":"2026-08-23T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78ddcd710010feb1dc2909e09b8123ac1adb7d63a114de1878635bd19aea95ce","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:49:56.151991Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:43:38.252406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"cited_work":{"arxiv_id":"2603.22216","doi":"10.48550/arxiv.2603.22216","metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2026 , eprint =","venue":"arXiv (Cornell University)","work_id":"37e704f6-862a-4142-9bfb-4d4eeaf0299a","year":2026},"citing_paper":{"arxiv_id":"2606.06031","last_updated":"2026-06-04T11:24:47Z","snapshot_observed_at":"2026-08-16T02:16:02.065767Z","submitted_at":"2026-06-04T11:24:47Z","title":"NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T01:43:38.252406Z"},"links":{"cited_paper":"/paper/2603.22216","citing_paper":"/paper/2606.06031"},"observation_digest":"sha256:0b7ec582e05a3ad22f9d058ad2fe1520c00b2c1cbb0dfb97f0cb6d17eee26686","observation_id":"d5fedb55-3422-432a-8fcf-30cd0a41b8e5","resolution":{"observed_at":"2026-07-24T02:23:54.104438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.22216/citation-record","integrity":"/paper/2603.22216/integrity","json":"/paper/2603.22216/citation-record.json","paper":"/paper/2603.22216"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.347220Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.347220Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:19562728b0345a96a395d1c8e49d339b0b8fee6c4d70b5f8b90a794676b6385d","observation_id":"1079c312-bdf4-4456-9043-50cd3352bcfa","resolution":{"observed_at":"2026-08-02T17:49:48.347220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.452689Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.452689Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:0552468c0103f978cca8f9b216eef2daf8f5665728323c5d5cc0752931799669","observation_id":"663588a9-1035-45f5-a173-7ec16d6f89c4","resolution":{"observed_at":"2026-08-02T17:49:48.452689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.558094Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.558094Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:b61ff61d10f10752dcaff93f6b58be891f402457a439af2d07e7e5ef904b25ed","observation_id":"36f8bdf0-eb0f-4bb4-9690-d1c807627996","resolution":{"observed_at":"2026-08-02T17:49:48.558094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.658095Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.658095Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e376d9dd7479654973d8a5476946bcf6c1d8720b3bbf1765d54223f6a4a794d2","observation_id":"b52ee5e8-afb1-4633-8127-13ceb21eede6","resolution":{"observed_at":"2026-08-02T17:49:48.658095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.779125Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.779125Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:61d3c8adb3a041cb9e78456bcf8a9fc2ed55db6b84c7e26b43fc2b8deafff93d","observation_id":"51b3f055-f05c-4cb3-a1ac-486465ffb3ff","resolution":{"observed_at":"2026-08-02T17:49:48.779125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:48.878696Z","title":"A continuous time framework for discrete denoising models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:48.878696Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:1d3ddbc6c304f40067d00b3132702557a11279be3b4b071121d085d717f65821","observation_id":"4c5fad2b-6e6b-44f3-8534-82361baf36c1","resolution":{"observed_at":"2026-08-02T17:49:48.878696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:49.033377Z","title":"One billion word benchmark for measuring progress in statistical language modeling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.033377Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:eebea0492d5c4da187373b103044b76cc9254922a899e8299c09aac8dc595a4f","observation_id":"5736ee0f-5080-4219-b059-592d56eb68dd","resolution":{"observed_at":"2026-08-02T17:49:49.033377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:49.123581Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.123581Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:75cfe9ebd3d9abe6dc975fea34afed09993677581108e32313c0a5bde4bb542a","observation_id":"12f3ef99-bd61-4331-8c7e-2184d30ad033","resolution":{"observed_at":"2026-08-02T17:49:49.123581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-02T17:49:49.229703Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.229703Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:91eb483392f82220562ca400a3762f8df766a6d4f22089eba80c30603f244270","observation_id":"b63324a3-b22e-4212-a64c-0e216d1b4109","resolution":{"observed_at":"2026-08-02T17:49:49.229703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-19T04:14:38.173722Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-02T17:49:49.320322Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.320322Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e064aa9ececb7719b6c0a1b8d3335c43bb2aa7119cfddf3d686514c2fba3713d","observation_id":"8447635e-cde6-4c44-baf8-70e5f7a3f626","resolution":{"observed_at":"2026-08-02T17:49:49.320322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:49.390097Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.390097Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:8d10d47a063298d045acaaed9592a826cd9999aeb718ac027f752c9f168e0130","observation_id":"9023f54a-dfc5-4183-92c5-a2251b5d8bca","resolution":{"observed_at":"2026-08-02T17:49:49.390097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-02T17:49:49.486016Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.486016Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:b732ba813774a234b6060957a9cb9e6367976283b942a17daa36bfdde6a4c6d1","observation_id":"8ecbe241-4abc-482d-80f7-b73a41ddd876","resolution":{"observed_at":"2026-08-02T17:49:49.486016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:49.631542Z","title":"A discourse-aware attention model for abstractive summarization of long documents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.631542Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:5f5eaa8bcd5bbd792dc529560a25132044c89c2165fd9946c456759d2d622a03","observation_id":"98c35d9f-9858-45dd-bb64-e1e9fa0843f3","resolution":{"observed_at":"2026-08-02T17:49:49.631542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T17:49:49.720517Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.720517Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:28ddba6b6c2208be9af83edc0c683d5da4743f01e30aff11fb1869fcb2fc09d3","observation_id":"80246763-8606-413e-8ea6-992ba73fe45c","resolution":{"observed_at":"2026-08-02T17:49:49.720517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:49.819441Z","title":"Gemini diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.819441Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:4cf67f2b263eb6bca87c31c453d429f738a3dc0c7131eb55071c69088fe0d404","observation_id":"fa124b1d-d018-48b3-8c15-a23ece9a426f","resolution":{"observed_at":"2026-08-02T17:49:49.819441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-20T02:58:37.877653Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15089","snapshot_observed_at":"2026-08-02T17:49:49.959448Z","title":"Continuous diffusion for categorical data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:49.959448Z"},"links":{"cited_paper":"/paper/2211.15089","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:14dcd3cc446ddaa8e6ad35697fe23a733fc78e39cf518705765c03e0e7c5ee0e","observation_id":"b19f4727-8cf8-42b3-abc4-4753d9908c7d","resolution":{"observed_at":"2026-08-02T17:49:49.959448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.115263Z","title":"Unifying autoregressive and diffusion-based sequence generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.115263Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:ea41ea7cce87603955fdb2cc65520dc429fee5760cdf74045ea01df059150479","observation_id":"cb4854b3-9d63-4c94-825c-1f25b6ce198d","resolution":{"observed_at":"2026-08-02T17:49:50.115263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.262435Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.262435Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:290b8b2277ebb0d58bcb6f1aa1cef25a37c77b31114e92d55dc3254630ecb40c","observation_id":"c3af8259-44dd-4843-b0b0-d596040b755d","resolution":{"observed_at":"2026-08-02T17:49:50.262435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.394684Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.394684Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:3e0d1551caec569fc29ac93d6825b82889bd5768ed21923fe859d9fc80d667fd","observation_id":"a61d24a0-6eda-42a4-b43c-ea433e7a3df8","resolution":{"observed_at":"2026-08-02T17:49:50.394684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.400779Z","title":"Mask-predict: Parallel decoding of conditional masked language models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.400779Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:986dee318eddb508997072cfb9d1df2312b1cf7e30ca397c29b36262963c0dab","observation_id":"effb11fb-8044-4924-a972-d2464dff165d","resolution":{"observed_at":"2026-08-02T17:49:50.400779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.457414Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.457414Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:ecea63b4f192071963244c2438973ebb6e0dbaa8a39b5cd5375ff6ee0b684fff","observation_id":"c52e6d14-27e4-4cc7-a794-8af2968825f9","resolution":{"observed_at":"2026-08-02T17:49:50.457414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.598841Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.598841Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:106dc1c2183cc7d63df740e78e1b55eebf200a0c8664196683ae9597e8a511e9","observation_id":"1a9487dd-3783-4aab-9f33-836709e17331","resolution":{"observed_at":"2026-08-02T17:49:50.598841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.726084Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.726084Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:224a5cc130b9a6da841925d665221a1c6cd43afbea41f39070651049b766901f","observation_id":"8cd22687-ec41-4436-b46d-730f2cd15303","resolution":{"observed_at":"2026-08-02T17:49:50.726084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:50.855179Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.855179Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:1fa33a88d2dcd92a78f7754c129639b453e54d636791985962f8bb2ed3d5cc3b","observation_id":"bb421df1-1fe4-4e8f-909c-a9340d9ad700","resolution":{"observed_at":"2026-08-02T17:49:50.855179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02281","last_updated":"2018-03-09T03:37:52Z","snapshot_observed_at":"2026-08-14T20:16:17.375580Z","submitted_at":"2017-11-07T04:42:48Z","title":"Non-Autoregressive Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02281","snapshot_observed_at":"2026-08-02T17:49:50.914473Z","title":"Non-autoregressive neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:50.914473Z"},"links":{"cited_paper":"/paper/1711.02281","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:83b85b21eef424132128eb327ac0b365516c8108edfcbf2e52a615614079c6e8","observation_id":"c3e223f8-0189-415f-8d63-b7ca2c3432dc","resolution":{"observed_at":"2026-08-02T17:49:50.914473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:51.103994Z","title":"Levenshtein transformer","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:51.103994Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e68cc777f96a8712aee3c767cc0fe0dce89b7e9ef288da842d53582b76c34bad","observation_id":"042e5328-b762-49e0-9f9d-c1e69ea3d53b","resolution":{"observed_at":"2026-08-02T17:49:51.103994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-02T17:49:51.261987Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:51.261987Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e1fc09be5f7074126f9e5d0715a6324dee9f365bdeccd27ff11dbecf43789d0e","observation_id":"e35478e7-ba6e-43d3-91b2-4c4a24f2a60e","resolution":{"observed_at":"2026-08-02T17:49:51.261987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:51.487175Z","title":null,"venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:51.487175Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:cd0344c8273615b61f855f8f8db51f4dc78feae41af0e5489a00563604af4c7e","observation_id":"a2218cab-296f-4157-8603-fe380fad81a5","resolution":{"observed_at":"2026-08-02T17:49:51.487175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-20T01:41:27.739080Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-08-02T17:49:51.649697Z","title":"Ssd-lm: Semi-autoregressive simplex-based diffusion language model for text generation and modular control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:51.649697Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:f338d36f6022e83d1bf2eea4577cbd15b04adf49467e945084178c3fc8b07953","observation_id":"01839513-d99a-4fda-9e4d-0ac7def12727","resolution":{"observed_at":"2026-08-02T17:49:51.649697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-18T14:05:49.723999Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-08-02T17:49:51.798854Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:51.798854Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:bf0cbe4e236398f57ccb7733c0b1906f283e1e7719cb9387e2bec3934a192176","observation_id":"28be9710-b24b-40ba-b746-05ff0c7fcba1","resolution":{"observed_at":"2026-08-02T17:49:51.798854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-02T17:49:52.012946Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.012946Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:daf47de4788c0ceaf83d9e3f1a897749f8e34b411e7bcac03a28a3d3418d06d6","observation_id":"a41001a0-e8f5-4535-9e46-77394c432a94","resolution":{"observed_at":"2026-08-02T17:49:52.012946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:52.179473Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.179473Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:152498ad8d08562bfbc0bba7c3936d9181d9c95a7f4f4f984770e0e5ba45a2ca","observation_id":"d0abd055-e645-40ac-b88b-c58fde3a751c","resolution":{"observed_at":"2026-08-02T17:49:52.179473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:52.302620Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.302620Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:723195e1f5f081ef6cfa117becbfc0f70fe3a3f4914f3e07fb3c99b252227507","observation_id":"20c8d6a9-c758-46c3-bb3b-ff83f57477ca","resolution":{"observed_at":"2026-08-02T17:49:52.302620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:52.445105Z","title":"Argmax flows and multinomial diffusion: Learning categorical distributions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.445105Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:ac700bfab640af1a5bc5e57c5491ca41c14a3ffaf9d3601d9fc69281d3a8d96c","observation_id":"9c9c630b-daba-4452-83ba-8eda3b14276f","resolution":{"observed_at":"2026-08-02T17:49:52.445105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:52.660473Z","title":"Accelerating diffusion llms via adaptive parallel decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.660473Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:4d47aa1521739bef3c84124deef70c51f22d200da1f43f4aff2fc34bf8fbd4e2","observation_id":"783fe19d-6e41-4de3-bbfc-9034e94d3382","resolution":{"observed_at":"2026-08-02T17:49:52.660473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-16T22:18:38.054720Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01025","snapshot_observed_at":"2026-08-02T17:49:52.807880Z","title":"Any-order flexible length masked diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.807880Z"},"links":{"cited_paper":"/paper/2509.01025","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:a1f9500caddc792389e42af3fd9380e425468287377cee693de3f1d23a36be01","observation_id":"b801e866-c62f-4236-bf29-669ce95f95b2","resolution":{"observed_at":"2026-08-02T17:49:52.807880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:52.941434Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:52.941434Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:ea1e5356ad41ba8f5eda5c4ba95901c19f54a6710b9ac80e87b7a8d920d2a63a","observation_id":"1e03e69e-7cb5-4eb4-9f13-47c53061a5d8","resolution":{"observed_at":"2026-08-02T17:49:52.941434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.064406Z","title":"Stochastic beams and where to find them: The gumbel-top-k trick for sampling sequences without replacement","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.064406Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:540c70ad0c25e47135d4a5afdf61627fd7a48f0b194a66e26be598ad751dd0c6","observation_id":"ee7a1c28-bcee-4160-aa57-1f27c0ddf712","resolution":{"observed_at":"2026-08-02T17:49:53.064406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.164238Z","title":"Cllms: Consistency large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.164238Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:7d336b87c503a62ea43ace7b85dd5fb03b35c0a98ef6ea0bcc1636c589545541","observation_id":"973fe76f-8e3c-4784-89c4-f3597b2d4ca1","resolution":{"observed_at":"2026-08-02T17:49:53.164238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-08-16T00:24:16.429058Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-02T17:49:53.293038Z","title":"Mercury: Ultra-fast language models based on diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.293038Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:b5fbd3a7e8667644cccb3ead92d28ffbc8544fa25b91598fbadd5a9f5497de8b","observation_id":"aecfe734-1003-4215-a417-87f4c35d0f0e","resolution":{"observed_at":"2026-08-02T17:49:53.293038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.375668Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.375668Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:6fbfced4446bff44571fa16feaca785f127d70352b5056a7fa2864066b945664","observation_id":"ca4957fa-464d-4b75-a6f2-b2eb455702c5","resolution":{"observed_at":"2026-08-02T17:49:53.375668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.473814Z","title":"Diffusion-lm improves controllable text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.473814Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e095b853f9da332cf359e27c5e0a58718fb6de3a5b0cfa9b9f134b7a8475fb46","observation_id":"ccd90081-8e8b-4377-b178-a850f05b399a","resolution":{"observed_at":"2026-08-02T17:49:53.473814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-02T17:49:53.547007Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.547007Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:4fff11bf5d3e605bec104a9457607491f66ded8e7638a02333ad67b7aef36d3b","observation_id":"2c983ae5-a3d6-4fdc-a3db-0b09751dd990","resolution":{"observed_at":"2026-08-02T17:49:53.547007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T17:49:53.627545Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.627545Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:998d97b3a41ca6fddd50c693f92e6e723edae556fc331a9e7031240fad685bbc","observation_id":"a785ac37-2e5a-46b1-832f-ab93954fa40e","resolution":{"observed_at":"2026-08-02T17:49:53.627545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01949","last_updated":"2025-03-19T08:34:29Z","snapshot_observed_at":"2026-08-17T22:34:27.429213Z","submitted_at":"2024-10-02T18:51:38Z","title":"Discrete Copula Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01949","snapshot_observed_at":"2026-08-02T17:49:53.702696Z","title":"Discrete copula diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.702696Z"},"links":{"cited_paper":"/paper/2410.01949","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:6f1241139afe10d1bde1d3ee37a0d3e6024a6235ec151ed5ce438eb471c27513","observation_id":"4da25fce-245c-4068-8af3-90535d941606","resolution":{"observed_at":"2026-08-02T17:49:53.702696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.775212Z","title":"Divergence Frontiers for Generative Models: Sample Complexity, Quantization Effects, and Frontier Integrals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.775212Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:91981e1046163af881346781dfd7f87ab93c7eb11bdd9834a345c16d8365f48b","observation_id":"447d1555-825b-4910-a909-f7e4ceac8254","resolution":{"observed_at":"2026-08-02T17:49:53.775212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-02T17:49:53.874773Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.874773Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:37437756b249ccf88162a3d282161ceba163ae32bcd2ded7d6868e9ad324c3ee","observation_id":"1fe23702-0d5e-4d4f-ad7d-5e618691910b","resolution":{"observed_at":"2026-08-02T17:49:53.874773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:53.984195Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:53.984195Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:1c562d059a4d88fe8c866364730a073dbe7ec16e243476706fc2aa377e2e2e92","observation_id":"7cd59e65-2b37-483c-b132-52a3f0555eff","resolution":{"observed_at":"2026-08-02T17:49:53.984195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.065128Z","title":"Maddison, Daniel Tarlow, and Tom Minka","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.065128Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:89b5d861339645d8a8c149757b8584ab81a3bb7307e064d9d18ebd0d7fc22c33","observation_id":"262b1b68-9713-462d-bd59-7f952a841486","resolution":{"observed_at":"2026-08-02T17:49:54.065128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.138783Z","title":"Marcus, Beatrice Santorini, and Mary Ann Marcinkiewicz","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.138783Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:67388350cc4186315e9621569a72d91304ca991a50297b4f0406c7ac5f8080b0","observation_id":"f63d1aae-b7b7-4e8b-95d0-907cdde597af","resolution":{"observed_at":"2026-08-02T17:49:54.138783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-02T17:49:54.205106Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.205106Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:2f54d88ba2de82b45bd53e75fb5718d20c48db588788af1fba32b7db79420ad0","observation_id":"d21b0bb5-90e3-474f-8771-443fdec0958f","resolution":{"observed_at":"2026-08-02T17:49:54.205106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.274853Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.274853Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:bdc51ebf5cfe415af0be7cfd7d646ff875f222455b710c711630a4bb076b3472","observation_id":"0872b1bd-6c62-4045-be27-73f664a4c6fb","resolution":{"observed_at":"2026-08-02T17:49:54.274853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-19T22:10:29.832011Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-02T17:49:54.375033Z","title":"Scaling up masked diffusion models on text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.375033Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:f5097dc5489c8e78e5887e435ff1b650a8c87e6914841dc2631d815f87fc6f9c","observation_id":"337edcbf-c282-4f36-bf47-f24e74ba0af9","resolution":{"observed_at":"2026-08-02T17:49:54.375033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-22T07:09:34.819168Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-02T17:49:54.447057Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.447057Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:bbc799507c0d4a9d90fde183c0dbfdaabf836f197c3a3a1ccb34ddbe2f055292","observation_id":"c48ef82c-cdf9-4481-9be6-69096d4e3049","resolution":{"observed_at":"2026-08-02T17:49:54.447057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.518176Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.518176Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:38bb9f7da8e95d96d225bc9e21c51b5250f7116cbdaa9d01c369deb79863642f","observation_id":"86c2f53a-003b-41c1-a178-fe224840e48c","resolution":{"observed_at":"2026-08-02T17:49:54.518176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.618387Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.618387Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:946e497965b9e779235551479a2711c98d86c959149217b3b2accaf2969232a7","observation_id":"7e6957a4-bc7f-4ed7-879c-3d50c25a6af1","resolution":{"observed_at":"2026-08-02T17:49:54.618387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.678703Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.678703Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:6263d52c6fbd3081d4602f6af62bd6a80f7f644b27a0a5dfe0c5de3dedd948e5","observation_id":"8a006e0b-84df-47a0-8ca9-5d272c49ff72","resolution":{"observed_at":"2026-08-02T17:49:54.678703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.762979Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.762979Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:2481d21673910e36caa0ec3535179a5e5a4ec057817d65cb35f169e0bd576d75","observation_id":"804c2f43-4d63-4b24-b032-0f60d249053f","resolution":{"observed_at":"2026-08-02T17:49:54.762979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.846231Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.846231Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:5de73a38784ecebc86889df48cdb71ee9cd5d46a35cc0d221c7f80d9f7348504","observation_id":"2c2a6bb5-81b3-42ad-b219-c6f3543d9bfb","resolution":{"observed_at":"2026-08-02T17:49:54.846231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:54.933009Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:54.933009Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:6656619b6b7964ec0ec20162c250e195c5045069db4ae163eeec222abeee7223","observation_id":"550da493-bfec-4597-a2f8-9aa6f03d1e98","resolution":{"observed_at":"2026-08-02T17:49:54.933009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:55.014793Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.014793Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e35497d5b7974e21b0e349de665c92b7f99cb1c9816c20810ea9ea10a9ba5c9c","observation_id":"d61acc41-1ade-4c33-b31b-238ba8c9fd89","resolution":{"observed_at":"2026-08-02T17:49:55.014793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11851","last_updated":"2025-07-16T02:31:40Z","snapshot_observed_at":"2026-08-20T11:40:12.060471Z","submitted_at":"2025-07-16T02:31:40Z","title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11851","snapshot_observed_at":"2026-08-02T17:49:55.073215Z","title":"Your llm knows the future: Uncovering its multi-token prediction potential","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.073215Z"},"links":{"cited_paper":"/paper/2507.11851","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:712ed13dffed36059b97c6b954444486b286b1cf82f1925aaa9ef058bcefcbdc","observation_id":"45a00f9f-e97f-4945-be09-b66ca875b0d1","resolution":{"observed_at":"2026-08-02T17:49:55.073215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10427","last_updated":"2023-05-17T17:57:34Z","snapshot_observed_at":"2026-08-18T03:17:09.571926Z","submitted_at":"2023-05-17T17:57:34Z","title":"Accelerating Transformer Inference for Translation via Parallel Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10427","snapshot_observed_at":"2026-08-02T17:49:55.112605Z","title":"Accelerating transformer inference for translation via parallel decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.112605Z"},"links":{"cited_paper":"/paper/2305.10427","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:3c2bf8c7cf6776ebcfba923d63ebe2d6cee1c03ab710863ec8af25f95ea661b9","observation_id":"ba04d43d-6c97-400b-a926-88ce208fb7e2","resolution":{"observed_at":"2026-08-02T17:49:55.112605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:55.206359Z","title":"Simplified and generalized masked diffusion for discrete data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.206359Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e83895c40254f104d1f973faa79b369b14f628cdc92dee52fb15c68ba741059d","observation_id":"369c3aeb-bf87-4877-9f70-8fb871b11b7f","resolution":{"observed_at":"2026-08-02T17:49:55.206359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:55.342172Z","title":"Diffusionblocks: Blockwise training for generative models via score-based diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.342172Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:e440d83f3f1b626d1a894bd60f49393851a6405a5598b648f72a7c37d8684068","observation_id":"8e8ea362-f93e-4fc3-a9a2-59118bd329be","resolution":{"observed_at":"2026-08-02T17:49:55.342172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07154","last_updated":"2026-06-01T01:30:58Z","snapshot_observed_at":"2026-08-16T12:51:34.788498Z","submitted_at":"2025-03-10T10:27:30Z","title":"Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07154","snapshot_observed_at":"2026-08-02T17:49:55.485449Z","title":"Ideas in inference-time scaling can benefit generative pre-training algorithms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.485449Z"},"links":{"cited_paper":"/paper/2503.07154","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:4056dbd9951fe6691ee404f1f2ccc021d561e0e3df027c76d0549cf644447111","observation_id":"f2b2d2dc-aace-4f01-8b03-63e4105ddc25","resolution":{"observed_at":"2026-08-02T17:49:55.485449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:55.650108Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.650108Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:fe0e61b05ec34a765322a50f0435b63a77d3e3e92c26ea0ebe02806d0f00c2b2","observation_id":"3e0dfd65-bc9c-48e7-b6e5-46cce8f96b63","resolution":{"observed_at":"2026-08-02T17:49:55.650108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-08-22T04:25:53.098928Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-02T17:49:55.759973Z","title":"Seed diffusion: A large-scale diffusion language model with high-speed inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.759973Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:aa9e15306e24951cf1915882c9dff053bab8a614810b2d318332bddb83312218","observation_id":"67b5c60b-8464-483a-9a20-d9ecadba7750","resolution":{"observed_at":"2026-08-02T17:49:55.759973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:55.907757Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:55.907757Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:cf0f1ebc2cd70baf9d6a7e1df354f44935e9b14ecdddc7fe6a04c95b8f5b7427","observation_id":"030d6895-28db-4061-984c-ffadd6a53bcc","resolution":{"observed_at":"2026-08-02T17:49:55.907757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16750","last_updated":"2023-03-06T18:57:42Z","snapshot_observed_at":"2026-08-19T12:28:09.151481Z","submitted_at":"2022-11-30T05:33:29Z","title":"Score-based Continuous-time Discrete Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16750","snapshot_observed_at":"2026-08-02T17:49:56.071326Z","title":"Score-based continuous-time discrete diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.071326Z"},"links":{"cited_paper":"/paper/2211.16750","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:626b78217dda1e64542d301d0621ffe139527ab0cf2d31be197beada1511e6f8","observation_id":"4556300d-d2dc-4d7c-aab6-64644361512b","resolution":{"observed_at":"2026-08-02T17:49:56.071326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T17:49:56.076090Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.076090Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:b5f093e748a1fa14d48a8b06ab6b46d8d71949cae786f02e436877ed34f876f2","observation_id":"f50dbbae-a828-4aca-b6d1-93a936a51bf8","resolution":{"observed_at":"2026-08-02T17:49:56.076090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.080589Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.080589Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:308cda43a967490b97036f8fda8f37e247604ec37f7d9e17e7a2414bcf6e2f70","observation_id":"85c468bc-7370-440f-b59e-1d4230e3885a","resolution":{"observed_at":"2026-08-02T17:49:56.080589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.084750Z","title":"u tte, Janis Fluri, Yuhui Ding, Antonio Orvieto, Bernhard Sch \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.084750Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:14217e329e7dd2418620db90247156f2f4b29592ccad6b3936b55e8315149615","observation_id":"c8f26ac7-76d0-4dfe-9ce0-91a9433c2be1","resolution":{"observed_at":"2026-08-02T17:49:56.084750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.089680Z","title":"Remasking discrete diffusion models with inference-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.089680Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:d618f2145b8c7f579abad209804ac28bd54e2ab272db29af693ab41a32df9117","observation_id":"e860b944-be3e-494d-b3c1-cdf74dc471d9","resolution":{"observed_at":"2026-08-02T17:49:56.089680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-02T17:49:56.094300Z","title":"Fast-dllm: Training-free acceleration of diffusion llm by enabling kv cache and parallel decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.094300Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:ad8e57604c8a35ff4da3d72d360ba05521fc61015e011722f7ebb20f287be97b","observation_id":"8e24d814-6c66-4164-838b-a3844b318cd1","resolution":{"observed_at":"2026-08-02T17:49:56.094300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.098508Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.098508Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:70ab0edb5107b1eb093a2ba3a01b318526d611f0ce79668dd04f73fdc3c1f0c7","observation_id":"8a0dd78c-64f7-4f70-8151-f812b4d9305c","resolution":{"observed_at":"2026-08-02T17:49:56.098508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.102520Z","title":"A survey on non-autoregressive generation for neural machine translation and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.102520Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:887a09314c1a0f14bb8789834e96997f8b86f864ad63e00be7fa1aacc1deb4e4","observation_id":"57418943-87ff-414a-ac71-93984eef6c7b","resolution":{"observed_at":"2026-08-02T17:49:56.102520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21357","last_updated":"2025-03-07T04:28:45Z","snapshot_observed_at":"2026-08-16T13:05:17.774393Z","submitted_at":"2024-10-28T17:25:56Z","title":"Energy-Based Diffusion Language Models for Text Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21357","snapshot_observed_at":"2026-08-02T17:49:56.106702Z","title":"Energy-based diffusion language models for text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.106702Z"},"links":{"cited_paper":"/paper/2410.21357","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:f23bda327b7f26110d266e4f8a63af2cad41845248469b8618b3a7f31bd51df5","observation_id":"6a783128-ee35-41e7-bd78-c67e13663d48","resolution":{"observed_at":"2026-08-02T17:49:56.106702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-08-14T18:38:02.862463Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-02T17:49:56.111129Z","title":"Dream 7b: Diffusion large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.111129Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:a3362031fa576a5167e9c4065d1324874878c6a37ec45eda752c1cffb512ab77","observation_id":"5c488aee-be9a-42c3-b53a-a05f015a99b1","resolution":{"observed_at":"2026-08-02T17:49:56.111129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.115518Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.115518Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:da1ecf153e8398ed0ca82877712c6f82509ffb602684e8fe96273d3af95319af","observation_id":"ab4d5f49-0a90-4eb4-a5bc-68bcce3fa7fa","resolution":{"observed_at":"2026-08-02T17:49:56.115518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.119756Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.119756Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:be99e3658984178058e3199b9da350b6097c48d9384955e21d5b8e772ea84da8","observation_id":"dabd7702-7885-4bca-9338-93185b096ff6","resolution":{"observed_at":"2026-08-02T17:49:56.119756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.124588Z","title":"Masked diffusion models are secretly time-agnostic masked models and exploit inaccurate categorical sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.124588Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:d9292787b407d02b2f966bba3d2582ce66c3d53ff49ecbf94edfbe7ba60aab71","observation_id":"f4aa8f09-1781-428f-a0b4-336a500c0dd1","resolution":{"observed_at":"2026-08-02T17:49:56.124588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05737","last_updated":"2024-08-02T16:09:14Z","snapshot_observed_at":"2026-08-19T19:50:58.273113Z","submitted_at":"2023-02-11T16:26:57Z","title":"A Reparameterized Discrete Diffusion Model for Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05737","snapshot_observed_at":"2026-08-02T17:49:56.128730Z","title":"A reparameterized discrete diffusion model for text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.128730Z"},"links":{"cited_paper":"/paper/2302.05737","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:0b1d464575ac4c0839d7ff8fb98661e189093f1e7aa3a3fe16f6d02e056038fa","observation_id":"8d9a7144-4930-4070-8eac-b4bf0575ac65","resolution":{"observed_at":"2026-08-02T17:49:56.128730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15457","last_updated":"2025-03-19T17:36:54Z","snapshot_observed_at":"2026-08-16T12:48:30.961329Z","submitted_at":"2025-03-19T17:36:54Z","title":"Di$\\mathtt{[M]}$O: Distilling Masked Diffusion Models into One-step Generator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15457","snapshot_observed_at":"2026-08-02T17:49:56.133260Z","title":"Di [M] o: Distilling masked diffusion models into one-step generator","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.133260Z"},"links":{"cited_paper":"/paper/2503.15457","citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:87fa835598b9d27eaca5d58873cb5312b7dd29505d9d9a98986167bbe0eb3c3f","observation_id":"54d84331-7116-4acd-a7eb-13bf9a5b6c79","resolution":{"observed_at":"2026-08-02T17:49:56.133260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.137563Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.137563Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:3a6c9c425fc8dd756eb3350439b92ec94d9bf4526c82e74c0fe1859611d836de","observation_id":"fc640a8c-afe4-4da4-a885-e66610d7c4bc","resolution":{"observed_at":"2026-08-02T17:49:56.137563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.142799Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.142799Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:388a7731b1c3e0c9bb140fe2133de466e9bf333e42bc58df35dccf0a7ce48d93","observation_id":"931c4a30-f29c-4c86-accc-e9978ff013ec","resolution":{"observed_at":"2026-08-02T17:49:56.142799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.147667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.147667Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:c3c9efdbb56d456ec24526655b7a21ef5c908b96c92b98f9b4706a0786821273","observation_id":"683727e4-5b9c-48ba-92db-54077803cfce","resolution":{"observed_at":"2026-08-02T17:49:56.147667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:49:56.151991Z","title":"requires knowing that ``Francisco","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-02T17:49:56.151991Z"},"links":{"citing_paper":"/paper/2603.22216"},"observation_digest":"sha256:fbe2776bfd1cf5d2e81385de8f0d23c9ec94ceea2192ae72ec7560c498985765","observation_id":"c863a1ac-5e8e-4b15-ac6f-346660989205","resolution":{"observed_at":"2026-08-02T17:49:56.151991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.22216","last_updated":"2026-07-23T16:32:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:33:41.982497Z","submitted_at":"2026-03-23T17:13:22Z","title":"Gumbel Distillation for Parallel Text Generation"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2603.22216."}