{"as_of":"2026-08-16T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7153f764aadb514afa1ddc0d19e7d044fc39bcd542da5702df5ac5a82bdea02","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T03:04:12.500342Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05722/citation-record","integrity":"/paper/2607.05722/integrity","json":"/paper/2607.05722/citation-record.json","paper":"/paper/2607.05722"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.09557","last_updated":"2026-05-28T14:40:40Z","snapshot_observed_at":"2026-08-10T22:40:12.860257Z","submitted_at":"2026-02-10T16:19:56Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2604.09557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09557","snapshot_observed_at":"2026-07-11T03:07:52.017190Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","venue":"cs.DC","work_id":"4309e336-9a94-47d3-82b4-5c88af532e12","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2604.09557","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:b7808225e58f45ebf9a5318e9c3d5c99eac30b6bb325196373194aa855653d15","observation_id":"34eac21a-efac-4fc6-90c9-a4e2c55746ad","resolution":{"observed_at":"2026-07-11T03:07:52.043449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:e96711b1d54fa49d6ed8b958564b93a6aabe3cab896a44799e44f21828f0201f","observation_id":"e2dc7d1b-e031-4d9e-aa13-3faa7e081908","resolution":{"observed_at":"2026-07-11T03:07:51.902611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-08-14T18:38:02.862463Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.15487","doi":"10.48550/arxiv.2508.15487","metadata_source":"pith","pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream 7B: Diffusion Large Language Models","venue":"cs.CL","work_id":"a8a49dbd-ad10-4c79-b1aa-3ad5173887ad","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:867d2ddd00a95d0d2b956e41c927e8177ddbd533e5add75af604467fa68e926d","observation_id":"bd218171-b3cf-46f2-aada-79a09f58b7f4","resolution":{"observed_at":"2026-07-11T03:07:51.619644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:51.378138Z","title":"Sdar: A syn- ergistic diffusion-autoregression paradigm for scalable sequence generation.arXiv preprint arXiv:2510.06303","venue":null,"work_id":"78561109-9df2-4b95-b2c6-4136d3384b98","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:78f7ed8e0543b3a5ac3c79d75f7f6face08ef34411bd4850d07ece56927cbf9f","observation_id":"b44acab4-a329-41f2-9db9-6d5716cdac77","resolution":{"observed_at":"2026-07-11T03:07:51.406882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-15T17:35:58.261951Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":"2410.18514","doi":"10.48550/arxiv.2410.18514","metadata_source":"pith","pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.18514 , year=","venue":"cs.AI","work_id":"18872de0-5f47-4650-ba4f-f48cab3bfc7e","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:eeb3f5758d045b2c7d2a3a3308ea6935ba1b20d197cf78a96df04c4e254c35d2","observation_id":"e34eeeb2-e170-4575-b709-d4c4f4ea8771","resolution":{"observed_at":"2026-07-11T03:07:51.150507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19935","last_updated":"2025-06-24T18:22:25Z","snapshot_observed_at":"2026-08-15T18:20:40.509413Z","submitted_at":"2025-06-24T18:22:25Z","title":"Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and Architecture","version":1},"cited_work":{"arxiv_id":"2506.19935","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19935","snapshot_observed_at":"2026-07-11T03:07:52.453229Z","title":"Any-order gpt as masked diffusion model: Decoupling formulation and architecture.arXiv preprint arXiv:2506.19935","venue":"cs.LG","work_id":"de99a665-5830-4922-8d2c-f76aedabc7bf","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2506.19935","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:562ef30f14a7fd7147d2d0f754cb3dd44143c973f64920fd9a01cf4e26a3b7d0","observation_id":"fa9819f8-5cd2-4e2e-a43e-56c75313f540","resolution":{"observed_at":"2026-07-11T03:07:52.501391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11851","last_updated":"2025-07-16T02:31:40Z","snapshot_observed_at":"2026-08-13T01:40:25.997863Z","submitted_at":"2025-07-16T02:31:40Z","title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","version":1},"cited_work":{"arxiv_id":"2507.11851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11851","snapshot_observed_at":"2026-07-11T03:07:52.420950Z","title":"Your llm knows the future: Uncovering its multi-token prediction potential","venue":"cs.CL","work_id":"16bb770c-f778-4c03-a015-c2e45263b787","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2507.11851","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:5b84dd2e5369abb18c7fc228b226771c5ce63cf63cc2f43b54c0f21bdef763dd","observation_id":"d4f25567-fa1b-47dd-b588-45e664bba341","resolution":{"observed_at":"2026-07-11T03:07:52.446413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-08-13T11:30:48.832931Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":"2503.01840","doi":"10.48550/arxiv.2503.01840","metadata_source":"pith","pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","venue":"cs.CL","work_id":"323c1b68-aec5-4444-944f-155a771bd8c6","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:a1d07fe7ff7cc79e79e08954c2c5eb81a62fc5804db351f672905294f814c638","observation_id":"c1893648-6f78-49ed-970b-4274eaf19e78","resolution":{"observed_at":"2026-07-11T03:07:52.335776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-14T13:55:40.999046Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2503.09573","doi":"10.48550/arxiv.2503.09573","metadata_source":"pith","pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","venue":"cs.LG","work_id":"b34ab928-6ffb-4028-b13c-395a8924d76b","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:79d0f69135f11bbdb8f3872912a240f30cbc84a7a0eabb6c0fe057a08bdb1cd1","observation_id":"113d8003-9586-474a-b9e3-454947404480","resolution":{"observed_at":"2026-07-11T03:07:51.074849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14067","last_updated":"2026-04-29T20:52:08Z","snapshot_observed_at":"2026-08-13T02:27:38.752907Z","submitted_at":"2025-12-16T04:12:17Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","version":2},"cited_work":{"arxiv_id":"2512.14067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14067","snapshot_observed_at":"2026-07-11T03:07:51.162396Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","venue":"cs.CL","work_id":"df68a164-2dfd-4559-984e-6095ef320eed","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2512.14067","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:cc04d033730fa431a9786a74832d30e9743a94e625fb8df1b560e79fff62f1b7","observation_id":"f3477b76-bcb3-485d-aff8-f7b241bf4510","resolution":{"observed_at":"2026-07-11T03:07:51.188712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:9334c5377bd66867b8ae632cea132dfaf3f03773621444c2ffe52e8ec0368d74","observation_id":"9a5d6f37-08f9-4a04-b937-798527f90133","resolution":{"observed_at":"2026-07-11T03:07:52.577000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:77f70d753dd8f067c442a8b7b2b8bb9b4ff5c37447a2d6dee797ecddb6f10632","observation_id":"bc8350b0-439a-41d9-9b62-106365ff549e","resolution":{"observed_at":"2026-07-11T03:07:50.840954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26328","doi":"10.48550/arxiv.2509.26328","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast- dllm v2: Efficient block-diffusion llm.arXiv preprint arXiv:2509.26328","venue":"arXiv (Cornell University)","work_id":"248fd492-8bf7-4ce9-a1df-130b5b976e36","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:c36ce38fb8a1311cc4aae0396268c1493f9c9cc242c3ea76908157de9775ad07","observation_id":"474678eb-046f-4164-9ecc-15b40d176491","resolution":{"observed_at":"2026-07-11T03:07:50.959092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04185","last_updated":"2025-09-04T13:02:39Z","snapshot_observed_at":"2026-08-15T00:39:58.408075Z","submitted_at":"2025-09-04T13:02:39Z","title":"Set Block Decoding is a Language Model Inference Accelerator","version":1},"cited_work":{"arxiv_id":"2509.04185","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04185","snapshot_observed_at":"2026-07-11T03:07:50.848023Z","title":"Set block decoding is a language model inference accelerator","venue":"cs.LG","work_id":"78d65102-c65d-4768-a6df-89a39e96c873","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2509.04185","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:f29734f0a40f11ab441202783bd18c5aab20d61a02c8b7d00606781ef65faf91","observation_id":"3f5f3e84-605e-4c12-8990-46a676ca3356","resolution":{"observed_at":"2026-07-11T03:07:50.879251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.820501Z","title":"Deepseek-v3 technical report","venue":null,"work_id":"674f5753-fa1a-4ce3-8e20-fde19b2ed23b","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:8d7d9ab992557782628f3bc414208fb1651fff4d00f6583a4ec5427fc488bd7d","observation_id":"175e54cc-2487-4fc4-b5f9-0ccc2f29d12e","resolution":{"observed_at":"2026-07-11T03:07:54.851941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":"2505.22618","doi":"10.48550/arxiv.2505.22618","metadata_source":"pith","pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","venue":"cs.CL","work_id":"9f6c2a70-9830-48ae-b181-6b5b1cbfae97","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:be2be09c04bb6b5aca179cb94a8daf7518c8a615d99face2421dcd18015c44c2","observation_id":"b2db3883-0fcd-4f23-9e7e-06ad4c958b28","resolution":{"observed_at":"2026-07-11T03:07:52.143643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.856398Z","title":"Fast inference from transformers via speculative de- coding","venue":null,"work_id":"8e354444-1cff-47ac-b3a6-609ab788b298","year":2023},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:c884e825f68cdbb23b2be9393902dae63537c1da466e07cc09113aa0c8520f73","observation_id":"eb3b8311-8579-47f2-a8b1-758bfa76288f","resolution":{"observed_at":"2026-07-11T03:07:54.890096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.374505Z","title":"Lora: Low-rank adaptation of large language models.Iclr, 1(2):3","venue":null,"work_id":"80a84b35-042e-4846-80ca-177dbf9b1b1b","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:109a5013ee5ffa35719fe6e302b47c508560d237912e04db31ff96167a4c8225","observation_id":"6e3c1379-917c-4824-a5cc-d34c09667c34","resolution":{"observed_at":"2026-07-11T03:07:55.402934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.23881","last_updated":"2026-06-01T13:21:18Z","snapshot_observed_at":"2026-08-11T03:26:10.154297Z","submitted_at":"2026-02-27T10:20:11Z","title":"LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2602.23881","doi":"10.48550/arxiv.2602.23881","metadata_source":"pith","pith_arxiv_id":"2602.23881","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Samarin, S","venue":"cs.LG","work_id":"3807cc54-6e95-4909-9f3c-f9cb4bc1b2a5","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2602.23881","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:56f23125565fe52e081c361ab9ead19bb5be2f6a070425bfaa7885e867fec162","observation_id":"1fc20c11-f197-429c-b22a-f548d160548e","resolution":{"observed_at":"2026-07-11T03:07:50.917812Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:52.191436Z","title":"Tidar: Think in diffusion, talk in autoregression","venue":null,"work_id":"ee07aeca-ea93-4394-85e4-7bbe1b5565d0","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:ebbfddb6a1cff1b8b4a3c04d306af2e5bc107191d14f4a29d2171277f930ee7b","observation_id":"3795c68c-e4ca-4944-86f6-ea4f58cfe872","resolution":{"observed_at":"2026-07-11T03:07:52.222856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":"2601.08584","doi":"10.48550/arxiv.2601.08584","metadata_source":"pith","pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ministral 3","venue":"cs.CL","work_id":"6f314463-0f42-4eea-a5c3-607e733d6afe","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:340b612d6625711416f1cf4f21d5a223095dc9aafcee0c6f1b598a8c8e0456d2","observation_id":"8e7314fb-6552-4750-aa3e-1723b6037bdb","resolution":{"observed_at":"2026-07-11T03:07:51.220131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14444","last_updated":"2025-09-02T16:12:36Z","snapshot_observed_at":"2026-07-06T22:15:27.120497Z","submitted_at":"2025-08-20T06:00:57Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","version":4},"cited_work":{"arxiv_id":"2508.14444","doi":"10.48550/arxiv.2508.14444","metadata_source":"pith","pith_arxiv_id":"2508.14444","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","venue":"cs.CL","work_id":"a449edca-bc6c-4333-9b98-84c9578290bf","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2508.14444","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:4befbc0edd4a07ed2d63ba713625779a9a63333684d08817bd26c1256d531d13","observation_id":"63117d4b-6445-4e67-9660-7a94f40a75d7","resolution":{"observed_at":"2026-07-11T03:07:51.292757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:36.116713+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:36.116713+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:b87e8c50cad2f4012055e7a8e4f3c637b1a993ea88e690b52fa200a05c7c4466","observation_id":"34ec3534-592e-4b6f-b720-cb9d9db433b1","resolution":{"observed_at":"2026-07-11T03:07:51.253713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12374","last_updated":"2026-04-14T07:02:32Z","snapshot_observed_at":"2026-08-15T09:08:16.743783Z","submitted_at":"2026-04-14T07:02:32Z","title":"Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning","version":1},"cited_work":{"arxiv_id":"2604.12374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12374","snapshot_observed_at":"2026-07-11T03:07:51.485773Z","title":"Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning","venue":"cs.LG","work_id":"9218633a-524d-4693-9715-f685e35cd82f","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2604.12374","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:93d00e041243178c600646c065223449b6635026bc0242e8e5b260e8888be536","observation_id":"0aed21d1-7ebf-4514-8c35-feabef09f223","resolution":{"observed_at":"2026-07-11T03:07:51.512366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.407096Z","title":"Finevi- sion: Open data is all you need, 2025","venue":null,"work_id":"5c2ed19b-1650-4453-87d4-bbb4d04a934b","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:917ed2789212ed732757d9e558d8e40a5a578f3154f7d3716de6b01cc302ae5c","observation_id":"196157c1-2151-40fa-817f-acf4c51ba51d","resolution":{"observed_at":"2026-07-11T03:07:55.433776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.342348Z","title":"Nemo-skills: A toolkit for improving skills of large language models","venue":null,"work_id":"d9b774c0-d559-4401-9283-9f2d83fb0861","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:ae987eecb3e08fb0c98c23d99d482f85baff6c852f387931d91360353fcec1eb","observation_id":"50a9c346-7fd4-4883-ac66-2706a358644c","resolution":{"observed_at":"2026-07-11T03:07:55.370418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.438778Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"f59ff72a-08ca-47eb-ac8e-34ef62ca935e","year":2016},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:3d2c528ebe644d8849ba9e12836deec70f1f72ab531ef6affc90469c5d337053","observation_id":"d65a9250-da68-4952-bd82-483b4f84112b","resolution":{"observed_at":"2026-07-11T03:07:55.472342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.234610Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"4fde8001-66a4-4f8e-9ed0-02a512db7179","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:632e1d9060e237bf5f2d0b0c07c18ea6d3eb6eaeae7ff96dbd6adc3e775d9368","observation_id":"0d77d2d8-2ed7-4a3d-a34f-2d5a755c5066","resolution":{"observed_at":"2026-07-11T03:07:55.271028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.276414Z","title":null,"venue":null,"work_id":"a76ff7c1-5623-4c74-8702-860f5bad0291","year":2021},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:832316bbd6cc37706aa1004e4060538e02b55dfc362033c4554ffaa242a71760","observation_id":"307ccccf-4953-4447-9beb-d83a9277438c","resolution":{"observed_at":"2026-07-11T03:07:55.303619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.311458Z","title":"Mmmu: A mas- sive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"e0533119-bf96-42a3-b4e2-997e9048f6cd","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:5605621ca14b3faf82c08d21047e72b46b84d90efa0ee9d80dffee9d5f936269","observation_id":"e626245a-e8a8-4593-9839-190bddd92077","resolution":{"observed_at":"2026-07-11T03:07:55.337625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.787558Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"ca622cd4-8c68-4b01-ae4c-7f222bc8ec14","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:5a15e27bdacb2f75912fb9fd32c1de94ffd6ea3b45950743c4695d9b439b908e","observation_id":"1d583235-1ddc-45a4-95ee-a733425b6817","resolution":{"observed_at":"2026-07-11T03:07:54.815897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.137609Z","title":"Realworldqa, 2024","venue":null,"work_id":"c516ba5d-c5d7-435c-975f-0cde6ad911c1","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:7b17fa52e3a8ebcc44d0a531ced33c82fd45b630d29452d9b4aaa2885665fe93","observation_id":"5e82ab62-cab8-446e-bea6-12c36e786cec","resolution":{"observed_at":"2026-07-11T03:07:55.164403Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.199961Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":"f0232ec7-42f1-4d66-9c61-960001ab189c","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:a2a8b2b0ac8a14a8ea1d526a8ed79361fd4e5fbd896ede41c3051b8d53d9e9ed","observation_id":"17c6fdc5-db31-470c-b141-7be15157d932","resolution":{"observed_at":"2026-07-11T03:07:55.231014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-16T07:03:45.766617Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:db55a4d5e66bdf8170ce34715de58ee3a90802f7ecb25eec2561d219b87f3fa0","observation_id":"a28d3a0d-2935-4b6f-9904-97d996fbf086","resolution":{"observed_at":"2026-07-11T03:07:51.443936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-14T13:42:27.582012Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"cited_work":{"arxiv_id":"2505.16839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16839","snapshot_observed_at":"2026-07-11T03:07:51.804158Z","title":"Lavida: A large diffu- sion language model for multimodal understanding.CoRR, abs/2505.16839","venue":"cs.CV","work_id":"137aa257-d405-4617-a62a-b313838b9956","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.16839","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:6adb2c3619cbc034b24ffac067ce79fbb6ea3e59f09e2466d5d0dca112d76544","observation_id":"e79d6e72-ac2c-4f02-ab0f-8e5f4bbae131","resolution":{"observed_at":"2026-07-11T03:07:51.832920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:d34a9d4989e497108300bfad79db3c9efd4f362069c8751fd6b24814d8945290","observation_id":"01287599-c0a9-451a-8b6d-7f3400a1fd62","resolution":{"observed_at":"2026-07-11T03:07:52.297701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16990","last_updated":"2025-05-26T02:04:39Z","snapshot_observed_at":"2026-08-07T14:49:45.584405Z","submitted_at":"2025-05-22T17:55:04Z","title":"Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding","version":2},"cited_work":{"arxiv_id":"2505.16990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16990","snapshot_observed_at":"2026-07-11T03:07:51.665307Z","title":"Dimple: Discrete diffusion multimodal large language model with parallel decoding.arXiv preprint arXiv:2505.16990","venue":"cs.CV","work_id":"6d9ab858-5467-437a-80dc-c4ee9dac2f26","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.16990","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:de2f8de9c756f42372ad8336e51c26b3cb2e9e0b0ca2088ce2e0fb352916b522","observation_id":"9f6939ff-ae94-478d-a3e2-79e0f33ffe68","resolution":{"observed_at":"2026-07-11T03:07:51.692682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-12T23:21:07.520817Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":"2407.11691","doi":"10.48550/arxiv.2407.11691","metadata_source":"pith","pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":"cs.CV","work_id":"c639e7fb-11f5-459a-8942-659daa5ac1d8","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:ba96d909cd5eb2dbb770557a71ba86483730b17df6049702477f346fa4ce7115","observation_id":"ce412b0f-15e9-4e5c-b6d0-536b2bf5d278","resolution":{"observed_at":"2026-07-11T03:07:51.040962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.067454Z","title":"Diffusion-lm improves controllable text generation.Advances in neural information processing systems, 35:4328–4343","venue":null,"work_id":"7f1b1d9e-420c-49f9-b4da-71d8dadf94cb","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:bca45f8ba4e13edc089ce3a1399d19b4ad630ca0eab0df8b6bbb444dd81d2657","observation_id":"ea88afda-c9e1-474b-8b9b-cb3a9f87aca1","resolution":{"observed_at":"2026-07-11T03:07:55.095406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.08933","doi":"10.48550/arxiv.2210.08933","metadata_source":"pith","pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","venue":"cs.CL","work_id":"180ac1b2-1f1e-4b77-9bf9-7a16f0167e1b","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:0e278b117dffb8401baa1373ae6569d30af56f6de1991e8653f9c26cd4f67abb","observation_id":"f8233d5e-53ea-46c7-99c9-4705c0663b62","resolution":{"observed_at":"2026-07-11T03:07:51.869202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:15.980384+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:15.980384+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-15T15:12:19.000530Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":"2210.17432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-07-11T03:07:52.620085Z","title":"Ssd- lm: Semi-autoregressive simplex-based diffusion language model for text generation and modular control","venue":"cs.CL","work_id":"92551172-cac4-4cf1-852c-8afc80877d9f","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:543199fcb8f6e18724ee7b6fed31108376d88f795ffe4805c9f34b88c51052e6","observation_id":"0e286d06-31e6-42fc-b17e-177b6547f40a","resolution":{"observed_at":"2026-07-11T03:07:52.645513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.035109Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":"1490bbeb-c037-43fc-9dba-98bc390e089c","year":2021},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:9b91cf2978898d5179372bb206a4220f0e15cdac6fab3d48d4dc33972bed3d87","observation_id":"aa6dfe1d-55c9-4706-9d94-299e74364f4e","resolution":{"observed_at":"2026-07-11T03:07:55.062906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-15T19:46:08.657028Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.15029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-07-11T03:07:52.584366Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":"cs.CL","work_id":"f8aa68fd-4a3d-4cf5-9c91-239acc6012c8","year":2022},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:a2bc1de9c0671662046110296af539e51d3d923dc0a8bd91f1632a2accff3674","observation_id":"be62835e-7ed0-4f30-a8c3-89751f82d9b1","resolution":{"observed_at":"2026-07-11T03:07:52.613513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.099645Z","title":"Simple and effec- tive masked diffusion language models.Advances in Neural Information Processing Systems, 37:130136– 130184","venue":null,"work_id":"520531e0-a410-4483-a32e-9c625cfa5caf","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:67530a603cf6084a4236e2a3b8529d23967b71633d69e0e3e6f8b0d3a426b079","observation_id":"040d331f-c5e3-4947-947c-5dac8115459f","resolution":{"observed_at":"2026-07-11T03:07:55.133567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.000131Z","title":"Simplified and generalized masked diffusion for discrete data.Advances in neural information processing systems, 37:103131–103167","venue":null,"work_id":"4ae2bfee-688a-4c3e-9cae-b6dd2c2b2edf","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:032f2377125336d2b833efb336eb5e8d6eb5f5319afff5781ed9a43cf1b76f3a","observation_id":"3972c613-35f0-4c2d-8148-b50739d64088","resolution":{"observed_at":"2026-07-11T03:07:55.027801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":"2310.16834","doi":"10.48550/arxiv.2310.16834","metadata_source":"pith","pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","venue":"stat.ML","work_id":"fcc1dcd6-aa26-420e-86d2-dc87b127ddd5","year":2023},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:c361a443c53711c2f399c3f9f7d7f1097e0a8ae9c6196c20cb406a343050a339","observation_id":"7d7eff89-a772-4a40-b27c-35045f145927","resolution":{"observed_at":"2026-07-11T03:07:52.258382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":"2406.03736","doi":"10.48550/arxiv.2406.03736","metadata_source":"pith","pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","venue":"cs.LG","work_id":"b4fe3d89-98ce-4983-a647-1cb8b9c85cae","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:c51552638d7d77ab9d7094e5521fe33945dfa0108d54e50a1c566d5e969887d9","observation_id":"8f858fc6-a77a-497f-8312-0624be162feb","resolution":{"observed_at":"2026-07-11T03:07:51.970689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01928","last_updated":"2026-08-05T00:02:32Z","snapshot_observed_at":"2026-08-08T23:08:57.113826Z","submitted_at":"2025-06-02T17:47:27Z","title":"Esoteric Language Models: A Family of Any-Order Diffusion LLMs","version":5},"cited_work":{"arxiv_id":"2506.01928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01928","snapshot_observed_at":"2026-07-11T03:07:51.084083Z","title":"Esoteric language models","venue":"cs.CL","work_id":"7814b198-20b6-492f-82f9-909bee103c28","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2506.01928","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:8280259780e386f2d7f43f478ea573542642135304c2ffe59a31efff9b8e587a","observation_id":"36878b75-1d1c-49ee-b7cb-e38e980fb0f9","resolution":{"observed_at":"2026-07-11T03:07:51.111590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10892","doi":"10.48550/arxiv.2506.10892","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The diffusion duality","venue":"ArXiv.org","work_id":"4d71092a-cda4-4bad-b660-5932ea447f30","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:4ad4f3681916fa4fe989f9b8a44aa62f40db484801c1219eb4a8b4c71fbb0702","observation_id":"ca9ac9fb-ff75-41f0-a49a-27c000b89ebe","resolution":{"observed_at":"2026-07-11T03:07:51.658448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:feeed1d80513006eae89bc71c6831210289c480eb17e077ff5ee76f1a7ef5b6a","observation_id":"c4413e59-3e50-4ec0-9c90-dba1983060ed","resolution":{"observed_at":"2026-07-11T03:07:51.938767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:52.049493Z","title":"LLaDA2.1 : Speeding up text diffusion via token editing","venue":null,"work_id":"e3c404e2-a097-4443-8acd-3b073ce2156e","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:5a30151b2be2c9418fd8294dd7a51c0ec3f4806d42d63012e0f9d5aafbfb76da","observation_id":"da6171d8-7939-4108-a066-e63466991796","resolution":{"observed_at":"2026-07-11T03:07:52.075559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.168007Z","title":"Gemini diffusion","venue":null,"work_id":"36e4a510-e8cf-42f8-996d-daeddbf54ee5","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:eff6ee1d358bdd4a8993ae70a1d6b696f1600b841f530264c52e1025cb39df68","observation_id":"56153efc-bfcc-4f60-8d78-5a37f1612aff","resolution":{"observed_at":"2026-07-11T03:07:55.194559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-08-16T00:24:16.429058Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":"2506.17298","doi":"10.48550/arxiv.2506.17298","metadata_source":"pith","pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","venue":"cs.CL","work_id":"09638e55-9958-4407-94da-0a6fbc082ebc","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:045214bc7b60e5196f1a64a297857a9e383bbfe1440919824893cb90b7bc035f","observation_id":"66a1e024-58ce-4e4a-9eb8-cb54b3d20a14","resolution":{"observed_at":"2026-07-11T03:07:52.183991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-08-13T09:36:05.994763Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":"2508.02193","doi":"10.48550/arxiv.2508.02193","metadata_source":"pith","pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","venue":"cs.CL","work_id":"7412f5f3-8e71-41c1-9c69-d4ca250b18fa","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:4f3ed94ce1bc998542ddbb395844ca3f865235eed191eaf24f0a83c4aa3e9105","observation_id":"3b9b83df-3bfb-4358-8156-2f1dd9a8c649","resolution":{"observed_at":"2026-07-11T03:07:51.726775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-15T21:31:14.491444Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"cited_work":{"arxiv_id":"2506.20639","doi":"10.48550/arxiv.2506.20639","metadata_source":"pith","pith_arxiv_id":"2506.20639","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffu- coder: Understanding and improving masked diffusion mod- els for code generation.arXiv preprint arXiv:2506.20639","venue":"cs.CL","work_id":"174cb4e5-25ae-4cca-b4e2-405cbd5774ba","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2506.20639","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:08b2867af10727d650b9af90134d7068aad042250ca1505a04224f7bf9bafb9b","observation_id":"6ce9c2c3-aacd-485d-acd7-144acb5d389d","resolution":{"observed_at":"2026-07-11T03:07:51.370846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-15T08:43:47.691420Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"cited_work":{"arxiv_id":"2509.01142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01142","snapshot_observed_at":"2026-07-11T03:07:52.385541Z","title":"Dream-coder 7b: An open diffusion language model for code.arXiv preprint arXiv:2509.01142","venue":"cs.CL","work_id":"8a7c9708-6012-4156-8cca-f10969908d10","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2509.01142","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:fa2af11934621f94729b001b5cc4f1977a6aa902770614149c4c763694baebd9","observation_id":"8d4561c0-cf98-4bf0-b667-e9a363363b61","resolution":{"observed_at":"2026-07-11T03:07:52.413115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-16T00:49:47.326327Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12216","snapshot_observed_at":"2026-07-11T03:07:51.770001Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":"cs.CL","work_id":"570ed81c-2193-43d1-8537-c6bdb7cd8112","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2504.12216","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:76a3afae68acc3b3b9b9c83901a769a20eb933af4edfae6dd425b36ba4809ca9","observation_id":"d68e3dd8-7361-4025-8fea-4b6ebb70d01c","resolution":{"observed_at":"2026-07-11T03:07:51.796395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-08-09T15:57:47.133628Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":"2505.19223","doi":"10.48550/arxiv.2505.19223","metadata_source":"pith","pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","venue":"cs.LG","work_id":"ebe72b3e-b18c-4784-8c3d-d7bfda67e098","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:761c78c1886bc999f837a105833c8a64ec3af170d9a231ae0f68a737701c8abc","observation_id":"3f613c0d-5d4a-45fb-a187-14aba66a0d61","resolution":{"observed_at":"2026-07-11T03:07:51.547812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.15857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:51.450303Z","title":"Diffusion beats autoregressive in data-constrained settings.arXiv preprint arXiv:2507.15857","venue":null,"work_id":"04099815-0749-48db-9330-6a45659cbe95","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:da939cb9a310ca0ae26716e8503d9468e3a48c945e83dc37ab38990e65b585a1","observation_id":"bad4ca4d-c098-45f1-8e47-55df5238b15b","resolution":{"observed_at":"2026-07-11T03:07:51.479237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15045","last_updated":"2025-05-21T02:59:14Z","snapshot_observed_at":"2026-08-14T20:03:27.002372Z","submitted_at":"2025-05-21T02:59:14Z","title":"Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective","version":1},"cited_work":{"arxiv_id":"2505.15045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15045","snapshot_observed_at":"2026-07-11T03:07:52.511039Z","title":"Diffusion vs","venue":"cs.CL","work_id":"19f5c929-f408-4d04-84d3-146d11106f23","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.15045","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:4aa024d866e1188a8ac835e298481efd7b9a121ee6c8067f12df07ad5e147e3e","observation_id":"8edf1a45-279a-4e80-b36d-4c300261ee2b","resolution":{"observed_at":"2026-07-11T03:07:52.540657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06295","last_updated":"2026-06-06T06:01:00Z","snapshot_observed_at":"2026-08-15T20:39:24.581453Z","submitted_at":"2025-05-17T15:50:46Z","title":"dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching","version":3},"cited_work":{"arxiv_id":"2506.06295","doi":"10.48550/arxiv.2506.06295","metadata_source":"pith","pith_arxiv_id":"2506.06295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, J., Dong, X., Ye, Z., Mehta, R., Fu, Y ., Singh, V ., Kautz, J., Zhang, C., and Molchanov, P","venue":"cs.LG","work_id":"fd1cde49-2043-4004-96e2-a9cca486ec0a","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2506.06295","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:154be0b282fd37382ed1d7ade83dfcf03f0c1f1da8c0ac727d287a8359070aff","observation_id":"2ddd6f12-c769-40f6-a244-05bdf7feed90","resolution":{"observed_at":"2026-07-11T03:07:52.377537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:b282e763ffe01daa011d5ffcf4c38f236d4a6e8d947096a26094dfa9d9f72ddf","observation_id":"a6be4ad2-c798-4782-842c-e59f1aae65fb","resolution":{"observed_at":"2026-07-11T03:07:52.108528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.00413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:50.968632Z","title":"Accelerating diffusion llms via adaptive parallel decoding","venue":null,"work_id":"4ade588c-b9fd-4cde-8d73-9d8863d29913","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:c2177bd324c24e774846b387bb8a69fcf8bff21efcb62ee2ee6e72df5ad3b347","observation_id":"d2e15fbe-b2f8-45c4-9af9-70cca30f221f","resolution":{"observed_at":"2026-07-11T03:07:51.004707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:51.733423Z","title":"Accelerating diffusion large language models with slowfast sampling: The three golden principles","venue":null,"work_id":"121d5d8f-5ee6-4a5d-8ae0-c4070efcebc8","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:dba65e53ca880d3cca20733d6776fab665cad12ba1fc551ccc69e934e076030c","observation_id":"c6867f73-4815-4854-a65b-189dfa76926d","resolution":{"observed_at":"2026-07-11T03:07:51.763651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.966551Z","title":"Scaling diffusion language models via adapta- tion from autoregressive models","venue":null,"work_id":"9a07b256-b63f-499a-bc1f-9e60cc28fe4d","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:05c9ae0538840c926b0d6d19b97dd0da4a978e4ee999ba0d82a93abde587d32c","observation_id":"bf344906-5b53-4b86-a15d-324d0296b11c","resolution":{"observed_at":"2026-07-11T03:07:54.996360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-08-13T05:22:59.274069Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":"2508.09192","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-07-11T03:07:51.302542Z","title":"Diffusion llms can do faster-than-ar inference via dis- crete diffusion forcing.arXiv preprint arXiv:2508.09192","venue":"cs.LG","work_id":"3fd87c40-91ee-403b-9781-58b4e2feb625","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:f1af0b3b0788e177a8d1ef178dd744343a2e8c59078a4c7c564838dacfbefbf6","observation_id":"b5589151-cc4a-4e0e-a515-93522f1abf2b","resolution":{"observed_at":"2026-07-11T03:07:51.333830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07568","last_updated":"2026-08-06T16:26:09Z","snapshot_observed_at":"2026-08-15T02:34:19.643906Z","submitted_at":"2026-01-12T14:25:36Z","title":"d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation","version":3},"cited_work":{"arxiv_id":"2601.07568","doi":"10.48550/arxiv.2601.07568","metadata_source":"arxiv_reference","pith_arxiv_id":"2601.07568","snapshot_observed_at":"2026-08-07T02:38:17.181363Z","title":"d3llm: Ultra-fast diffusion llm using pseudo- trajectory distillation.arXiv preprint arXiv:2601.07568","venue":"Open MIND","work_id":"c66cf43f-ca47-4958-9037-5212d2e00f9d","year":2026},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2601.07568","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:ecac28224729884f112bb83b270fb19a9d58f8d8f03244f724fc6fb8ca783d66","observation_id":"ca3b104d-5bff-450a-bbdd-36f71b15759b","resolution":{"observed_at":"2026-08-07T02:38:17.181363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10260","last_updated":"2024-08-28T17:26:03Z","snapshot_observed_at":"2026-08-14T07:10:41.698675Z","submitted_at":"2024-06-11T01:16:10Z","title":"Flextron: Many-in-One Flexible Large Language Model","version":2},"cited_work":{"arxiv_id":"2406.10260","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10260","snapshot_observed_at":"2026-07-11T03:07:51.978133Z","title":"Flextron: Many-in-one flexible large language model","venue":"cs.CL","work_id":"40e1a3fa-e573-4c1a-95b3-b3892662c624","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2406.10260","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:e5e07659ee0b3ff6c7017a54d5f3d4c8ab921fd4f644d04b462577efb244fcd2","observation_id":"1416b32b-88a5-464f-9ca3-216f03f5318c","resolution":{"observed_at":"2026-07-11T03:07:52.009234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.931516Z","title":"Amoeballm: Constructing any-shape large language models for efficient and instant deployment.Advances in Neu- ral Information Processing Systems, 37:78299–78319, 2024","venue":null,"work_id":"8abe5792-6699-42bd-929d-65e037e229db","year":2024},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:411a5fcd3f28264b5cf29128978c062bbb3ce2276180b03b5b671039d5647188","observation_id":"e44a8bc4-999b-4025-a179-919eaf3613cc","resolution":{"observed_at":"2026-07-11T03:07:54.962527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:54.897650Z","title":"Nemotron-Post-Training-Dataset-v2, August 2025","venue":null,"work_id":"a1262cef-459b-48d2-b5f2-659477d0ec0f","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:5bdd2ea7523a913934c7d5b87c5946315a9c815792357b05baa7e6b33c8539c8","observation_id":"67c77b6c-5350-422c-b8c9-42de7da374c6","resolution":{"observed_at":"2026-07-11T03:07:54.927058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":1,"verified_exact":48,"verified_fuzzy":18},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.05722."}