{"as_of":"2026-08-14T10:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac27c3996b9e578d053f28cda2326a1ea7761f38c13bb1be7eaa4841e7e98427","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:08:23.240012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25820","snapshot_observed_at":"2026-08-03T14:08:23.240012Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29079","last_updated":"2026-07-31T06:58:02Z","snapshot_observed_at":"2026-08-14T08:08:20.269028Z","submitted_at":"2026-07-31T06:58:02Z","title":"Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:08:23.240012Z"},"links":{"cited_paper":"/paper/2605.25820","citing_paper":"/paper/2607.29079"},"observation_digest":"sha256:fcb210e70cb0101cebb7d7ca0fb0510957c431c1c87c45e7b01fb897d2390ba0","observation_id":"a99759a8-4f6e-4a92-ac28-fd3616096aa3","resolution":{"observed_at":"2026-08-03T14:08:23.240012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.25820/citation-record","integrity":"/paper/2605.25820/integrity","json":"/paper/2605.25820/citation-record.json","paper":"/paper/2605.25820"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:532a28244f5bf5e497083131c712b9916572b93947593fb5943e7a8255d5e7c2","observation_id":"2d4d04f1-4e1b-4029-8b95-13512cb350ae","resolution":{"observed_at":"2026-06-29T23:14:01.585003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03006","last_updated":"2023-02-22T16:05:48Z","snapshot_observed_at":"2026-08-08T00:54:11.411686Z","submitted_at":"2021-07-07T04:11:00Z","title":"Structured Denoising Diffusion Models in Discrete State-Spaces","version":3},"cited_work":{"arxiv_id":"2107.03006","doi":"10.48550/arxiv.2107.03006","metadata_source":"arxiv_reference","pith_arxiv_id":"2107.03006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg","venue":"arXiv (Cornell University)","work_id":"dd94568d-9785-4320-aa3f-95be75e16641","year":2021},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2107.03006","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:c4715f605a7b243ad5850258a9ae101a69ecaca5c1cbe1b011daf86c8862727f","observation_id":"bc49845f-1ff8-44ea-b6f9-e23837357bed","resolution":{"observed_at":"2026-06-29T23:14:01.591123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:4658584293b4d74fdb6d34b1f0dddca5f09f76d9f0316aa426264deb0c5eb8a0","observation_id":"5eb7e9fa-bccf-4267-af89-6d7748641784","resolution":{"observed_at":"2026-06-29T23:14:01.582359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:44279f47ecd0008e07d6d60fec88dc2213eac26e7af26e87df1a08a555dd7aa6","observation_id":"c729fb16-e291-423b-a6ae-70d2ece4bc85","resolution":{"observed_at":"2026-06-29T23:14:00.904427Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21336","doi":"10.48550/arxiv.2512.21336","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Optimizing decoding paths in masked diffusion models by quantifying uncertainty.arXiv preprint arXiv:2512.21336, 2025","venue":"arXiv (Cornell University)","work_id":"8c54a56d-27e6-45d0-ad28-c786ddfc7efc","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:458746fee439b0210a5af99657a97fcf8c0ea83457c03f9b12017bdcd46a9866","observation_id":"9c56adfa-0686-4816-a31d-42a9777d628d","resolution":{"observed_at":"2026-06-29T23:14:01.588129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:14:01.591024Z","title":"From bits to rounds: Parallel decoding with exploration for diffusion language models","venue":null,"work_id":"53aea896-5db2-43b7-a78a-33f4a50bf9bf","year":null},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:36a339802f3e7717cd4a00c1313820e3e24b244731f671aadce85b3ca4c9b5c4","observation_id":"f0995bef-73c2-49ae-990b-9c23439eb216","resolution":{"observed_at":"2026-06-29T23:14:01.592715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.18578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:57:26.546521Z","title":"Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs","venue":null,"work_id":"f5bcb45d-ff33-4079-a5c6-7af7dd36ff80","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:df0f6c89cdb83d89c928279ca612d3c8366b8f8de4732860ba4402a521ef8045","observation_id":"87ea575e-1511-468c-9078-950b53ee7062","resolution":{"observed_at":"2026-06-29T23:14:01.595611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.00413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:50.968632Z","title":"Accelerating diffusion llms via adaptive parallel decoding","venue":null,"work_id":"4ade588c-b9fd-4cde-8d73-9d8863d29913","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:eb8c524c718b5ca14315ccd8be8edb705e3952835968729a575f11d46ea256bc","observation_id":"04df0b1b-7673-42ea-9d6e-1801276ab996","resolution":{"observed_at":"2026-06-29T23:14:01.631233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09106","last_updated":"2026-06-01T18:15:10Z","snapshot_observed_at":"2026-08-13T08:02:38.480401Z","submitted_at":"2025-12-09T20:44:33Z","title":"Learning Unmasking Policies for Diffusion Language Models","version":4},"cited_work":{"arxiv_id":"2512.09106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09106","snapshot_observed_at":"2026-07-03T09:17:48.799710Z","title":"X., B´ethune, L., Ablin, P., Kirchhof, M., Monterio, J., Turrisi, V ., Ramapuram, J., and Cuturi, M","venue":"cs.LG","work_id":"f076b2ed-f762-40d4-853e-c32c4673c0b9","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2512.09106","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:f06f29070a194192db7812dd49669f694ab2d48bdf042351b0993aeb2c1d977c","observation_id":"c59cbc0b-bc90-4abc-99cf-e870e968b251","resolution":{"observed_at":"2026-06-29T23:14:01.657926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12996","last_updated":"2026-06-01T14:39:20Z","snapshot_observed_at":"2026-08-08T15:08:08.044449Z","submitted_at":"2026-03-13T13:52:02Z","title":"DAPD: Dependency-Aware Parallel Decoding via Attention for Diffusion LLMs","version":2},"cited_work":{"arxiv_id":"2603.12996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.12996","snapshot_observed_at":"2026-07-03T04:57:38.626283Z","title":"DAPD: Dependency-Aware Parallel Decoding via Attention for Diffusion LLMs","venue":"cs.LG","work_id":"2f37ab0c-1618-4ec1-a058-fac87d4e3b52","year":2026},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2603.12996","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:5632aeefe1ea7dcecaee1152f711ba9ea3654f44bc4bfc3169fd024d0cde1d8d","observation_id":"325d2663-6f88-4776-a4e4-f5f3e112e7f8","resolution":{"observed_at":"2026-06-29T23:14:01.645321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:14:01.618798Z","title":"Lookahead unmasking elicits accurate decoding in diffusion language models","venue":null,"work_id":"fb3cda8b-aa54-4c3f-b7cd-3c04452449d1","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:b55fb0d27b8820e9a0987d74ee08275f7c278077c49486ff07e0e0ef86051723","observation_id":"22218e9f-ef1c-4803-99ad-409410b669d5","resolution":{"observed_at":"2026-06-29T23:14:01.620983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-14T07:24:20.183029Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2511.15098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.15098","snapshot_observed_at":"2026-06-29T23:14:01.622146Z","title":"A comprehensive study on visual token redundancy for discrete diffusion-based multimodal large language models","venue":"cs.CV","work_id":"6b383a96-a530-4c6a-a2a8-7e80efe06812","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2511.15098","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:9146c23769f7c42103979196ddf7e1f0f09efa7975f8504b366290bd9aea8da4","observation_id":"a712b606-82c0-49f7-a460-c1cffc3b8273","resolution":{"observed_at":"2026-06-29T23:14:01.623445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2512.14008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-07-17T01:20:41.788401Z","title":"arXiv preprint arXiv:2512.14008 , year=","venue":null,"work_id":"6d750855-b10b-4205-8f24-52c8849f71a2","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:2124204cfcdce5d19c07cd5320075f0f63bfbdaaf852826c8a664eb018c9eab6","observation_id":"7629bb48-de80-405d-94d8-eac60c43604b","resolution":{"observed_at":"2026-07-17T01:20:41.788401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:f867ea0f94f44d951e040e9fff83fcba5ed385692b640083a2bf10721680ef97","observation_id":"e5cbbc32-b5fa-4940-be8c-5da9a2e8db74","resolution":{"observed_at":"2026-06-29T23:14:01.628391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":"2310.16834","doi":"10.48550/arxiv.2310.16834","metadata_source":"pith","pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","venue":"stat.ML","work_id":"fcc1dcd6-aa26-420e-86d2-dc87b127ddd5","year":2023},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:e9031f72a5f0b4bf6bd261f2e699f9451542febdd3099d1ebc35a188a1d2b01f","observation_id":"b02072dc-b976-4813-9417-b9c637e5a8fc","resolution":{"observed_at":"2026-06-29T23:14:01.669957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19037","last_updated":"2026-05-25T06:12:46Z","snapshot_observed_at":"2026-08-06T23:11:28.082317Z","submitted_at":"2025-06-23T18:49:23Z","title":"Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models","version":5},"cited_work":{"arxiv_id":"2506.19037","doi":"10.48550/arxiv.2506.19037","metadata_source":"pith","pith_arxiv_id":"2506.19037","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models","venue":"cs.CL","work_id":"55cfe19f-b334-42ff-b957-c98e1b95c44b","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2506.19037","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:bee439459694b8ad50bc4bcdd54dee644d0478766f5d8e4422b5fe4b505080fc","observation_id":"38e177c5-b715-4b38-8e14-c10c871c8d69","resolution":{"observed_at":"2026-06-29T23:14:01.612209Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:9c90606d4c29aca00a2ab15dfd7ee73316b78c242392ab4527906a74c8e6671a","observation_id":"9cb7cd5a-4cbf-408d-8b46-0e8923cf3ac8","resolution":{"observed_at":"2026-06-29T23:14:01.642863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02560","last_updated":"2026-04-02T22:21:24Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T22:21:24Z","title":"Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2604.02560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02560","snapshot_observed_at":"2026-07-02T16:17:08.457605Z","title":"Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models","venue":"cs.CL","work_id":"59fda9c3-c8b2-4b41-9954-bb27c372902b","year":2026},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2604.02560","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:7431269faf0252bcaeb8962b5bc2de5189e9ad2701869f1e77f7afc74ae1a649","observation_id":"8949c69a-f7d2-4ede-8582-139648a9bce7","resolution":{"observed_at":"2026-06-29T23:14:01.663735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-12T23:45:16.671232Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2406.07524","doi":"10.48550/arxiv.2406.07524","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simple and effective masked diffusion language models","venue":"arXiv (Cornell University)","work_id":"5df1af01-b5ff-4722-96c8-091c22b808b7","year":2024},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:78154eab6ff45fa1af8bff358857aecae0a7fa679300715444d05e131df9d60d","observation_id":"eebf1119-9747-480b-ae3f-857bd13977be","resolution":{"observed_at":"2026-06-29T23:14:01.655282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.00307","doi":"10.48550/arxiv.2503.00307","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S., and Kuleshov, V","venue":"arXiv (Cornell University)","work_id":"ce8df7d8-7fe0-475b-8258-108354ad295b","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:73f1099b4a08b36f38d58c6c6c6c90c65898143e4f056e1158a51c97ccccda7f","observation_id":"384f3fd4-8c11-410d-82c9-d6698a37394f","resolution":{"observed_at":"2026-06-29T23:14:01.660965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:05.623462Z","title":"Lumina-dimoo: An omni diffusion large language model for multi-modal generation and understanding","venue":null,"work_id":"564fa918-f290-4779-8c2c-dcc4258252da","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:5c3032193e3be5c635c7114a2f2ef8fd4f938fc4bdced31f1bd0e6affd171da9","observation_id":"6aacf684-5223-4dec-a3bf-eb78199c2c0e","resolution":{"observed_at":"2026-06-29T23:14:01.599103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":"2410.17247","doi":"10.48550/arxiv.2410.17247","metadata_source":"pith","pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":"cs.CV","work_id":"ca5cea36-45c6-4d00-8408-14876a5d59c3","year":2024},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:b9ce51e75cc462c44ef93612d252b878df4d6794cebf1256d6fa8e8447e26a70","observation_id":"33968c8c-594f-4749-a3c9-e5d1d35dbfe2","resolution":{"observed_at":"2026-06-29T23:14:01.609816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:14:01.600791Z","title":null,"venue":null,"work_id":"ca30e519-b9f4-44d4-9626-aa1534232d5f","year":null},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:50eaf23508cfa0abec853cfd284b60d6465ebd2671b519c92dfd4221a274a0b2","observation_id":"b52eb361-65dc-47ad-982d-00911b4cdf30","resolution":{"observed_at":"2026-06-29T23:14:01.602487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20540","last_updated":"2025-03-26T13:38:10Z","snapshot_observed_at":"2026-08-10T05:25:24.750234Z","submitted_at":"2025-03-26T13:38:10Z","title":"Beyond Intermediate States: Explaining Visual Redundancy through Language","version":1},"cited_work":{"arxiv_id":"2503.20540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20540","snapshot_observed_at":"2026-06-29T23:14:01.615806Z","title":"Beyond inter- mediate states: Explaining visual redundancy through language.arXiv preprint arXiv:2503.20540, 2025a","venue":null,"work_id":"6d9b46ee-cbd3-457b-927d-99c906a788f1","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2503.20540","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:f7724d20a146bd165c6d4903ffae4a1f7b021d7662e9a06bc5304fbe1691c494","observation_id":"3b953252-544b-4266-9162-4e66258235fa","resolution":{"observed_at":"2026-06-29T23:14:01.617539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:6237940e5bb1fcc31d1d15cd2f49a64e2e485931674b29c75b6c17d14375c684","observation_id":"086e7709-73b4-463a-b55b-8fdc273f2be7","resolution":{"observed_at":"2026-06-29T23:14:01.647644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:b1f0c2730f06ec284af85bda1ff90310ff55834ff88134813e61b03a794aff12","observation_id":"e3c9f15a-40bb-4901-940c-6be7a95ad9c1","resolution":{"observed_at":"2026-06-29T23:14:01.649826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16990","last_updated":"2025-05-26T02:04:39Z","snapshot_observed_at":"2026-08-07T14:49:45.584405Z","submitted_at":"2025-05-22T17:55:04Z","title":"Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding","version":2},"cited_work":{"arxiv_id":"2505.16990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16990","snapshot_observed_at":"2026-07-11T03:07:51.665307Z","title":"Dimple: Discrete diffusion multimodal large language model with parallel decoding.arXiv preprint arXiv:2505.16990","venue":"cs.CV","work_id":"6d9ab858-5467-437a-80dc-c4ee9dac2f26","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2505.16990","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:d6d11cabe08d2dfaa7dbe251b7828a0cc6acc2733dea6735e9d7574c6cb6bd4d","observation_id":"0ba49b8f-c811-49a5-a0f7-a7da5a7719ca","resolution":{"observed_at":"2026-06-29T23:14:01.652377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-12T11:25:29.449646Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"cited_work":{"arxiv_id":"2501.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16297","snapshot_observed_at":"2026-06-29T23:14:01.665133Z","title":"Fal- con: Resolving visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"5bf9f96f-4554-4d68-9347-6ea2a87a3960","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2501.16297","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:e4f3643e3a8e71b99b606d8c2963e7a8ade6874f72d345c92091f03582397a6c","observation_id":"308599d9-d0d2-4720-a799-43695fdad954","resolution":{"observed_at":"2026-06-29T23:14:01.667217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.00286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:46:13.568053Z","title":"Generation order and parallel decoding in masked diffusion models: An information-theoretic perspective","venue":null,"work_id":"daac6ae6-8350-4349-82bb-77ee946dd3dc","year":2026},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:e70da2893300b5911cbbbe091249b8151b5bf0f70cdd8cc4ac363a55aadd0148","observation_id":"ef1cc481-c6a5-44ca-810d-bc854f89c25d","resolution":{"observed_at":"2026-06-29T23:14:01.637196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15593","last_updated":"2026-04-11T12:34:43Z","snapshot_observed_at":"2026-08-12T13:44:50.648627Z","submitted_at":"2026-01-22T02:39:36Z","title":"Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow","version":2},"cited_work":{"arxiv_id":"2601.15593","doi":"10.48550/arxiv.2601.15593","metadata_source":"pith","pith_arxiv_id":"2601.15593","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow","venue":"cs.CL","work_id":"413ce5c2-d94a-4ae9-9961-bdea1db31340","year":2026},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2601.15593","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:28df3c0cd40ba80a1c8d85aba8e5651c790acd35630ae70ddee528b70d7a95b0","observation_id":"9f8f58d7-297c-4dd6-84ee-7d591b4b09af","resolution":{"observed_at":"2026-06-29T23:14:01.640437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:4b46092b8060ea09404bc5f98018c86b1048d24774a9d1776f1601809b69f381","observation_id":"d37521bc-96c8-40b0-8963-e8a331aac687","resolution":{"observed_at":"2026-06-29T23:14:01.614635Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9438.0937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:14:01.632808Z","title":"We exclude λ= 1.0 , which would leave the candidate window identical to the positions selected by confidence-based de- coding","venue":null,"work_id":"f1852268-9b7c-4e8b-8154-6eb296e2afb6","year":null},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:365a7c130f7a605e2ff74e6b236639bfa9a20d40390da7add6485006a93aab87","observation_id":"64a8d6e4-72de-42d4-9f2f-ca5d5722f90c","resolution":{"observed_at":"2026-06-29T23:14:01.634439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2605.25820."}