{"as_of":"2026-08-04T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f95598c6b3dceefd2ff76eb358ec05e188262228bd2a14592f25916ff44e627b","coverage":[{"denominator":126,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T14:50:59.661153Z","state":"measured"},{"denominator":169,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":169,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:21:38.232907Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:51.413936Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:7c76d85a8bd611e88b94f66e7793c4a49166e60a5a0b67ce5228550ab48f2fd6","observation_id":"1b7c86df-7425-4b28-8daa-40d4aa28a340","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2509.20863","last_updated":"2026-05-11T17:24:47Z","snapshot_observed_at":"2026-07-31T08:03:41.164839Z","submitted_at":"2025-09-25T07:55:58Z","title":"GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T14:49:08.081740Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2509.20863"},"observation_digest":"sha256:f0abfd76febdd1fdd2f395d37f017d91e7d97c18bd0509b1919785090e4ecc8b","observation_id":"ab559257-454d-43bf-8b9b-c0bcee9e46ca","resolution":{"observed_at":"2026-05-18T14:51:30.260333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-02T07:15:59.205489Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:5bc5f21b97531140ea0a609e1f9487243afbafde37fa7d174a61f50c39f2b368","observation_id":"fef952f2-3797-49a6-a50f-cf81e24ba9ed","resolution":{"observed_at":"2026-05-18T14:16:27.810932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T18:44:36.636455Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.13030"},"observation_digest":"sha256:f762bf78430e679644248a7730de2bd24388d851177fad6c6379e1858485b4ad","observation_id":"cad80625-c2a5-4ed7-ad51-3222285652f4","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T16:21:38.232907Z","title":"Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-03T16:21:30.104761Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.232907Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:4e727a7f8e6df8f3eceb464c391a583ff3beba409e1e524cc4489ffc03fb3dc5","observation_id":"1dd19a22-ab81-4af8-b0e9-42b4d1a2685c","resolution":{"observed_at":"2026-08-03T16:21:38.232907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2512.14067","last_updated":"2026-04-29T20:52:08Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T04:12:17Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T22:29:08.669964Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.14067"},"observation_digest":"sha256:8b8dcff4426d5de3f7d4d524c0a0dc990f0d4ab6511abc6ab1f6fd5964d1b70f","observation_id":"32197b4c-006c-4b17-ad27-5c150d8fc6dd","resolution":{"observed_at":"2026-05-16T22:31:19.339185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T16:19:36.475336Z","title":"Mmada: Mul- timodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14099","last_updated":"2026-06-03T04:57:11Z","snapshot_observed_at":"2026-08-03T16:19:32.635264Z","submitted_at":"2025-12-16T05:15:07Z","title":"ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:19:36.475336Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.14099"},"observation_digest":"sha256:bf86e8eb553999e09a32ad373036931bdd6c34c92392511eee30d4e7a32a4e74","observation_id":"56a7a3e3-ce11-432b-839d-baaca9810c21","resolution":{"observed_at":"2026-08-03T16:19:36.475336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2512.19433","last_updated":"2026-04-08T06:02:03Z","snapshot_observed_at":"2026-08-03T08:21:20.873368Z","submitted_at":"2025-12-22T14:31:58Z","title":"dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T20:38:06.225705Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.19433"},"observation_digest":"sha256:ba82601e94ccf07667d15fc10ad5aee29a83eb19302e24b7898e46728bcd0c38","observation_id":"df090975-d48e-4dbf-acf9-6cc62755331b","resolution":{"observed_at":"2026-05-16T20:38:24.504106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T09:03:21.281392Z","title":"Mmada: Multimodal large diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15165","last_updated":"2026-06-08T15:43:52Z","snapshot_observed_at":"2026-08-03T11:44:38.056149Z","submitted_at":"2026-01-21T16:41:58Z","title":"The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T09:03:21.281392Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2601.15165"},"observation_digest":"sha256:dd4ff525edb00806145108f0e00412320507dd2fb86be862eb1c6c03aab22f18","observation_id":"13f313ab-603b-4cef-b83e-0c3c78dcc9b2","resolution":{"observed_at":"2026-08-03T09:03:21.281392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T03:57:32.391604Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.391604Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:02ca14d9ec64e0a20e99cbb943f0f3c297cb28287bdf8d5c595c5ee39449d214","observation_id":"3c3f005f-105c-4236-a0e2-1d02d5f23d12","resolution":{"observed_at":"2026-08-03T03:57:32.391604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2602.18176","last_updated":"2026-05-22T13:29:19Z","snapshot_observed_at":"2026-07-06T22:46:30.684694Z","submitted_at":"2026-02-20T12:26:03Z","title":"Improving Sampling for Masked Diffusion Models via Information Gain","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T07:30:59.831550Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2602.18176"},"observation_digest":"sha256:3501c534630a90136ef4de21a9bcec2b2651aac6722b13c879aa8a0568841ef4","observation_id":"52ce73a6-7591-4de5-a891-63e8b6af6cd8","resolution":{"observed_at":"2026-05-25T07:35:29.597706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-02T20:00:15.054046Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00377","last_updated":"2026-05-28T04:34:19Z","snapshot_observed_at":"2026-08-03T07:25:34.565995Z","submitted_at":"2026-02-27T23:33:06Z","title":"Improving Full Waveform Inversion in Large Model Era","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T20:00:15.054046Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2603.00377"},"observation_digest":"sha256:1e5bd32f723b0df825b7aae96ac9369e66ff4f94e7e43fc9ce9dd194ad215e99","observation_id":"11c44097-da16-4beb-934e-295162996ef0","resolution":{"observed_at":"2026-08-02T20:00:15.054046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-15T13:43:40.241796Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06577","last_updated":"2026-07-03T04:02:30Z","snapshot_observed_at":"2026-08-02T23:56:12.139811Z","submitted_at":"2026-03-06T18:59:57Z","title":"Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-15T13:43:40.241796Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2603.06577"},"observation_digest":"sha256:5b350087d07b79b723cae79c0438243a0d9af34934eed1af8d503130995554e3","observation_id":"5160d785-f484-4f58-a685-23dfa6d5bbcd","resolution":{"observed_at":"2026-07-15T13:43:40.241796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2603.12554","last_updated":"2026-05-14T15:00:13Z","snapshot_observed_at":"2026-08-02T00:20:37.436575Z","submitted_at":"2026-03-13T01:38:44Z","title":"Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T12:38:02.339424Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2603.12554"},"observation_digest":"sha256:0999b2fff0be6de6fa13130629822abdf11f1e74f5f1b80c4f1a8c51f97521bd","observation_id":"43ecc968-9484-4cf2-85df-ffd568c4061b","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:392544459de552aac5a4d429519656624a49a6a3e82d3872f302aa35dc8dc60a","observation_id":"4595ef8c-3fe9-434d-84a8-0f7ffbe37779","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:ee1ca3c4ac4b535699e74a6011d8f2c47e5f3bb93096fa00e4f36e10c31ae9fb","observation_id":"12d2da17-a5d3-448c-9437-594b4866016d","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:cf68ea02d5ed6b88998b210e8fe51690b726def95ae9f9fac8544475dc364c6e","observation_id":"ecbb25a0-6515-4899-ae16-743bcb6f6f51","resolution":{"observed_at":"2026-05-19T16:47:40.258886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:df7345b747294dcb646513af03f2c575b8f5c6198e6b186ba6f95fe297f86989","observation_id":"70f94ca4-0977-44d6-ae4c-89a99b862690","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:1938e48cfb134a16748c53af0365a86e33e05914384869de324d0ed2c6049e6a","observation_id":"e0087f75-aa6b-41d7-add5-d7a9910619cd","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:ab3525d2ca16e2320746ece9c7c5cf700086b25f700bb1a82e509c42ab320aec","observation_id":"8128049b-d782-4112-a1c9-3daee9e4283c","resolution":{"observed_at":"2026-05-21T08:59:55.288148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.16514","last_updated":"2026-07-12T15:32:26Z","snapshot_observed_at":"2026-08-03T00:38:31.335979Z","submitted_at":"2026-04-15T09:17:38Z","title":"BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:28:47.505755Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.16514"},"observation_digest":"sha256:b8578a2f1a58a73fb2fa8cc20ea64dab1ca816cdb4558971f97f2a4e65ce107f","observation_id":"abe51ad2-db00-45d6-8aee-0aaa5fbd0530","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.17068","last_updated":"2026-04-18T17:04:10Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T17:04:10Z","title":"Stability-Weighted Decoding for Diffusion Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T06:12:37.804816Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.17068"},"observation_digest":"sha256:94208b7fe9aea03c36aa995bcff3a35b778a06bd057774163f5a4dad50d8298b","observation_id":"241ce839-64e1-4fc9-bf7c-a547a7d67a7d","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.21904","last_updated":"2026-04-23T17:49:25Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:49:25Z","title":"UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-09T22:21:10.133655Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.21904"},"observation_digest":"sha256:d33cf3974c5360503824d54dc6165d2de27db2193af949afe826f4759225be32","observation_id":"9f9a43b9-bc4d-49ff-9e33-9b4302fa9024","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-07-06T23:08:37.811548Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:18.081248Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.22152"},"observation_digest":"sha256:7008c0919aa9f952dbf30392eb0c98a21af8e3b526f3151d924a70d4c45e3edf","observation_id":"bf864c24-1876-4b1e-a4ce-c555a257bbdd","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:778d8305a614c235d749d3ebf914fc71cc64dccd285bb443af02cd7ab24432a3","observation_id":"de4bc6a6-a86c-4a91-a960-b3f01ce383a9","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:d1eee0125d4f126c296ac254f655f7b8b4254300f1c5c9f713b2c69fae22d63a","observation_id":"9e3482fc-0701-46c0-8218-8693526b6cbe","resolution":{"observed_at":"2026-05-20T23:43:51.129679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.27720","last_updated":"2026-07-28T07:15:20Z","snapshot_observed_at":"2026-08-02T15:12:44.865870Z","submitted_at":"2026-04-30T11:11:47Z","title":"Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T05:25:44.844424Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.27720"},"observation_digest":"sha256:2771752596ec3d95532b3a2d59e14f58f988feaa8c852751d268a0e1aca7f8d8","observation_id":"a9b9f25b-f62e-4c85-91d7-af8e98de2a9a","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-02T15:12:46.786429Z","title":"MMaDA: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.27720","last_updated":"2026-07-28T07:15:20Z","snapshot_observed_at":"2026-08-02T15:12:44.865870Z","submitted_at":"2026-04-30T11:11:47Z","title":"Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T15:12:46.786429Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.27720"},"observation_digest":"sha256:04c44408a2c80e398e72bd9be4db36de2199117a94a219b41bff95dc5d0ffe19","observation_id":"afa1081a-abf3-4e4c-8977-380af283f1dc","resolution":{"observed_at":"2026-08-02T15:12:46.786429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.02263","last_updated":"2026-05-27T00:04:34Z","snapshot_observed_at":"2026-08-02T22:31:39.128773Z","submitted_at":"2026-05-04T06:17:49Z","title":"Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T18:38:07.949718Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.02263"},"observation_digest":"sha256:368dc66843c6111e4c651fde0d2f2990b037a3fe50552cab3e5ec7167afd49b1","observation_id":"22896690-8163-4db9-82d3-8bc8dd727ee6","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.02263","last_updated":"2026-05-27T00:04:34Z","snapshot_observed_at":"2026-08-02T22:31:39.128773Z","submitted_at":"2026-05-04T06:17:49Z","title":"Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T23:59:02.580783Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.02263"},"observation_digest":"sha256:05b5a4de6827e6c71e6ef80516d74b1d4a5c6b95fe9e4531fc9dc648a1f83b7d","observation_id":"5ee87dd0-caaf-4517-9c38-3bbcb043155c","resolution":{"observed_at":"2026-07-01T00:25:10.332978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.08144","last_updated":"2026-05-02T19:43:16Z","snapshot_observed_at":"2026-08-02T07:31:09.899562Z","submitted_at":"2026-05-02T19:43:16Z","title":"NoiseRater: Meta-Learned Noise Valuation for Diffusion Model Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:44:04.922621Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.08144"},"observation_digest":"sha256:174efa1ecc0ceb327887ad7056e5c7e60a6ed6f662a40e3627b4e5cad09148de","observation_id":"b100ee1d-9e9c-4680-8b07-6c8ec67f1723","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.09302","last_updated":"2026-05-10T03:59:40Z","snapshot_observed_at":"2026-08-02T09:00:26.118638Z","submitted_at":"2026-05-10T03:59:40Z","title":"Discrete Langevin-Inspired Posterior Sampling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T03:21:21.408659Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.09302"},"observation_digest":"sha256:6a74d2b564025aee28bd2c6761f49153b8d5504679cb53a3292f977ebe02d989","observation_id":"538becbd-efb7-4b90-8fc1-932698fa52a8","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.10218","last_updated":"2026-05-11T08:58:40Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:58:40Z","title":"Relative Score Policy Optimization for Diffusion Language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:42.196931Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.10218"},"observation_digest":"sha256:54bf50d9bfd39c69d84756fcec2bf8d35b948c81124377aa380713fa53c50738","observation_id":"dc424ff0-e64d-469c-81c9-73bb81583ce7","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:5dcc33c67ca0a86e89e8e5fd7a58fe506b3c0ffe2d3bbdde27da82bf2fefffa0","observation_id":"b9d10b12-947a-46c1-8d4c-826d241f0725","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:00.503644Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:85716643adb1244e071e6d9e0eea96ad31cb9e58c786710875a24251ef751baf","observation_id":"869fb5ae-7717-4b82-9fe7-66b12b308dec","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T21:06:01.667173Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:e719aaed1eba238aab02d7852e33f0b707411c50ce1b044c1b52bb76c79ee24c","observation_id":"4793b85f-c456-4ab3-bd5b-0d9c5a154f2f","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T01:45:39.649473Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:83e60834f886ed370a7c403fe0b95e0dd44722354f0887adc266b78dbd9b52b7","observation_id":"cbf8dbdc-c4e7-4fc5-9623-f054887d5dbf","resolution":{"observed_at":"2026-05-15T14:51:00.186449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-19T16:27:59.293776Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:8db9f18265021fb57674f01ecc7cfac0c7e5ae5d7df265a91f1f3a8b0b99e6a3","observation_id":"e28f85a9-b768-42a9-bc43-e4bb70a80e15","resolution":{"observed_at":"2026-05-19T16:32:39.592192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-30T21:16:13.804718Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:d44a73da9f9a53a70bc771c3b1ceb4e08dfa1ea63ff2ccd656ef12e69b9cb7c5","observation_id":"1a888b34-b3c8-48f3-a060-0a77a183a5a0","resolution":{"observed_at":"2026-07-01T14:35:46.492322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.16941","last_updated":"2026-05-16T11:27:40Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T11:27:40Z","title":"Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T20:41:48.063871Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.16941"},"observation_digest":"sha256:977cefeaa68b69002b2f3da34e64a4f374f34329d0d1d055166ed9d4c33ab69d","observation_id":"a88484b6-616b-40f8-bb85-b1c46bcb2aac","resolution":{"observed_at":"2026-05-19T20:42:46.155603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.23163","last_updated":"2026-05-25T07:32:46Z","snapshot_observed_at":"2026-08-02T21:34:47.188518Z","submitted_at":"2026-05-22T02:31:32Z","title":"Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:00:58.024124Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.23163"},"observation_digest":"sha256:b9dcfce603bab90bff67a44236b539f1b562a177f834b9d26e2406f2989c9880","observation_id":"358a728a-f7ca-42f1-abd3-bc76902c247c","resolution":{"observed_at":"2026-05-25T05:06:38.505163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.23163","last_updated":"2026-05-25T07:32:46Z","snapshot_observed_at":"2026-08-02T21:34:47.188518Z","submitted_at":"2026-05-22T02:31:32Z","title":"Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T16:34:21.422620Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.23163"},"observation_digest":"sha256:75c00cc9a4085ea441429fa9988a41461ccd02488cf3a745643d074d8418cf31","observation_id":"e667c714-65ec-4adf-a8d0-f821f5f87e9b","resolution":{"observed_at":"2026-06-30T16:35:12.295098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:575ead6017350e90698d92695a03ff36537128c317ea123b15724fc83b936808","observation_id":"086e7709-73b4-463a-b55b-8fdc273f2be7","resolution":{"observed_at":"2026-06-29T23:14:01.647644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.29198","last_updated":"2026-05-29T15:12:05Z","snapshot_observed_at":"2026-07-06T23:38:37.178378Z","submitted_at":"2026-05-28T00:17:49Z","title":"Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:59:03.375697Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.29198"},"observation_digest":"sha256:c77b6a548ef9884d760eaa6928f27af15b9095ab0dd23f29d248cbded1379484","observation_id":"600fe1e3-ad13-4431-b520-e22a69821dea","resolution":{"observed_at":"2026-06-29T09:03:15.889347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:ecd0fcb9180b8c933638308481c0a1df13198ea63bf1e170ac1c56c9dfb5b3dd","observation_id":"a827c1ca-a1b2-4d91-ada0-e3a5a414332c","resolution":{"observed_at":"2026-06-29T08:53:16.303177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e20c85220bdfa727c907e3b82604e95a3e77c9ee3b9e461ee6c8025d636af78b","observation_id":"6939d29e-488c-4439-aea2-ed4237fc773b","resolution":{"observed_at":"2026-06-28T22:52:45.090923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-01T15:38:52.805916Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:5a7d0a04e2f2e347ec1655ea5e6c882dc6f1fba22b62f966090ddf709d49c617","observation_id":"7f5534d9-0081-4af6-b3be-3e7c875ee5bd","resolution":{"observed_at":"2026-07-01T19:16:00.507408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.02544","last_updated":"2026-06-01T17:46:46Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:46:46Z","title":"SimSD: Simple Speculative Decoding in Diffusion Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T14:58:00.723105Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.02544"},"observation_digest":"sha256:923a15918fd4b37e3b52f8621fe866732b0b1f0e53af7749b4176ca4f181a51b","observation_id":"b0f2c5cc-9191-4ff2-8abc-c9f2a8921161","resolution":{"observed_at":"2026-07-01T22:56:19.507957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.04027","last_updated":"2026-06-01T18:10:21Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T18:10:21Z","title":"MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T13:43:51.171443Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.04027"},"observation_digest":"sha256:83ca3544705eb48d6b549d7c4d8c861fe4b99e84c667f818c6d2b5ae9515f7a5","observation_id":"88613756-b150-49be-8009-094b86058f00","resolution":{"observed_at":"2026-07-01T23:56:24.441096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:a4c63a54aade9e6d8a02fa1140cf136c33628911661c6d3cfa8458371227b34b","observation_id":"aa8649db-da31-4f93-b55e-85eee930f019","resolution":{"observed_at":"2026-07-02T03:06:29.573608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.04535","last_updated":"2026-06-03T07:18:23Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T07:18:23Z","title":"Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-28T06:20:27.041099Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.04535"},"observation_digest":"sha256:b4bff43d1afff68d946dc61b4132b59852ed1239419899ea5a942ca6858b5a96","observation_id":"778bbb38-14fc-4d4c-b762-eec8e2a7b276","resolution":{"observed_at":"2026-07-02T08:06:48.424273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.08501","last_updated":"2026-06-07T07:59:55Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T07:59:55Z","title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:21.493677Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.08501"},"observation_digest":"sha256:22a44404942ee7a9abcde13eeb0920b70682a54b491e5f9b03467e3fe283a065","observation_id":"010827f9-95ea-4d51-816e-476b412c26f5","resolution":{"observed_at":"2026-07-02T22:57:26.605270Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.12841","last_updated":"2026-06-11T03:09:57Z","snapshot_observed_at":"2026-07-06T23:51:40.528967Z","submitted_at":"2026-06-11T03:09:57Z","title":"TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T07:42:45.896118Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.12841"},"observation_digest":"sha256:d209b56fecc189f6a89d3354e4ca062283ab2b863a2626e754dd5acb6a1c5608","observation_id":"60b3ec82-4b0b-4ddc-baa1-f7972b607dd4","resolution":{"observed_at":"2026-07-03T13:38:19.407383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.13679","last_updated":"2026-06-11T17:59:50Z","snapshot_observed_at":"2026-07-06T23:52:23.981568Z","submitted_at":"2026-06-11T17:59:50Z","title":"InterleaveThinker: Reinforcing Agentic Interleaved Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T06:42:34.126336Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.13679"},"observation_digest":"sha256:29601daf878c54c32b4ce5e207a74532a71cf516aafa78c8fd1b3cc9675da6e7","observation_id":"a0b40dd6-1ac5-4f2c-a8c8-aa80f431ff51","resolution":{"observed_at":"2026-07-03T15:08:32.844173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:a1d68abc69f6b926e8f334d1c49f3fc0d0bc16ebf21a0ad224c75f7c5e93d295","observation_id":"95866b58-e1d8-4d40-9303-159209c7b898","resolution":{"observed_at":"2026-07-03T14:18:22.943777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:4ab91d1e977528a8133dc5863dba74ad01f92ee4bea486d938765e23c4839205","observation_id":"0a64f099-d9aa-4a2c-810e-8af79b3dfc97","resolution":{"observed_at":"2026-07-04T16:09:57.567477Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.25331","last_updated":"2026-06-24T02:51:36Z","snapshot_observed_at":"2026-07-06T23:59:47.542695Z","submitted_at":"2026-06-24T02:51:36Z","title":"Improved Large Language Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:34:45.620481Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.25331"},"observation_digest":"sha256:2cfdc4939c2facd955861d677a5ba4ce39da2218189f7e7aca2f0428ce2b6017","observation_id":"cd5ff93b-0488-4833-8a04-b6b31e6082d8","resolution":{"observed_at":"2026-07-04T19:20:05.679205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.26713","last_updated":"2026-06-25T07:48:59Z","snapshot_observed_at":"2026-08-03T03:16:49.561291Z","submitted_at":"2026-06-25T07:48:59Z","title":"LithoDreamer: A Physics-Informed World Model for Multi-Stage Computational Lithography","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T04:51:18.153338Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.26713"},"observation_digest":"sha256:296b6dd4c9fd820898c7b0a1c13440093eed7c3aa566d2c38d9667d9a3792302","observation_id":"595926b4-c45a-4e9c-8f11-1313fd0b44cd","resolution":{"observed_at":"2026-07-04T13:49:52.355089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:eac21e7cd0b002a72f392f4f3f2b860d6b36372192105b1857fe1e93174bcda8","observation_id":"c2d8373b-64d8-4ad0-aadf-7063bd4454b7","resolution":{"observed_at":"2026-06-30T08:14:26.662482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-02T09:39:32.630179Z","title":"Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:32.630179Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:7cdd30137fdca983713545482cf4b7269433cdc4dbd6dfea5d7bde9e1894f14d","observation_id":"78dcc2da-fea6-4cd4-89cc-8bbba6b9a481","resolution":{"observed_at":"2026-08-02T09:39:32.630179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.30054","last_updated":"2026-06-29T09:45:15Z","snapshot_observed_at":"2026-08-03T16:11:35.736788Z","submitted_at":"2026-06-29T09:45:15Z","title":"Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T06:04:07.327934Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.30054"},"observation_digest":"sha256:867a4cd8d3f77e29a69e09371f5d255d5ee284171f3458712a37ab6f45c80e07","observation_id":"fbc51968-a12b-4d36-b0b9-dd53948f64b0","resolution":{"observed_at":"2026-06-30T06:04:20.937206Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:da8c35e9a54ffca1991fddd6a43557f26dfd7a71cae73fed2408381528cf4552","observation_id":"a4e419d1-7ebb-46d6-bc5c-eb5a0328f9a7","resolution":{"observed_at":"2026-07-01T10:05:40.367208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-12T03:56:26.770729Z","title":"Mmada: Multimodal large diffusion language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03236","last_updated":"2026-07-03T11:45:21Z","snapshot_observed_at":"2026-07-12T03:56:26.107275Z","submitted_at":"2026-07-03T11:45:21Z","title":"TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T03:56:26.770729Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.03236"},"observation_digest":"sha256:72e8bc41b4e8f89900e26842da6871751a4c8a0bdfb99b156bbd3780e54a7990","observation_id":"dfd29b72-a0f2-406a-9f9b-dc0bbda9c39c","resolution":{"observed_at":"2026-07-12T03:56:26.770729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2505.15809 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-02T17:55:32.932244Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:e0bc3819bcd74df2d780f2328b58a2b0f1d1ea9579e663a9f08e3059ac17dffb","observation_id":"9f547940-83d8-426b-85f1-49597944d867","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-07-11T03:04:09.555872Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:9b0dd897ee4215a365c8311af92da393c382b956df2a977e492dc173ce3fb0d5","observation_id":"a28d3a0d-2935-4b6f-9904-97d996fbf086","resolution":{"observed_at":"2026-07-11T03:07:51.443936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-02T05:17:48.230225Z","title":"Diffutester: Accelerating unit test generation for diffusion llms via mining structural pattern, 2025c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13431","last_updated":"2026-07-15T04:23:22Z","snapshot_observed_at":"2026-08-02T05:17:20.911150Z","submitted_at":"2026-07-15T04:23:22Z","title":"Discrete Diffusion Models: A Unified Framework from Tokenization to Generation","version":1},"reference_index":190,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:48.230225Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.13431"},"observation_digest":"sha256:fa7a38adcc7efa31f24e88828cd3fbc074f9f8f9e8726cf69956794fa2c89b04","observation_id":"04cb6e76-ea97-4900-bd0b-80bd18c98368","resolution":{"observed_at":"2026-08-02T05:17:48.230225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-02T01:48:56.029119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-03T19:01:15.705968Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:56.029119Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:20ad0abc8c3e54667a349e35325329dbb3d975418bec1df3c54ea75205135f65","observation_id":"43a35c33-fa2b-4b4e-9ef5-bb071eb4c73a","resolution":{"observed_at":"2026-08-02T01:48:56.029119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-01T16:48:36.570741Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-01T16:48:34.275040Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:36.570741Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:815477d4e4e3560d847122fbd0c27d3634c0185f5abcdb48e9224649c29ced9a","observation_id":"47df349c-489c-436f-aec7-59f53a5cbe36","resolution":{"observed_at":"2026-08-01T16:48:36.570741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-01T02:14:09.788866Z","title":"arXiv preprint arXiv:2505.15809 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-03T21:55:22.610961Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.788866Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:7646df4a40a665adeda0cdce523181ffb44a801225a2641507d0c3eaa40ce0a1","observation_id":"231c1717-8a8d-452d-8840-1cedb5534a6d","resolution":{"observed_at":"2026-08-01T02:14:09.788866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15809/citation-record","integrity":"/paper/2505.15809/integrity","json":"/paper/2505.15809/citation-record.json","paper":"/paper/2505.15809"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:36:03.183974Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"72bdd905-4f91-46af-883a-4c2849c99ffd","year":2018},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5ea468a0370c5b41069100454e8120ff33c7fa3d0c981d56e0f0557ac8de872c","observation_id":"fb949630-e33e-4d9c-b529-7fe530ed1b86","resolution":{"observed_at":"2026-05-15T14:51:00.044693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"97345cea-ff46-4103-a836-60d34717536c","year":2020},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d6ae787d98c9b6efee736f050f170c12b7ee29a5da0a2b3e21de50332f703340","observation_id":"a2fb3350-ce98-49dc-8bf6-8228dc4af0f7","resolution":{"observed_at":"2026-05-15T14:51:00.052136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:45175a0f7b8bbff7b5c39b73832337770ad20e7508d9580d9b98953e2bec2cf9","observation_id":"921f9849-59d5-4d60-a968-b371ad70fa52","resolution":{"observed_at":"2026-05-15T14:50:59.729150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2312.09251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":"2891128c-bc6e-4651-be44-a7b8f6f3ad91","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:fccc781dd0425864ea42fa2cb4211e103b951c187904e87047f49202e255aeea","observation_id":"0d456aa7-05ec-41fe-a08f-a3a0500c832c","resolution":{"observed_at":"2026-05-15T14:50:59.848027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":"2307.05222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-04T10:09:44.721463Z","title":"Emu: Generative Pretraining in Multimodality","venue":"cs.CV","work_id":"d20ff802-68ef-4783-943f-7bf17acb6a68","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:c18e4b40e2c2b2821e91ad1c654737da3545beb7fdacb17e3309dc8e9784dc42","observation_id":"24ae7dfa-e2f3-4a95-857e-278095069e6f","resolution":{"observed_at":"2026-05-16T20:22:11.462164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:46859ab1714b39c0a19d0a289346997ea2457ff527e8b7b860156382fcc77603","observation_id":"ec11eb0b-6777-46b3-b61b-780cc315fee6","resolution":{"observed_at":"2026-05-15T14:50:59.902495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-10T07:36:58.000502Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:da2fcc7c1970b25807a932a0380cf6cd7bf0f3bd5d333fe527638c41ef9b6a3c","observation_id":"d9716231-2902-45fa-84b5-fae5bfbace46","resolution":{"observed_at":"2026-05-15T14:50:59.718265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":"047d1a07-709d-4e44-b79c-61c667a3f06d","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a088947baea6c22b4603cb8dfce051662f5b2b58a17023c6389a8a828e7fc14f","observation_id":"0e418431-77d6-4234-87bb-f6c2b035c798","resolution":{"observed_at":"2026-05-15T14:51:00.056481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d500ed57ef2eea70a6a123a0c4e08964dcb1f4431d759bfe752d8e4473184605","observation_id":"571b9114-4fb5-4417-8ff5-6fef32f79f08","resolution":{"observed_at":"2026-05-16T00:26:21.484895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"7fa71aa5-5c9b-42bc-b8bd-c9c3990a94a0","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:fc8e49ffe501ff4adb8f351d3193e3fef9ccffb1022cacbe97dedc002ea7e4ed","observation_id":"ec1089e9-f5f8-4811-9685-b0ca27da6215","resolution":{"observed_at":"2026-05-15T14:51:00.060611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:680a8fbfc4bdf75e07e4326ae53852f24b83d87aacf49625991568c27579ba64","observation_id":"90dc9801-715f-437f-8f3a-fda1bd743430","resolution":{"observed_at":"2026-05-15T22:09:16.660059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:87dacae6b1c35da1ad63999529254838918c461218fb6c1662b5442c240f13d3","observation_id":"b996e979-8360-48f4-b03c-9fd914e15219","resolution":{"observed_at":"2026-05-15T14:50:59.891401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"b9fb3232-8214-492b-be7b-545b10d7f355","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d99f9ca48a000ce09be5f1b21a0b2684f28f46f63c98a8f3f6493cca097d284a","observation_id":"7c44082a-23b0-4d85-9b1e-dffd36223999","resolution":{"observed_at":"2026-05-15T14:51:00.063791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DreamLLM: Synergistic multimodal comprehension and creation","venue":null,"work_id":"8b935d05-a7f7-474e-ad12-0eaf40cca0d8","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:e9908bb06f0187621c527dfdad6f5f48e38df99a76a3c42ae76194ddabdd8030","observation_id":"19b8fbdd-2b1d-4fe5-9a6b-71628249ff35","resolution":{"observed_at":"2026-05-15T14:51:00.068371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating images with multimodal language models","venue":null,"work_id":"833834dd-7046-44cb-971e-a9295eb6eee4","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:0ed11eafd654e9ebe9bcce400d5b2e2f749331054a5ff61caafe4f3bc042108c","observation_id":"6053d725-9f06-4d06-8744-80528a8cd981","resolution":{"observed_at":"2026-05-15T14:51:00.071892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"f9537de8-a067-42d8-a06b-3a786f15f765","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:fc3e5af6497bc657d2b6f3d0b5f08a8ffa25822c11a19675c43100f476fad8f8","observation_id":"1131beae-9237-465c-aa6b-c535e9745890","resolution":{"observed_at":"2026-05-15T14:51:00.074711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:c6bc09c7621d070f9a2e2522ef897bc08266c78af4e27c7f893c07b3002e521e","observation_id":"9e61143c-38eb-40b6-b20d-e5576defed9b","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:437888038deee69d19e164a6f0778991cc7a6df4a07c5981cb6627b60a56d495","observation_id":"0b0ba415-f8e8-4a23-bfa3-0bf9125946ef","resolution":{"observed_at":"2026-05-15T14:50:59.764951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:49ebdbb45ceba1651387b4b632ad34f300ff6127ace49b738d9dfdad13729a20","observation_id":"867ee91a-bbfd-41da-8309-17a8fbfb801b","resolution":{"observed_at":"2026-05-15T14:50:59.778692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-07-11T03:07:51.875617Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a929d09e00ff709dfa6ea4ee68cb509226fc77546617fa74cec0bfcb43d492ed","observation_id":"f335ff4b-d157-4cd3-8d00-4fcb2a3e26d2","resolution":{"observed_at":"2026-05-15T14:50:59.793008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"7a3c8dd0-83f0-4a5b-9148-52453c55160c","year":2020},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:2c474c620def0203435fcde3cf006cc9d5fd390ea9354c81c1745d8c035c28d8","observation_id":"62406cb4-bb3f-4aa6-a51d-0720ff0926b3","resolution":{"observed_at":"2026-05-15T14:51:00.078103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a2479f1584df8eb0a93b357108d6dc985a27640a7b54a9007c9c2b5065e28ccf","observation_id":"47ddc277-904f-43b0-a2d7-987c74eeb0ae","resolution":{"observed_at":"2026-05-15T14:50:59.838917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-10T06:36:52.573462Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:b1102b5105c51cead3d87485be6feb2910cfe2aee899d485c8042c6808bb97fe","observation_id":"182cc9b2-c698-4796-a379-09b667703afc","resolution":{"observed_at":"2026-05-15T14:50:59.843135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.941805Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837","venue":null,"work_id":"3256b5a6-76d9-460c-ad77-5d232058ad6d","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5eda54c7941fdb034e26cf497ab0c2beed2d1fb08736cc3f2585d50f7f373482","observation_id":"4731bda0-a302-4137-ad12-e883f6e02947","resolution":{"observed_at":"2026-05-15T14:51:00.081828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d391678860eb63b6472e50ae2138c21a6677e46a1a9da3f2f842eec6af81a8d7","observation_id":"702b57a8-b5f9-40ad-983f-3436b1ea454b","resolution":{"observed_at":"2026-05-15T14:50:59.874569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":"8bc1dfa4-53fb-4fbc-87ab-a1affc4596d6","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:65035c39df040877cb3e58875abc8c62bf7b07525e4ceef3ec745510880d21e4","observation_id":"d1574be5-1323-4b1a-9bb0-075f3eb242ba","resolution":{"observed_at":"2026-05-15T14:51:00.085232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, and Liang Lin","venue":null,"work_id":"9abda4ac-1c65-4a93-b856-7f3e3e9b7bf6","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:7beccbb2c441b452bcd16052090598f20852d9ad208391393713095b84ee0c1a","observation_id":"ed9aa9d7-c1bd-423b-9044-166a6e6b1be7","resolution":{"observed_at":"2026-05-15T14:51:00.088423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"1695633b-085f-4c6c-aeb3-9451b54dfc96","year":2016},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:7218a4748c59f372f40f84c59c25e1ae9887dadb68a382ee5ee1abe32b1cca63","observation_id":"1fe952ff-2cde-489a-a6b1-8c4983afaec8","resolution":{"observed_at":"2026-05-15T14:51:00.091767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"6607c1a9-ce29-49ca-a51d-8415fc83531d","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:587812e86ae925e37f00f4b68d3bd31b70393b7974745b624a45eb8d798c65be","observation_id":"3e29b659-8c9e-4825-b0c3-48b94a10db48","resolution":{"observed_at":"2026-05-15T14:51:00.095137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a67353e0-6103-4875-87ce-e221ba375a25","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:93c88f8085a872078916c990bc00e22ec406014f9989e5a3b5ce439d58d2c4ed","observation_id":"ff1def59-772d-428e-a4ef-0569566a1f0d","resolution":{"observed_at":"2026-05-15T14:51:00.098554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:1b6d403d60c0db93ac392a14e2899e2a66dc44e996c9361a6916acb2edf96c2d","observation_id":"759a2b7b-9112-4ba1-bd89-794b230386cf","resolution":{"observed_at":"2026-05-15T14:50:59.724596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"95377c08-c1b8-44fb-b732-7fd722f0e103","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d8151a15ff31468fb60752d5ffd8a6e6fe3fd1caf93673f1edb9e2c71af3c568","observation_id":"8a4a4225-c644-40ef-85da-e8588c7d0ea0","resolution":{"observed_at":"2026-05-15T14:51:00.101889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"3521aaa9-7f69-4320-bd0c-a63c14934744","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a25db4e816c079df9389c16e403230dde5eafc72d02dbf425e228f4a758ea4db","observation_id":"51dbc47a-cd85-4cfb-9901-3c1590ec3fea","resolution":{"observed_at":"2026-05-15T14:51:00.105582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The refinedweb dataset for falcon LLM: outperforming curated corpora with web data only","venue":null,"work_id":"6699efa3-6dd8-4c7a-863d-92741582e655","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:3120e490d17e2079b1a655fe8c17573a0918929cc0205f4687491894875f8dbe","observation_id":"31acadb4-d211-49c0-8d7b-30780d80408c","resolution":{"observed_at":"2026-05-15T14:51:00.109242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"5d363e5d-c3e7-4b6d-b456-a1bd505446b2","year":2009},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:44553c10201f23da28868a1de8ce5b48ed64e6b5aa1c47f88910bc457ba8c1e2","observation_id":"23f19fd7-322a-4a97-a093-5d810bbad181","resolution":{"observed_at":"2026-05-15T14:51:00.113396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"5163d507-f354-4c7a-bf6f-5b0f91bcf83f","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:f71be106365ab3116e5e13910cf1f93cc1eba412474f6bb2086d5bbd7c0978eb","observation_id":"e838c433-1215-44f3-9ce2-9bf5ff23d73e","resolution":{"observed_at":"2026-05-15T14:51:00.117308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.908517Z","title":"Segment anything","venue":null,"work_id":"ffd866b4-b8b4-4924-887d-af662dde5bdc","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:f9e5b2672ebaf6984c80dcc8cb8d5ea285fd024d0ccfd11b9949bc164152e434","observation_id":"722114fa-ddfd-415f-8ec7-eacb352f28a5","resolution":{"observed_at":"2026-05-15T14:51:00.120433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"laion-aesthetics-12m-umap","venue":null,"work_id":"f06a0c0d-4e61-4e3f-90c9-c94dbb72329e","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:ecc78ebf3c33e936a93bdaebcf7a4ec2790105b176e914552ebf4a2e91d2c83c","observation_id":"f25b407c-9c2b-4b1b-8e29-f0758e096c08","resolution":{"observed_at":"2026-05-15T14:51:00.123336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"915e3315-9cda-4414-869c-5a8b499df5ab","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:7d08291a9ea3495e4e510697d47cb2d2656db3229dcdcb906dbafa9ed1244e54","observation_id":"cda28788-7f4e-42f9-a41b-6a09ceb63cde","resolution":{"observed_at":"2026-05-15T14:51:00.126203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"8cc0b7fb-7425-4943-b1a5-2e7a75459e77","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:f564419e0a415d04ff213f758f8224e38617d1f7121dbc560d60dde316868b6a","observation_id":"98246a7a-4802-440b-951e-9e615c656d70","resolution":{"observed_at":"2026-05-15T14:51:00.129053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":"2502.06772","doi":"10.48550/arxiv.2502.06772","metadata_source":"pith","pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates","venue":"cs.CL","work_id":"ac87fc17-4716-4a39-b9f1-d67b15418147","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:367aef3c4ee8da5cd46afc59fcecaaefb52be3adc3cad574b31b3e6ecfac6e8a","observation_id":"a0c2d6af-8636-467e-9d76-cdcf6fdaf682","resolution":{"observed_at":"2026-05-15T14:50:59.864337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":"d35c1e53-2d81-40e1-87dd-daa982bbecae","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d96e7713a19b205f01d61b3d6333139a4eb54326a2e93a7791104f9e3e08baae","observation_id":"78a86927-f67a-4792-b7c6-3df24d26a94a","resolution":{"observed_at":"2026-05-15T14:51:00.132173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"7bd37f69-c662-41fb-8922-fb8b6c4f5e19","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5497a60de34a95ace5083b95e9275574506acabfd063cd5bd58449676e6aec40","observation_id":"4ef0f7f0-3045-41d0-87c7-051708ccf443","resolution":{"observed_at":"2026-05-15T14:51:00.135337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open Thoughts","venue":null,"work_id":"a626fd75-501b-425c-b69f-0878f5bcb84d","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:72d3a53a3f36e5c7b5fc8d2294368517d203be11d8c3c635cf741734789fd85f","observation_id":"212ea4a7-d9a5-4017-9faa-0ffc325155ef","resolution":{"observed_at":"2026-05-15T14:51:00.138270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling","venue":null,"work_id":"30a3b2b3-5159-4621-b0b7-57dccdd49124","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:17a39ca65fcca52333e3ea6a4d3f1eea8217f6bbd25035b16aec8565aa8035e2","observation_id":"f601dd0e-860b-49b8-9bc0-d5bc2e3c78c5","resolution":{"observed_at":"2026-05-15T14:51:00.141465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":"412688a5-18b4-4e42-8533-d8597e4d1143","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:250e9804302613781d285cd89e54189bc1811d1df709e5a28cfc21b8a1fae17b","observation_id":"5ef9c87f-ce9e-4e93-b53f-8e5202aede9b","resolution":{"observed_at":"2026-05-15T14:51:00.144198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:f2d93fd161534a24d7ae99ef6155a34adcc06fbad1122d0fddfa516a185be347","observation_id":"33dcdefe-e59e-430d-8966-2633d29c5969","resolution":{"observed_at":"2026-05-15T14:50:59.907266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.220646Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"429f97ab-9d82-4f69-86fa-eeb917a577cd","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:92695eae66aeb49f215f050006437957a8794adf41e1612f4ad1fbbdca556c2c","observation_id":"5311a623-c235-45d2-bc4f-373c347057c0","resolution":{"observed_at":"2026-05-15T14:51:00.147138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"601bdea2-6831-4efe-8e10-ca392eaf88ef","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:2439b8d57ff75f1efee07f18d44bd4a2e47614160b8056036fee64d4df6597ac","observation_id":"07cd823d-cbc9-4016-a31d-a06def6de80e","resolution":{"observed_at":"2026-05-15T14:51:00.150146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.601448Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"0277ca77-a5cb-43d9-8038-b4346f109953","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d5e0fab50f0e5ce3d8c79c4fb8d966b7fe95daafa98021b2cfd5feb8aec8a1c0","observation_id":"fa6e826d-f70f-4b22-99ca-3c632c35d5f4","resolution":{"observed_at":"2026-05-15T14:51:00.153363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5eff388f1ab0c388b4e6736b301a18181ca58966d7af79e710398c84db2ae3eb","observation_id":"5d67eccc-d9d6-45be-92dc-f8b664f910f4","resolution":{"observed_at":"2026-05-15T16:24:27.819650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"42b404b0-ddd5-483d-8735-08e84d8f536c","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:6fb7f23a72ff48df7e63bf2f64985cc218ff823d6e39b92dbda3f2205a906e39","observation_id":"6127edc3-50d1-463e-8830-0832603bb267","resolution":{"observed_at":"2026-05-15T14:51:00.156716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:3be4b284d5090a429008a7444a451c49b34e0357838d9165e69ef30381498f02","observation_id":"b57b3c1b-f38c-43cc-84c9-7533e36819c4","resolution":{"observed_at":"2026-05-15T14:50:59.745826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:c57ee0e33249d94c43b275226f6253157d4cd522f84aa5e22f5d000b36e5a45a","observation_id":"510bc526-9323-432f-a5c1-cf8a86e89652","resolution":{"observed_at":"2026-05-15T14:50:59.749411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:98885f05b4212868903b7df820e3c0501ecfe04e942653ca59ec06068798f064","observation_id":"e6b68b22-0eb4-4371-9e7a-5af03bd4b398","resolution":{"observed_at":"2026-05-15T14:50:59.753839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5bb5a1841eede8072ab3cba32042e17c0c02f809d535cceb542ad2dabe235c37","observation_id":"7cf3fa26-7b8a-44aa-b7fb-8a79f285668d","resolution":{"observed_at":"2026-05-15T14:50:59.757783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o1 system card.preprint","venue":null,"work_id":"a3f3f006-56bb-47cd-8566-e2b0d95b49cf","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a1d14b23f14f53d5d6ff1e9176dcb8b87a9532fa60ea995aeb8d0c3c8c5685ab","observation_id":"9c078740-7d9f-4a6b-8861-875e33ca3925","resolution":{"observed_at":"2026-05-15T14:51:00.159878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:17a31e81c6b31fea2713db549abb0386a0e7fea8186cacda10c40a3ed3b1face","observation_id":"b4fae0d7-6a48-4de8-8ee4-c4d75be11488","resolution":{"observed_at":"2026-05-15T14:50:59.771898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal foundation models: From specialists to general-purpose assistants.Foundations and Trends® in Computer Graphics and Vision, 16(1-2):1–214","venue":null,"work_id":"36292fe5-6449-4693-b3c3-c060fc00f8e7","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:ebe9e3421c5e9faef66fddc3c2898ca7100bb0a2ee29940b200e06fb0cdd187c","observation_id":"92383866-01a2-4c19-959c-3a824be15364","resolution":{"observed_at":"2026-05-15T14:51:00.163124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2306.13549","doi":"10.48550/arxiv.2306.13549","metadata_source":"pith","pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-07-11T03:37:46.833302Z","title":"A Survey on Multimodal Large Language Models","venue":"cs.CV","work_id":"29d41a4d-d51b-4020-8947-991367e75c2c","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:042f9b332be02bd2c14df139be6ceed2b6b6626cac51562b5a2e2b91c9ac8f0a","observation_id":"253b4759-b89e-45ff-bce7-2c1833eac5e3","resolution":{"observed_at":"2026-05-16T02:56:42.979926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2404.18930","doi":"10.48550/arxiv.2404.18930","metadata_source":"pith","pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hallucination of Multimodal Large Language Models: A Survey","venue":"cs.CV","work_id":"1902954e-ed65-4b00-9956-5cc759b8ef40","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:401d281bf8897c9eb4a7b1334cc166927d19cc356c17197f99fa23a8a13df2f9","observation_id":"37c64dfe-60db-43e3-b996-6bb00ec520d7","resolution":{"observed_at":"2026-05-15T14:50:59.786071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.NeurIPS, 36","venue":null,"work_id":"83af3d85-abaf-457f-b544-7238570ca714","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:36af96097491e49159cc42c4201b75f938469ca35265a366b5c10959c7e817e6","observation_id":"71799f63-ff7e-4461-8c58-c67cb357dcb4","resolution":{"observed_at":"2026-05-15T14:51:00.166508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:61094d1e49de87c14d9599e336fac55f9bdb3a99858a7f8599689bc49dada4ef","observation_id":"eb458215-0d14-4806-904f-b4a4fbf4b0c8","resolution":{"observed_at":"2026-05-15T14:50:59.796628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-10T20:57:35.014119Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a70ddd02a062e2a296e2ca47731545a610f18b94b0e3ed125ed9f1b5cff118aa","observation_id":"2c1fac96-d5eb-49f7-879a-bc2c985ea8ee","resolution":{"observed_at":"2026-05-15T14:50:59.808440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":"2403.09611","doi":"10.48550/arxiv.2403.09611","metadata_source":"pith","pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","venue":"cs.CV","work_id":"378a250e-75a3-4ceb-b9a3-f8a5c2ed1a66","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:dc9e3ef8049aa217ef0d77634e8c2e0dc62976e367a5ad40ee7bc6db9d3c7105","observation_id":"0c45f6b8-6c9c-4d34-beed-57b63926474f","resolution":{"observed_at":"2026-05-16T04:09:36.761640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:56fbb8819d1be29a6ea141d55a6c401a4c4ba3c340596845d449b9491d66f9f6","observation_id":"bbd1b1fa-0b9c-4025-be4d-057ddaff9198","resolution":{"observed_at":"2026-05-15T14:50:59.818881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-10T15:47:23.275572Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:b90c89e47ae83378c03968c420564672ec7b767ede8fca1ab8c665daf3e1259e","observation_id":"d9dfa50b-319f-4700-b3da-9d70218584c3","resolution":{"observed_at":"2026-05-15T14:50:59.824463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":"76b31848-25d7-46be-9ae3-b14b269d8eec","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:ebbdf9096380337b38d2ebe4bcc4a08c23df86876d99ce7de956154c3a92fd59","observation_id":"1794a132-4200-4fb3-bc8e-bf60d18828b9","resolution":{"observed_at":"2026-05-15T14:51:00.169646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:4ef728e87d54367095114522c59f0501efcb4d9cc3b6a08d33bd84890f5bfefa","observation_id":"248141da-dd18-4816-a150-b61bbafd69f5","resolution":{"observed_at":"2026-05-15T14:50:59.834549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raphael: Text-to- image generation via large mixture of diffusion paths.NeurIPS, 36","venue":null,"work_id":"3ba13ba7-a20a-44f9-8b97-6332cfe9e746","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:472d79f27da54077f6d62a952e9c2b5e772acbe6d38a5eda375abd0416d4ca1f","observation_id":"8e93e53e-8629-4271-8caf-c93d509f8562","resolution":{"observed_at":"2026-05-15T14:51:00.172627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":"202a3cd1-c167-46c9-8944-14f3b0e3c59b","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:bfa4c939c9b3bbaade10851fb6c4dfb2eb5375557bd1b86dc4e9e4093432771a","observation_id":"949f6199-9132-4b85-a745-fcc2a450ad08","resolution":{"observed_at":"2026-05-15T14:51:00.175302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation","venue":null,"work_id":"1e4f41d9-a285-40fa-acee-028b4b761043","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:aabe9fc625ef4313a8b67db61404d190748cb9a23999762c9008713dac46d5af","observation_id":"0d88f640-9c5a-4b81-9635-46bea4750d2e","resolution":{"observed_at":"2026-05-15T14:51:00.178079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07771","last_updated":"2024-04-11T14:07:25Z","snapshot_observed_at":"2026-07-06T17:58:52.016903Z","submitted_at":"2024-04-11T14:07:25Z","title":"An Overview of Diffusion Models: Applications, Guided Generation, Statistical Rates and Optimization","version":1},"cited_work":{"arxiv_id":"2404.07771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07771","snapshot_observed_at":"2026-07-03T07:37:45.361675Z","title":"arXiv preprint arXiv:2404.07771 , year=","venue":null,"work_id":"0f9d887c-c591-4ae1-8d5e-5f4b652b0fa6","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2404.07771","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d5c78f8e2c291a4c5765ec22cf48ad594a377c889a4b729a345cfd0c2c028994","observation_id":"f7995592-57e2-4dfd-b7cc-6b9e0d61a067","resolution":{"observed_at":"2026-05-15T14:50:59.853373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12146","last_updated":"2025-02-17T18:57:26Z","snapshot_observed_at":"2026-07-06T20:38:06.085744Z","submitted_at":"2025-02-17T18:57:26Z","title":"Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening","version":1},"cited_work":{"arxiv_id":"2502.12146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12146","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-sharpening: Fine-tuning diffusion models with denoising trajectory sharpening","venue":null,"work_id":"256e2e32-3be5-4d53-80eb-2a446f2f4cf4","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2502.12146","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:6b47aa9130196b65f1e752ca487887d7ff1f29eaa40762c54520673907c91cb1","observation_id":"3df2197d-09f1-4cb0-9dbd-59dcb47bd885","resolution":{"observed_at":"2026-05-15T14:50:59.858515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-directed conditional diffusion: Provable distribution estimation and reward improvement.Advancesin Neural Information Processing Systems, 36:60599–60635","venue":null,"work_id":"58b14084-e065-4542-9cb2-86b19910c4f2","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a6a44e9899be711deae425306565a6cfef4c83bb17263532d73772d91289d9bd","observation_id":"d89783d8-ee86-447f-82de-4b03473bc5e9","resolution":{"observed_at":"2026-05-15T14:51:00.180452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14743","last_updated":"2024-10-15T19:37:51Z","snapshot_observed_at":"2026-07-06T18:04:08.777507Z","submitted_at":"2024-04-23T04:51:02Z","title":"Gradient Guidance for Diffusion Models: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":"2404.14743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14743","snapshot_observed_at":"2026-07-02T01:26:24.919909Z","title":"Gradient guidance for diffusion models: A n optimization perspective","venue":null,"work_id":"02e03ab9-1bc1-42d0-9075-a43367fdd924","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2404.14743","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:ffb35c3648973008ac7226c918da9ceaffe2ba797bbbdf485bf9806e02b3d6d9","observation_id":"21ad3f4a-8f13-4fb1-9598-168fdd07bd19","resolution":{"observed_at":"2026-05-15T14:50:59.868901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:17:00.162991Z","title":"Score approximation, estimation and distribution recovery of diffusion models on low-dimensional data","venue":null,"work_id":"3adef166-442f-4bee-b1df-ac8d8b67a633","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:1b364c577d7dc5c7da468cba393b4d15d4e54da83883e1f8c0a94a5db717ef15","observation_id":"b4237290-8605-422c-91d7-6b17f0d12439","resolution":{"observed_at":"2026-05-15T14:51:00.182881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07303","last_updated":"2024-10-11T16:17:53Z","snapshot_observed_at":"2026-07-06T19:30:43.691433Z","submitted_at":"2024-10-09T17:43:38Z","title":"Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow","version":2},"cited_work":{"arxiv_id":"2410.07303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07303","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rectified diffusion: Straightness is not your need in rectified flow.arXiv preprint arXiv:2410.07303","venue":null,"work_id":"578946eb-ee70-4e88-a1f6-16245c6fd477","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2410.07303","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:bc71aa0e0f765a91ea6df3c8453c1350fdc7384ed5ef50ee0917c92bedff34a9","observation_id":"c5430022-d2a2-46f6-8bb5-2dcde028a193","resolution":{"observed_at":"2026-05-15T14:50:59.881022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving diffusion-based image synthesis with context prediction.Advances in Neural Information Processing Systems, 36:37636–37656","venue":null,"work_id":"c4f6af1d-45b4-4ba8-bc95-324b8a3c7cc9","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:9b48fa6feca536ab9ade01768ebc645e48720732c2e62a101dc254b2ca43c0f4","observation_id":"a6f5c7d5-a4d4-4d66-857c-e97fe9dae415","resolution":{"observed_at":"2026-05-15T14:51:00.185358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure-guided adversarial training of diffusion models","venue":null,"work_id":"c27ff82d-34a7-403b-9876-1357394b76bd","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:e625a141646af4624869c1b73584fc682cfa9795055b2fefe30a7d0d4e085b49","observation_id":"543b501d-f5d6-4375-bfba-703bac231bfa","resolution":{"observed_at":"2026-05-15T14:50:59.910876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotetris: Towards compositional text-to-video generation.Advancesin Neural Information Processing Systems, 37:29489–29513","venue":null,"work_id":"055fa4fe-ff11-4804-abb0-a82f65ffa336","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:670e3d2ba87e74bd277e2f5d9092f448489764b8407af84a7c196e7cf5417b3f","observation_id":"76aaedea-6f6d-4064-a725-783986063885","resolution":{"observed_at":"2026-05-15T14:50:59.914403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured denoising diffusion models in discrete state-spaces.NeurIPS, pages 17981–17993","venue":null,"work_id":"ee04bb32-7b57-470b-95b3-7634b0cca602","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:4fa04f57a20eec429be0abaa4c751be37ea48af16019fa7bba846e44a87556c7","observation_id":"049a8ebd-8223-4cb0-afd1-22fd19b05dfc","resolution":{"observed_at":"2026-05-15T14:50:59.917872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vector quantized diffusion model for text-to-image synthesis","venue":null,"work_id":"a15812ea-18be-4240-a5ce-2e90965a1c7c","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:ca05b6d8c4f721d83d795ec648a09975d042a070bd10a953b2fdc3d28687cd91","observation_id":"790d0e44-e598-49d6-b8ea-bdfc16c93625","resolution":{"observed_at":"2026-05-15T14:50:59.922026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gritsenko, Jasmijn Bastings, Ben Poole, Rianne van den Berg, and Tim Salimans","venue":null,"work_id":"dadb4086-4517-45cf-a81a-f134dbb690ca","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:79852fd22d0f7e651e6c364875ee5a21e08438531cc4b794a89bc9499e5d774f","observation_id":"2362884e-f3b6-4043-a4d3-5e4239975d83","resolution":{"observed_at":"2026-05-15T14:50:59.925236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murphy.Probabilistic Machine Learning: AdvancedTopics","venue":null,"work_id":"5a1ff758-96a5-425e-9d10-e04c42bace4f","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:72173528e3d6443134bcc1d68be96123637db7994488837d92fd12fcfe24abda","observation_id":"59ab54db-1ca8-4f3a-8657-8526c0e9bb87","resolution":{"observed_at":"2026-05-15T14:50:59.929018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the objectives of vector- quantized tokenizers for image synthesis","venue":null,"work_id":"7640bf80-65d3-4e6c-bece-aeac6403825e","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:3cfbd9aa5a326fd9cf0b8ef619a2b89bb4687dd0275d023bec07c2c89b612066","observation_id":"fdd5bb84-3abf-41d9-9342-1657e0830363","resolution":{"observed_at":"2026-05-15T14:50:59.932577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.NeurIPS, 30","venue":null,"work_id":"b2e10dc3-c6ea-4366-b27e-62396a0f1182","year":2017},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:35405f64179361833ab3df524af197cf4e66f6c5add6453196ebc2dc4bb084b3","observation_id":"19c4bfa5-7d2b-4891-84d7-e719c1307237","resolution":{"observed_at":"2026-05-15T14:50:59.935764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.933522Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67","venue":null,"work_id":"ca70123a-eca4-46cf-a990-8e69d8885801","year":2020},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:2d753722f6d368944f5de0ea3d19eb99baf221ac243f6d6b218dab001852d431","observation_id":"09b78d8a-4575-4647-a26d-de6db18337e0","resolution":{"observed_at":"2026-05-15T14:50:59.940031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d7db242cf0ddbca3ec4812575e27e2eea18fc8890a5b8aeb89efe96ed9ea8af0","observation_id":"fb099ec4-5ddd-4b41-b20b-b2fbd04e324c","resolution":{"observed_at":"2026-05-15T14:50:59.742112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image transformer","venue":null,"work_id":"cedaec59-9e1d-4729-be1d-9b4dbecfee65","year":2018},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:6ab4b1f3bc0099ac857cdb56f291b4dbf0a88c96e312acf066b5c52d29fa507a","observation_id":"0f1742aa-d590-4dc5-87b0-f2e39c33fe95","resolution":{"observed_at":"2026-05-15T14:50:59.943825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"4cc8e24c-9701-46e6-8e68-ebeb3c7a3bdd","year":2021},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:5a6ed8089f7a15d40c0e4463c47c96ee867dc5899b119d0fdfaeb453e7d8dd3b","observation_id":"25311f4d-123b-48d5-9cc9-ba4344ced037","resolution":{"observed_at":"2026-05-15T14:50:59.947564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classification accuracy score for conditional generative models.NeurIPS, 32","venue":null,"work_id":"e8efd978-20bd-43a7-9f32-844d4158fb89","year":2019},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:7ff3177841c2446f750f31b7d5d697f5c8f9fa78c07c101b433e910b8b526eb5","observation_id":"ad00e2d3-c149-4788-9428-78d0128f8b05","resolution":{"observed_at":"2026-05-15T14:50:59.951298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pretraining from pixels","venue":null,"work_id":"65f7fa81-e98a-4eba-ab14-c6e4e15b8f56","year":2020},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:7a278d3655cf1d26c993e90f1f04ac3a2c2f522008773d7db49e51989c4f46eb","observation_id":"03201462-0c46-4cba-bc4f-0974193d3968","resolution":{"observed_at":"2026-05-15T14:50:59.954919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:771bc894e5f9d26c4b1bb59fe7ef52b3a1e59b2871a5a6c5a97fa6b5f2f46291","observation_id":"e9eef0f7-ce2b-4a08-8c80-2884929218b5","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advancesin neural information processing systems, 37:84839–84865","venue":null,"work_id":"08437127-6586-4184-99e1-d9862d527e69","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:1b8765c4fb7c0c1db4253906ee79d885e43629a96115c18449250092d4d1cebf","observation_id":"85e03685-b3c2-428e-9944-0f96f0b08232","resolution":{"observed_at":"2026-05-15T14:50:59.958488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-07-06T16:16:56.609388Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a3db110c6d337457d9cdfabc00a723d118249c498c25d98e30fc7a03b539e3b4","observation_id":"bfb03666-dc73-483e-a948-ce00f2e52775","resolution":{"observed_at":"2026-05-15T14:50:59.768622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":"3b008a3a-1965-4327-ada9-102f93e8429b","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:3395d614471290c34a386bba36200f3846de7183b44b45d3eb14851533fc7baf","observation_id":"d0aea713-0a11-434f-91c3-b8bf8e3b0ae0","resolution":{"observed_at":"2026-05-15T14:50:59.961939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-01T16:34:38.923197Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":"2405.19335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-VILA: cross-modality alignment for large language model","venue":null,"work_id":"dafe02b3-76e1-4cea-a443-5a34bf5ee0c4","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:c679fb8b2cabf41677099f2e80465b6aa918eb72b2f3d4fd98d7c9ad78326a8b","observation_id":"abff7c5e-1703-4c7e-8ceb-c800c58692f3","resolution":{"observed_at":"2026-05-15T14:50:59.775698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jointly training large autoregressive multimodal models","venue":null,"work_id":"cbdd4c97-398a-4cee-a9b4-9002a9a2f792","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:191d639da16ebd674a691a9448c547f2e5e7b3deef9feea9aaa710bb5ff9fcfc","observation_id":"427529eb-446c-43df-a223-7c2d03618e88","resolution":{"observed_at":"2026-05-15T14:50:59.965192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vector quantized diffusion model for text-to-image synthesis","venue":null,"work_id":"27df9d65-a221-46b5-95c5-92ee96ddbd8c","year":2022},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:2237041b70d93278c76a6913518d21ab4ceb37b2669a57e84aa9fc5b9eb09ada","observation_id":"f698e10f-5ba2-467b-8996-e285e6f2fe01","resolution":{"observed_at":"2026-05-15T14:50:59.968451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":40,"verified_fuzzy":60},"total_outbound_references":126},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 126 outbound references and 69 inbound Pith citation observations for arXiv:2505.15809."}