{"as_of":"2026-08-07T15:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72ab992812466e8b9c55770346a9469366c153bf689630b20907c0dfebaaa439","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:59:38.518069Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-07T14:59:38.518069Z","title":"Unified multimodal discrete diffusion.arXiv preprint arXiv:2503.20853, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-07T14:52:06.219322Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:38.518069Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:b7cd517eb2eb94ab4680c0876fac3768875bdfccad10b2ff50332ce58f65c029","observation_id":"8a9254a9-244a-4103-9683-75d540ca5767","resolution":{"observed_at":"2026-08-07T14:59:38.518069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:d6d234307b2ec3cf1d4ae0214c6c94879c6578e0546569113137723088543691","observation_id":"3f4cc231-4116-41ba-a654-3b56db6a9fd6","resolution":{"observed_at":"2026-05-17T03:46:06.160898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-07T14:04:57.037941Z","title":"Unified multimodal discrete diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-07T13:55:51.834215Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.037941Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:01c460f2c2068590637a9be68a95507188346d9c9cbb5c1fd9683b363a4b4c9d","observation_id":"8a7ddd00-d69d-4127-bcbd-7de3b7e2b9ec","resolution":{"observed_at":"2026-08-07T14:04:57.037941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T12:59:31.454155Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.23606"},"observation_digest":"sha256:90bc71223c058814428ec92557d7cb0fac27e1363753356c4f7545cad7555c84","observation_id":"e837ec56-76f3-4e25-8e24-85d9e707d090","resolution":{"observed_at":"2026-05-19T13:02:17.981905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-07T05:34:51.487999Z","title":"Unified multimodal discrete diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07903","last_updated":"2025-06-12T23:40:11Z","snapshot_observed_at":"2026-08-07T05:20:14.869994Z","submitted_at":"2025-06-09T16:20:20Z","title":"Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T05:34:51.487999Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2506.07903"},"observation_digest":"sha256:3f38eb80d8c98a25989d4f86c88507974b72bd754fc1d689e4609168499713fa","observation_id":"7371bf34-d56d-4437-9b23-667ade40e132","resolution":{"observed_at":"2026-08-07T05:34:51.487999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:4ad0487a55e06ab5e387d56d426524233f003ac873b12c014d2d8e97b7dededf","observation_id":"691113db-8987-48d0-a1a1-66b4ac9a6529","resolution":{"observed_at":"2026-05-12T18:51:15.613109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T20:15:21.863902Z","title":"Swerdlow, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:21.863902Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:a934aed5692fd08cfb70578b01115ddb15f08ef6ce58a13dc75e52ffa2664006","observation_id":"4a313236-7e17-4e9d-a8ed-7ef526ebf6cf","resolution":{"observed_at":"2026-08-05T20:15:21.863902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T13:20:05.369338Z","title":"Unified multimodal discrete diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-06T04:06:34.224683Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T13:20:05.369338Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2509.01025"},"observation_digest":"sha256:22a1eff4a62692b7990625afa9eba7b5f5eb6d79c8d34923aeb0b8538e842dbd","observation_id":"150620b1-d481-4313-ae7e-8911d4f34d59","resolution":{"observed_at":"2026-08-05T13:20:05.369338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-02T07:15:59.205489Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:a77f5c4af2f231010caf2a0f1f2354dc6ffde6f0d681800faf6e65be90459412","observation_id":"a106f2b8-23c9-442b-8c56-4e16453cb9cc","resolution":{"observed_at":"2026-05-18T14:16:27.807390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2511.08416","last_updated":"2026-05-07T17:16:30Z","snapshot_observed_at":"2026-07-06T22:35:31.750339Z","submitted_at":"2025-11-11T16:27:43Z","title":"Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications","version":3},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-17T23:40:01.988138Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2511.08416"},"observation_digest":"sha256:db84c098898e63d545340d252f439cefa149f4dc46ee7fccfc87ad51eab8e63a","observation_id":"cc7a35f6-51f8-4c93-953e-bffe17bb1461","resolution":{"observed_at":"2026-05-17T23:40:31.133757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:b0df92085843c66edbe0a168588ff9d85bb6fc01ef1491ec91cec27937010c65","observation_id":"cc17d7e1-6680-49be-9fe3-b165a4f69546","resolution":{"observed_at":"2026-05-17T21:30:18.142915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.07971","last_updated":"2026-06-16T14:50:02Z","snapshot_observed_at":"2026-08-02T12:35:41.123059Z","submitted_at":"2026-05-08T16:32:17Z","title":"DVD: Discrete Voxel Diffusion for 3D Generation and Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T03:17:23.458350Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.07971"},"observation_digest":"sha256:24f868bb8b664bf27c3231d92f2528d802301e3e4c49ec706e18496fac6bee6c","observation_id":"5443a025-859f-4992-b97c-ea7f7ae5f8d5","resolution":{"observed_at":"2026-05-11T03:20:56.051052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.07971","last_updated":"2026-06-16T14:50:02Z","snapshot_observed_at":"2026-08-02T12:35:41.123059Z","submitted_at":"2026-05-08T16:32:17Z","title":"DVD: Discrete Voxel Diffusion for 3D Generation and Editing","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T23:07:55.414879Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.07971"},"observation_digest":"sha256:00f73e700c83c89f7d70cd381aa3667c70af611ac495b87c05b71f1287f269dc","observation_id":"71e2eb40-5e8b-43c1-a6ac-ef14893aad00","resolution":{"observed_at":"2026-07-01T13:35:45.943905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.09291","last_updated":"2026-05-10T03:36:49Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:36:49Z","title":"dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T03:52:05.779559Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.09291"},"observation_digest":"sha256:ea4b3fd659e18a3a0165b1d329d8b83b3843f04736f5d17bd155b382f0e30f34","observation_id":"038a67ca-a5a3-4f9e-8e39-fcfa03e1df69","resolution":{"observed_at":"2026-05-12T06:51:29.586215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T01:45:39.649473Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:9061f7ae772b41574a010c9b96163896b7a033f812ccb0966e972951b38f56f4","observation_id":"7cf5054b-cd09-4088-baaf-5185adf86e4f","resolution":{"observed_at":"2026-05-15T01:48:28.723710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-19T16:27:59.293776Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:ce86a3305fa0f2f98ad745d0fe16b86159e32ff2e37360c8e6296193396c5910","observation_id":"9236c017-733a-41b5-9416-7d980359ed55","resolution":{"observed_at":"2026-05-19T16:32:39.560230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.14531","last_updated":"2026-06-07T03:23:07Z","snapshot_observed_at":"2026-08-02T15:39:21.779915Z","submitted_at":"2026-05-14T08:13:43Z","title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-30T21:16:13.804718Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.14531"},"observation_digest":"sha256:686427696302f6beaa1ca6a185288f441b422f591d174d746e585dd580a53c90","observation_id":"992a4399-db8d-4bc9-85cc-6dbe3a2d4f49","resolution":{"observed_at":"2026-07-01T14:35:46.479800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:fdaf1813fbbb8f2b588c19b1766fbdd8e1be6de83dc8bdb6402c8d5da84bfd10","observation_id":"ee81fd2b-21de-4c8d-918e-903eaf672893","resolution":{"observed_at":"2026-05-21T05:23:58.492037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2606.07079","last_updated":"2026-06-05T09:16:51Z","snapshot_observed_at":"2026-08-06T18:02:03.549311Z","submitted_at":"2026-06-05T09:16:51Z","title":"AsyncPatch Diffusion: spatially-flexible image generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T22:33:35.266477Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2606.07079"},"observation_digest":"sha256:481156c1253340bf7026ac8be0cddf515ff4fc0b20c2a7a65b0b52e56da4358c","observation_id":"de055821-2e37-4a4d-94a5-c4b80ed59148","resolution":{"observed_at":"2026-06-27T22:41:23.894403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2606.07895","last_updated":"2026-06-05T23:10:43Z","snapshot_observed_at":"2026-08-06T00:27:16.284109Z","submitted_at":"2026-06-05T23:10:43Z","title":"TBD-VLA: Temporal Block Diffusion Vision Language Action Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:20.600217Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2606.07895"},"observation_digest":"sha256:1ed78e97519b37669de3cc50baff890adac2c3fde4cd483efe05ea203ddff998","observation_id":"8d73f961-3a7b-46c7-9e3f-6ea330ea7154","resolution":{"observed_at":"2026-07-02T18:57:16.660623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:abef4433acc491827669f0901f757f776dfc250c9ea622a1a830ad5b0cc116b7","observation_id":"cba9c7ef-81f4-48bb-b1e7-1f4bcd7c8956","resolution":{"observed_at":"2026-07-04T16:09:57.462869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:bbb034a22a8d380d160fc36a3d7636f5b1b26c45a0ec5f6b86753f0765febf12","observation_id":"1f059dcc-0a4a-4735-af44-1518455bebe1","resolution":{"observed_at":"2026-07-01T10:05:40.326540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-02T05:17:45.264805Z","title":"Unified multimodal discrete diffusion.ArXiv preprint, abs/2503.20853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13431","last_updated":"2026-07-15T04:23:22Z","snapshot_observed_at":"2026-08-07T01:50:04.940823Z","submitted_at":"2026-07-15T04:23:22Z","title":"Discrete Diffusion Models: A Unified Framework from Tokenization to Generation","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:45.264805Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2607.13431"},"observation_digest":"sha256:e778abf49eb56f233dfe1b8e63ee7ef95e8e8b14e707337dd43507127f88b013","observation_id":"e53b5323-ab96-477f-8c2d-a6ac9b33cce4","resolution":{"observed_at":"2026-08-02T05:17:45.264805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-01T23:55:57.967718Z","title":"Unified multimodal discrete diffusion.arXiv preprint arXiv:2503.20853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15200","last_updated":"2026-07-16T16:57:34Z","snapshot_observed_at":"2026-08-06T14:03:11.209012Z","submitted_at":"2026-07-16T16:57:34Z","title":"Mask-Aware Policy Gradients for Diffusion Language Models","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:57.967718Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2607.15200"},"observation_digest":"sha256:a40940db154778c1a6b44d29353bb61b0e9ba6b8b5adc699503866535d37b50f","observation_id":"2af4499e-603c-4e56-9089-a556820eaa93","resolution":{"observed_at":"2026-08-01T23:55:57.967718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-01T20:54:02.898395Z","title":"arXiv preprint arXiv:2503.20853 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16528","last_updated":"2026-07-17T22:09:01Z","snapshot_observed_at":"2026-08-07T07:19:10.753414Z","submitted_at":"2026-07-17T22:09:01Z","title":"Hierarchical Domain Generalization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T20:54:02.898395Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2607.16528"},"observation_digest":"sha256:955f08c03ace2060e07fc3a912ccd76d38be06dc81ef67f33dce33d6cbce47a8","observation_id":"086e4088-fa5f-435f-9e1e-1f6dc9505163","resolution":{"observed_at":"2026-08-01T20:54:02.898395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.20853/citation-record","integrity":"/paper/2503.20853/integrity","json":"/paper/2503.20853/citation-record.json","paper":"/paper/2503.20853"},"outbound":[],"paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:59:13.885813Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2503.20853."}