{"as_of":"2026-08-14T15:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac0367ac05cb5c38ffd329c046699c51ebc3acb7b18f298edf1e82700af4844b","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:21:40.277901Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:39:33.093629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:38:43.676950Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2512.14008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-07-17T01:20:41.788401Z","title":"arXiv preprint arXiv:2512.14008 , year=","venue":null,"work_id":"6d750855-b10b-4205-8f24-52c8849f71a2","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:2124204cfcdce5d19c07cd5320075f0f63bfbdaaf852826c8a664eb018c9eab6","observation_id":"7629bb48-de80-405d-94d8-eac60c43604b","resolution":{"observed_at":"2026-07-17T01:20:41.788401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2512.14008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-07-17T01:20:41.788401Z","title":"arXiv preprint arXiv:2512.14008 , year=","venue":null,"work_id":"6d750855-b10b-4205-8f24-52c8849f71a2","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:37c51cdabef028f3a0d84fe2b4f7fda781b3ac7f8384bdd190de552b06752a34","observation_id":"af62d3ef-f720-4a86-9729-568b77fdb0a7","resolution":{"observed_at":"2026-07-17T01:20:41.788401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-08-02T09:39:33.093629Z","title":"Sparse-lavida: Sparse multimodal discrete diffusion language models.arXiv preprint arXiv:2512.14008, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:33.093629Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:d53fa7a47385f91c527956ceaed012d4ef3a385f0bb19a2c46f43437cf45ba3e","observation_id":"984d7d8e-7210-4a8e-8593-09f46d87463b","resolution":{"observed_at":"2026-08-02T09:39:33.093629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2512.14008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-07-17T01:20:41.788401Z","title":"arXiv preprint arXiv:2512.14008 , year=","venue":null,"work_id":"6d750855-b10b-4205-8f24-52c8849f71a2","year":2025},"citing_paper":{"arxiv_id":"2607.01775","last_updated":"2026-07-02T06:45:43Z","snapshot_observed_at":"2026-08-05T08:13:48.395073Z","submitted_at":"2026-07-02T06:45:43Z","title":"Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-07-03T17:30:39.458521Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2607.01775"},"observation_digest":"sha256:5d95673d9250e48d7b177bafcbce4061f22fe01ea8d28a6ca03f34fcd3fdce79","observation_id":"1e3fa0bf-8eb9-4b00-870e-e304e1d71f41","resolution":{"observed_at":"2026-07-17T01:20:41.788401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14008","snapshot_observed_at":"2026-08-02T01:48:51.932358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:51.932358Z"},"links":{"cited_paper":"/paper/2512.14008","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:4709710a0d35bd0138054f2a409e6b218002c2a4e009bb7658d4f6f408cc5f67","observation_id":"cc4f3ba4-420e-41ed-999f-08fee99c6af5","resolution":{"observed_at":"2026-08-02T01:48:51.932358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.14008/citation-record","integrity":"/paper/2512.14008/integrity","json":"/paper/2512.14008/citation-record.json","paper":"/paper/2512.14008"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-14T13:55:40.999046Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-03T16:21:31.275013Z","title":"Block diffusion: Interpolating be- tween autoregressive and diffusion language models.arXiv preprint arXiv:2503.09573, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.275013Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:cf0edaadcfe4dc84060cd7e42dd6bc348342d36d0ec23c96dbccae14e1c64fc8","observation_id":"2e5f1d29-7e7a-4fb7-b411-955f2a7ea27c","resolution":{"observed_at":"2026-08-03T16:21:31.275013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:31.317490Z","title":"Structured denoising dif- fusion models in discrete state-spaces.Advances in neural information processing systems, 34:17981–17993, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.317490Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:501da73a106ced25749df1696866988696dbebb13647c92a8766ed48542bb826","observation_id":"b8146d99-7772-4259-a545-b88a37ed3a2f","resolution":{"observed_at":"2026-08-03T16:21:31.317490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T16:21:31.374567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.374567Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:56196699da85c276456ad4ace43d744eb6839e3d50c17c5a331bdb56751a747a","observation_id":"015f33cc-23d0-4e5c-9e3d-196760368038","resolution":{"observed_at":"2026-08-03T16:21:31.374567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17076","last_updated":"2025-03-21T12:00:59Z","snapshot_observed_at":"2026-08-07T16:46:46.751028Z","submitted_at":"2025-03-21T12:00:59Z","title":"Halton Scheduler For Masked Generative Image Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17076","snapshot_observed_at":"2026-08-03T16:21:31.435181Z","title":"Halton scheduler for masked gen- erative image transformer.arXiv preprint arXiv:2503.17076,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.435181Z"},"links":{"cited_paper":"/paper/2503.17076","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:90630cd7f7aaa7e55c5657213606aec41b500901c172cf8ec7197f2741246015","observation_id":"d6221954-d337-4a12-b8fe-e52ebc046a27","resolution":{"observed_at":"2026-08-03T16:21:31.435181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:31.520363Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.520363Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:b137ad186f196834cf5b88a7ae6a85002c22a91feb84bbb118536c6bf1a8b765","observation_id":"83c143c3-c219-4a5a-9e2b-819970be1393","resolution":{"observed_at":"2026-08-03T16:21:31.520363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:31.603156Z","title":"Coyo-700m: Image-text pair dataset.https : / / github","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.603156Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:a62904da2e20af34356b179655314cf06319fd936e32fd930ab1de87002d13c3","observation_id":"dd5ac18c-1554-45e5-b067-298f16be34a3","resolution":{"observed_at":"2026-08-03T16:21:31.603156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:31.680617Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.680617Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:91900d038c7f3c52e24592a888bd9a26e7de06848688dc97149e1638930b420f","observation_id":"95c26570-d1c3-4547-b6b1-59553bd53feb","resolution":{"observed_at":"2026-08-03T16:21:31.680617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T16:21:31.725029Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.725029Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:1869ede954bd526d91b47b8448d561372a0aa02d9cb75210e6b78d3f27eea4e2","observation_id":"ab85a340-a5c4-4404-a48d-c2a01f7d38e5","resolution":{"observed_at":"2026-08-03T16:21:31.725029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-14T11:02:32.549556Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-03T16:21:31.813465Z","title":"Sharegpt-4o-image: Aligning multimodal mod- els with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.813465Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:12597cba957ce22baf30b0cc091eecf2545b0d596ebed78da0446877f5a97642","observation_id":"cb519f03-a043-4030-8e65-b652ae1f883a","resolution":{"observed_at":"2026-08-03T16:21:31.813465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-03T16:21:31.888731Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.888731Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:eb776a113f4d96315929eca524201555222f33c0a992e8df3aa8c5b02c7b6c87","observation_id":"cdba4620-f658-4390-a193-ec99267fe35a","resolution":{"observed_at":"2026-08-03T16:21:31.888731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:31.960189Z","title":"Sdar: A synergistic diffusion-autoregression paradigm for scalable sequence generation.arXiv preprint arXiv:2510.06303, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.960189Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:a472114140d7c1527c4e00feff754086572cc1638be99dff5144b5e8550440f5","observation_id":"a27ce837-6cb6-4020-9de9-132ab1b3ab10","resolution":{"observed_at":"2026-08-03T16:21:31.960189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-14T10:06:18.357222Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T16:21:32.006411Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.006411Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:ceef8354ee6a65203f61e634fdb2841f5bccd730807cc6cd9d2e8f11d9a08174","observation_id":"aa860c1c-2632-4aa7-b6de-71350afa582d","resolution":{"observed_at":"2026-08-03T16:21:32.006411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.108651Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.108651Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:0328a14cf1b64da91cba30366b0de9dd70bd4eceb21dd8730a5538a4dcd2b3f5","observation_id":"517b9884-a8b9-4233-b9b7-e4f826f1e19a","resolution":{"observed_at":"2026-08-03T16:21:32.108651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.180195Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.180195Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:dffb250587e77023d0e6d5aadb2a28b46767ef6127b6458ddc0a1d1ee043030e","observation_id":"5127ee4f-d1df-4b35-920f-b4421a01b24f","resolution":{"observed_at":"2026-08-03T16:21:32.180195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.248872Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.248872Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9b2e7d85e5aacda9c9cede72056b37538e5aa0cd6f3454a997337026fc8eed4f","observation_id":"4ed01278-b7bd-46de-a1b9-3f8798c0af15","resolution":{"observed_at":"2026-08-03T16:21:32.248872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T16:21:32.331138Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.331138Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:10fe24d03baec7740412022c34e681efa67c1203a0de3560ac9888250d0f349a","observation_id":"00d7975a-5547-4546-9ac3-d260e33ce698","resolution":{"observed_at":"2026-08-03T16:21:32.331138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.411609Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment.Advances in Neural Information Pro- cessing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.411609Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:6eddae8a60db8f09f0e3850036db47d4fa71fac608403f44b46e7a21c5fc1a9f","observation_id":"fcb18a22-f58e-4f29-bfa1-5ba7f8de4c4e","resolution":{"observed_at":"2026-08-03T16:21:32.411609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-11T20:47:50.864749Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-03T16:21:32.491974Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.491974Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:72ca2094a90cb6a27e43583a45805738b80ee0001bb03254b62f7650a0545fa3","observation_id":"422dbeb9-5e7f-4fe7-90ca-88f2e6ae6291","resolution":{"observed_at":"2026-08-03T16:21:32.491974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.577277Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.577277Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:469ce757418784e1899b1d36b18fd1d991ef7cb40ec307891358611224b8add7","observation_id":"99356766-f590-4816-a53d-83d6389bb270","resolution":{"observed_at":"2026-08-03T16:21:32.577277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.682171Z","title":"Unified discrete diffusion for si- multaneous vision-language generation.arXiv, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.682171Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:df79e60b6f7e08762e101779a8caf04049a2cd333da1315f3586457fd49b520e","observation_id":"1f0b3f9f-1175-4df1-b673-01756b972405","resolution":{"observed_at":"2026-08-03T16:21:32.682171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-03T16:21:32.763858Z","title":"Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 5(7): 16, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.763858Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:a83c5122c305e41c3f2db3dab8e154df51c14b722a99acd5b92b0d20f7a5b414","observation_id":"d869eb79-89e4-4c0a-8a4f-d5441ec53756","resolution":{"observed_at":"2026-08-03T16:21:32.763858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10582","last_updated":"2025-03-15T01:09:17Z","snapshot_observed_at":"2026-08-07T17:06:19.282495Z","submitted_at":"2025-03-13T17:32:48Z","title":"VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10582","snapshot_observed_at":"2026-08-03T16:21:32.823096Z","title":"Visualwebinstruct: Scaling up mul- timodal instruction data through web search.arXiv preprint arXiv:2503.10582, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.823096Z"},"links":{"cited_paper":"/paper/2503.10582","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:0b99a9114eec0d81cfcc07132acacb7156307baa12e24c09c2d6eb59f6f2ab8d","observation_id":"50d1afc4-20bf-4fc3-9f59-3eb70eee4f0f","resolution":{"observed_at":"2026-08-03T16:21:32.823096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:32.907400Z","title":"Referitgame: Referring to objects in pho- 9 tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.907400Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:b928d83c7bd879eb9f61f1f12c7aaac8bd4fbc71a108bfbe35f6c0e7d33a65b8","observation_id":"7ce2fe76-20f9-45e5-b0cb-6fd6b23e069f","resolution":{"observed_at":"2026-08-03T16:21:32.907400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-03T16:21:33.027701Z","title":"Mer- cury: Ultra-fast language models based on diffusion.arXiv preprint arXiv:2506.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.027701Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:f592ee1fc0a5119481d9c0b9e866014cbdd9aef92a66981489f318d30d59def7","observation_id":"e401cbdf-a595-4065-a582-5d2a856263b2","resolution":{"observed_at":"2026-08-03T16:21:33.027701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.150937Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.150937Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9f001f3df00a0707cf21e6e77395325b24853ebf20f580ae24a073816992af53","observation_id":"77332f7e-e738-4752-b78c-98145d5da34a","resolution":{"observed_at":"2026-08-03T16:21:33.150937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.359001Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Ad- vances in neural information processing systems, 36:36652– 36663, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.359001Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9c32ec02d47d778ff445277f134a0901e1cf515082a6c628f457bc13448b72c9","observation_id":"319a7461-f406-49ff-adee-f0d019eaeea4","resolution":{"observed_at":"2026-08-03T16:21:33.359001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.430680Z","title":"Flux.https://github.com/ black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.430680Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d22eaf1e70a785d397c081742b7ee2cdb335fec3635a8a2e65c70175ef267e2d","observation_id":"d5b1fb5f-ea04-4549-8986-6a3292b41be0","resolution":{"observed_at":"2026-08-03T16:21:33.430680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.545236Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.545236Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:36697741d8b08ef2b14f9a0a4325089d5e7cf5cadb0893e2c373b7f5ec94b671","observation_id":"73c32410-1435-4f50-9680-efa9adad3911","resolution":{"observed_at":"2026-08-03T16:21:33.545236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.658393Z","title":"Blip-diffusion: Pre- trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.658393Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:b1bfc8d40daed76aba472e276efaca826f2b6e45a684bc8e8774b1b00e8b41dd","observation_id":"690b09b8-36da-40f3-83fb-250bb252f32e","resolution":{"observed_at":"2026-08-03T16:21:33.658393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:33.772773Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.772773Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9235693a9ad9e6d92d59b33639bb68ebd89e003189e3e0b820429ce4ee4ac424","observation_id":"0729ccc2-cdc1-4158-b201-4cc182163957","resolution":{"observed_at":"2026-08-03T16:21:33.772773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06738","last_updated":"2024-10-17T01:30:33Z","snapshot_observed_at":"2026-08-13T05:04:55.220153Z","submitted_at":"2023-12-11T17:53:45Z","title":"InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06738","snapshot_observed_at":"2026-08-03T16:21:33.900776Z","title":"Instruc- tany2pix: Flexible visual editing via multimodal instruction following.arXiv preprint arXiv:2312.06738, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:33.900776Z"},"links":{"cited_paper":"/paper/2312.06738","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:19c8501f98b44d57bb9f3e6e628f0815465636eb961d4625c92e143060dd9723","observation_id":"c627d780-daa7-40c1-a254-bbb7bda83ec6","resolution":{"observed_at":"2026-08-03T16:21:33.900776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-13T18:55:13.828466Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.19244","snapshot_observed_at":"2026-08-03T16:21:34.063352Z","title":"Lavida-o: Elastic masked diffusion models for unified multimodal understanding and generation.arXiv preprint arXiv:2509.19244, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.063352Z"},"links":{"cited_paper":"/paper/2509.19244","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:19a0f11fbd9df7ff3872f25c65e93f2124374bbc21c0a28e74be7f4d7c16ce08","observation_id":"9ba97daa-8a33-4978-838c-beda1e91ac46","resolution":{"observed_at":"2026-08-03T16:21:34.063352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-14T13:42:27.582012Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16839","snapshot_observed_at":"2026-08-03T16:21:34.225411Z","title":"Lavida: A large diffu- sion language model for multimodal understanding.arXiv preprint arXiv:2505.16839, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.225411Z"},"links":{"cited_paper":"/paper/2505.16839","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:922f81a25ff4a1bfe9a22fbf016058fa3c96b18c3953f95596a1e9684ab49e40","observation_id":"7cbfe9af-adca-4c65-a0d1-903bc5d42745","resolution":{"observed_at":"2026-08-03T16:21:34.225411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-03T16:21:34.439620Z","title":"Uniworld: High-resolution semantic en- coders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.439620Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:2317d4a7fb00922b9f354955a9602233c738e4ef520f2aeaa9ba039b5193efba","observation_id":"aaca2245-3af9-4222-a213-d487d9f7ac8a","resolution":{"observed_at":"2026-08-03T16:21:34.439620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:34.515666Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.515666Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:fc548da75ce004876aad668cd1d60085ce437a82c653b813653c4453889f8da5","observation_id":"2daaf990-efe9-470a-b0ed-5c5c4adae800","resolution":{"observed_at":"2026-08-03T16:21:34.515666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-03T16:21:34.652312Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.652312Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:4b45157ee817170173e975ba98603c6a94ba14cef168db6fc3d49f1eb99e846a","observation_id":"7e34dbe6-471a-411c-9ff4-91460f2a828c","resolution":{"observed_at":"2026-08-03T16:21:34.652312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:34.806510Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.806510Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:f4967bf7befc8a51d3359684398160498213f7f96a8dbb90090b0ba966658b78","observation_id":"d471d982-2de5-4bd9-9b53-339983219a36","resolution":{"observed_at":"2026-08-03T16:21:34.806510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-03T16:21:34.918576Z","title":"Discrete diffusion modeling by estimating the ratios of the data distri- bution.arXiv preprint arXiv:2310.16834, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:34.918576Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:e8ee1f52515e5a713a822f57378432a24123e9b657a69c91e68b58cbf1db88c0","observation_id":"e58941af-e7d3-4b9a-bd11-aaa7f1a7b367","resolution":{"observed_at":"2026-08-03T16:21:34.918576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T16:21:35.058138Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.058138Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:39db782849818504ed3573cc06fbcb04f2d942e411f8805c7bdeca81816e5750","observation_id":"b6904efb-a30f-47e1-b0fe-fb6c0a7245f3","resolution":{"observed_at":"2026-08-03T16:21:35.058138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:35.155487Z","title":"Unitok: a unified tokenizer for visual generation and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.155487Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:1646148060896a8e79a4ae7f3add9d282ad041662eaadff0fb4f37552f9d98e8","observation_id":"98901624-b232-4ac6-bf9e-6110fd73e9d1","resolution":{"observed_at":"2026-08-03T16:21:35.155487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T16:21:35.294723Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.294723Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9f77ffdc540b7ca2e05fd961b941ea43b66b1d260757427a4903545ee66a0236","observation_id":"c1cad497-ab5f-4dac-90b2-9ee8ba46a4b2","resolution":{"observed_at":"2026-08-03T16:21:35.294723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:35.412047Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.412047Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:351fa90138164c7b7643ebd4e934bfe85cb2993fa992d7d453f862c8cbcbd3f2","observation_id":"ec52f14f-8485-46f8-a7eb-ff8ca43e6280","resolution":{"observed_at":"2026-08-03T16:21:35.412047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:35.568594Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.568594Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:01a0f416c6d45d054d25296493f560596292d5e0fe5cf0ef6136586b838fe60e","observation_id":"63ee8488-85c0-405f-8172-dc7d1c1e489d","resolution":{"observed_at":"2026-08-03T16:21:35.568594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:35.722711Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.722711Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:73bd4f96a5579faf1fd1e6bbc5b9a7b2f698d00e3d901c8b22c84e8f53e3d684","observation_id":"03b93bcc-167a-4913-8875-eff802353be3","resolution":{"observed_at":"2026-08-03T16:21:35.722711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-03T16:21:35.889523Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.889523Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:06b2459e4137ab01e6c834bb6f9abe5014f812ea69c19275d6f3bdd97850766c","observation_id":"e2f6a1be-aeb2-4557-95ef-cc8e61c54de9","resolution":{"observed_at":"2026-08-03T16:21:35.889523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.053626Z","title":"Dall·e 3.https://openai.com/index/ dall-e-3/, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.053626Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:661df51ac7612022523868f5674ef2ab63aea6fb7834ebdb9bdf45c3ec7bebef","observation_id":"63bc66d1-e3c9-4aca-952a-516a8e378b55","resolution":{"observed_at":"2026-08-03T16:21:36.053626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T16:21:36.170362Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.170362Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:ae6a13c7bdbe6c23487f29c5d68f01bb018349a12c5a18804cb5b4caafe17320","observation_id":"e1f20f59-01b6-44d5-8f6a-8217356ed24b","resolution":{"observed_at":"2026-08-03T16:21:36.170362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T16:21:36.303981Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.303981Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d0baa9c5f135bc261d1dd520e1fb49e3a3782225ca548b18adc3bfdb59efd33f","observation_id":"00c49ad6-72fb-4335-bb25-d856fabe1332","resolution":{"observed_at":"2026-08-03T16:21:36.303981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.424148Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.424148Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:849828f7d90fca58eab4a3f9b83d827d3d54e52d2344b6f53a29ce2b6982285f","observation_id":"f94b5626-92a6-4298-8f75-95767ead62d9","resolution":{"observed_at":"2026-08-03T16:21:36.424148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.537363Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.537363Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:cc6c681bf05b91691e8588722568fa13e5a207d59837e4021f027509794dce48","observation_id":"15eb1e5e-b42f-4a28-8b28-91817e75bc80","resolution":{"observed_at":"2026-08-03T16:21:36.537363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.672279Z","title":"Simple and effective masked dif- fusion language models.Advances in Neural Information Processing Systems, 37:130136–130184, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.672279Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:0fe654b8907068aef8535554a5a9678c4bcfc9048436fdedaf34fa9790361263","observation_id":"f32406eb-1785-4d3d-a436-dc26e5c8f9b0","resolution":{"observed_at":"2026-08-03T16:21:36.672279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.822838Z","title":"Laion-aesthetics.https : / / laion.ai/blog/laion- aesthetics/, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.822838Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:8fcb4b374a9acfa1bbcf54ea6b000c068499165a6ac1923ce4e190138aa014a9","observation_id":"592a8b64-1010-4728-8184-8c1c3dc37b68","resolution":{"observed_at":"2026-08-03T16:21:36.822838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:36.935037Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural in- formation processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:36.935037Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:ed225fdba39999de2a967dfda453102ed9cf2fc788f96bc686ebe731307532f3","observation_id":"260c8988-8800-44b3-8b33-64017bb8485b","resolution":{"observed_at":"2026-08-03T16:21:36.935037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-08-13T04:58:18.304861Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23606","snapshot_observed_at":"2026-08-03T16:21:37.055379Z","title":"Muddit: Liberating gener- ation beyond text-to-image with a unified discrete diffusion model.arXiv preprint arXiv:2505.23606, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.055379Z"},"links":{"cited_paper":"/paper/2505.23606","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:de5d4bea86ebaf3688c02378ae6186e5e25edae9865c2c125fcad44070f882e8","observation_id":"8580dfb8-ab89-4628-8b9d-f54d23b16015","resolution":{"observed_at":"2026-08-03T16:21:37.055379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:37.195079Z","title":"Sparse-dllm: Accelerating diffusion llms with dynamic cache eviction.arXiv preprint arXiv:2508.02558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.195079Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d26454f6c9758e6be2d9a086ec3fa4a2b13f4479d426716f34f413cdd9355baa","observation_id":"422723de-f80c-4a2a-9eec-9d74d89d962c","resolution":{"observed_at":"2026-08-03T16:21:37.195079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:37.313959Z","title":"Journeydb: A benchmark for generative im- age understanding.Advances in neural information process- ing systems, 36:49659–49678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.313959Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:1da94fdbad69b9cafae13a0d98b92f3fd5a763a33f6fe9da84ddd604194b8ec5","observation_id":"10be79d1-d1ac-43bc-9579-4646383e9453","resolution":{"observed_at":"2026-08-03T16:21:37.313959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-08-13T05:22:59.274069Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-08-03T16:21:37.455637Z","title":"Diffusion llms can do faster-than-ar inference via discrete diffusion forcing.arXiv preprint arXiv:2508.09192, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.455637Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:299657c3c115310f416673b0f8908657f3712e362f289749a6d30805cda618c4","observation_id":"4febda56-29fd-4f78-bf8d-e93b4ac5d848","resolution":{"observed_at":"2026-08-03T16:21:37.455637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:37.549253Z","title":"Segllm: Multi-round reasoning segmentation with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.549253Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:8f5dbda4bebca323fc6daf19594096acaca2c961d7dc4ecdb3645bc961c1a51b","observation_id":"159cbec4-d1ea-40e7-8c4e-790c2f00a3e8","resolution":{"observed_at":"2026-08-03T16:21:37.549253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-12T23:50:24.433472Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-03T16:21:37.664980Z","title":"Gpt-image-edit- 1.5 m: A million-scale, gpt-generated image dataset.arXiv preprint arXiv:2507.21033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.664980Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d3a19e221071a87e5c95bf45553774faa0b26fcae5ce7089191d1ea131600b26","observation_id":"f30cd611-26b5-44df-9794-0973834a8c51","resolution":{"observed_at":"2026-08-03T16:21:37.664980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-03T16:21:37.768727Z","title":"Fast-dllm: Training-free acceleration of diffusion llm by enabling kv cache and parallel decoding.arXiv preprint arXiv:2505.22618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.768727Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9213b13c17bf474d6ff32e107eb37d4d845982d6a297a6bedc981fb5e03b6cd0","observation_id":"a3ae9a3f-10e6-47fc-9d0f-9c9a8e73f11d","resolution":{"observed_at":"2026-08-03T16:21:37.768727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T16:21:37.852349Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.852349Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:f6f0d2cfc372c97adb0b4966870ab363af90c2693fcac12b08f0175b0e724efa","observation_id":"9fa80018-870b-444a-9a83-36ae5772908a","resolution":{"observed_at":"2026-08-03T16:21:37.852349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-03T16:21:37.920408Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.920408Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:a3a910b802929c4273b05e16db8454c5fbe972e06df91849586085b494661065","observation_id":"381f95c8-fbb1-4bfb-883b-73b41cd9acdb","resolution":{"observed_at":"2026-08-03T16:21:37.920408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:37.984425Z","title":"VILA-u: a unified foun- dation model integrating visual understanding and genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.984425Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:6cc466aa6e858c47b3fc26d5dcadec0e9549448c1c8034941555fc378ce89226","observation_id":"7bb4e548-69f4-4d12-885c-86d4bc19d753","resolution":{"observed_at":"2026-08-03T16:21:37.984425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:38.047544Z","title":"Omnigen: Unified image genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.047544Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d7b3de37dc662934c7d920b6be097596cb225185931364e5c83e35cb179136f3","observation_id":"f1396d73-a551-442e-ba77-8054db4ddb14","resolution":{"observed_at":"2026-08-03T16:21:38.047544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-03T16:21:38.152198Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.152198Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:e606bb83bc89030b8ac48fa4fe7574f4b2b34fdff018157fa76be25046c9af04","observation_id":"722332ec-76dd-4aec-b09e-56fc90c16713","resolution":{"observed_at":"2026-08-03T16:21:38.152198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T16:21:38.232907Z","title":"Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.232907Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:559b093b32dfdfc8a89683f0d6a2d0c9f01e45ef3425ef1f31b4750d77f10504","observation_id":"1dd19a22-ab81-4af8-b0e9-42b4d1a2685c","resolution":{"observed_at":"2026-08-03T16:21:38.232907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:38.338674Z","title":"Dream 7b,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.338674Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:c65834e2b21efa6cd029e575f6446c65d702284c2815183aebb35c629418e0f9","observation_id":"ac717bf6-846d-4940-bdaa-942dc6dc7261","resolution":{"observed_at":"2026-08-03T16:21:38.338674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-03T16:21:38.419317Z","title":"Imgedit: A uni- fied image editing dataset and benchmark.arXiv preprint arXiv:2505.20275, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.419317Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:c88a207eaefe9b8fbbbff6e7cc86e0401f8ac059a901a0bd97e6fc493289b610","observation_id":"0e12e5bf-806c-4ee4-8530-c61d9e04d8cb","resolution":{"observed_at":"2026-08-03T16:21:38.419317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-03T16:21:38.516268Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.516268Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:d882bef666d642b1b741d687b888c0c738834bd1d07be8f23ade42a9a9cb278a","observation_id":"de50c696-4650-4c37-a92b-b230fba37457","resolution":{"observed_at":"2026-08-03T16:21:38.516268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:38.637196Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.637196Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:8399734f03f092f4ffe3810159f0e98e8d8cf0cbb287ced82216a99802b6134c","observation_id":"2ed0f6df-0948-4e1f-8440-92a1dcc99d6b","resolution":{"observed_at":"2026-08-03T16:21:38.637196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16990","last_updated":"2025-05-26T02:04:39Z","snapshot_observed_at":"2026-08-07T14:49:45.584405Z","submitted_at":"2025-05-22T17:55:04Z","title":"Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16990","snapshot_observed_at":"2026-08-03T16:21:38.748437Z","title":"Dimple: Dis- crete diffusion multimodal large language model with par- allel decoding.arXiv preprint arXiv:2505.16990, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.748437Z"},"links":{"cited_paper":"/paper/2505.16990","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:fe3a6239234c71a5940d12dd44acd6998e4e2712700bbb89ca29867848d10dd6","observation_id":"ca2e4a40-27bc-4821-8a89-c6dca9e1d453","resolution":{"observed_at":"2026-08-03T16:21:38.748437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:38.857913Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.857913Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:01990dae38f87996bf82b9229c252f182fe2f5538b0fde087cd494131e2dd7e0","observation_id":"54202b41-ca23-432e-8b6d-8dd4638d97b2","resolution":{"observed_at":"2026-08-03T16:21:38.857913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:39.024404Z","title":"Magicbrush: A manually annotated dataset for instruction- 11 guided image editing.Advances in Neural Information Pro- cessing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.024404Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:288c9c80e5e0a3d0b7b1796006549acf30d89b56a591d303ca82174f6441c8c8","observation_id":"c909dbad-c9b2-490e-a03c-53a47f7ce459","resolution":{"observed_at":"2026-08-03T16:21:39.024404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-03T16:21:39.116064Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.116064Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:2900e34a4437f2012ef37619160d27bd5731af39b11e4375d1ae4458a5d5b16c","observation_id":"9f36e4c7-411e-4edb-a80f-fdd43ca7f9d8","resolution":{"observed_at":"2026-08-03T16:21:39.116064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:39.209645Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Pro- cessing Systems, 37:3058–3093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.209645Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:e7d66f2d28cc0ff87052b1e3778d442c57806e05b26afbd6f291726850d7ae5b","observation_id":"007b409c-f1b0-444b-ad40-dc6f57e7ab02","resolution":{"observed_at":"2026-08-03T16:21:39.209645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-03T16:21:39.318402Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.318402Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:e28e296503fb4eab5dee26ef8447ffd5def459100250818806f2da523478219e","observation_id":"8e9ed9ad-2b51-4d19-9f3a-b206f545faad","resolution":{"observed_at":"2026-08-03T16:21:39.318402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T16:21:39.471015Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.471015Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:0f1f24fae002ed905da00958a0e9a8ef6dfec832c00a6c5d771bbdf46eeb3da7","observation_id":"b5ff52f0-cf5f-4df5-afba-fa5eba706c45","resolution":{"observed_at":"2026-08-03T16:21:39.471015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:39.643580Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.643580Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:8cdfdf245e53a19965cdc3de42ccbc010056a35141e36683d33de21c84b37a93","observation_id":"5d2662de-ecbb-4b08-b19b-874cbf05d83e","resolution":{"observed_at":"2026-08-03T16:21:39.643580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:39.884046Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:39.884046Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:3ec62f0e231f80a0ea1e7103e3188b0ed2812774fb02b0e73a9dfd07688075e1","observation_id":"b871aece-7911-4e31-98a6-59f15ba397d9","resolution":{"observed_at":"2026-08-03T16:21:39.884046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:40.089008Z","title":"[reg]” that is similar to mask token “[M]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:40.089008Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:33a4d5376ef8cda7ab230feb614d7759219a949dfe6ea6ee82c25818a7a675db","observation_id":"5e4aec08-24b3-4f5e-b7b7-466f99a29243","resolution":{"observed_at":"2026-08-03T16:21:40.089008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:40.175124Z","title":"Data pipeline Our training dataset consist of the following tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:40.175124Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:f73cfd144aea9b100ededf606c4ddd83d97947449fb5e44133363b9f64bb97d9","observation_id":"695b6728-2c0b-4029-977a-41e9968af7bb","resolution":{"observed_at":"2026-08-03T16:21:40.175124Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:21:40.277901Z","title":"First, the speedup only benefits long sequence generation such as text-to-image generation, image-editing, or visual math problem-solving with long reasoning chains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:40.277901Z"},"links":{"citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:be11c5480aad587b03591feb029ee5faaef5bacae5a0fc252138edd3c09765f3","observation_id":"4258395d-0a80-4fe5-aaa0-daa6118d9e71","resolution":{"observed_at":"2026-08-03T16:21:40.277901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 5 inbound Pith citation observations for arXiv:2512.14008."}