{"as_of":"2026-08-13T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d1a8f4f94b914ef388f1597aa28c20f34ab67412f044fd13d895ee1252230dd","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T03:46:06.074416Z","state":"measured"},{"denominator":159,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":159,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:51:18.515307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:52.266883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T04:28:02.231373Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2505.22618"},"observation_digest":"sha256:e9a8feebaa7e098923723c410d211d38c87f65caca0ed1f3e3de3822d8075001","observation_id":"c7785dfa-a5d3-4648-ae12-9fccc85b42cb","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-06T05:32:07.588327Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01616","last_updated":"2025-08-03T06:25:17Z","snapshot_observed_at":"2026-08-12T13:47:44.637809Z","submitted_at":"2025-08-03T06:25:17Z","title":"The Philosophy and Physics of Duality","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:32:07.588327Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2508.01616"},"observation_digest":"sha256:4a2a416fea76849def1c36e699bb4df5ccc0e800877eb02066856fe3d92dcd0d","observation_id":"a82829d2-a820-4e1e-a799-5096c180d32f","resolution":{"observed_at":"2026-08-06T05:32:07.588327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-05T20:15:15.869197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:15.869197Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:79aa9675c24963b56eeba42192e47ae7c7aeec2ef191677856146a64f045dff3","observation_id":"07b2dcdb-1cff-428a-9a8c-6e1035ba0070","resolution":{"observed_at":"2026-08-05T20:15:15.869197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-04T22:55:30.063762Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-12T13:47:44.838416Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.063762Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:03b8a1a846adfeb9c2ae798e40816b6515c85aee1bb577ac9ea34de257cdffa3","observation_id":"072f861c-8656-4bc4-935d-2ad3398040cc","resolution":{"observed_at":"2026-08-04T22:55:30.063762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-04T17:57:47.054983Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10396","last_updated":"2025-09-12T16:44:31Z","snapshot_observed_at":"2026-08-12T01:25:18.465764Z","submitted_at":"2025-09-12T16:44:31Z","title":"Inpainting-Guided Policy Optimization for Diffusion Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:47.054983Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2509.10396"},"observation_digest":"sha256:0a44050594c0f8962117eae63ce205d9b101afd9b46699a90f9cd049f15ce50f","observation_id":"dca79717-210d-479b-90c9-37e24c8d55fc","resolution":{"observed_at":"2026-08-04T17:57:47.054983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-04T15:39:42.150374Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-12T23:50:25.614579Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:42.150374Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:d4a52ee04a9fb6970e2c7587d3448737bdac56d92b54f03b182687068e709399","observation_id":"24b21a0c-3418-40c6-8124-7baa99028163","resolution":{"observed_at":"2026-08-04T15:39:42.150374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2510.06133","last_updated":"2026-05-26T03:39:22Z","snapshot_observed_at":"2026-08-04T11:16:44.535486Z","submitted_at":"2025-10-07T17:08:33Z","title":"CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T09:06:25.049493Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2510.06133"},"observation_digest":"sha256:53e2e82ebf229e028a2d1768c9c66d3aa25561016bf9193128dd9a4de5e4cb2d","observation_id":"40f9660a-6be0-4cce-93c0-e954c9b8ac14","resolution":{"observed_at":"2026-05-18T09:11:10.026064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-04T11:16:47.440982Z","title":"Runpeng Yu, Xinyin Ma, and Xinchao Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06133","last_updated":"2026-05-26T03:39:22Z","snapshot_observed_at":"2026-08-04T11:16:44.535486Z","submitted_at":"2025-10-07T17:08:33Z","title":"CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T11:16:47.440982Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2510.06133"},"observation_digest":"sha256:95a4fde8cac4ae4d1f83282f73b48959ee50418cc61ee9bfded6721f34ea76a2","observation_id":"02d7388a-13b4-4c4f-b1fd-67961e2f98f9","resolution":{"observed_at":"2026-08-04T11:16:47.440982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-03T21:31:36.816979Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-03T21:31:33.690337Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:36.816979Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:ac8b1ec8e282c48727b0b0c8674245a72a61561ca9a83323bee1f21f60145c64","observation_id":"87f4633e-4417-412e-8e99-a5245e57c9db","resolution":{"observed_at":"2026-08-03T21:31:36.816979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-03T16:21:38.516268Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-04T04:44:58.323566Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:38.516268Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:aab521292ea232e5946c6bf3c8de8dfdb0a64cf960d20edb1508964aacd2c7d5","observation_id":"de50c696-4650-4c37-a92b-b230fba37457","resolution":{"observed_at":"2026-08-03T16:21:38.516268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2512.14067","last_updated":"2026-04-29T20:52:08Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T04:12:17Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T22:29:08.669964Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2512.14067"},"observation_digest":"sha256:57796eba23cf3ef152d7500da18c2e5e01686b80a4aa194276a78adc413b5cde","observation_id":"cb444cf3-6c48-4bd9-ac63-0a6dd390f5df","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2512.19433","last_updated":"2026-04-08T06:02:03Z","snapshot_observed_at":"2026-08-11T06:37:49.595265Z","submitted_at":"2025-12-22T14:31:58Z","title":"dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T20:38:06.225705Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2512.19433"},"observation_digest":"sha256:827a1e1f76c7d8631ec3c2387681796e2d1125962e1e4dfdcadc8136db202fe4","observation_id":"7312622e-1578-4eea-aaf4-5a9bc24a6733","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-03T08:14:37.068486Z","title":"Llada-v: Large language diffusion models with visual instruction tuning.arXiv preprint arXiv:2505.16933,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17917","last_updated":"2026-06-24T06:45:45Z","snapshot_observed_at":"2026-08-09T10:53:17.179319Z","submitted_at":"2026-01-25T17:36:04Z","title":"Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:37.068486Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2601.17917"},"observation_digest":"sha256:828759d7591e4dfa8a12f43a7c1e76fec4a2a15ab0695045b6fbe8416e05ece7","observation_id":"91116f92-a9f5-4328-b953-eb8627c20fa7","resolution":{"observed_at":"2026-08-03T08:14:37.068486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T22:27:44.206481Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16872","last_updated":"2026-05-27T14:51:57Z","snapshot_observed_at":"2026-08-10T14:44:30.822705Z","submitted_at":"2026-02-18T20:59:22Z","title":"DODO: Discrete OCR Diffusion Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T22:27:44.206481Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2602.16872"},"observation_digest":"sha256:4b5607489110c7040ff5e4b6e595d3740deddc4f64ebd3127643f5f3bcd297d2","observation_id":"36b693b4-2464-4076-a5c0-d10994d5788e","resolution":{"observed_at":"2026-08-02T22:27:44.206481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-15T13:43:40.241796Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06577","last_updated":"2026-07-03T04:02:30Z","snapshot_observed_at":"2026-08-02T23:56:12.139811Z","submitted_at":"2026-03-06T18:59:57Z","title":"Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-15T13:43:40.241796Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2603.06577"},"observation_digest":"sha256:9e0373488a3b66de873381e5f61d921e85246ea727e650c6e8796f6dcddfd7d7","observation_id":"1af74f9a-ebed-46be-bb48-014677dea550","resolution":{"observed_at":"2026-07-15T13:43:40.241796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-08-11T02:26:33.013800Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:c84e308b69e97bce6fe788b102ee6af75f95b1f1206dc5f4c990f0b55fb5a880","observation_id":"92a023c9-53c7-496f-a97c-b996afba0642","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:8ea725c1d760435e073f1be965d5c2575dfdbb85d8ccfc9682be978d6a0f93b5","observation_id":"d5b250fd-1231-4206-9f3b-fbbad600a124","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:7989c1f5695eae7b6a6e8fe56ccbd319c743e0df749d98fa0d5bda2bd8511ace","observation_id":"48172090-4760-4a73-96a6-c70627854ba7","resolution":{"observed_at":"2026-05-19T16:47:40.114126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.09450","last_updated":"2026-05-17T13:20:28Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T16:07:14Z","title":"ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:54.441128Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.09450"},"observation_digest":"sha256:89ddec737cc069072abcf76be996fbe1c7ad51ccc35884625ee5f2e402f6f486","observation_id":"6ebb8afe-175f-4c15-93df-684a05f7cbbc","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.09450","last_updated":"2026-05-17T13:20:28Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T16:07:14Z","title":"ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T08:52:04.531938Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.09450"},"observation_digest":"sha256:07c56a2f58c5e77e40900905549b1c4501bc75da4b2239b063a4026094763f56","observation_id":"401f5876-6c26-4a02-85cf-c91df8f2ce99","resolution":{"observed_at":"2026-05-21T08:54:05.875779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:08:58.648967Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:300e61ccf828b1fe55aead92c5500f6b3fedd10b55fa47f46471acb13fd05e8b","observation_id":"52b44d06-1538-478c-8960-9592f83ddfaf","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T16:27:21.284010Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T16:27:21.284010Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:da5c53bf49684146ce37781cbc1ff2230e8a3dedc3203ed99fab10e4bc7ba2e5","observation_id":"10beb142-c2e7-4b3f-b268-6d919da7e65c","resolution":{"observed_at":"2026-08-02T16:27:21.284010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.13413","last_updated":"2026-04-15T02:31:31Z","snapshot_observed_at":"2026-08-11T13:26:01.255993Z","submitted_at":"2026-04-15T02:31:31Z","title":"Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:31:46.940449Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.13413"},"observation_digest":"sha256:ae79f9a2f66f96199c3f1a63aa64c5d8f0649f7fc829237d8dd217c0de56f0c7","observation_id":"1686a21a-cb41-41e2-9221-edc480f3f1df","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-12T20:50:53.567415Z","title":"Llada-v: Large language diffusion models with visual instruction tuning.arXiv preprint arXiv:2505.16933,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13416","last_updated":"2026-07-06T05:33:02Z","snapshot_observed_at":"2026-08-02T11:35:00.658422Z","submitted_at":"2026-04-15T02:33:44Z","title":"DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T20:50:53.567415Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.13416"},"observation_digest":"sha256:76e3ed5b67bc90aa9d08ae88d525fda7b8e676c2eba745d0f755a4d2dfd8ad7f","observation_id":"c15f2d8e-0392-4f8f-84ee-744cf0776978","resolution":{"observed_at":"2026-07-12T20:50:53.567415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.16514","last_updated":"2026-07-12T15:32:26Z","snapshot_observed_at":"2026-08-12T13:45:57.255462Z","submitted_at":"2026-04-15T09:17:38Z","title":"BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:28:47.505755Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.16514"},"observation_digest":"sha256:d8f84cd116c0d1e796f496a35d12a0deadf2d8f4c43a40cecc333276cdb61085","observation_id":"fbbafb58-abfd-4d16-b8ca-a2b898647d8e","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.17068","last_updated":"2026-04-18T17:04:10Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T17:04:10Z","title":"Stability-Weighted Decoding for Diffusion Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:12:37.804816Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.17068"},"observation_digest":"sha256:dc0596c68574c94efdc20c71e7df53cb3c6c2c4e61074221789244de030159a7","observation_id":"eb4bde6f-c13e-46f7-a290-c7abca04ea42","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2604.18839","last_updated":"2026-04-20T21:06:12Z","snapshot_observed_at":"2026-08-12T01:18:54.060014Z","submitted_at":"2026-04-20T21:06:12Z","title":"One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models","version":1},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-10T04:56:35.796962Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2604.18839"},"observation_digest":"sha256:e410850f0e5f0fdf0c97f3a905a751cbf24baee057e0c57a33557ee9effa2b2e","observation_id":"ca8d6825-d1c7-47a7-aaf5-00c0fd0daf9a","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.06548","last_updated":"2026-05-07T16:44:56Z","snapshot_observed_at":"2026-08-04T07:00:09.042412Z","submitted_at":"2026-05-07T16:44:56Z","title":"Continuous Latent Diffusion Language Model","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-08T10:04:09.646578Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.06548"},"observation_digest":"sha256:d0865c7da317f7a76ba64515b740ad74c50908ba6da9a5ab67d7ae9ffc58483f","observation_id":"0edd5724-900e-418f-9547-dc81ff4795ad","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.07399","last_updated":"2026-05-11T06:29:59Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:54:57Z","title":"GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:48:09.652599Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.07399"},"observation_digest":"sha256:0dccc0f632bce7b79e8e47ed2dd277682b03956472a7f8a65d50cba6748b8941","observation_id":"b34a8d5b-8b14-4ff0-8664-9ddca8b66942","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.07399","last_updated":"2026-05-11T06:29:59Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:54:57Z","title":"GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:54.794576Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.07399"},"observation_digest":"sha256:0eb663e383980d0a99a5f7837e517aa1a15b7fecef2397025abfd8c9a734d70c","observation_id":"c57969a2-7928-4a43-bffd-f52edbfd67af","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.10218","last_updated":"2026-05-11T08:58:40Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:58:40Z","title":"Relative Score Policy Optimization for Diffusion Language Models","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:42.196931Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.10218"},"observation_digest":"sha256:18b463f1263e4fdecde784eefa1f89677c666c2d563affc892d20fd96d8c4920","observation_id":"3a02f2a6-a770-466f-81a8-1cb2f278de4c","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.10938","last_updated":"2026-06-26T03:16:31Z","snapshot_observed_at":"2026-08-13T00:17:25.829130Z","submitted_at":"2026-05-11T17:59:29Z","title":"ELF: Embedded Language Flows","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T03:30:11.905667Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.10938"},"observation_digest":"sha256:8a816bdc3eb892f6cdc4451d9dbf06f545401e1a0c792f85d48f9e06003a40b5","observation_id":"9a8fe905-5117-403b-91d0-fdf1754ade04","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.10938","last_updated":"2026-06-26T03:16:31Z","snapshot_observed_at":"2026-08-13T00:17:25.829130Z","submitted_at":"2026-05-11T17:59:29Z","title":"ELF: Embedded Language Flows","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T22:21:54.815122Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.10938"},"observation_digest":"sha256:8bbcc04037e18f24791b2fef5ae2c3bf04f6d76fe2b4983ac27b572e8e01c5a7","observation_id":"f89f8dc6-cc6c-4f68-9a6f-f28f0e3c50d5","resolution":{"observed_at":"2026-07-01T14:05:46.219054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T20:54:50.887381Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:b0aac86045f72567314f33f071729e0fe7940b476baacf7b2219e9534f1c4547","observation_id":"0541e5a3-d182-4862-882c-223458aa6288","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T05:07:58.953866Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:d531b387f5f494f3630a78843e6466423194804d87112a310d7275172b3e994a","observation_id":"c046c1a7-c9b0-4ecd-b767-f7c846f2431f","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-08-11T09:26:13.392012Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T02:14:59.487486Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:761a87721632cc78eeecfe614cdb697e3fe38a876b60ba965332dfe72bfb4e0f","observation_id":"8a319274-e01d-4b42-b589-99229e3338c1","resolution":{"observed_at":"2026-05-17T03:46:06.580274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-08-11T09:26:13.392012Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T21:47:32.112057Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:a5f16b13108c59fcbba637d9a6493e1da554ed5f9b9747089b040ac861198c47","observation_id":"d91d7967-7d2b-4495-9d9c-4fc7050ec5a9","resolution":{"observed_at":"2026-05-20T21:49:05.340916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.16842","last_updated":"2026-05-16T06:59:54Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:59:54Z","title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:03.005508Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.16842"},"observation_digest":"sha256:7ed428262f9052f10c3b9aaf662f5e30ef7d989c86e3f2b46966219c9bd2246f","observation_id":"97d16801-5838-4526-827a-d903d58cf0e7","resolution":{"observed_at":"2026-05-19T21:22:48.437357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.23163","last_updated":"2026-05-25T07:32:46Z","snapshot_observed_at":"2026-08-12T23:58:45.349372Z","submitted_at":"2026-05-22T02:31:32Z","title":"Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T05:00:58.024124Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.23163"},"observation_digest":"sha256:941fd151dbee9cfea36520623f4f0949f7adbbef5e430436ef55bce781645632","observation_id":"bf27191e-27c8-476a-a3fc-64e88f6847c7","resolution":{"observed_at":"2026-05-25T05:06:38.510406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.23163","last_updated":"2026-05-25T07:32:46Z","snapshot_observed_at":"2026-08-12T23:58:45.349372Z","submitted_at":"2026-05-22T02:31:32Z","title":"Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T16:34:21.422620Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.23163"},"observation_digest":"sha256:4a4f14a6744ef63c618a82166552b1dd10c6d793d4a142f56b5e4eae2f5f760f","observation_id":"941648a2-a284-49f5-8c8a-8a06e1b960ee","resolution":{"observed_at":"2026-06-30T16:35:12.292159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:a9a7382134105a203e6933c18ba28634645367e78b2774ad0dfcbb133f20381c","observation_id":"e3c9f15a-40bb-4901-940c-6be7a95ad9c1","resolution":{"observed_at":"2026-06-29T23:14:01.649826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.29488","last_updated":"2026-05-31T04:55:43Z","snapshot_observed_at":"2026-08-01T22:54:33.345437Z","submitted_at":"2026-05-28T07:15:19Z","title":"AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T08:52:10.642943Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.29488"},"observation_digest":"sha256:8edaadf3452e1b2566bfba824ac8987acb58fb0aa1c0a9d1cc74002ff3f4fb7e","observation_id":"f822b833-a84e-436b-b1f1-f51754cfbdf7","resolution":{"observed_at":"2026-06-29T08:53:15.643977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:98bf1b6e0041c8aab73144a299a3fa375f2a0e4db2efc6fa26ee2de8189eb7cd","observation_id":"9ae228eb-72a0-4e85-a531-164d1de881bb","resolution":{"observed_at":"2026-06-28T22:52:45.042761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.04535","last_updated":"2026-06-03T07:18:23Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T07:18:23Z","title":"Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T06:20:27.041099Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.04535"},"observation_digest":"sha256:b17fb879ea52c84abdaf90aee04f30df17425e66064e886561b9b41f36786fb5","observation_id":"ff7ad414-ffcb-43a5-b5cd-3bb6c841210e","resolution":{"observed_at":"2026-07-02T08:06:48.409248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.10537","last_updated":"2026-06-09T08:06:22Z","snapshot_observed_at":"2026-08-12T23:24:13.475291Z","submitted_at":"2026-06-09T08:06:22Z","title":"Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T13:30:19.620692Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.10537"},"observation_digest":"sha256:276b4536c5557a0b9791c8d5304e6ee98c753f6b7e8f4c265b3acf67ea812474","observation_id":"930ae589-b850-42be-8cc0-a8501c1e2886","resolution":{"observed_at":"2026-07-03T04:57:38.705417Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:539deaf9b1ce6ef51678b5b8d54d673e3572ac9f67b2464950798d7a975f27f8","observation_id":"d13cc417-d2c5-4d66-8cfd-cc2f299eca4d","resolution":{"observed_at":"2026-07-04T00:49:18.047342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.25331","last_updated":"2026-06-24T02:51:36Z","snapshot_observed_at":"2026-08-12T06:31:23.910087Z","submitted_at":"2026-06-24T02:51:36Z","title":"Improved Large Language Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T21:34:45.620481Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.25331"},"observation_digest":"sha256:a98e4d1b36a48ee6d6dc4e6ab2fe3ad2d25dbd8b716ea77e25147ba0f6d44cc2","observation_id":"32551ffa-a4de-414c-8aa5-6147c706dc9e","resolution":{"observed_at":"2026-07-04T19:20:05.614967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:c74e983b59e62a87b86066f127921e4121692f58cd4c3e1abee963397ffd5376","observation_id":"02c0a308-8bee-444f-8aa6-fc63c7094570","resolution":{"observed_at":"2026-06-30T08:14:26.650220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T09:39:38.012846Z","title":"Llada-v: Large language diffusion models with visual instruction tuning.arXiv preprint arXiv:2505.16933, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:38.012846Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:8d57c284134f95987852558496e0235a15c7a4387326e1e4d01a2464badca8b5","observation_id":"09b26b26-9119-418d-bf41-2f6e9082c521","resolution":{"observed_at":"2026-08-02T09:39:38.012846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2505.16933 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-09T08:34:06.125045Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:536dc995e2c55eefbf3e343287e06f31b47b54d2c91223e33f255a42bef9a019","observation_id":"491af39e-5970-49fd-a154-f335659969fa","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-12T03:56:26.770729Z","title":"Llada-v: Large language diffusion models with visual instruction tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03236","last_updated":"2026-07-03T11:45:21Z","snapshot_observed_at":"2026-08-13T00:18:22.569383Z","submitted_at":"2026-07-03T11:45:21Z","title":"TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T03:56:26.770729Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.03236"},"observation_digest":"sha256:1db3d06954d8cd0e297de534fed9c3c15e31ad3c9ac1c478a0aebae77181ddb6","observation_id":"5e3d5295-6984-4f2b-80d0-a215eeeb8670","resolution":{"observed_at":"2026-07-12T03:56:26.770729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:b5406fd3255d1432685fff95c3e801d7552c28f73a04b44b9305417aaeeb709b","observation_id":"01287599-c0a9-451a-8b6d-7f3400a1fd62","resolution":{"observed_at":"2026-07-11T03:07:52.297701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T05:17:48.734640Z","title":"Llada-v: Large language diffusion models with visual instruction tuning.ArXiv preprint, abs/2505.16933, 2025a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13431","last_updated":"2026-07-15T04:23:22Z","snapshot_observed_at":"2026-08-07T01:50:04.940823Z","submitted_at":"2026-07-15T04:23:22Z","title":"Discrete Diffusion Models: A Unified Framework from Tokenization to Generation","version":1},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:48.734640Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.13431"},"observation_digest":"sha256:78e40d6ad739c2b408d0a0cf3dd62d9fa2ba5f0783bfd8dcddc632be45d0c5a4","observation_id":"29edb95b-2335-441a-86cd-ed5e4a95e833","resolution":{"observed_at":"2026-08-02T05:17:48.734640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T14:46:39.695123Z","title":"Llada-v: Large language diffusion models with visual instruction tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14107","last_updated":"2026-05-07T18:05:39Z","snapshot_observed_at":"2026-08-06T20:18:15.646830Z","submitted_at":"2026-05-07T18:05:39Z","title":"Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:46:39.695123Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.14107"},"observation_digest":"sha256:417abe3679d51fe9d003b5b8a051e1a93f2642f89ea5c8cf37d3d31ffd1d9a4c","observation_id":"e2d08504-8703-4a64-b2f9-3723b98fc4bb","resolution":{"observed_at":"2026-08-02T14:46:39.695123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-02T01:48:56.739924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:56.739924Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:164b6f9812a081102d913498286aeb588275670618ffc1b10a25b7a7e18e91bf","observation_id":"4151bba2-1a48-4929-8f1e-88859952e015","resolution":{"observed_at":"2026-08-02T01:48:56.739924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-01T16:48:36.676187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-10T05:53:59.744780Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:36.676187Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:9859719abc02e2d62c4291a3338ced71233425db864d1217bb882ebeb05980d7","observation_id":"effdeb4d-4795-4f84-bf2d-209671065be8","resolution":{"observed_at":"2026-08-01T16:48:36.676187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-03T14:08:23.176270Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29079","last_updated":"2026-07-31T06:58:02Z","snapshot_observed_at":"2026-08-10T03:46:49.756845Z","submitted_at":"2026-07-31T06:58:02Z","title":"Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:08:23.176270Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2607.29079"},"observation_digest":"sha256:8dbb7a4fb9e81ead10f4c00ed270f1be2dc39e553d9e06620ff0ddb5edea126e","observation_id":"f5a08073-03ad-47be-96d7-8fc06ab571d3","resolution":{"observed_at":"2026-08-03T14:08:23.176270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-06T00:40:52.308647Z","title":"arXiv preprint arXiv:2505.16933 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01035","last_updated":"2026-08-07T13:22:07Z","snapshot_observed_at":"2026-08-12T23:12:29.473448Z","submitted_at":"2026-08-02T06:45:16Z","title":"WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T00:40:52.308647Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2608.01035"},"observation_digest":"sha256:ccbf019dd45f10b0942e875c6cf8222277bcfb0c04b025c034832ea7251b8266","observation_id":"1479906e-e069-4285-84e4-0955a62c6fc0","resolution":{"observed_at":"2026-08-06T00:40:52.308647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-10T16:51:18.515307Z","title":"2505.16933 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07006","last_updated":"2026-08-07T09:20:40Z","snapshot_observed_at":"2026-08-12T23:11:40.851062Z","submitted_at":"2026-08-07T09:20:40Z","title":"Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T16:51:18.515307Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2608.07006"},"observation_digest":"sha256:9367180cb9e7cc50283866cb0f2854f470bdd3e7621577a0fc99166a5a6c964e","observation_id":"0764bdfc-f9c4-48fc-8f13-9bbc35667233","resolution":{"observed_at":"2026-08-10T16:51:18.515307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16933/citation-record","integrity":"/paper/2505.16933/integrity","json":"/paper/2505.16933/citation-record.json","paper":"/paper/2505.16933"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:46:21.919920Z","title":"Visual instruction tuning","venue":null,"work_id":"4622b96e-3148-4c4d-812a-c4afdea5f469","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:945a0b8aec3fc1cd5327ecddfe6972f92e63b0a192dce1e6f512ddaa617b2d57","observation_id":"eb3827e3-a287-405e-a693-ca44886b26e5","resolution":{"observed_at":"2026-05-17T03:46:06.504560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"d7798e63-66b9-4475-9452-7f723907e04e","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:5ae47154a533d94d5274e5901b7bcf0e5cad8c2fd1eda34e66831900ba746e46","observation_id":"1da84e56-3bd4-4ebe-ab82-4a7ef24e5818","resolution":{"observed_at":"2026-05-17T03:46:06.427693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:04da2d9c7ca44e5f40225d0c4a2533ec64a9ce95783f080282a978ca8b307799","observation_id":"3e14fcb8-15a1-4822-85bd-75e105605ac1","resolution":{"observed_at":"2026-05-17T03:46:06.374982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"459e59dc-9bb6-4e5b-b2da-ec1327ff8249","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7cddddf0e023fbc8ad3fd8423c13685447eab87e9b8c9dbcdc7cd124bcbf871c","observation_id":"f169e065-3353-4bc7-8af7-153c59d0da1b","resolution":{"observed_at":"2026-05-17T03:46:06.432745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7b9cb2e8d70379f1395eecef2471e53212440ce4e421b4cd0e7849423d536f11","observation_id":"d0c19dc5-0c8a-4ca8-9786-8f45aa59691a","resolution":{"observed_at":"2026-05-17T03:46:06.378866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:72b30d5432ae6a1018b0b3f3ef497a1c44f4840004d315c26342bc777aeb33f8","observation_id":"4d8324a0-973b-47e8-b9cd-e6b79cde81f7","resolution":{"observed_at":"2026-05-17T03:46:06.382760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:cf15f074946dfd2b898492c237ecf413ca4bc15785bd7d5421b4cb4da02fec90","observation_id":"4ce34fd3-d640-4d04-896e-3421ccbaa926","resolution":{"observed_at":"2026-05-17T03:46:06.386499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:1cc090b240e8b0ef12b23dcce9524b1b44d086c35f9a28ddccdb0290ef07f971","observation_id":"8b25ced2-3437-4776-af5b-64709d4dc2ab","resolution":{"observed_at":"2026-05-17T03:46:06.391139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-12T23:40:51.437627Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:725135a9d2da068840a63dd1b272249b346c3c6b2bd964dbf7ef8d902f552882","observation_id":"06d1d233-677c-4da6-a2ad-61236a8de789","resolution":{"observed_at":"2026-05-17T03:46:06.395741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":"2501.12386","doi":"10.48550/arxiv.2501.12386","metadata_source":"pith","pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","venue":"cs.CV","work_id":"5801b83f-d5f4-4020-bad2-4bc47f71fe7d","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:875b8b475e9b74de51ea2108e4c987439ad6ae3f3a8faca089499402886d31ad","observation_id":"40cb993f-0961-4de2-82ad-085c8318420d","resolution":{"observed_at":"2026-05-17T03:46:06.399421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"361e7c43-ae1b-40af-9ddf-de78568d4b08","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:0430c80eff44c1ba23972c4fe29df745effa9938891f60ef014bf31314bf055f","observation_id":"166dcc9d-cf00-4591-be91-8ac64bfe4c22","resolution":{"observed_at":"2026-05-17T03:46:06.451055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:44861047a20e3094af78fd1d99e3446f014a2a987e80b496a53c4b9dd7f1603a","observation_id":"331ed5d7-2084-415c-bfeb-bc831b564724","resolution":{"observed_at":"2026-05-17T03:46:06.403500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understand- ing by generative pre-training","venue":null,"work_id":"4335d2b4-7195-4e19-a41d-1989cb5fc80c","year":2018},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:0cad1cee0cb7e7f28678a6ddde00f0f9dfdc4414aa9e47bdd4433c827cc30b96","observation_id":"b7a15082-b335-4343-b195-3bde33bcc2d9","resolution":{"observed_at":"2026-05-17T03:46:06.456509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"f2d43298-fa7b-4a79-8665-7fb8b50066aa","year":2019},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:a3d9b50b21614ffb78aff138aca3ca9ebcebfc98c289db5cbac6fc72ccf6cc7c","observation_id":"bcba5c8f-c61c-4fd9-a7d7-35d5f3be3d9c","resolution":{"observed_at":"2026-05-17T03:46:06.459411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"6541d444-5e6f-478a-b372-876c34fc93a5","year":1901},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:02e6c9a1664ba63495d7316da348c1b489a2720140bf4169638d3b948ac763df","observation_id":"48d415b4-551d-40c4-aef8-c91e1e3283ad","resolution":{"observed_at":"2026-05-17T03:46:06.462167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:fb548c71ae6bb726e766373154fa87343aef1b675f5d44fc3992e74dd90b7baf","observation_id":"d9e3779f-853a-401e-92bc-4b97125945e0","resolution":{"observed_at":"2026-05-17T03:46:06.407078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:63592ea61f71730992de729232f7c423b30547760153a8d5f40d87a0e28ac3c1","observation_id":"9f4fe500-7a64-4a75-a2a4-354d104ff9bd","resolution":{"observed_at":"2026-05-17T03:46:06.410445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f714ea38e718696a811d28dcfa5681afedbefe40488cbe9abb91d9bb00f58a0c","observation_id":"863a75d8-8b69-4ae0-8d25-7ca290de2a65","resolution":{"observed_at":"2026-05-17T03:46:06.414170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:e94cd9d7085718662538b675e8ed87a6b467d4debf57a4ad0ad45b24c5a4c4c5","observation_id":"9ea18293-1c8d-4055-b5df-92e8a040a93b","resolution":{"observed_at":"2026-05-17T03:46:06.417644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":"2309.05463","doi":"10.18653/v1/2025.findings-acl.996","metadata_source":"pith","pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","venue":"cs.CL","work_id":"618db55c-6906-42e3-a4c5-c17088cb1df8","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:22d72e8123ca991a35f6ca3c9843e8ccfece1366dd66573fb56a5de6ae90cf21","observation_id":"9799e762-59f7-4ad2-9188-2c2e8e84faa2","resolution":{"observed_at":"2026-05-17T03:46:06.421714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f9061acb7c04c6af474f1ae4dd681c7176f334c33df85052c9be2e970bf7c2cf","observation_id":"e20982b7-90c8-46b3-8f8a-598f0a197b53","resolution":{"observed_at":"2026-05-17T03:46:06.425044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"0fb7819e-5efa-4b83-a76d-83be3b514bfa","year":2015},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:5cfc934fc6e1a34cddd61819e48f8171d741518e2d86437ae03d427e82bea7cb","observation_id":"9d44a0bf-8555-41d1-9c94-7eee55cd6dfe","resolution":{"observed_at":"2026-05-17T03:46:06.481351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"cb57b9d1-50ac-479d-93fa-17abd72b5c0a","year":2020},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:d344c76a30b0d765ea29dc4ca96e8c4f05c1a97ec98458fba8fa6001fb4cb2ed","observation_id":"e804b2df-89ef-4240-88a4-325bfb7d01da","resolution":{"observed_at":"2026-05-17T03:46:06.484167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:2b5ca5c38b9c300feef11ad6aefc6ca20fbac4f51fedd66b3a1cd07be2c3ab02","observation_id":"34e3f717-f466-4afe-9689-add636dc0769","resolution":{"observed_at":"2026-05-17T03:46:06.133700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Argmax flows and multinomial diffusion: Learning categorical distributions","venue":null,"work_id":"e33daf7c-2df6-41ac-9a58-d4fb4ef23d1f","year":2021},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:e525d4f4be8847934366133b5135a81c8480dfe98ac8385f166e1580eb6ea6c1","observation_id":"8edaaf77-deae-4cfd-8618-38e6b417e85a","resolution":{"observed_at":"2026-05-17T03:46:06.489056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":"3ad97f50-98c3-4161-be64-3d312074ec79","year":2021},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:a7d4f86ea49e9136af59dca56e313892f06e9e0497ab21a2124c55f3f9b3e4dc","observation_id":"7c97355f-9f1e-43b8-ac90-3c6554c5ba9f","resolution":{"observed_at":"2026-05-17T03:46:06.491672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One transformer fits all distributions in multi-modal diffusion at scale","venue":null,"work_id":"e74a50df-9d79-4308-83fa-1c8c049d7b5c","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:1b1607ebc699105f7f13dd6c14ff92e5e653ab18fa7336e0ce97e53bb46570dc","observation_id":"f52b048d-4123-4f13-83c6-bedd5d61d168","resolution":{"observed_at":"2026-05-17T03:46:06.494360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7842d33b727483e0670cc2ecc0feee920c61cdfd00a818143e169e143ba4a686","observation_id":"0223dedc-50b9-4d17-ab40-db591575af9e","resolution":{"observed_at":"2026-05-17T03:46:06.139700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3ba6937a171cf04f93eb00cf45e92b220c9a5ce303f33feb4e0186b09e607d83","observation_id":"296627a3-06a6-4c75-89c3-b84188b0c60d","resolution":{"observed_at":"2026-05-17T03:46:06.145032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-12T22:01:16.325060Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2411.07975","doi":"10.48550/arxiv.2411.07975","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2411.07975","venue":"arXiv (Cornell University)","work_id":"57d73d19-7fb3-40ec-aa67-42c6d678ec43","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:c198c8b42910bbc38cdef71151f226fe83e78366bae2ec872fb24779d73eff81","observation_id":"f69b31da-aeac-4421-b8fc-b816f8812f13","resolution":{"observed_at":"2026-05-17T03:46:06.149969Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:97c87aaf23c91e5e646ac5b697f270ea42bcc850cbc4af083b4a0ad73279e831","observation_id":"839ae744-19dc-4705-a683-de022f9a29e4","resolution":{"observed_at":"2026-05-17T07:51:13.882527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-08-12T16:02:32.102388Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":"2412.00127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-07-03T14:38:28.877985Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads","venue":null,"work_id":"26db0012-a10a-4cc5-b860-df81bb6df3ae","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:b2bb0ea61e1326744446a262eb036c352bb64862394e6620d86511f180a6a536","observation_id":"d0d52794-3986-4ec9-92e2-92310a2bf8d1","resolution":{"observed_at":"2026-05-17T03:46:06.155454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-08-07T16:34:48.936382Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2503.20853","doi":"10.48550/arxiv.2503.20853","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified multimodal discrete diffusion","venue":"ArXiv.org","work_id":"5679bcd0-fa0c-4dc2-9864-eebaf9386a07","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:9be0527473d65b69b1b36a1f24b94e7553827c67b6bd4ecdd1de9cc2c7cac30a","observation_id":"3f4cc231-4116-41ba-a654-3b56db6a9fd6","resolution":{"observed_at":"2026-05-17T03:46:06.160898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-10T22:52:06.844699Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:c8e260ac56f67284e43336393e29ce6fe3e67a38a0bbe3af46c2219c4ccf2d7b","observation_id":"b40dcffc-9bae-4483-bd3b-485d13ea5e07","resolution":{"observed_at":"2026-05-17T03:46:06.166172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A continuous time framework for discrete denoising models","venue":null,"work_id":"f5465a0f-3ebc-4ebf-a3f9-03563ae8ff05","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:8b8e405e857e153207dc59c283fc3ad4c2ec64629caad9d74ba22e5554f5556d","observation_id":"da41ae7d-9522-4068-a4ad-eb02fdbf6299","resolution":{"observed_at":"2026-05-17T03:46:06.515783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-04T09:42:38.461420Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.15029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-07-11T03:07:52.584366Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":"cs.CL","work_id":"f8aa68fd-4a3d-4cf5-9c91-239acc6012c8","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:e59829ee00ac5500d9293b21ba10c548c5e8d4349314f1ada775628d1adaa10a","observation_id":"d5937ee9-e1f8-45ff-aa30-2c14e0817adb","resolution":{"observed_at":"2026-05-17T03:46:06.170976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based continuous-time discrete diffusion models","venue":null,"work_id":"8dded925-aea1-4ca0-8ca2-3c84fd21378e","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:1330b67aedf95c3cfeb7cc240350d4ec958e906c197c503e24a836927c8fc169","observation_id":"5568ff17-9370-4799-ab26-0f87be51fb50","resolution":{"observed_at":"2026-05-17T03:46:06.521210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":"ddc138cd-d8f1-4e4f-a494-c3e83b42ccf4","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:c688ad493b45c9858a9b982d369e4fc64f8b092c6669d651310e542dcb7f501c","observation_id":"d00570c7-a48a-45eb-9999-4f9bb61511b4","resolution":{"observed_at":"2026-05-17T03:46:06.524078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04329","last_updated":"2025-01-16T08:46:16Z","snapshot_observed_at":"2026-08-12T23:48:29.548939Z","submitted_at":"2024-06-06T17:59:10Z","title":"Simplified and Generalized Masked Diffusion for Discrete Data","version":4},"cited_work":{"arxiv_id":"2406.04329","doi":"10.48550/arxiv.2406.04329","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04329","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplified and generalized masked diffusion for discrete data","venue":"arXiv (Cornell University)","work_id":"7327f84b-c683-483e-b1ca-f9d3dd756e70","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.04329","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:d22cbd3a2c8b0eee0163558af644d27ca1f6c1e11e51cda544e3ddf8582cbced","observation_id":"c524b596-ef42-44fe-9b85-ed2d972577e3","resolution":{"observed_at":"2026-05-17T03:46:06.176281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-12T23:45:16.671232Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2406.07524","doi":"10.48550/arxiv.2406.07524","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simple and effective masked diffusion language models","venue":"arXiv (Cornell University)","work_id":"5df1af01-b5ff-4722-96c8-091c22b808b7","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:9a530a64e7085f39ecc48b14166fe5f939512957b2aee2266a958c89eccde108","observation_id":"e7475394-6ea5-4e0c-9ed7-246eb2dc315c","resolution":{"observed_at":"2026-05-17T03:46:06.181114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":"2406.03736","doi":"10.48550/arxiv.2406.03736","metadata_source":"pith","pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","venue":"cs.LG","work_id":"b4fe3d89-98ce-4983-a647-1cb8b9c85cae","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:19d0c14b276b3d80b55369f6ebbc7aeeeeaa2777ed299452544e033037970fdd","observation_id":"6acf96e2-3ce4-45cc-9a1e-10feeba17223","resolution":{"observed_at":"2026-05-18T12:06:09.375609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":"2502.09992","doi":"10.48550/arxiv.2502.09992","metadata_source":"pith","pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Diffusion Models","venue":"cs.CL","work_id":"cce0f4b3-ed4d-4375-b84d-3f01316016c1","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:8e602e0ba2184bd20e00d0820d8057ec26999e0fddde150b78f02d4d3d1da9f1","observation_id":"9bd7c7d8-9e2d-4f4a-8089-1341606f43fb","resolution":{"observed_at":"2026-05-17T03:46:06.190689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:22:47.284480Z","title":"Effective and efficient masked image generation models","venue":null,"work_id":"4976ca2b-26b6-4128-86cf-4d63d890afda","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f288d2f923ef230c43fed967ad2ec5488db775bccfcf13f72cb4edc02b904577","observation_id":"bd0b8896-2c9f-4690-baac-3ec50bfdcd6c","resolution":{"observed_at":"2026-05-17T03:46:06.196182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3f4f7253762d58b3fcead513065e5ef4e5484ef7505be672b7c4af49b50eb5fe","observation_id":"0c0d6acd-f0e8-4f5c-b306-bf8ba73ece36","resolution":{"observed_at":"2026-05-17T03:46:06.201287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:b7005791cd3a7ffa55f4482f088a0a5a97e2ed12be815313f5c81494d0f849f8","observation_id":"cc9b7f28-f032-498c-b772-ba0ac2edc3dc","resolution":{"observed_at":"2026-05-17T03:46:06.205879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-12T22:16:08.064745Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":"2410.18514","doi":"10.48550/arxiv.2410.18514","metadata_source":"pith","pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.18514 , year=","venue":"cs.AI","work_id":"18872de0-5f47-4650-ba4f-f48cab3bfc7e","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:fe7db4d07081c8825f90346538b678e112127a1c2071a00e4923e9769efaf68a","observation_id":"445b6210-ae1a-4947-bae5-b525d1df4109","resolution":{"observed_at":"2026-05-17T03:46:06.210623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative flows on discrete state-spaces: Enabling multimodal flows with applications to protein co-design","venue":null,"work_id":"c197459a-2507-47b2-8e15-40f2122f6e81","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:a2399cb114b3228998e7ded6ce46155427bf4d082057ef53e4c83293897e3d14","observation_id":"28decc83-d2eb-411a-b305-0dbd6b0f38be","resolution":{"observed_at":"2026-05-17T03:46:06.551165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06787","last_updated":"2024-12-10T14:09:22Z","snapshot_observed_at":"2026-08-12T00:06:21.223993Z","submitted_at":"2024-12-09T18:59:56Z","title":"[MASK] is All You Need","version":2},"cited_work":{"arxiv_id":"2412.06787","doi":"10.48550/arxiv.2412.06787","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"[mask] is all you need","venue":"arXiv (Cornell University)","work_id":"ad3639c1-28b2-4dff-9b32-2710c4f005e8","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.06787","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:800c14a661113b60ed2488b13048041e85a9fd6e0090888e8b9d84e1e89278a5","observation_id":"08656729-0c85-4f49-a871-8b13c4e11075","resolution":{"observed_at":"2026-05-17T03:46:06.215090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"ede99995-ac06-419c-a6dd-f4a8221f9748","year":2021},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:8891c14ce65f1f06d692941729e14cabfee31107eca82e1ff175e75e76b72975","observation_id":"41c3e79d-43c6-47d2-a54b-8e3497ef3a44","resolution":{"observed_at":"2026-05-17T03:46:06.558145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":"4938ef88-53e4-4aed-bfce-2135e5f40a61","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:e70b8f16f997da21ecbfcae1c2534ece68f85f758fb551430c69f160d55875b0","observation_id":"235af7ba-d005-4b4e-a10b-404e509d1973","resolution":{"observed_at":"2026-05-17T03:46:06.561415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:a4f162e479a7390e348df1f5b4f5d2308f8cfe455fdae84bf2e71fffa2b6197c","observation_id":"f3554d0f-20eb-43be-b3ad-ef62fd9bae44","resolution":{"observed_at":"2026-05-17T03:46:06.219339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f3484a03d62d20b5b2d4126f899662894d7accf05fd6b6b543ceb0fc92c149c1","observation_id":"b7916aac-0447-4d56-aceb-d18a2a28da93","resolution":{"observed_at":"2026-05-17T03:46:06.223481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:fc52c80a05e1c57b76e3f67734fdbce88b38c07cb7e105929480e8631c231bcc","observation_id":"43fc7807-9237-4cae-b9f5-66485888a76e","resolution":{"observed_at":"2026-05-17T03:46:06.227621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"2f217e56-ada1-482b-ab43-178554324ff2","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:276164c1cb63c766a16919678c2e5b84e84a1213ed965845e49357f952006e38","observation_id":"97d3e00c-f044-47ea-95a8-d494f548746f","resolution":{"observed_at":"2026-05-17T03:46:06.572843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-11T20:47:50.864749Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:addfa2d6fb71f9202e5eb58dcbbe40c303b481f3addc8ede6dd4e6c34ec979ec","observation_id":"74420e64-e9bf-490e-9bad-8518905b5848","resolution":{"observed_at":"2026-05-17T03:46:06.232126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10582","last_updated":"2025-03-15T01:09:17Z","snapshot_observed_at":"2026-08-07T17:06:19.282495Z","submitted_at":"2025-03-13T17:32:48Z","title":"VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search","version":2},"cited_work":{"arxiv_id":"2503.10582","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10582","snapshot_observed_at":"2026-07-04T10:39:46.066764Z","title":"Visualwebinstruct: Scaling up multimodal instruction data through web search","venue":null,"work_id":"86d6ed83-70db-45a9-b9ae-7dcb86f053f5","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2503.10582","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:4f599252643019c8f7cc63cc9338b2b1b9083f76548af02f64ed0225f4a832b9","observation_id":"56107efc-5ba8-45f9-8914-68e61b75a389","resolution":{"observed_at":"2026-05-17T03:46:06.236748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3: Think deeper, act faster","venue":null,"work_id":"bbc50f09-5ad2-4e54-b53f-fec54779639e","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:78e26428e6c5a631e0602273f4fc88f0ac251f8b48115a306f84db36dad85199","observation_id":"766fedce-a1e5-4383-85b2-bef96fdbbfe2","resolution":{"observed_at":"2026-05-17T03:46:06.430142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:605e827ac9bbb1f1559f6bd3c380d4133bb9fe1fe9ea65555091cc59b04f835a","observation_id":"b09d0fa8-ad5f-4e5d-b554-7ded94b6979a","resolution":{"observed_at":"2026-05-17T03:46:06.241029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct pref- erence optimization: Your language model is secretly a reward model","venue":null,"work_id":"4b827de5-80ec-4661-a38a-513930c0459e","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:334b506ad4afd1f655a0206b5680a7e589c85d6ffc35144e63edd25ae67c09c2","observation_id":"e69c9a60-9b6b-46eb-a1da-eaf0754f3d8d","resolution":{"observed_at":"2026-05-17T03:46:06.437948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":"4ad3aa3c-19fd-4558-b7c6-83b22ff672ca","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:d94b52ac6a739d9cada2fb3f5c44d92fbd49c5670fda97f9970070d38e6e7fcc","observation_id":"ae8df455-53cf-436d-b6a1-2d4c87990ae6","resolution":{"observed_at":"2026-05-17T03:46:06.440182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:4f1adc12f1d27522f47f5846bf3200f983d51af64846d29578a51b3ea6d11163","observation_id":"25e23fe3-dd3c-4c96-8eb7-124c01a569c0","resolution":{"observed_at":"2026-05-17T03:46:06.244804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"3ebaa0d2-8ee7-434f-8f65-ed4cdaa94c83","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:ea8aeaea934d6e7ce72d3c32ef30de2c5b7b8443a8072dccfc13bf0737220a5f","observation_id":"d357fa1e-e6c9-4c78-9844-a96a9eac384f","resolution":{"observed_at":"2026-05-17T03:46:06.445530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:177f55784802c51a30c25cd4609d38d25492d9e369349d5d0d24dbd11160cf1d","observation_id":"59aa0ef3-eed0-4f7e-870d-2f320e92a188","resolution":{"observed_at":"2026-05-17T03:46:06.249031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:356e6d7f30ba5b7a117491b958635678d3d622b9beb4f14c9f4b82c1f9920cd4","observation_id":"954aae21-7be7-4b15-811b-87e85925fe7b","resolution":{"observed_at":"2026-05-17T03:46:06.253398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:d53754f1efea931b025ba0c496e4ce28ba9e3483fae088893f3c3333927ebb37","observation_id":"96b9674b-7c79-4d0c-8582-4f29ae20bde2","resolution":{"observed_at":"2026-05-17T03:46:06.257804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player?","venue":null,"work_id":"58c3332c-cdd0-4247-8c45-0cd987f1084c","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:c6664b641494d658ac012c9e79dfc535b0c3c64d9d7dc2888eb44b956c65abf3","observation_id":"94533f71-da6b-4817-9cd0-cfd613a27ac5","resolution":{"observed_at":"2026-05-17T03:46:06.467768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?","venue":null,"work_id":"d3d736cf-2625-4b14-ad4f-869db82dad32","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:b630028d566a1999b288d79adb9c787bc7b0798ff8af4ce65b48acf4c0bf0a31","observation_id":"6d754cfa-d9d4-4afd-adff-19a806badf15","resolution":{"observed_at":"2026-05-17T03:46:06.470591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathvista: Evaluating math reasoning in visual contexts with gpt-4v, bard, and other large multimodal models","venue":null,"work_id":"d27da932-53f1-451e-ac27-8ec96b508c72","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3d3e5659afb3cc0acf01662bef7abbc41e7e713e305741e39089a26196936f04","observation_id":"0dfe3396-9f15-45bb-a736-7942eb673620","resolution":{"observed_at":"2026-05-17T03:46:06.473458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"33d4d745-77dd-4e0c-b4a8-69f19757b500","year":2016},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:de576aeebbc53888ff93d27f1140e924022fcd256c631c19a768d3d78074b55e","observation_id":"9dd7dea5-c8ce-406a-a6f2-67c4e0c9f396","resolution":{"observed_at":"2026-05-17T03:46:06.476384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:94269ff624ec089c35d922f54691d32bde6613b04aeec4f5f9e74c3aec193253","observation_id":"f6c0efea-4f43-47c8-a549-b2bac16b1c8a","resolution":{"observed_at":"2026-05-17T03:46:06.262206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"0f0244ea-a2dd-454d-982a-c11542140f48","year":2021},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:55c3bda51dd3e3a8fd0b90e8988b6080a3bdf357cf50759aba4c8ea26f1e432b","observation_id":"a32c1cb8-8f25-42d2-817d-2bf52fdc48e3","resolution":{"observed_at":"2026-05-17T03:46:06.486618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infographicvqa","venue":null,"work_id":"9090e9ce-e9d5-4118-b514-70a7950f0dfb","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:ce5077b8209aac8947db17a94f767d13a34cb82f45e7e9b675b8fd910402b0fd","observation_id":"097ac91d-3457-4070-9e4e-facd08cb09ef","resolution":{"observed_at":"2026-05-17T03:46:06.496875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"69a9d785-3054-4852-9742-70b103eaa196","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3b10f11e5ab9f7abad6405c2590ea8445231bac5713b30e9f63213d7c8b025d4","observation_id":"d4403c52-757d-4631-9544-b237b722ab18","resolution":{"observed_at":"2026-05-17T03:46:06.499231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-12T15:27:37.917473Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":"2406.09411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-07-04T21:00:08.872451Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","venue":"cs.CV","work_id":"9303f540-1c57-4c25-bed8-4456eb1c7e17","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:38e7f75a3aafdccdd2d1f24baab7f266495169c4b597380b7293355f15013fce","observation_id":"546a3dee-5b6d-4675-a23e-1e94049a767d","resolution":{"observed_at":"2026-05-17T03:46:06.266916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:815c2a98c3db711869ac3e3c7a00363defcec595f7d4134aa8b27bb44aaf3f9c","observation_id":"34eaec19-4036-40b3-813d-b147c32d8412","resolution":{"observed_at":"2026-05-17T03:46:06.271119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:1054de128c3dcd745fd343a44204bb974d4b86070b48004f54421d8bae67c8b9","observation_id":"4362463a-c272-4aa9-9fa4-c71980ac5c6c","resolution":{"observed_at":"2026-05-17T03:46:06.275850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"c8b37450-b9f4-4c8d-bf40-1d5a9a794a55","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:5aea896ef1d9aa9f1dede5739fc6624b97c7e7b793827f99bd802b01778cf560","observation_id":"079da712-36c7-4575-8ad6-f9906f60615e","resolution":{"observed_at":"2026-05-17T03:46:06.512512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"14566195-76eb-4d4e-8dfe-84a1f4d39f45","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:fbae482d5d2a317eb5c1534c6c051ea7449ac37dfc514a21ad986091a8be2436","observation_id":"98b271ca-217a-457f-99b8-2aae51ed6882","resolution":{"observed_at":"2026-05-17T03:46:06.518834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:47227d69dca4f6f49775f9451b6b8bf54ed1b595c880ac868a49ce2a71b2a519","observation_id":"f926c3c7-f79c-4371-a099-c6908596a461","resolution":{"observed_at":"2026-05-17T03:46:06.280227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:22ddf6e15e63cc5e5309222a415d343ad9b44d7e627e0b26d8887c166baab987","observation_id":"49a6cef4-ddf7-432d-80ca-9b727dc6395c","resolution":{"observed_at":"2026-05-17T03:46:06.283985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:ccf942f94808a626f7966e8382fb6b471ef8f161acd6630c609708ecbbb6e876","observation_id":"010a517e-f0b1-4adc-9d7c-92ee868653fc","resolution":{"observed_at":"2026-05-17T03:46:06.289016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:aea62467950345024c1f9baeb0b633ced91a0f43461b4e467091ae0c16851298","observation_id":"415cfe4b-de35-47ff-9419-73ac225adc98","resolution":{"observed_at":"2026-05-17T03:46:06.292960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:ee4724e69bcd7171206b23a0db98141ebcbcdfed70ef9a2c7765d67e84748f99","observation_id":"d483a297-5ab9-499c-b3ed-e7815f5a501e","resolution":{"observed_at":"2026-05-17T03:46:06.296588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters when building vision- language models?","venue":null,"work_id":"6f608cd1-cc46-47f2-a405-7f48f101e5b5","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:72bcbd7e21cba0e2dc15073ab0347a438d8711a18d95a1a6b769ec87c0f6248f","observation_id":"90c34c26-3cb2-43a8-9c6f-4cb44e5ec9cd","resolution":{"observed_at":"2026-05-17T03:46:06.541997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-lm improves controllable text generation","venue":null,"work_id":"fd7fb56a-1d28-40df-bf0a-07467d1186ca","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:a650151ff6dac5fa4aad2e947eb2aa80f0e31e121e8e9f238ff37095faf1350b","observation_id":"6335c45f-b843-448d-85f7-16fa449c88e4","resolution":{"observed_at":"2026-05-17T03:46:06.545358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.08933","doi":"10.48550/arxiv.2210.08933","metadata_source":"pith","pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","venue":"cs.CL","work_id":"180ac1b2-1f1e-4b77-9bf9-7a16f0167e1b","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:b67f42aad25afe3b46173b24fc576058cd4eb6895ccce2f2ec29dc0112b2c927","observation_id":"06e83cfe-da1b-4941-b442-33935c749004","resolution":{"observed_at":"2026-05-20T06:50:38.345995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-08T10:55:08.646488Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":"2210.17432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-07-11T03:07:52.620085Z","title":"Ssd- lm: Semi-autoregressive simplex-based diffusion language model for text generation and modular control","venue":"cs.CL","work_id":"92551172-cac4-4cf1-852c-8afc80877d9f","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:9819fb9d44dfeccf5e4f8702e8021e0575865aa7838c52cb658fdeca23a9f202","observation_id":"b375bf3c-173b-4363-ab3b-cb69fb510164","resolution":{"observed_at":"2026-05-17T03:46:06.304802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04236","last_updated":"2022-11-08T13:30:27Z","snapshot_observed_at":"2026-08-11T01:11:41.456510Z","submitted_at":"2022-11-08T13:30:27Z","title":"Self-conditioned Embedding Diffusion for Text Generation","version":1},"cited_work":{"arxiv_id":"2211.04236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04236","snapshot_observed_at":"2026-07-03T17:38:43.646621Z","title":"Self- conditioned embedding diffusion for text generation","venue":null,"work_id":"b8ff832e-f8bf-46b5-a76a-7491ac443852","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2211.04236","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f2806716ec3b26a338cfbbc6eba485a205106a07680cb7cb520b25a27379f6d5","observation_id":"5e5f35e3-e498-4783-88d0-c5f65f595e2b","resolution":{"observed_at":"2026-05-17T03:46:06.308600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-06T15:11:19.955049Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":"2208.04202","doi":"10.48550/arxiv.2208.04202","metadata_source":"pith","pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":"cs.CV","work_id":"89278cce-9610-430c-a4e1-9c5915aa5c95","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7eff1458ed630726e0255142a8715d0918efc2d525534b17b66977bb5ac0fb44","observation_id":"826ada18-bbca-486e-abb0-90a06845a8e1","resolution":{"observed_at":"2026-05-17T03:46:06.312461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-07T07:03:02.158312Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"cited_work":{"arxiv_id":"2211.15089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.15089","snapshot_observed_at":"2026-07-04T17:09:58.816805Z","title":"Continuous diffusion for categorical data","venue":"cs.CL","work_id":"c0904b65-a618-46bd-85ef-53635f43ea5c","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2211.15089","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7a8b154f8dc7e200d6c15eb48d81071a501dc92c289f5ef097166a1c1b767215","observation_id":"aee58e8e-e87d-46ec-b43d-2163b6a6cd53","resolution":{"observed_at":"2026-05-18T03:30:22.553521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Categorical sdes with simplex diffusion","venue":null,"work_id":"a3c3fe48-b482-4d73-9a95-724b2f1d9147","year":2022},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:9cf23abff2c77e0a76d41df36e24a608f22b4db63a627aa28921086de81f21d0","observation_id":"335ae4b8-e1ab-445d-8b78-1d88a7ac3d12","resolution":{"observed_at":"2026-05-17T03:46:06.575634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":"12c5ca3b-9f78-47c9-91a5-40d36543ffca","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:94105b1f173df43b4df03acbac366f0f1ff28265a68df2b3e01ad3ee0d69bc1d","observation_id":"fc0cb21d-4572-43b1-9348-b787ecbec784","resolution":{"observed_at":"2026-05-17T03:46:06.578941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tess: Text-to-text self-conditioned simplex diffusion","venue":null,"work_id":"2e0f6ce7-2637-436a-8f78-90f3d0ecbdba","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:16d16934d64530cf89a1f5e0ea2361f08e47701584d949c54274717b582627ab","observation_id":"79705010-b49f-4211-9800-40a077a77b6b","resolution":{"observed_at":"2026-05-17T03:46:06.435422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10025","last_updated":"2024-05-01T02:58:30Z","snapshot_observed_at":"2026-07-06T14:53:42.192162Z","submitted_at":"2023-02-20T15:14:46Z","title":"DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises","version":2},"cited_work":{"arxiv_id":"2302.10025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.10025","snapshot_observed_at":"2026-07-03T17:08:43.457635Z","title":"Dinoiser: Diffused conditional se- quence learning by manipulating noises","venue":null,"work_id":"35c5afd4-f834-46e8-bf77-934bc6312553","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2302.10025","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:719f31bfd42f21528168551b925bc5b6ab022922a1f357165697e854f3977ed6","observation_id":"9f78f635-7cfe-4958-9aa9-9718fecfd85a","resolution":{"observed_at":"2026-05-17T03:46:06.319703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planner: Generating diversified paragraph via latent language diffusion model","venue":null,"work_id":"d1e6c286-b03a-44ad-87df-78518b707a0d","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:24c784c8f14ba719975c5d7f07e79d41699a7277c6cc5969416f701f71b1e578","observation_id":"89cc55f2-661b-454f-b7c3-701027ffb29c","resolution":{"observed_at":"2026-05-17T03:46:06.448323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reflected diffusion models","venue":null,"work_id":"09723727-2c58-42da-9b87-843065fd7ea9","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:638ef368f8658da7418f85445f0eb750c336114fbf2f954a306acf181651e120","observation_id":"cd448a65-09ea-4803-9e1f-529f3b07ec74","resolution":{"observed_at":"2026-05-17T03:46:06.453674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07037","last_updated":"2025-03-11T08:07:39Z","snapshot_observed_at":"2026-08-11T03:42:10.440297Z","submitted_at":"2023-08-14T09:56:35Z","title":"Bayesian Flow Networks","version":6},"cited_work":{"arxiv_id":"2308.07037","doi":"10.48550/arxiv.2308.07037","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.07037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bayesian flow networks","venue":"arXiv (Cornell University)","work_id":"cf1d1296-8467-45d6-a054-ef16e15dea21","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2308.07037","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:019a462fe939a660c4fd2c9901a36a48423913391a485697a3db99ae17be69df","observation_id":"b78038ef-7bf1-429d-b8f5-e0cc015bc126","resolution":{"observed_at":"2026-05-17T03:46:06.323058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text generation with diffusion language models: A pre-training approach with continuous paragraph denoise","venue":null,"work_id":"1f201a8b-4f27-4951-83ee-d618406e6d00","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:f5c3799acd276efd20df58dc80db3f189541499302ea3e3d6e952c1e989ad4af","observation_id":"2f7b1ba1-11c5-47ea-ba0a-1e63ff2b25f8","resolution":{"observed_at":"2026-05-17T03:46:06.478931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15766","last_updated":"2024-06-02T13:55:21Z","snapshot_observed_at":"2026-08-13T00:23:10.148298Z","submitted_at":"2024-04-24T09:39:06Z","title":"Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2404.15766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15766","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying bayesian flow net- works and diffusion models through stochastic differential equations","venue":null,"work_id":"d28fa240-da17-4e03-9a51-477aa38dc0de","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2404.15766","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:74a001938b3fbad67bbf669771688d61bc6ef8f571d14a1c0ab18a8e20180d70","observation_id":"82d4db9d-1bb7-442d-a71c-07dc8d9c0f1e","resolution":{"observed_at":"2026-05-17T03:46:06.327035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16431","last_updated":"2025-04-23T05:32:58Z","snapshot_observed_at":"2026-08-07T16:00:00.984752Z","submitted_at":"2025-04-23T05:32:58Z","title":"Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion","version":1},"cited_work":{"arxiv_id":"2504.16431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16431","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Target concrete score matching: A holistic framework for discrete diffusion","venue":null,"work_id":"cf0a5b62-2551-4788-aad3-b4cde4f2d668","year":2025},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2504.16431","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:74a673d7b9acbe6b811ccb9b8febb0e6a31ad7fe9c2efbc48389f624483c54d5","observation_id":"c40fe4d7-3a34-4b71-927d-6fb9afbb34c5","resolution":{"observed_at":"2026-05-17T03:46:06.330844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":57,"verified_fuzzy":40},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 59 inbound Pith citation observations for arXiv:2505.16933."}