{"as_of":"2026-08-07T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b9278703318c3259ca55dce46f3c536800f1793adb262ea9cb912472b817bc9","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:59:26.886235Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:38:05.237334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19534","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2606.19534 (2026), https://arxiv.org/abs/2606.19534","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2606.19534","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:22d741a5f5db9a06400a30c3e41a83199c0ee7363262fa1566c7f61190846344","observation_id":"dc62360a-eee7-4d13-8555-e62edb66b550","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.19534/citation-record","integrity":"/paper/2606.19534/integrity","json":"/paper/2606.19534/citation-record.json","paper":"/paper/2606.19534"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:35c34bb92763f57507fd8c28b297518337db8662dcfd60c607ead9a9006662d7","observation_id":"69465d34-1e91-4d0f-8be4-fcbe807e7c05","resolution":{"observed_at":"2026-07-04T00:49:17.966899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:a03aa9fb70b8ef7b91053eac25983b14b80fa90931c1d9226def29a5dd536969","observation_id":"edcd7512-d4b4-45b2-9d2a-0778e3952b64","resolution":{"observed_at":"2026-07-04T00:49:18.034990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:808068b5a5d91f5376d302428d5208fc7d8fed84e57a98e460db80257b24bdd9","observation_id":"c6f416eb-220a-4221-86e9-a94bf855832b","resolution":{"observed_at":"2026-07-04T00:49:18.030383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":"2512.15745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-07-11T03:07:51.909523Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","venue":"cs.LG","work_id":"a1b1080d-0a91-44a4-8f70-2bf3e7a27e0b","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:2f0f015e9adfdd9fc244762de4e0c5d4709b5a5910a2ff7d8fbbfe91548c08eb","observation_id":"dc8738d5-5022-437b-ac97-d5cc843b92b1","resolution":{"observed_at":"2026-07-04T00:49:18.039142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:73d7670bb444a2850c6db2baef0adc64ef2e1cad087117a4549c7bb83ba03e01","observation_id":"60a76bbc-69c0-44e6-ab0f-0fcb8e0ae680","resolution":{"observed_at":"2026-07-04T00:49:17.957492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:10bcbf7762e8bc0a1715077839daa97a9fe779acfbb34dd623dab4d515b3a3bd","observation_id":"f074caa9-2d56-40fd-9007-920e4ba0fb36","resolution":{"observed_at":"2026-07-04T00:49:18.042882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Are we on the right way for evaluating large vision-language models? InNeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:b431b53f1a305a5294b2c1cd3a4357a6161dba401a6f5855de6e6672c1ce6103","observation_id":"81a74e3f-d806-4c02-a06d-66b480a1592c","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:b547a2215f7626860709c64dcd125543ca42877689fba57f8608da181159cdec","observation_id":"32a425e3-c04f-4d7f-b7f3-01c3542cbf20","resolution":{"observed_at":"2026-07-04T00:49:17.941439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:51.378138Z","title":"Sdar: A syn- ergistic diffusion-autoregression paradigm for scalable sequence generation.arXiv preprint arXiv:2510.06303","venue":null,"work_id":"78561109-9df2-4b95-b2c6-4136d3384b98","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:eb52d318559f815dd8f0eaa5ac8f12f73cdf95d48ced598c7fda4ab41a556806","observation_id":"69c4fb90-6787-46bb-8740-8e444176e815","resolution":{"observed_at":"2026-07-04T00:49:17.971828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Coconut: Modernizing coco segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:ed0cfa90f7579836d334c2a260155a6353f19c9c7d2e4505e4e25746e7dd2e16","observation_id":"1034c832-6371-4d35-bb79-82a7104ad9f3","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"VLMevalKit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:bd991352b3a9fbbd3c18cae541235d103ff4ef6eae7b47071236fcbc88defc09","observation_id":"1bcbb7fb-6833-411b-bd3e-a0fb4fd980d2","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:ec28d0153ee334cf804e423c4f2ba5b798a3597e8b4663cd63f9ce4be09cbef7","observation_id":"b7065d67-8233-4124-bfdf-2f89ce39d9a4","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:991a11247cedb0b3b50fe522db587d18c4723a6b9d1badc5cec282a53036b4d4","observation_id":"985f5488-3e60-48a4-be6e-710af8944d4d","resolution":{"observed_at":"2026-07-04T00:49:18.027794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Dataseg: Taming a universal multi-dataset multi-task segmentation model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:17265bbf5b1c88c8a0e91a789d3d2317a6f8ce27be4ffbefbaed14231f383332","observation_id":"6addfe4d-986b-410d-ae39-3528dbdf7ee1","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:658b6df65ee3897d48ce58a6bfb6dcb2040ddf3765c53104168b314c7f3d0765","observation_id":"4092cf1b-cc5e-4ae6-84ae-ec7ac589face","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:2900069606faafa3022a4672d8f384cd03a93c90011b09470df392bf9aab3ba7","observation_id":"8ea77c65-c133-45dc-a0e2-372d83264c7d","resolution":{"observed_at":"2026-07-04T00:49:18.054172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Ai2d: A dataset for diagram understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:5a00329d1b753171a157bd2c007dd4c6ce759add0f765ce4fead78c1ca0f39b3","observation_id":"c9ff9b25-681c-4432-8761-78883a39ac0d","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:e0e9762d11b1afd91ac70e7bfa6f0746691177f62907469d7f005effc0b0bb9c","observation_id":"ed7700ed-c843-4e75-8f84-02553ee9164b","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:9ba7525854f75383229e1d41818e93e242a32f8d1bc652df3164d29cd7a3b467","observation_id":"7c1e478e-961e-4009-9c0d-72a8061d46e4","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:1d813ff5310a75a219ca3d6f3b6248e3af606dd9baffd8512e772765d80ff883","observation_id":"caf6e1e2-57b0-41ee-a72e-d0e331a3545a","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Llava-onevision: Easy visual task transfer.TMLR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:c5da6b6b87f398e0e9da4459d55e1cf6a87499a0bfc3a6d6a8e4fdff2b289bee","observation_id":"7f702793-1820-4b27-9119-09987a479169","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-07T09:15:18.123904Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":"2506.24102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-04T00:49:17.974489Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world","venue":null,"work_id":"e8ee823b-4ec2-4107-9beb-484b8bd1d865","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:b0ec71cc1218c37af1f7d65fba540e1a2bd5fd372a21f0e3d9cf35dc23d6bb08","observation_id":"6d5d9761-0f57-4a1e-915f-e3d09818a77e","resolution":{"observed_at":"2026-07-04T00:49:17.978718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:9d3ffb2c358e61f71ff5d495af9f7968b926effe82f0485083e18b8ace6d56be","observation_id":"eabc9dd0-9e18-4a5b-8158-9306d1033461","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:ac27feffb0fac80eda405aa7e003d2191fd2436f44197f70af6068a97b83cdfc","observation_id":"d98e4add-d5db-43f3-ab25-04f496bbff13","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Visual instruction tuning.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:f2c427dd66ba3b3f6b9bb5acd1044f816bb0b39cfda9da7a8ba4952d814cb782","observation_id":"bf609126-ac93-4c8d-a453-f751e9d57b4e","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:f5c0131ffcdc3cccc2f0d85c9a6deb1dcb954c3a30e75df626d22101db715d37","observation_id":"57699af0-374f-489f-8875-5c7dc83de466","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:524e5caace669c51d4298c125fec65a18c9fa3916135996774b6e056e0320be0","observation_id":"27bb208d-a5a3-46eb-b473-0b226e5eb6ff","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:5f499a53ca2f30f0bdf429a0d27f363d36dcf5167a905ee01d209be4a6f48f86","observation_id":"3eec8668-8fcb-4299-adf3-82246b1b453e","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:0658bade560a739ad8a700ce575fe698338b0b02e8f696ccdce50bf78cbbde37","observation_id":"75201859-afcf-43f4-83c6-887f0feccea7","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-07T00:33:28.890965Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:52f71d65bea95b30a9a64e833c322a66e12fea7ccca34659cdb28670063acc5c","observation_id":"5a9c32be-0c02-4617-93f7-9729fd6f1cfb","resolution":{"observed_at":"2026-07-04T00:49:18.049881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.203105Z","title":"Open-o3 video: Grounded video reasoning with explicit spatio-temporal evidence","venue":null,"work_id":"fb25eed0-9409-44e6-af47-191ebb595de1","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:2b2b515cba1a139257545e6960f57a04098c99f1b8159bbd0bbeb89a41ba8fe6","observation_id":"9fced0f7-1ff4-4aa8-a8ac-d5d7cf8e1356","resolution":{"observed_at":"2026-07-04T00:49:18.041246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"The flexibility trap: Why arbitrary order limits reasoning potential in diffusion language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:c8f379a2c127c453af7d20958a4d7e530de90d559f4b258627cd6aeb075c8a43","observation_id":"bb3416f3-4bd8-4940-9bf2-10cd1ddf524f","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:8842d050c365340331e80debe2f4c91ee6ced87f26c7e39071e9b356079c6cfe","observation_id":"1a5f57a9-298c-47bc-9f48-08a33bf5db61","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Openai-gpt-5.2.https://openai.com/index/introducing-gpt-5-2/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:db713996626c82823afa181bdb259ecf53a274513ef49fda7898e625ff8ada67","observation_id":"365bd1b4-dc9e-4c97-9c5d-4b864b82fe2b","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07568","last_updated":"2026-08-06T16:26:09Z","snapshot_observed_at":"2026-08-07T08:52:14.948897Z","submitted_at":"2026-01-12T14:25:36Z","title":"d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation","version":3},"cited_work":{"arxiv_id":"2601.07568","doi":"10.48550/arxiv.2601.07568","metadata_source":"arxiv_reference","pith_arxiv_id":"2601.07568","snapshot_observed_at":"2026-08-07T02:38:17.181363Z","title":"d3llm: Ultra-fast diffusion llm using pseudo- trajectory distillation.arXiv preprint arXiv:2601.07568","venue":"Open MIND","work_id":"c66cf43f-ca47-4958-9037-5212d2e00f9d","year":2026},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2601.07568","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:378b2e07c0ff50d37097faac308785d71ffbe626880eceb4a27f9fe994ff73bf","observation_id":"961d46b0-bd76-4b90-bc32-731911991abf","resolution":{"observed_at":"2026-08-07T02:38:17.181363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:4a17899e78523c6e8c6e6150f5cd20974f1092305d3139d40dac4e87d9b5f026","observation_id":"b69a7643-0ab1-49ae-95e6-8e99ba9cab11","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:d1a3e6b460046c8d37ed50f8d387830da4cce50d65914227eed855660d691213","observation_id":"40e00f14-7ed4-4f88-a8ec-68372a8c307b","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:2b51bb00cf1da8aa58ce70b2687a1986f624008adbe6f7fa2209483ba3f2257f","observation_id":"0262fa8a-2bb8-4cd6-85af-93a6e9077d2d","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:fb7b09a97c0c89602d3643249c28eef7adf5cc4509b6c0d4b9c78e6bdd7f9717","observation_id":"7b3efd9e-afbd-4593-bb19-9b4516a6026e","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:75a798891504e162d88fc1a02f43e60fcfaf2090bf9cdd03eaeaa721c268f855","observation_id":"599b1598-a3f2-4c7c-9796-fc209c233e0b","resolution":{"observed_at":"2026-07-04T00:49:17.985767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.029670Z","title":"Grasp any region: Towards precise, contextual pixel understanding for multimodal llms.ArXiv, abs/2510.18876","venue":null,"work_id":"ff0a6d2e-bec1-49c2-bf6d-e3ee4a836026","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:4ad3a7287b667a8925a464bcc31174d87fa44b74ed176a95710da76038eb0f58","observation_id":"376d24da-6733-471c-8065-713f086183e2","resolution":{"observed_at":"2026-07-04T00:49:18.032446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:449ecc2c5f678d2c45af7d888da530440c12b6e19529775b372253583a39d70b","observation_id":"5f12108a-f962-4534-ab2c-fe8eaa15d317","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:a75fd769c29081425a6c5ab602640e505872d356d53799d97b6a960ac0f3fa99","observation_id":"b0bea613-3961-48fc-b414-37476d1e0217","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Realworldqa: A benchmark for real-world spatial understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:13536a5a277667595d13aab40c10ac852caf2e6b528353798a8b462f0ec36d1b","observation_id":"3c5f94fe-7cf3-4d5c-a796-4d8d0b1f3f78","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:05.623462Z","title":"Lumina-dimoo: An omni diffusion large language model for multi-modal generation and understanding","venue":null,"work_id":"564fa918-f290-4779-8c2c-dcc4258252da","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:a93bbe8bcd7704f5420eda3208faf582cff03650be499a6d2954090040b049ec","observation_id":"631f3465-7d80-4135-9859-7c214aea7b70","resolution":{"observed_at":"2026-07-04T00:49:17.948765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:9ed6c7db433bce13f6506bf9b2e77fa648c62e62be5cfd747abe5aa7bfdcf998","observation_id":"1f1d4d8b-b552-4b90-b73f-f5929da88acc","resolution":{"observed_at":"2026-07-04T00:49:18.036381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":"2310.11441","doi":"10.48550/arxiv.2310.11441","metadata_source":"pith","pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":"cs.CV","work_id":"ddc8878e-ed0c-4a66-952a-254dce1c622a","year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:caa2ba29d68742d5ebf8ac3732e472d82c740f286f37fb398ec11c0a1d0c0399","observation_id":"5526169c-264e-4da9-9212-d3e6b66e7435","resolution":{"observed_at":"2026-07-04T00:49:17.976188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Mmada: Multimodal large diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:7b7f00adae4d07dfc55b7bde8802084086be1bf8c4b799e25bb52c20a8dfb5d0","observation_id":"9722ad0e-3013-4482-8184-58930a299833","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.15487","doi":"10.48550/arxiv.2508.15487","metadata_source":"pith","pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream 7B: Diffusion Large Language Models","venue":"cs.CL","work_id":"a8a49dbd-ad10-4c79-b1aa-3ad5173887ad","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:eee635e89e24082011d2278821b955a470ff2df2056757e93d67ac5b46cae63a","observation_id":"759bbd20-b2e3-4749-8f45-d7100e30db65","resolution":{"observed_at":"2026-07-04T00:49:17.955122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.16933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-07-11T03:07:52.266883Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","venue":"cs.LG","work_id":"0cc20892-a1cb-4674-af31-8b884e2a3a79","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:71cd8bee4f72148e2962b08fa89e01765449f5bfbc898a46df47a854fc361496","observation_id":"d13cc417-d2c5-4d66-8cfd-cc2f299eca4d","resolution":{"observed_at":"2026-07-04T00:49:18.047342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":"2501.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-10T03:06:43.598138Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":"cs.CV","work_id":"fbffda10-106c-432c-b84e-5d0908666921","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:eda5061bec366fd974eaebc31f75d130337976507229420107a2c5755a9d09b2","observation_id":"7e4f28f1-2df0-4fcd-a6fe-9c177e3daa78","resolution":{"observed_at":"2026-07-04T00:49:17.981146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.005080Z","title":"Visual reasoning tracer: Object-level grounded reasoning benchmark","venue":null,"work_id":"503cf2a3-c67e-4e04-a09e-6f1ce2de1dbc","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:05ae6fa913256c6c10bf50a8a5f1a14e541d94a08d885c4c4a860621b74fd491","observation_id":"2e7bb20e-13d2-4162-98d5-e1c8b9b0587f","resolution":{"observed_at":"2026-07-04T00:49:18.007437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.043160Z","title":"arXiv preprint arXiv:2510.23603 , year=","venue":null,"work_id":"43ae7bd7-20d8-45b8-aaa5-9edf7b238010","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:63284a5622328bb8f86e8ac567df3ac9c0bf26a318eef0abfb814dabc6bdc259","observation_id":"5ced1f86-011a-4c18-a68c-35faa9a26abe","resolution":{"observed_at":"2026-07-04T00:49:18.045577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:f9f4553f95c1174d0e1017827191d9eaa4a7ae5a78317703f8f9b7a357c88751","observation_id":"d8e3b033-faad-42a5-9651-3be9e6698292","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:20c15d6adce00e92b671589f14b74ae9fa910d43cc82f30572b02b2b67967139","observation_id":"aa64f7c4-f7a0-4cd7-ac01-3ea84e42919b","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In ECCV, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:b223afbef8e1c965ccaecadf5a440cc480971dd327ba40a024ea0cdc42768576","observation_id":"db0bbb23-5a06-4e20-a995-698d56181b07","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-06T08:24:07.376776Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":"2307.03601","doi":"10.48550/arxiv.2307.03601","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gpt4roi: In- struction tuning large language model on region-of-interest","venue":"arXiv (Cornell University)","work_id":"b02ad5c2-c3ba-4507-92e5-eb54ef438f86","year":2023},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:998cb571374a5acb7cf186fb076014880e78367867ef063d7c75190aed753392","observation_id":"8965d514-eac4-4041-a629-53856b3c9536","resolution":{"observed_at":"2026-07-04T00:49:18.014142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:59:26.886235Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:73bdb2d8644de46abf66d93dbdf8e0d262afbc39e549ecb551ebd6ffade69fe0","observation_id":"371d1551-fea6-4dd8-a715-6250d03aa42a","resolution":{"observed_at":"2026-06-26T20:59:26.886235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-07-06T21:09:17.062196Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":"2504.10465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-07-04T00:49:18.024069Z","title":"12 Preprint","venue":null,"work_id":"91b7e3be-bdd3-417a-af20-52b191496631","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:5463ed6371e4c728b4136c192e3b49f2b7ea689aad5fcf3f79e6ffc0336db768","observation_id":"cf4aeb30-1799-4ff3-a2a5-7e0bbab87631","resolution":{"observed_at":"2026-07-04T00:49:18.026551Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.013915Z","title":"Bee: A high-quality corpus and full-stack suite to unlock advanced fully open mllms","venue":null,"work_id":"8b287178-e36c-4bf3-945b-0997aa51c384","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:89995b30d089014068c952df41847aa7c59c40e055cc71e84edbb4e58fea27f0","observation_id":"d4450f81-72ff-4bb2-8715-2f4d3a6ffcdc","resolution":{"observed_at":"2026-07-04T00:49:18.016324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.003081Z","title":"Samtok: Representing any mask with two words.arXiv preprint arXiv:2601.16093, 2026","venue":null,"work_id":"93b1de9d-7f38-470d-abe4-ddc391f40cdd","year":2026},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:21307e1a5310c0599c09e8f10cad026da16058775e47238de5ffaf6f7b626ef7","observation_id":"6c463358-a249-4d29-8403-dc4d0dfafc75","resolution":{"observed_at":"2026-07-04T00:49:18.005405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:c80ec8fa9e2a40556eace8f2095d3888ca1557699ac270aa81bd90b808edf30c","observation_id":"7326d3a8-24dd-42ed-9d4a-1d90b0edbc3e","resolution":{"observed_at":"2026-07-04T00:49:18.003257Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":33,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2606.19534."}