{"as_of":"2026-08-07T01:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5636ffbf6206f968b0992226376ab659741d1235f69f94da284ef65c1fabc4b0","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T07:31:26.225257Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08434/citation-record","integrity":"/paper/2607.08434/integrity","json":"/paper/2607.08434/citation-record.json","paper":"/paper/2607.08434"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.710138Z","title":null,"venue":null,"work_id":"7ee043d4-f468-4945-a52d-400857fdb126","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:47a1a68589cf568fbc367e60a0803b8b67955ba30e932041a62792640bc05110","observation_id":"3502a4f0-94ec-4591-b5e3-481cbd981c61","resolution":{"observed_at":"2026-07-10T07:56:58.711996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.707403Z","title":null,"venue":null,"work_id":"be78b967-9869-4f97-858b-2592ec131d8c","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:88357bd41d449637de640349bf9655b3b6a557f36f7b9455462b52e3ebf0fb14","observation_id":"bf654343-635a-4232-8b8d-f61d90cebe7c","resolution":{"observed_at":"2026-07-10T07:56:58.709386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.712810Z","title":null,"venue":null,"work_id":"8145403e-1fc8-4596-b435-8fba2cdb8cb2","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:d000af089d5e2fa69483f11cb95db90229fb96f1bd0d2045e34e761a0bc0c773","observation_id":"a1629f7a-cff8-43fa-8d75-2c6997e83883","resolution":{"observed_at":"2026-07-10T07:56:58.714727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.715499Z","title":null,"venue":null,"work_id":"1258267f-6da4-462d-b2bc-4a0c426d70fb","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:92286b99a690e1f976155bcdcff8c2fce8190ca6cc1c39968c5b720e6728c245","observation_id":"3ca00ea5-6fe8-48f5-abe0-d3372e37d644","resolution":{"observed_at":"2026-07-10T07:56:58.717115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.718055Z","title":null,"venue":null,"work_id":"78b281e7-e634-4794-954d-edd73be9084c","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:21da5c96f7e0ef38430936c03d7ca2b8cb6ae8920adc4db0e1ccf5fbe013f847","observation_id":"9b2164ec-80ea-45b5-98fe-e060ad9093a4","resolution":{"observed_at":"2026-07-10T07:56:58.719580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-03T12:37:51.928616Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.13872","doi":"10.48550/arxiv.2405.13872","metadata_source":"pith","pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image-of- thought prompting for visual reasoning refinement in multimodal large language models","venue":"cs.AI","work_id":"b297e4fe-c03f-49c9-896a-2d505bdf26ce","year":2024},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:5103288e98d4e0363c7d04002b9cef6456c065d6de6ded5f5e6adc15f1897473","observation_id":"e62e72e3-01de-4406-9b66-eb6952835972","resolution":{"observed_at":"2026-07-10T07:36:58.024656Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.720231Z","title":null,"venue":null,"work_id":"69c6f354-e779-4fe7-b125-bdf2a6edbd00","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:92c2da5af255e81d96fd8a93620c60eea8873527d61ebf02628b30ada535b37e","observation_id":"bf9bd398-dd13-440e-8a61-031e37feae29","resolution":{"observed_at":"2026-07-10T07:56:58.721837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.705562Z","title":null,"venue":null,"work_id":"83d8c1e1-91a5-4d1f-82df-327c22b12c30","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f01d94709bdd0afb319a486fbe746583c86f9f1cb2f2b5ed1be3429413d2c312","observation_id":"d5433c77-8fea-4815-91b5-eccbe1657dc8","resolution":{"observed_at":"2026-07-10T07:56:58.706746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.697469Z","title":null,"venue":null,"work_id":"db7cd27c-09e6-407b-a328-0524825fa8fd","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:79ecee533627941992d3c566b7ab1e7e845b3b3a98e34249d7a800d38df530ea","observation_id":"7b9aee08-60ed-4039-bc66-9b44e00b5aea","resolution":{"observed_at":"2026-07-10T07:56:58.698766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f3b83105573b356279ab26f7c33348c40371ac8ec288ce2747a41c0f0eae68b3","observation_id":"ba4739ec-9e76-412d-9e72-a002e0566044","resolution":{"observed_at":"2026-07-10T07:36:58.021899Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.701881Z","title":null,"venue":null,"work_id":"fc7d470b-4ef0-4c8e-bf01-8060ff88caa4","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:0386ef9a208b0f8af90d9c43e7adf600576b799455479b3a9f5332c22668f3b8","observation_id":"44846971-84d7-46f2-85bf-ba70069b7175","resolution":{"observed_at":"2026-07-10T07:56:58.703243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.615424Z","title":null,"venue":null,"work_id":"6f2d1c56-a145-492c-8912-1aac715b6c10","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:ee17660042d3a1ae06646e094e835aacf05a92bd20c487386467934705ef8d5c","observation_id":"2439bb6e-de7f-49f4-905b-a1fb7c77574b","resolution":{"observed_at":"2026-07-10T07:46:57.616760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.613580Z","title":"Proceedings of the International Conference on Machine Learning , year=","venue":null,"work_id":"9c041b59-13f3-4861-b85d-cd4028b7aedd","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:e143eecae33f4a3cee15406a039fbf22cd68240653f9ec843a6516f68c96639b","observation_id":"bd63ae46-d9c2-4f4e-9771-b5c5812224d4","resolution":{"observed_at":"2026-07-10T07:46:57.614694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.617464Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"bf2d3d64-3a74-4fc0-960c-e913a561acaf","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:63cccc73ee9b9f73401cdd1d2aecd4951f0c07ef4794e76ab760e3f363921da9","observation_id":"cf283b9b-7c90-4f45-83d5-7b87dacbc82e","resolution":{"observed_at":"2026-07-10T07:46:57.618853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.621841Z","title":null,"venue":null,"work_id":"04916d63-7f3d-453b-b042-3053effff04e","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:d6280cfb86bf139a34b9b47489d1861bc5c474779636e1aaeabcaf8d9bcb7778","observation_id":"a6ed172b-cbf6-477f-bb82-b5c0bdbd921a","resolution":{"observed_at":"2026-07-10T07:46:57.623106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.610309Z","title":null,"venue":null,"work_id":"81ff465f-0e2d-4955-9750-1de8638b4c2b","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:3611e3637eee9d64b63e5eb825c131cdabd00b145539a952efa042faf7c87429","observation_id":"96be6459-e5e6-4ed2-8319-035a70633ab8","resolution":{"observed_at":"2026-07-10T07:46:57.611868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:94ba618bdbab97e21b7c9122ab473e9719f517fc7d4b3d493179983dbccbb6a3","observation_id":"3006de00-dcad-4461-b36d-110c524b0510","resolution":{"observed_at":"2026-07-10T07:36:58.019384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.609846Z","title":"and Krishna, Ranjay , booktitle=","venue":null,"work_id":"b1d15a49-ed1e-4e77-a1f7-da12f2a086df","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:c966a0cbd307fb7e5a95ef8c6a2633b86ef5a32ff27eb128fd2d68e993bfd78a","observation_id":"b29b9d96-f848-4193-b9b0-d488d88970bf","resolution":{"observed_at":"2026-07-10T07:46:57.611029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-06T00:17:24.145369Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2502.17425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-07-10T07:36:57.997924Z","title":"Introducing visual perception token into multimodal large language model","venue":"cs.CV","work_id":"e6d202f1-5b0b-4af8-8490-511c7c189b9c","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:1bebfab5211d54b787f862bb01c2974a5075a852f27f6a2ca167966ac62fd614","observation_id":"63e626de-969a-4252-b038-bb09a77b5df3","resolution":{"observed_at":"2026-07-10T07:36:57.999269Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.618476Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"fb21c4ef-e24e-4308-8119-9e7e8dd0542b","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:9ebfcc64015c1b560eedcefd8aebdf83d44e4391f3d55f323641d11172990fd0","observation_id":"3b52b4bc-f28a-4715-9199-cfac58de6393","resolution":{"observed_at":"2026-07-10T07:46:57.621144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:c366dbd2f21796c1843139baf926ee17e1da5109fd492239d38c25781754c633","observation_id":"e5efc899-ca69-4cfb-a7ef-b788a4b7d4c3","resolution":{"observed_at":"2026-07-10T07:36:58.004857Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.601337Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"638249f4-bbfe-49f4-90a0-c3ac61f1f379","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f3e9afd56d81502a5f354a1a6939be7d64a9496277e34972a98eff269166b840","observation_id":"4049ff5c-9876-45b9-98f9-066b213573f5","resolution":{"observed_at":"2026-07-10T07:46:57.602546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.605406Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"ba9bf6f8-6d7f-47d6-88cc-98e94c8035c6","year":2024},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:06a8bb87a507cb1c2b2a82b16eb467ee683763fcbf8ff4b31bf288573967937b","observation_id":"42c783a3-3797-4b30-b9b0-8bfbabe903b2","resolution":{"observed_at":"2026-07-10T07:46:57.606756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"cited_work":{"arxiv_id":"2509.01656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01656","snapshot_observed_at":"2026-07-10T07:36:57.995051Z","title":"Reinforced visual perception with tools","venue":"cs.CV","work_id":"4b06b3fa-508d-4153-ae9a-da6c80291228","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2509.01656","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:1c718645b869a72d1a3c24f0045748cc47fff586a72ad5927c74331d6d6a026d","observation_id":"83dc3f04-24e7-4dd7-a124-1b11362b38bd","resolution":{"observed_at":"2026-07-10T07:36:57.996649Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.611730Z","title":"2025 , month =","venue":null,"work_id":"fe273c90-1001-4584-8361-2c8764d9001f","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:bb17c741abbfb621f78ea1ea36e95c48cf000e09abb96bcac7ecae026033f8da","observation_id":"75f2dc1d-f477-4d77-9c66-cd5b6aa07bf2","resolution":{"observed_at":"2026-07-10T07:46:57.612970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.595433Z","title":null,"venue":null,"work_id":"6f9a46a1-74e0-4dc0-a769-2c55ea35c0e1","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:bf83ba0eee341c18341a49603491452f877486a36fbbf321db3efd54663bc433","observation_id":"87bdf766-7d7c-471b-9e91-ffc200f50945","resolution":{"observed_at":"2026-07-10T07:46:57.596604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.597249Z","title":null,"venue":null,"work_id":"37b5daf8-7e42-4ca8-8add-44c83b224565","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:8c937934a434c9a1ced1f9289889d49139dbe40e52c41bcc9b1989c9bcb84682","observation_id":"ad1077f2-52da-45c5-80e9-0018438ed0fb","resolution":{"observed_at":"2026-07-10T07:46:57.598562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.600903Z","title":null,"venue":null,"work_id":"01c547a6-6561-471a-acf4-553f3b9ae90e","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:77cfc87e6ceb7353cd5544895f1fdef985dc733de8cb59fd3d739ae57fd7f481","observation_id":"ea365113-934a-4b81-a5f6-652259bc4cb6","resolution":{"observed_at":"2026-07-10T07:46:57.602050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.602726Z","title":null,"venue":null,"work_id":"ee1e8a3d-f2ca-422b-9c79-a1db82c6bffb","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:419eba35bcb71c6203b82112cdc2892ddbf9358d1c29d0633b7781ab1827e96e","observation_id":"ba4691ab-8a40-44de-8375-d0fb88448500","resolution":{"observed_at":"2026-07-10T07:46:57.603805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.591714Z","title":null,"venue":null,"work_id":"586d675b-391f-416c-83cf-36e044f10958","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:4c3f7b535701d7edd05a1192e9f1c8b9a16b5e54e52da6a4627f6782b111cce4","observation_id":"1f37d61b-ebe7-4dc8-8110-02eaff21c6a4","resolution":{"observed_at":"2026-07-10T07:46:57.592942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.585690Z","title":null,"venue":null,"work_id":"a1434426-c187-4f3f-afba-bcb894adfc50","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:eba6f3be46354cb54ac6ad6d20fdb213382f317d653e96c0473c8a8696b60521","observation_id":"2daff4b2-91f3-4f22-8ffc-d408d0e2b87c","resolution":{"observed_at":"2026-07-10T07:46:57.587080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.587629Z","title":null,"venue":null,"work_id":"26c0a33a-2d51-48dc-a411-faea667a7d53","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:ce52b66e2ed2c11569e8ca6e3e4f0bbc0c7acf58cf6a50241cf0129a5c555a33","observation_id":"287b21fc-5ca9-4ed8-baf8-9de0c23324cb","resolution":{"observed_at":"2026-07-10T07:46:57.589014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.599450Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"fb3db211-bdde-474f-b6ec-d0857c1c58bc","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:b1cc57a54ad18f08fc41faff47726288b73cc94ca142a059933f9bab38b2a760","observation_id":"e430b73d-bccb-42fb-ab61-653634cdde5f","resolution":{"observed_at":"2026-07-10T07:46:57.600692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:665c8309d504241e9e79aa9a70d2ae30adc10f2803be6a406961ca18a1f134e8","observation_id":"49b64a2f-5f4e-457e-9976-6fbec354f37f","resolution":{"observed_at":"2026-07-10T07:36:57.988224Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.577882Z","title":null,"venue":null,"work_id":"f91b6193-714c-4839-b5ae-fc40738a56aa","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f68ca5d70ae92a8487ed7f8583078ac9a8e34cae3130a9aef70b21baeaab5b4a","observation_id":"b17b3a05-e66f-4bac-a13f-cc492b1488c4","resolution":{"observed_at":"2026-07-10T07:46:57.579854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.577422Z","title":null,"venue":null,"work_id":"b9f29b71-2811-4af8-b532-c8857144072d","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:bfa2c96b60a19b5e36506a1ce16a53cbb10bd0e4d6cf75ca0aa8f21b22a4f0b1","observation_id":"eaedf568-2285-455e-a23a-4c4c3d2debbe","resolution":{"observed_at":"2026-07-10T07:46:57.579017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.589576Z","title":null,"venue":null,"work_id":"8b33f193-9f50-4a93-b4df-d794c9084768","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f9e5c6709df69b61c9e77d714a3be07ccb0674fee14eb928c8f6a3140c5a44ee","observation_id":"474cae3a-4ab4-4a0f-b5fe-f53cbc2efccb","resolution":{"observed_at":"2026-07-10T07:46:57.590929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:57.989452Z","title":"arXiv preprint arXiv:2511.23469 , year=","venue":null,"work_id":"6a7ee597-1a26-417a-a34a-2bad8bb3a705","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:6d0d4ed6b7c7d639c429c123fe029813c5d3d10e653f111186a819410d77f4d1","observation_id":"b3379363-9d6e-4273-a6a9-92433ab7dd95","resolution":{"observed_at":"2026-07-10T07:36:57.991028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.579757Z","title":"2024 , organization=","venue":null,"work_id":"42ad3142-0c5f-4230-a92d-72be2d87c765","year":2024},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:7d8f129b94773f5ca62586bc23e64dd7a37b4cf30a8b1afa0520e0f877dc9b88","observation_id":"76e6fd5a-d4b0-49c0-8805-ee08fc2cdc83","resolution":{"observed_at":"2026-07-10T07:46:57.582178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.604503Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5a531bea-f0ed-4a69-b5d1-8b51e8974e5a","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:161b9d474822da1d1d9148975c560978cff4f0a8be2c13ad9d05c9af5002a3b7","observation_id":"99833c2b-e260-42bb-ad04-f2db56ab1790","resolution":{"observed_at":"2026-07-10T07:46:57.605695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.623724Z","title":null,"venue":null,"work_id":"6e3acd81-1fee-429b-a79b-d4b90a522e69","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:7e6fbe8c5f9cb92cfb6c81d7d9844172a7595e52260409b1765ee37eddc8a88c","observation_id":"38b8c56a-67d1-414f-87e6-a1ccbcac1a04","resolution":{"observed_at":"2026-07-10T07:46:57.625198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03276","doi":"10.48550/arxiv.2603.03276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond language modeling: An exploration of multimodal pretraining","venue":"arXiv (Cornell University)","work_id":"d972314c-446c-43b5-9de5-4bb7c5f1cdcf","year":2026},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:74b54dad512d56a912d6afe93202ed109a276742b73f10739ccaecac72bd2c8d","observation_id":"e38fe33b-0dbf-40ee-9645-203eeca55aff","resolution":{"observed_at":"2026-07-10T07:36:58.030196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.563621Z","title":null,"venue":null,"work_id":"4da63e4c-924d-41a4-bb64-243f71d5f97c","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:c68304b9a43cec389736e42370347475d9d7b6f921c4dd05d979a5c19e067261","observation_id":"0abcf05c-7b6a-4b25-9ee3-723f7a6154c9","resolution":{"observed_at":"2026-07-10T07:46:57.564835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.595647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"63cc197b-173f-4e65-87b0-482f2b9168a8","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:1200ea1a537cce871d7380e203dfd6b2331e7130e22ef4393475688284648edb","observation_id":"d7957a1f-67d6-4e99-96d2-119b07835a54","resolution":{"observed_at":"2026-07-10T07:46:57.596929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:05861cf1091aadcc19532e8c2987556d25c58a46d1e778f53755a66d0d8ce092","observation_id":"301fdde3-146f-4547-ac99-7e4a075ccf74","resolution":{"observed_at":"2026-07-10T07:36:58.007727Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.593434Z","title":null,"venue":null,"work_id":"05985e86-9b47-448f-a0cc-e976dc328e29","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:06fc5fdd1635a019737f3558629eea3a705021e3d742f1903ba75590ac84c36f","observation_id":"5f49c1ae-87d7-4cd7-be7b-7037403bb310","resolution":{"observed_at":"2026-07-10T07:46:57.594995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:f056f3721c1b8d8d27387b098c579975449831690e74266fe10ccb5c28bdd527","observation_id":"83540de7-62e6-4743-85fb-9686a745b563","resolution":{"observed_at":"2026-07-10T07:36:58.001860Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.570036Z","title":null,"venue":null,"work_id":"97521905-6d33-4e2b-8c58-e59d249ba640","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:bba0719d8d0506210ee16c7bbc706c8f7f46a4f7eb47161a3eb00f57c1ad9fa1","observation_id":"c61d1850-4b63-46dd-ad87-8e7778acc638","resolution":{"observed_at":"2026-07-10T07:46:57.571779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:71462b791ec45e77d2fc9a30f3a664c085da168dd9dddb035ed217c6f39cb68d","observation_id":"4407d57c-6c6e-440b-a41f-bf04bc9ae2b7","resolution":{"observed_at":"2026-07-10T07:36:58.027359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.02567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:58.031623Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567","venue":null,"work_id":"b2e70f99-2155-4021-82c3-540574140c6a","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:29d911a2e12d48ce95bc57989934dfcd0b5c8ab66dbacf165e96c05c9f3beac6","observation_id":"878cc41e-db19-4327-a9ad-fcee16a035a4","resolution":{"observed_at":"2026-07-10T07:36:58.033134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:6c29aa390ecbe797ad72c6ae507cd34424f8d87ff500f638be718113264785c5","observation_id":"c6e07094-9579-4b06-98b4-f8dc47a13054","resolution":{"observed_at":"2026-07-10T07:36:58.016528Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.572468Z","title":null,"venue":null,"work_id":"f212a3cf-3948-489e-ba82-f790873192f8","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:34d570bf03c63feed676042483da579bf298bda627a13996739418c290cc6762","observation_id":"12ebfe23-63ca-480f-8d4e-fd7d00d42271","resolution":{"observed_at":"2026-07-10T07:46:57.574011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.559255Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"78172059-2c62-444f-9c1d-75252c088da0","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:fe6bba6c0f651c4b852080d5077baecf437fc74f6bd5a5781324482f91d06193","observation_id":"83d79555-b1c7-461c-9d81-f9b69b0eb1d5","resolution":{"observed_at":"2026-07-10T07:46:57.560859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08524","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:57.992417Z","title":"arXiv preprint arXiv:2602.08524 , year=","venue":null,"work_id":"46660a6c-1e49-4687-be01-064793e258f9","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:cb1d617742f3f375642afcc70b6fe6aeb19ee14f7048b861adb8868f843e154d","observation_id":"7b06b4d7-48b9-4a91-bc75-6a7795afd4b8","resolution":{"observed_at":"2026-07-10T07:36:57.993826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.557170Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":"27f426d9-9488-4edd-929b-3fbe9227c48a","year":2026},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:2c47face3aa0348cca79a9b464876f7396a065a62073b3cfdbe9482789042b0d","observation_id":"f3a9c1af-fd01-42a0-bb2a-1423bfef16b4","resolution":{"observed_at":"2026-07-10T07:46:57.558924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07256","last_updated":"2025-05-12T06:10:48Z","snapshot_observed_at":"2026-07-06T21:22:21.577606Z","submitted_at":"2025-05-12T06:10:48Z","title":"Synthetic Similarity Search in Automotive Production","version":1},"cited_work":{"arxiv_id":"2505.07256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07256","snapshot_observed_at":"2026-07-10T07:36:58.012393Z","title":"Synthetic Similarity Search in Automotive Production","venue":"cs.CV","work_id":"fcd62373-23cd-4e58-bdfb-43e1ff49c89a","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2505.07256","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:baedd072b1ad76c301cd6853a1dc1508334636ae6d5a54e767cb227200bfd17e","observation_id":"b7a09343-7051-4256-b55d-ab6f4fee55bf","resolution":{"observed_at":"2026-07-10T07:36:58.013976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.573145Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"aa652fec-d6a7-4bef-9260-2f01270b5f9b","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:0839fb529e3ee438ea78f04229584b7cf96e65451d9d6161d0c26a3def25a370","observation_id":"a5991963-0c94-4dc5-b3a1-b4b376299c08","resolution":{"observed_at":"2026-07-10T07:46:57.574764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"cited_work":{"arxiv_id":"2605.18390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18390","snapshot_observed_at":"2026-07-10T07:36:58.009410Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","venue":"cs.CV","work_id":"35bc6597-4abc-46f4-98df-2c801ff2c1e1","year":2026},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2605.18390","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:dccf83db2ee02b794aba02a3d02ba96ecc8c6e80f08d47ff69c5d2b8712f2fb5","observation_id":"cc960685-3011-4161-b367-c7aa67f85770","resolution":{"observed_at":"2026-07-10T07:36:58.010915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.553008Z","title":null,"venue":null,"work_id":"b1aa1e85-1e2a-42d8-9206-3a6f9e58ec4c","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:98668205c505607fa24986cc1a8a44e07f3afdba2da8455fb0ba734be5b2e27b","observation_id":"185a6ab1-31c9-49f7-96fc-a2734f46dc12","resolution":{"observed_at":"2026-07-10T07:46:57.554398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.559559Z","title":null,"venue":null,"work_id":"71b7c462-8747-437e-95a2-8fa16434bc4c","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:a057bb423cbc18d9649e72be660ad6d4608a9064ddeeb64ff9e345f19da2864f","observation_id":"6874e3ea-9568-40f8-bebe-f238b6acf827","resolution":{"observed_at":"2026-07-10T07:46:57.560990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.565278Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"01321abf-9e30-4289-a6c3-ae2b85a9e0cb","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:03afd3e46a2768bdb20ffb1c72d3aaef1fb5aa94b7bf6115c8c39a4b051d44cc","observation_id":"cdb30a92-af3c-437d-b7ac-064f0040fe58","resolution":{"observed_at":"2026-07-10T07:46:57.567037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.690873Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"d5096fc3-e24a-4e90-a25a-188e9f95ff41","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:b3ad724512056cc2b2826ee12a44dfffac2c0c6199726b4272145cdbb33208d0","observation_id":"68a766f6-57ad-414d-a67d-ad0c0e330ef3","resolution":{"observed_at":"2026-07-10T07:56:58.692190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.692772Z","title":null,"venue":null,"work_id":"bc127b32-2757-4de0-b222-06925b292b2a","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:c119e9785415ddb4fb47d52692c3d42b69ff21460fc00d2f436c184be68cae01","observation_id":"89c026f1-b619-42b5-b3c3-941041e0d680","resolution":{"observed_at":"2026-07-10T07:56:58.694172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.694726Z","title":null,"venue":null,"work_id":"d2485f64-99f6-4bfc-b26b-c16be10d61a3","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:ff736b09f71b8e0ef4977f396466e75713651e9a82a7f1cc952789e046713d88","observation_id":"360650b5-03ec-4412-94f2-410941c81ecb","resolution":{"observed_at":"2026-07-10T07:56:58.696416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.699322Z","title":null,"venue":null,"work_id":"1e107d85-5cb0-4fd1-bab1-7a21210f35f0","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:58eea9dfdbabf99255d9fbf5580facd31f73f105650828917df30fc0095b617f","observation_id":"5a946fa1-3870-4be6-a985-3699185b7026","resolution":{"observed_at":"2026-07-10T07:56:58.701287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.703868Z","title":null,"venue":null,"work_id":"b558caf3-a2b9-4b76-829b-b182587a9f79","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:26a4ad9bb2c430cc77a532f421ee8137470a82be132960a256a5cef875b586f7","observation_id":"69acc418-3efe-42b1-8bef-6128bfed25d8","resolution":{"observed_at":"2026-07-10T07:56:58.705236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.687183Z","title":null,"venue":null,"work_id":"417a4dee-d6c3-4ba4-b4fc-a83e92dd1b49","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:aff99bdf7bd96debc6ff55d5dce2f9dd3e28b8e62f8bcb75bd5f7a537df39dc6","observation_id":"9fff5df9-0000-48d7-8e1d-72aa1d62363c","resolution":{"observed_at":"2026-07-10T07:56:58.688490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.689026Z","title":null,"venue":null,"work_id":"9fac0337-579b-45f2-8500-d996ab3c99c5","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:d30af4567d54ccc08472206c5a67f659c87ddc9957ce6b36153f50ac84c9b379","observation_id":"ba8ba986-95e6-433e-9c22-e61a5666920c","resolution":{"observed_at":"2026-07-10T07:56:58.690299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.685142Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal","venue":null,"work_id":"ee924cf8-ffee-4123-be60-964aa35179ee","year":null},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:9345f8fe9cd9877cd905d88cdb70f7c9ae456020880a39e7e797a4e2d619beb7","observation_id":"7ae698f9-d85e-47f0-a548-fed80697e1f9","resolution":{"observed_at":"2026-07-10T07:56:58.686489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:20:06.138424Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":35,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2607.08434."}