{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d35fb1dd5dc6f5c27685cf46a8b329c1af69ee09386f70a41fbbf18a749d9a6d","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:27.579774Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T21:32:08.503584Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T14:36:05.322735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"cited_work":{"arxiv_id":"2505.16579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16579","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c3a7c067-ce5a-4cec-9c00-5e1035b44475","year":2025},"citing_paper":{"arxiv_id":"2604.22875","last_updated":"2026-04-28T04:48:22Z","snapshot_observed_at":"2026-08-03T02:43:56.733861Z","submitted_at":"2026-04-23T22:33:15Z","title":"SketchVLM: Vision language models can annotate images to explain thoughts and guide users","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T21:32:08.503584Z"},"links":{"cited_paper":"/paper/2505.16579","citing_paper":"/paper/2604.22875"},"observation_digest":"sha256:3426295ddeea8eaf6381e0c8e562f11e579f485b1cfe071c561ea00b3857f0e6","observation_id":"a3be3925-d3a2-4896-8e84-2d466f961232","resolution":{"observed_at":"2026-05-11T14:36:05.326174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16579/citation-record","integrity":"/paper/2505.16579/integrity","json":"/paper/2505.16579/citation-record.json","paper":"/paper/2505.16579"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T15:02:24.783223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:24.783223Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:2956255ed8620e83306117e4449c2c728dcc1debbf24356c94bb7e8126e0e2bd","observation_id":"d392d12d-df48-447d-b2c8-55afe1872500","resolution":{"observed_at":"2026-08-07T15:02:24.783223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:02:24.843868Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:24.843868Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:f3c4d53ccc601250541afcbeafd1840a57f077dfca13c5116013fe526311a50e","observation_id":"d369d101-b043-43a5-ac8e-35b385e3d5bc","resolution":{"observed_at":"2026-08-07T15:02:24.843868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T15:02:24.955656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:24.955656Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:90f43eadb8cfb4834a454b63054f86f80f80d5e5e7e25109427914cfcab1432f","observation_id":"a768fc52-f4a4-45e4-8ead-41ade8a9bbb9","resolution":{"observed_at":"2026-08-07T15:02:24.955656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:02:25.132191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.132191Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:e9ad740c8c49aa94f334704a9dd1d32af11a8c5b78f666cd014f3708d677205f","observation_id":"724ccaf1-5152-4020-b225-fbaa6e536ca7","resolution":{"observed_at":"2026-08-07T15:02:25.132191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-07-06T19:58:44.149533Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19488","snapshot_observed_at":"2026-08-07T15:02:25.200640Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.200640Z"},"links":{"cited_paper":"/paper/2411.19488","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:b06899c230375553789f78838b8a771cec547b04dd3db4bb9a30ef727ce0ad8e","observation_id":"4e7f2367-3101-4041-9abb-96fe64d90401","resolution":{"observed_at":"2026-08-07T15:02:25.200640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04800","last_updated":"2022-07-25T17:26:06Z","snapshot_observed_at":"2026-08-08T00:05:55.584788Z","submitted_at":"2022-02-10T02:26:45Z","title":"The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning","version":2},"cited_work":{"arxiv_id":"2202.04800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.04800","snapshot_observed_at":"2026-08-07T15:02:27.973829Z","title":"The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning","venue":"cs.CV","work_id":"07e3f82c-8fd0-46a7-9283-e1dc9313da28","year":2022},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.246792Z"},"links":{"cited_paper":"/paper/2202.04800","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:e0188cd4b2fa9824ba018055050b21e452be7561aa7768e73b4912537cff79bf","observation_id":"9f366451-7cae-4ceb-860e-2eb4ee718d4e","resolution":{"observed_at":"2026-08-07T15:02:28.069695Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-07T20:46:02.743961Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T15:02:25.409128Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.409128Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:e4ce921a33193081edd0ec320e944a5d0026607b82c31a0bf129cb76d8a8ae97","observation_id":"e7c8bc35-93ae-49e7-8dd3-60f36a5cfcb2","resolution":{"observed_at":"2026-08-07T15:02:25.409128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:02:25.544884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.544884Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:d2d3f82aad0ee5dfc188c4479938d3bb87e15e03eef2bbb563f7606d2b23e15e","observation_id":"904ec99a-5f78-4d84-8995-bd187d72ae45","resolution":{"observed_at":"2026-08-07T15:02:25.544884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-07T15:02:25.601130Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.601130Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:67e0be9ffacb2ce02e9c2fa5cbb3b9c14d1ef3823dec35fc2037489afbc5924a","observation_id":"2d134f9e-5c17-4b86-9d2c-5ff156aa1530","resolution":{"observed_at":"2026-08-07T15:02:25.601130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:25.691311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.691311Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:6f5c52851a91718ca8a098d4232c71b8c0829fa5c6a2ca1ab352a18ae3de79cf","observation_id":"760a5f88-7882-4a49-ba54-e8a8f01cc2d8","resolution":{"observed_at":"2026-08-07T15:02:25.691311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08693","last_updated":"2024-08-16T12:14:55Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T12:14:55Z","title":"Med-PMC: Medical Personalized Multi-modal Consultation with a Proactive Ask-First-Observe-Next Paradigm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08693","snapshot_observed_at":"2026-08-07T15:02:25.738836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.738836Z"},"links":{"cited_paper":"/paper/2408.08693","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:fb092a4ed23ed1ed2789c29d41772c276e920fed516de53668c2970ef6654b3b","observation_id":"c39c6697-9f26-4516-900b-2db79dd05e48","resolution":{"observed_at":"2026-08-07T15:02:25.738836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:02:25.841387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.841387Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:9c0690f71b4953deaaf53c427e220aafce370fb39ef3369d82ab0278b5487a5d","observation_id":"65a724fb-6abd-4279-8576-c22f418abf0d","resolution":{"observed_at":"2026-08-07T15:02:25.841387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T15:02:25.944057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.944057Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:ca80f83a3f742cece9a06396925b96dfd74f35f944711266a986b81251a86dc9","observation_id":"20fc7cfd-c3b1-4448-9b4a-6f89d7d9f9c1","resolution":{"observed_at":"2026-08-07T15:02:25.944057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17076","last_updated":"2024-04-01T03:17:09Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-27T22:23:27Z","title":"Compositional Chain-of-Thought Prompting for Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17076","snapshot_observed_at":"2026-08-07T15:02:26.083572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.083572Z"},"links":{"cited_paper":"/paper/2311.17076","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:f559799c2188a983c1c09661e4a672988bcff06879ba67233e5dcabfe1e0af64","observation_id":"122c7166-4311-4d08-a4a3-f36094e61cd0","resolution":{"observed_at":"2026-08-07T15:02:26.083572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:28.388635Z","title":null,"venue":null,"work_id":"ed6836f3-1170-422e-97ac-3d9a5d098760","year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.167566Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:f2a5e543a5c2dfbff066a7234f17b18056f55d1ad1bc72dbc791074faf96725a","observation_id":"2f609678-7fec-42bd-9efb-9440d1536144","resolution":{"observed_at":"2026-08-07T15:02:28.503460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T15:02:26.254694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.254694Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:9d026e0591b43a6ccef636f2ce162be1d74d347c4b5216b0202eaa8389b5221c","observation_id":"5c8956ee-8a8d-4793-8f62-05ccc2f48825","resolution":{"observed_at":"2026-08-07T15:02:26.254694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:28.235539Z","title":null,"venue":null,"work_id":"17f501b5-b0a8-4e7e-a3ad-3d34ce7a8c09","year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.330414Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:bf62d7a410ad8ad442c71225ce20973f359cd8dbb129838510541a6cd275bb79","observation_id":"3a676439-2414-4e49-95cd-ea8f163b8edd","resolution":{"observed_at":"2026-08-07T15:02:28.305760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T15:02:26.398066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.398066Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:b20c6607fc898d63ff7020f1e1dfbc42b90f0b472c92742f36249eb972220840","observation_id":"b695ae8d-aa12-48c9-a326-f4abd40500b4","resolution":{"observed_at":"2026-08-07T15:02:26.398066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T15:02:26.475930Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.475930Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:5c85de1f35f0a55bf9dcfc27680b06c077a087337596cab9522dab7183c55a3e","observation_id":"ce0a4132-05fa-4f6b-81e4-15ea8a5f2294","resolution":{"observed_at":"2026-08-07T15:02:26.475930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T15:02:26.564151Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.564151Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:8d9d8ab8525bc0235329dfbebbe887b0590e57f9511fdd0aca7ffd600702ac7e","observation_id":"259f02f7-c6b6-437b-b6b3-bbfaca65695f","resolution":{"observed_at":"2026-08-07T15:02:26.564151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T15:02:26.636292Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.636292Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:64c1c81cd7ac648039eb8bad797d73827083160163aee91571b631935a5f76b6","observation_id":"18c2e927-af90-4a3f-8cb7-9d6565d0d76e","resolution":{"observed_at":"2026-08-07T15:02:26.636292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T15:02:26.697184Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.697184Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:713a10d0084c7040955a2fd21d1a56955662acbf07a9fd3b0dbf9d0c52dd3e83","observation_id":"35bdbbd9-123a-4424-8122-d3144942bcae","resolution":{"observed_at":"2026-08-07T15:02:26.697184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:02:26.814318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.814318Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:7bf09217552776103427b37f3ffc6151dd9e6ac711b1ef8744265d3da7009a1f","observation_id":"565bbe37-6430-40e2-af36-f08aad36afa9","resolution":{"observed_at":"2026-08-07T15:02:26.814318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:26.931367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.931367Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:889fc1f7618803fbfbdee9f7bdd784391b4b8debae7a5e3a0ae17f0cbc2f8ed1","observation_id":"78815e43-b6a4-4974-be74-be751308dd65","resolution":{"observed_at":"2026-08-07T15:02:26.931367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T15:02:27.056855Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.056855Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:c2da917e277f6f1e569023cee049ddaf439b0652c8e3f455aefec0b3553a6435","observation_id":"215337b5-4fd6-4475-95f7-3aba6a64c905","resolution":{"observed_at":"2026-08-07T15:02:27.056855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16436","last_updated":"2023-10-26T04:16:52Z","snapshot_observed_at":"2026-08-06T08:30:44.878001Z","submitted_at":"2023-10-25T08:03:10Z","title":"DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16436","snapshot_observed_at":"2026-08-07T15:02:27.176868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.176868Z"},"links":{"cited_paper":"/paper/2310.16436","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:2c5acd48fcf987089e6a39108c37b3ae9403a1a2256e80039bf151225f47a15c","observation_id":"4887c9c4-572d-4dee-8cd3-c88ea7972825","resolution":{"observed_at":"2026-08-07T15:02:27.176868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:02:27.349532Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.349532Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:074ab8e2faa7fae76c80a812fbd95872e2119c8530aaf48ba54f3ed62e34f9a7","observation_id":"75822fd1-1674-4244-a18f-b958e6bb4628","resolution":{"observed_at":"2026-08-07T15:02:27.349532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:27.475806Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.475806Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:43d0bb4291221f5f210654dd1ceff833eb8a3b985da47ace7fe1334e312ec576","observation_id":"f22aed27-8280-444e-becf-9813a3e5a6f0","resolution":{"observed_at":"2026-08-07T15:02:27.475806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:27.579774Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.579774Z"},"links":{"citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:a7c6573c931c3a14994a1223449ca83be14c3da2c01631d592bf734f64ebe74d","observation_id":"548b94c8-3f8f-4a2e-8a38-ceb2116087ed","resolution":{"observed_at":"2026-08-07T15:02:27.579774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2505.16579."}