{"as_of":"2026-08-07T22:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ee3eb9d5c94697b86b1739f670237e43998725119608817f04b5582d043ed97","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:11.266165Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:49:02.294828Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:f4f7edb6e3d36b61ba88b1fd2304e966244974638f1f39e5b27d6d89279858c5","observation_id":"8d2a8bfd-bce7-4e65-abcb-f1cb399801d9","resolution":{"observed_at":"2026-05-16T02:56:42.155815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:47603799dca6e1ab66044b3204acd9d086ca5bce439435693874ada8611e9ed2","observation_id":"6a9d2b29-e7e5-4a5f-aade-acd9df9586fa","resolution":{"observed_at":"2026-05-15T17:18:53.689340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:523e7dcece0136c7d11998c082ce82629f55920fa6790bc3da83c9073fc4c1fd","observation_id":"01fe981e-0f3a-4d7e-97af-0a6f31164355","resolution":{"observed_at":"2026-05-16T05:21:44.988534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T15:10:11.266165Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings.arXiv preprint arXiv:2305.02317, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-08-07T19:32:34.217989Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:11.266165Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.16192"},"observation_digest":"sha256:9152ee0a28aac8b9fe0f82b81ac9204d4a4b706f23f62bda066301ebcaf2708f","observation_id":"824d62e9-3f98-438e-9cc0-bbd5e9de4f34","resolution":{"observed_at":"2026-08-07T15:10:11.266165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:23:17.734824Z","title":"URL https://openreview.net/forum?id=1ikK0kHjvj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.734824Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:59a0f94a1abb3d1eb096997e2649021c9c191ce9d2ae10ebabbb13e38a013de0","observation_id":"2747b5cd-31f1-4a9a-a7d0-9b27b197983b","resolution":{"observed_at":"2026-08-07T14:23:17.734824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:12:05.316112Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-07T14:05:35.534429Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:05.316112Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:524913a2ac681c4b72d87833c900b6c6a30944f71892c3f012a7a03042222570","observation_id":"251461e2-d61c-43f5-9dff-f1df33622f8f","resolution":{"observed_at":"2026-08-07T14:12:05.316112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T12:42:25.021502Z","title":"Visual chain of thought: bridging logical gaps with multimodal infill- ings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-07T12:36:01.559601Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.021502Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7ac2e8c30c041da3d388ea5f5c2d3fdcd34e89b45daa5d63fa1bde86b5338b09","observation_id":"991f54e3-8231-4670-bdee-c8beff1d6ab8","resolution":{"observed_at":"2026-08-07T12:42:25.021502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T04:40:10.790536Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-07T09:15:21.192033Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.790536Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:38f3e61c7788ff06c919f2cc46dbb7c591a28b6aeb40e4b40e56ef431b2ce571","observation_id":"d6973e5d-3d08-4214-bbe4-a5764c3ead37","resolution":{"observed_at":"2026-08-07T04:40:10.790536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T11:19:02.751761Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-07T11:11:27.738711Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.751761Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:f312448825e4f4a78116f172ca66011b6e98579f240d0bdb2717feedfac01108","observation_id":"9515bdd8-7253-490f-8bd9-b5d53f00a0c8","resolution":{"observed_at":"2026-08-07T11:19:02.751761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-06T18:51:05.057773Z","title":"Visual chain of thought: Bridging logical gaps with multimodal infillings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.057773Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cbaad11cf903c2773992adbf0c8b599db82b9f6d96127aa25f25911f010e95b5","observation_id":"e1e41564-69ac-402c-b641-dd779435f174","resolution":{"observed_at":"2026-08-06T18:51:05.057773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:67e0f753314ecd14b588251c160e8022f21fbd2758c7b64fb3e58d4ccb7b7511","observation_id":"1d9134d9-2d67-4ef6-8865-6454a3103638","resolution":{"observed_at":"2026-05-15T18:56:23.987203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-05T05:34:40.348235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05226","last_updated":"2025-09-05T16:40:13Z","snapshot_observed_at":"2026-08-06T03:16:59.543245Z","submitted_at":"2025-09-05T16:40:13Z","title":"Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T05:34:40.348235Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2509.05226"},"observation_digest":"sha256:159d2f99c9e19a8944ba47a9cdff3096f277330100000c1d4a1f310258be445b","observation_id":"ad075480-7c56-48d2-b986-c70603077360","resolution":{"observed_at":"2026-08-05T05:34:40.348235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:f7a5bcd7197e04a38e6a26697e76b4d57283f82336f098fc5b75245191f81148","observation_id":"bcaae467-e363-4982-b444-879b2eaf533f","resolution":{"observed_at":"2026-05-18T12:32:36.347236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:1290bfb6512ff2fccb79200449893d750e1bd0a589538ef51c781b9fb0ea2327","observation_id":"c9501840-9dc0-4a57-8174-2ed738536823","resolution":{"observed_at":"2026-05-10T09:48:48.348511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2604.20696","last_updated":"2026-04-22T15:41:33Z","snapshot_observed_at":"2026-08-02T21:16:36.054502Z","submitted_at":"2026-04-22T15:41:33Z","title":"R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T01:28:14.039910Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2604.20696"},"observation_digest":"sha256:08a6a32150f7ab182597bfa51b1432bf41750f827449ea07af936a8a844fd1c5","observation_id":"ab011063-c40e-4571-a5aa-9352f7f6effe","resolution":{"observed_at":"2026-05-11T13:36:04.240674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:9c34a51b2e84e99b6bcc7bbf180f2075ca6e4bd61bd24322fbca5904a99e2754","observation_id":"595f3cef-e4df-4b0c-95c9-73f5a1ade0d6","resolution":{"observed_at":"2026-07-03T23:49:02.296271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2607.00361","last_updated":"2026-07-01T02:59:59Z","snapshot_observed_at":"2026-08-05T17:42:57.892027Z","submitted_at":"2026-07-01T02:59:59Z","title":"ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T11:48:35.972372Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2607.00361"},"observation_digest":"sha256:34204305be1a43aea0c5d4e5fe1ae4b4989671ba547c1186e040c57edbb8afd4","observation_id":"1e0eeb18-b51d-4fbc-9a48-fd58cc5f6a4c","resolution":{"observed_at":"2026-07-02T11:56:54.961436Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2305.02317/citation-record","integrity":"/paper/2305.02317/integrity","json":"/paper/2305.02317/citation-record.json","paper":"/paper/2305.02317"},"outbound":[],"paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2305.02317."}