{"as_of":"2026-08-06T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1239c4d15579fd82f9d1ca448d11a46ac8662fcdd7d5553d3492b65922baa699","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:57:40.838682Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:59:57.253374Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:b4026f84c46308702648e8068a0af81f6db9ecaf2a051bf68895975609dff2f3","observation_id":"cd69af3a-c658-4de7-b693-ad706aefd14b","resolution":{"observed_at":"2026-05-15T17:18:53.710895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:fc31ffa34a8756800bd197a929a72003b1e9beda3b9e4cb4757c78a264ba8179","observation_id":"cd23a595-bf5b-4d0f-8550-15b82f3f5b94","resolution":{"observed_at":"2026-05-19T06:12:07.081795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-03T20:57:30.540242Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:30.540242Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:e23beb1a14c6c7b1a32b2301d5f3af80f6cd330e3f5ce2d51054b4cac4bfff64","observation_id":"a0d61b9f-e1be-4f8d-9c4f-fbb619126a18","resolution":{"observed_at":"2026-08-03T20:57:30.540242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-03T10:49:58.803374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08758","last_updated":"2026-06-29T18:48:00Z","snapshot_observed_at":"2026-08-06T02:33:07.002390Z","submitted_at":"2026-01-13T17:42:27Z","title":"M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:49:58.803374Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2601.08758"},"observation_digest":"sha256:5a2bb5a622eeffec23f9a4e8c2b0c24a4d92c8be6511a4bfd890ecb6795edf6e","observation_id":"fc6636ce-071f-46a3-91a6-23c9f979f512","resolution":{"observed_at":"2026-08-03T10:49:58.803374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-02T20:19:15.127415Z","title":"CoRRabs/2403.12966(2024) 2, 4, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-04T03:41:58.938743Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:19:15.127415Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2602.23615"},"observation_digest":"sha256:140adffbe14cfa7dc1ec0ab71f0d48e71e5bf49ea4d0fc08f46bf72baefad39d","observation_id":"684c86e5-0d91-499a-85b5-0a00f9524f72","resolution":{"observed_at":"2026-08-02T20:19:15.127415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-13T16:55:20.099628Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27493","last_updated":"2026-06-06T05:46:49Z","snapshot_observed_at":"2026-08-05T12:08:07.856004Z","submitted_at":"2026-03-29T03:18:42Z","title":"Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T16:55:20.099628Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2603.27493"},"observation_digest":"sha256:a23cf2366d5d4b11084a9f8fc6d71fabfab9fe0cd91223ae8a3fbe2d569ec0c5","observation_id":"f45d257b-0d11-45a7-813b-85ed3811a840","resolution":{"observed_at":"2026-07-13T16:55:20.099628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2603.27494","last_updated":"2026-04-13T08:50:29Z","snapshot_observed_at":"2026-07-30T04:57:09.309756Z","submitted_at":"2026-03-29T03:18:57Z","title":"Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:35:12.859669Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2603.27494"},"observation_digest":"sha256:766fa9fd0c0c3f8829597ccb3ed887dd770ce11164257857ad7975465e3140d1","observation_id":"23e646b7-5992-4713-afa8-5cd784aa1b6c","resolution":{"observed_at":"2026-05-14T21:38:00.943697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2605.09146","last_updated":"2026-05-09T20:10:53Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:10:53Z","title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T02:58:46.728868Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2605.09146"},"observation_digest":"sha256:8bec5a1db3a885a1439489f7a967b0fa2a6cf8765abbc0bae6b2c6fb3588fb8b","observation_id":"a961c15c-59e3-4194-9a80-6740ef13ffcc","resolution":{"observed_at":"2026-05-12T03:01:18.293323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:004e58e6e617f6d38821a44d0c8a8c6663bce16fcd080fc69283ea90cc77f27f","observation_id":"12dd8a4c-9c84-456d-94f0-cd1823df109c","resolution":{"observed_at":"2026-05-20T10:58:13.393013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:7c90fd843fbb37ff142d34b65191a7878be51c64588ff3f75e4354e272b674a3","observation_id":"bbef1c4a-05ba-41c9-84bd-d1f8555e4ab0","resolution":{"observed_at":"2026-06-30T18:35:00.704886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-04T07:49:41.211792Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:2fe4197ca2a2a6e7ff2b8f265affe537aa5ec9d2e386930bf832b8057732e1f3","observation_id":"02bf47d2-71cf-4189-acf2-9dc74a589aea","resolution":{"observed_at":"2026-07-03T20:18:57.800982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2606.24118","last_updated":"2026-06-23T04:09:05Z","snapshot_observed_at":"2026-08-03T04:47:08.013790Z","submitted_at":"2026-06-23T04:09:05Z","title":"An LMM for Precisely Grounding Elements in Documents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T01:51:50.043216Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2606.24118"},"observation_digest":"sha256:f15772cbc4e467d15e53eb7123065262171406989f1f5ab37474d4207eea4372","observation_id":"6fec5a22-b305-436b-9315-e96dc9f8b8d2","resolution":{"observed_at":"2026-07-04T15:09:54.732696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2606.24292","last_updated":"2026-06-23T08:17:15Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:17:15Z","title":"ActiveScope: Actively Seeking and Correcting Perception for MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T01:06:40.481169Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2606.24292"},"observation_digest":"sha256:c1270b7cf6434b7c7b0679f587d7d4fc5492a005c10a6f7522dd0fe557706d9a","observation_id":"b6d50c90-17fe-415b-8956-ed10cf4791f2","resolution":{"observed_at":"2026-07-04T15:59:57.255666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:7c3e452c291b6f904fce519e967abd225af095a1b3ab0168a3af6965afccc3dc","observation_id":"b4d01059-1aac-4bd7-882c-e1b6a0ef5325","resolution":{"observed_at":"2026-07-04T15:09:55.117287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2403.12966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-04T15:59:57.253374Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":"1e0fb79e-bc12-467a-b0e7-f03abed7b006","year":2024},"citing_paper":{"arxiv_id":"2607.01191","last_updated":"2026-07-01T17:24:26Z","snapshot_observed_at":"2026-08-02T15:51:49.700376Z","submitted_at":"2026-07-01T17:24:26Z","title":"Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-02T13:24:17.538850Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2607.01191"},"observation_digest":"sha256:2399640cdcc4db36976c8e8e05bf6860a07ab0413b060b6201440b2b8c8f1e2d","observation_id":"4cf2e4d6-aaca-4331-a20f-c6aba144b36b","resolution":{"observed_at":"2026-07-02T13:26:58.461700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2403.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7133bca4eebd4138db1ddc5f88d9fb50e19501f3f13cf3599ca6567e7372216b","observation_id":"4a13e359-7a5d-4ebf-ba38-dea51b07c98f","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-02T06:18:15.882601Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16311","last_updated":"2026-07-14T16:45:02Z","snapshot_observed_at":"2026-08-02T06:18:04.185958Z","submitted_at":"2026-07-14T16:45:02Z","title":"Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T06:18:15.882601Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2607.16311"},"observation_digest":"sha256:a205a023fbd7c048cc245817d62be3b6a4076523e464f90e1f1e90f194b01ea3","observation_id":"125a6848-5382-4caa-adf9-477492677fed","resolution":{"observed_at":"2026-08-02T06:18:15.882601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-04T11:57:40.838682Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-06T07:17:28.014737Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.838682Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:7a55dbb6b17077c81e7c8c84d8801edbcdaca6da1313c7871e3fdc99bce80424","observation_id":"43170df6-d614-4c33-94f2-bfce8ce52198","resolution":{"observed_at":"2026-08-04T11:57:40.838682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.12966/citation-record","integrity":"/paper/2403.12966/integrity","json":"/paper/2403.12966/citation-record.json","paper":"/paper/2403.12966"},"outbound":[],"paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2403.12966."}