{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab0c71f72b35f6bd6ee4b53ad7e270a0f506bf16b96a48b28fc5faac70a9ddbd","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:14:26.501485Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00356/citation-record","integrity":"/paper/2508.00356/integrity","json":"/paper/2508.00356/citation-record.json","paper":"/paper/2508.00356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:27.078443Z","title":null,"venue":null,"work_id":"14e4200f-695c-4d3f-99ef-60d8dba8c7f8","year":null},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.383981Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:8510c2a1f62342659ce5091d20b4947be0c76c360f730095e3d9c56c9b942e7f","observation_id":"57c4ef17-6644-495a-a376-98a2eb7fe313","resolution":{"observed_at":"2026-08-06T10:14:27.083225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:27.062481Z","title":null,"venue":null,"work_id":"584ef81f-481c-4d8a-80e1-fb7c1f630828","year":2023},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.395786Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:0040a8c890a7d70fcc518393e7d851a635b37f31fc5ec7718aaea9c58513d74f","observation_id":"7c949231-5f48-44ea-9a23-e4db810e6bbd","resolution":{"observed_at":"2026-08-06T10:14:27.067450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05947","last_updated":"2023-05-10T07:39:14Z","snapshot_observed_at":"2026-08-06T13:36:02.600670Z","submitted_at":"2023-05-10T07:39:14Z","title":"iEdit: Localised Text-guided Image Editing with Weak Supervision","version":1},"cited_work":{"arxiv_id":"2305.05947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05947","snapshot_observed_at":"2026-08-06T10:14:26.949358Z","title":"iEdit: Localised Text-guided Image Editing with Weak Supervision","venue":"cs.CV","work_id":"863cc84c-7223-45c3-af60-b241fe202321","year":2023},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.400829Z"},"links":{"cited_paper":"/paper/2305.05947","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:05d3db7ad2305b2b58bf70e01bfa72f9f7a20408f4ff2a0f0bc11808d2e971ca","observation_id":"ec7a6b27-faeb-4549-9bc1-9262a518c81c","resolution":{"observed_at":"2026-08-06T10:14:26.955157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.11027","last_updated":"2020-05-05T09:13:24Z","snapshot_observed_at":"2026-08-08T05:33:42.283828Z","submitted_at":"2019-03-26T17:19:56Z","title":"nuScenes: A multimodal dataset for autonomous driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.11027","snapshot_observed_at":"2026-08-06T10:14:26.406143Z","title":"Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.406143Z"},"links":{"cited_paper":"/paper/1903.11027","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:b22a6905366baec094bd157b49be720f1748084b2221e3586e3e7d25062261c5","observation_id":"d3bdebc5-3888-494c-b572-a38bb4c572ba","resolution":{"observed_at":"2026-08-06T10:14:26.406143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00590","last_updated":"2022-03-28T02:42:56Z","snapshot_observed_at":"2026-07-06T11:43:31.430346Z","submitted_at":"2021-09-01T19:43:59Z","title":"WebQA: Multihop and Multimodal QA","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00590","snapshot_observed_at":"2026-08-06T10:14:26.411573Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.411573Z"},"links":{"cited_paper":"/paper/2109.00590","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:d24ddb02b5c019d885ffec3e33057a67f92e5fdce064f6cfba8c4b24d9aa16c3","observation_id":"8fc48e60-3e2c-482b-a6c0-e0198b28d2de","resolution":{"observed_at":"2026-08-06T10:14:26.411573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:27.046904Z","title":null,"venue":null,"work_id":"f6842c8e-3272-4a5a-8ec7-c9b3661993d1","year":2024},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.417685Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:f4b2b7de64d9e48c9719a30880a7ed76a734567e95d3ac910f767eda01c19fe9","observation_id":"718fb223-8954-4c7c-a9ed-14aa57031b23","resolution":{"observed_at":"2026-08-06T10:14:27.051742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04101","last_updated":"2019-11-14T01:19:36Z","snapshot_observed_at":"2026-08-06T13:36:04.298242Z","submitted_at":"2019-09-09T18:54:40Z","title":"Neural Naturalist: Generating Fine-Grained Image Comparisons","version":3},"cited_work":{"arxiv_id":"1909.04101","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.04101","snapshot_observed_at":"2026-08-06T10:14:26.894444Z","title":"Neural Naturalist: Generating Fine-Grained Image Comparisons","venue":"cs.CL","work_id":"0b83cf81-1ba2-4fa6-8ab1-542ff8c97324","year":2019},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.422530Z"},"links":{"cited_paper":"/paper/1909.04101","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:f7e4a7a2331b9c5e7c216fc53b38640c28bd234534d67f5bcb612cdfe658c66d","observation_id":"6a4d9f21-e11b-46b3-b594-55fede6f18aa","resolution":{"observed_at":"2026-08-06T10:14:26.900213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.646","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.550273Z","title":null,"venue":null,"work_id":"758fb4be-f400-4f74-91b5-4e0e42e916c5","year":2024},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.428676Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:6c9d76c5f54dedc26f055b5173a98d6e9f51d91f020965155e393a887bfb0ca8","observation_id":"bdc9d5da-fed6-44d1-9a24-02c2d089559a","resolution":{"observed_at":"2026-08-06T10:14:26.555105Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08218","last_updated":"2018-05-09T17:26:40Z","snapshot_observed_at":"2026-07-06T06:24:51.822169Z","submitted_at":"2018-02-22T18:16:53Z","title":"VizWiz Grand Challenge: Answering Visual Questions from Blind People","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08218","snapshot_observed_at":"2026-08-06T10:14:26.433842Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.433842Z"},"links":{"cited_paper":"/paper/1802.08218","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:7113b5a39a890dcd0ff808d54917a8207da48f7dd3b619ae2a4cfb0ebe4b19c5","observation_id":"f8835270-7cc0-44f3-b1a0-514a488701e8","resolution":{"observed_at":"2026-08-06T10:14:26.433842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.01311","last_updated":"2017-08-03T21:13:04Z","snapshot_observed_at":"2026-07-06T05:54:00.594408Z","submitted_at":"2017-08-03T21:13:04Z","title":"Automatic Spatially-aware Fashion Concept Discovery","version":1},"cited_work":{"arxiv_id":"1708.01311","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.01311","snapshot_observed_at":"2026-08-06T10:14:26.854436Z","title":"Automatic Spatially-aware Fashion Concept Discovery","venue":"cs.CV","work_id":"0d98c4f0-2e0f-4933-8057-d4931fdccc7b","year":2017},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.439127Z"},"links":{"cited_paper":"/paper/1708.01311","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:94a1a4e33857c2701e1fee12d95c1a19edafb2d118aec2ec35da54c3723cfedd","observation_id":"7afc94be-cd73-4ec8-bf06-3aedf9ce1de8","resolution":{"observed_at":"2026-08-06T10:14:26.859611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:27.031779Z","title":null,"venue":null,"work_id":"1e13dab2-6f09-4183-a2c6-c453587fa88e","year":2008},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.443906Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:fd8a320c5ad8f37d59ecc6c657efe1271c03b91d5e44cf299479d339e9c46b26","observation_id":"03f9712d-06cc-4790-b42b-3eb47d297715","resolution":{"observed_at":"2026-08-06T10:14:27.036541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:27.015629Z","title":"Lim, and Edward H","venue":null,"work_id":"6d20abd8-a60c-4b84-93be-1a093540f0e0","year":2015},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.448708Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:f6f65b961cfbd4ff904468d6dc8e50a0420f35a05d616d1a2701cc75a3cfa5af","observation_id":"61f18b4e-39f1-4953-8d1b-a49da1445d0f","resolution":{"observed_at":"2026-08-06T10:14:27.020400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.999409Z","title":null,"venue":null,"work_id":"73161f6b-18a1-4a70-a219-a2610fe87eec","year":2024},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.453408Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:ccf2c89d20e578cc3edd1e9f7eb5148acc1c24c6282f357556af073768eca8b4","observation_id":"eec49654-8b85-42c3-8c4d-56a1da1665ee","resolution":{"observed_at":"2026-08-06T10:14:27.004968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00232","last_updated":"2019-06-02T10:38:04Z","snapshot_observed_at":"2026-07-06T07:11:57.756712Z","submitted_at":"2018-11-01T05:10:44Z","title":"Textbook Question Answering with Multi-modal Context Graph Understanding and Self-supervised Open-set Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00232","snapshot_observed_at":"2026-08-06T10:14:26.457867Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.457867Z"},"links":{"cited_paper":"/paper/1811.00232","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:a8e2c4280610686ce37281a0e354e9e54292b008e573448c3d09deff8d1fbb79","observation_id":"8038a4a9-d55b-42fd-9584-5c218f8e5302","resolution":{"observed_at":"2026-08-06T10:14:26.457867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.290","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.532894Z","title":null,"venue":null,"work_id":"92684b74-d955-4cf3-be40-3a94bf7b169f","year":2022},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.462613Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:ab2be17edce049c7ba591f4afcada1acd6a01773a088921b76b21836e36b1829","observation_id":"0e01d4e9-522d-4e50-a6b0-fba0710f9d9e","resolution":{"observed_at":"2026-08-06T10:14:26.539249Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.982881Z","title":null,"venue":null,"work_id":"e5443d4d-505b-4d6f-964e-2c8a99b7d7e7","year":2024},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.467296Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:707f7e23eb5ca8f0af84715de80b33d54341ab9de7e79c9f7c53aac01c596074","observation_id":"43534105-71b5-4352-9c37-10cd104a6e2f","resolution":{"observed_at":"2026-08-06T10:14:26.988233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-07-06T09:34:24.643148Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-06T10:14:26.472521Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.472521Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:7e8a6ca9f4373f0fb918b7d6aa0d3a9df06ce54b6a01990c9724c92eedccfe09","observation_id":"b8386a33-20c2-4723-803b-f2ef52d0b13a","resolution":{"observed_at":"2026-08-06T10:14:26.472521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.478099Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.478099Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:c2634cedc6f4b535e6175d3466eeaaa79738c245eb1fd26ebe78a8da3ca0f018","observation_id":"4412677d-676f-48ff-98b2-2ff2f9f680b0","resolution":{"observed_at":"2026-08-06T10:14:26.478099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02527","last_updated":"2019-04-17T00:18:00Z","snapshot_observed_at":"2026-07-06T07:25:37.124965Z","submitted_at":"2019-01-08T21:29:42Z","title":"Robust Change Captioning","version":2},"cited_work":{"arxiv_id":"1901.02527","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.02527","snapshot_observed_at":"2026-08-06T10:14:26.715908Z","title":"Robust Change Captioning","venue":"cs.CV","work_id":"60996dd2-b7b0-46ec-a3e8-b163329e83f8","year":2019},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.482824Z"},"links":{"cited_paper":"/paper/1901.02527","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:408d665744a741a11526ee4bc61e26b3ee22a41048f3c5ac5bf0ac2c3bbc7ce9","observation_id":"22fbebb8-7b81-47b5-92da-e90b3b048edc","resolution":{"observed_at":"2026-08-06T10:14:26.721542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:14:26.487693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.487693Z"},"links":{"citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:39954db8862884aeda76f841690ee7b181ac33f20daeaa9b8b9a0128f4de69aa","observation_id":"d74dbec7-1fe0-4d7c-a424-92774c0d32e7","resolution":{"observed_at":"2026-08-06T10:14:26.487693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01485","last_updated":"2018-10-18T18:31:00Z","snapshot_observed_at":"2026-07-06T06:26:35.067161Z","submitted_at":"2018-03-05T03:43:20Z","title":"Totally Looks Like - How Humans Compare, Compared to Machines","version":3},"cited_work":{"arxiv_id":"1803.01485","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.01485","snapshot_observed_at":"2026-08-06T10:14:26.611311Z","title":"Totally Looks Like - How Humans Compare, Compared to Machines","venue":"cs.CV","work_id":"f771f0f1-a9c4-47bc-8153-67a3c948239b","year":2018},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.492057Z"},"links":{"cited_paper":"/paper/1803.01485","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:4bc77e325a94afa59285bf1aa041f62a62391f8665de1740744726f1a698175a","observation_id":"f6f0a749-f489-4708-9d49-0fffae55ef97","resolution":{"observed_at":"2026-08-06T10:14:26.617394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01734","last_updated":"2020-03-31T01:18:33Z","snapshot_observed_at":"2026-07-06T08:41:52.497343Z","submitted_at":"2019-12-03T23:18:59Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01734","snapshot_observed_at":"2026-08-06T10:14:26.496776Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.496776Z"},"links":{"cited_paper":"/paper/1912.01734","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:16b06898c882e225d1cc99d08a4d3daea97fc42639acb1516f8be72118644d4f","observation_id":"eca3f955-72b0-4d9c-875b-545a2c56042b","resolution":{"observed_at":"2026-08-06T10:14:26.496776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10411","last_updated":"2019-09-23T15:10:41Z","snapshot_observed_at":"2026-07-06T08:23:53.657345Z","submitted_at":"2019-09-23T15:10:41Z","title":"NLVR2 Visual Bias Analysis","version":1},"cited_work":{"arxiv_id":"1909.10411","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.10411","snapshot_observed_at":"2026-08-06T10:14:26.572008Z","title":"NLVR2 Visual Bias Analysis","venue":"cs.CL","work_id":"c85ded0d-93a6-4ab5-bae7-91a786137c05","year":2019},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.501485Z"},"links":{"cited_paper":"/paper/1909.10411","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:554ba09508b686d0fb27eec158a7e69c4f5a4b597e660847117fba2aab051e5b","observation_id":"64e5c2e6-8ee0-4e94-9298-2f298e1ed724","resolution":{"observed_at":"2026-08-06T10:14:26.577064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07890","last_updated":"2023-06-18T01:11:04Z","snapshot_observed_at":"2026-08-02T11:43:57.950672Z","submitted_at":"2023-06-13T16:31:02Z","title":"VISION Datasets: A Benchmark for Vision-based InduStrial InspectiON","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07890","snapshot_observed_at":"2026-08-06T10:14:26.389640Z","title":"arXiv:2306.07890 [cs.CV] https://arxiv.org/abs/2306.07890","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.389640Z"},"links":{"cited_paper":"/paper/2306.07890","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:b8d77a3880afc538d3e5d8683f314a320ca01da345311accf2c4ecfe8e368c2d","observation_id":"2c619c72-0063-459e-a0b1-8cc98d7fccc2","resolution":{"observed_at":"2026-08-06T10:14:26.389640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":7,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2508.00356."}