{"as_of":"2026-08-07T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5bfd2554ab4019f46ee09f0ddad3db4a397404ba589e630aff7bbe8deabd37d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:57.423394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:53.217043Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-07T11:54:57.423394Z","title":"Zhang, L., Xiong, Y ., Yang, Z., Casas, S., Hu, R., and Urtasun, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01182","last_updated":"2025-07-08T20:18:16Z","snapshot_observed_at":"2026-08-07T11:48:05.040455Z","submitted_at":"2025-06-01T21:33:36Z","title":"Humanoid World Models: Open World Foundation Models for Humanoid Robotics","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:57.423394Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2506.01182"},"observation_digest":"sha256:e9c66c313f524b96752cb53239772a8b867e28ee69510dbc7540a971f44544c1","observation_id":"c73c9ba7-c9ea-4e43-9e37-a0a8a497c1a9","resolution":{"observed_at":"2026-08-07T11:54:57.423394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2507.04227","last_updated":"2026-04-14T14:47:25Z","snapshot_observed_at":"2026-08-01T14:12:08.736574Z","submitted_at":"2025-07-06T03:31:36Z","title":"Mobile GUI Agents under Real-world Threats: Are We There Yet?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T06:57:25.257775Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.04227"},"observation_digest":"sha256:31adb94aa7a330fa17980865cce001040e50be10b710fc64a260aaa741d6df0e","observation_id":"ff4d8d66-ad65-4f5b-af4d-afbdd0c8c57c","resolution":{"observed_at":"2026-05-19T07:02:07.906593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T17:46:22.192112Z","title":"Vision-Language Models for Vision Tasks: A Survey , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10106","last_updated":"2025-07-14T09:45:34Z","snapshot_observed_at":"2026-08-07T07:18:38.132008Z","submitted_at":"2025-07-14T09:45:34Z","title":"BlueGlass: A Framework for Composite AI Safety","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T17:46:22.192112Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.10106"},"observation_digest":"sha256:60bd91600b05955204ffded67309c1bc0e5ec314328169ee7159c1899f45023c","observation_id":"3db49778-a5be-4ef0-a1c8-f7351c95ef90","resolution":{"observed_at":"2026-08-06T17:46:22.192112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T15:43:10.857101Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15285","last_updated":"2025-07-21T06:35:46Z","snapshot_observed_at":"2026-08-06T15:33:16.546956Z","submitted_at":"2025-07-21T06:35:46Z","title":"In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:10.857101Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2507.15285"},"observation_digest":"sha256:147321417d6e72266c7b19979890ceb1f866edbd117d1ee15dc400babdea26f8","observation_id":"1e779dc7-e67d-466b-a7b0-912ccd56bd2c","resolution":{"observed_at":"2026-08-06T15:43:10.857101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2508.08508","last_updated":"2025-08-18T04:59:14Z","snapshot_observed_at":"2026-07-06T22:11:33.173654Z","submitted_at":"2025-08-11T22:40:05Z","title":"Re:Verse -- Can Your VLM Read a Manga?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T23:14:25.088197Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2508.08508"},"observation_digest":"sha256:b6b931d596d26f2ba2db9e643f27b3d08fcfb8e31127f7325700253d67e52457","observation_id":"fc1f0fa0-6955-4ad4-8235-c919c200d8d5","resolution":{"observed_at":"2026-05-18T23:16:54.116669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T10:27:39.491216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-06T23:21:03.442673Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.491216Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:5a209242b79f2542907e29aa66359a814d209752a305ed188f9d9d4a067ad9dc","observation_id":"29a3e9b4-a2d3-46c1-80dc-c3f24e36a74e","resolution":{"observed_at":"2026-08-06T10:27:39.491216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-04T16:33:29.108092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12795","last_updated":"2026-06-01T08:46:33Z","snapshot_observed_at":"2026-08-04T16:33:19.031185Z","submitted_at":"2025-09-16T08:14:15Z","title":"When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T16:33:29.108092Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2509.12795"},"observation_digest":"sha256:74029dd0d3ec165a4d1ee06ce2f64a6d87801eea53a0e7e489c625450a6c4038","observation_id":"7bcb7bce-92b6-4178-9dc3-1075095b3b0c","resolution":{"observed_at":"2026-08-04T16:33:29.108092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-04T09:33:42.375221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.375221Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:1a1124f978a1ee72f27d9dee3a1eed1904b750beb5ec32562b6ecd09c692abda","observation_id":"06b7ccd8-d487-4846-ac50-b8239a562185","resolution":{"observed_at":"2026-08-04T09:33:42.375221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2605.20648","last_updated":"2026-05-20T03:09:41Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T03:09:41Z","title":"Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T05:10:49.673130Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2605.20648"},"observation_digest":"sha256:c90a7075a633735653c860dc9090d24b47e847eaa7b1ef1e5141599464cc0f89","observation_id":"a59938c4-8385-45a5-abbc-10bcb40fce8f","resolution":{"observed_at":"2026-05-21T05:13:58.585221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2606.26734","last_updated":"2026-06-26T22:08:10Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T08:16:42Z","title":"Robust Onion: Peeling Open Vocab Object Detectors Under Noise","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T05:33:25.373918Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2606.26734"},"observation_digest":"sha256:1d509548dc7e8a176282b13e522691aa4d705946104df09fe4d90bf04e0a7f1d","observation_id":"1d9724cc-0f04-4d66-a058-affd20e900ef","resolution":{"observed_at":"2026-07-04T12:59:53.218477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":"2304.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-07-04T12:59:53.217043Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ebd9eff0-bd05-4f1e-9e9b-9be42ef36ad7","year":2024},"citing_paper":{"arxiv_id":"2606.26734","last_updated":"2026-06-26T22:08:10Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T08:16:42Z","title":"Robust Onion: Peeling Open Vocab Object Detectors Under Noise","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T00:42:36.605869Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2606.26734"},"observation_digest":"sha256:44fb337d7c986d36a3fd4ff02301fe14646717db9905e36c54273afa4caf4758","observation_id":"1b779d3c-1858-4f7b-82bd-9cb8f7a7c7cb","resolution":{"observed_at":"2026-07-01T16:15:50.080203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-01T20:36:26.660978Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16582","last_updated":"2026-07-18T01:48:25Z","snapshot_observed_at":"2026-08-06T09:08:27.902543Z","submitted_at":"2026-07-18T01:48:25Z","title":"Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:36:26.660978Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2607.16582"},"observation_digest":"sha256:7357e281ad3200a7b1f614613709daa7a39d1a9105fd1f423f5c1ae893a04e8c","observation_id":"7ef60ee1-85ce-467f-a5df-44e7adf32d77","resolution":{"observed_at":"2026-08-01T20:36:26.660978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-01T13:26:30.037563Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19128","last_updated":"2026-07-21T14:18:25Z","snapshot_observed_at":"2026-08-01T13:26:25.581511Z","submitted_at":"2026-07-21T14:18:25Z","title":"One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T13:26:30.037563Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2607.19128"},"observation_digest":"sha256:f941394f455f11e9160aff957059afa4ae6547f8ac9135c811332e2bb95b438c","observation_id":"d85a81fc-c181-46ff-9174-878c230ffae3","resolution":{"observed_at":"2026-08-01T13:26:30.037563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.00685/citation-record","integrity":"/paper/2304.00685/integrity","json":"/paper/2304.00685/citation-record.json","paper":"/paper/2304.00685"},"outbound":[],"paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2304.00685."}