{"as_of":"2026-08-20T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a256bf40d496a0820c378dc4522e08b6c02d28d7afd5b52f087485aba88c05f","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:28:39.810901Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01370/citation-record","integrity":"/paper/2412.01370/integrity","json":"/paper/2412.01370/citation-record.json","paper":"/paper/2412.01370"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.003322Z","title":"Artemis: Affective language for visual art","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.003322Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:536fb4b6dd1d9142bc37c52220bbc917de764d9112423d0c8aad91faced32602","observation_id":"7ab34dd0-f126-446a-9a2e-6666b0b96ed3","resolution":{"observed_at":"2026-08-12T04:28:38.003322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.054864Z","title":"Feelingblue: A corpus for understanding the emotional con- notation of color in context.Transactions of the Association for Computational Linguistics, 11:176–190, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.054864Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:ead5495598e02956925fc8e7e096dc439f81a54f056b9f664eeb64c538a6c437","observation_id":"a559219f-0e2e-4a95-92b1-c3bc742964ff","resolution":{"observed_at":"2026-08-12T04:28:38.054864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.145741Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.145741Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:e50bfd65c5cc89e1dc7923b3ca1ca355c34ce96b8f2b9426626e9ae51813cee5","observation_id":"a32c6281-9c4d-4ce6-9854-f0f7ed3dc9aa","resolution":{"observed_at":"2026-08-12T04:28:38.145741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.150738Z","title":"Explain me the painting: Multi-topic knowledgeable art description gen- eration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.150738Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:f5be80a4d0ed01fb4f85f92bfb3ff13a521bcbfe6261f078e17fae5934ff0539","observation_id":"74832a63-777f-4fca-b59a-95b253eaf969","resolution":{"observed_at":"2026-08-12T04:28:38.150738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01690","last_updated":"2024-09-03T08:13:06Z","snapshot_observed_at":"2026-08-19T20:13:29.544028Z","submitted_at":"2024-09-03T08:13:06Z","title":"Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits","version":1},"cited_work":{"arxiv_id":"2409.01690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01690","snapshot_observed_at":"2026-08-12T04:28:40.365200Z","title":"Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits","venue":"cs.CV","work_id":"ed259be4-dbf0-4612-a1b3-e058dcb53463","year":2024},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.155517Z"},"links":{"cited_paper":"/paper/2409.01690","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:844bea9a778e80e7a2f082de7096b5de4d89a1a00037cb7d318b26927786399b","observation_id":"19fa2347-3eef-48e7-a2c2-1f85b6db6be8","resolution":{"observed_at":"2026-08-12T04:28:40.472696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.161415Z","title":"Bridg- ing the gap between object and image-level representations for open-vocabulary detection.Advances in Neural Informa- tion Processing Systems, 35:33781–33794, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.161415Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2be06ae216d447596bb3c08f0495f8cdd6396a72c8338c868d2a37c197b1f8e4","observation_id":"b79c97ce-f162-480e-8e25-1f1a355f36a8","resolution":{"observed_at":"2026-08-12T04:28:38.161415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.166687Z","title":"Clip retrieval: Easily compute clip embeddings and build a clip retrieval system with them.https : / / github","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.166687Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:422bd3cecac622ba9163cc8417093c8cf7cdd6b81b372c33896bb58c8dce7c45","observation_id":"d2a3c8a7-0c14-412d-8e15-50deef6273e0","resolution":{"observed_at":"2026-08-12T04:28:38.166687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.171052Z","title":"Viscounth: A large-scale multilin- gual visual question answering dataset for cultural heritage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.171052Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:236afdc1c403c7647ffaed57952e8a7f3f015c0d2a63bdeecfd2a68be14364c4","observation_id":"217bea4a-3900-4979-b31d-fe583452871a","resolution":{"observed_at":"2026-08-12T04:28:38.171052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.176728Z","title":"Predicting image aesthetics with deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.176728Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:02d07a3c39bea25a19fa0d8421f422e1e5d68e4496ff6e03d2fc809b816a2b64","observation_id":"968a67bb-7162-4c82-855b-8b34d7154f9c","resolution":{"observed_at":"2026-08-12T04:28:38.176728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.181314Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.181314Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:3544c4c5ec340e615608692f1d06c96e1f0d9e74993c2c65b40dd68db0967a2a","observation_id":"686e0b9d-99aa-4b79-8619-5920307db9ed","resolution":{"observed_at":"2026-08-12T04:28:38.181314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.233064Z","title":"Visual question answering for cul- tural heritage","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.233064Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:b8c19daa638608d9861ed166792283873c2a09cd5d4764d2b4811bec495a13f2","observation_id":"e287ec9c-024c-42f7-bbe0-239a78dbecc4","resolution":{"observed_at":"2026-08-12T04:28:38.233064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.318618Z","title":"Fine-tuning convolutional neural networks for fine art classification.Ex- pert Systems with Applications, 114:107–118, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.318618Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:4fd803ef0020214e839c5b222427b96bd2d04955c0128ee7484598bb0b74520c","observation_id":"a943caab-bd28-4bf6-b97e-9e6b98f24f67","resolution":{"observed_at":"2026-08-12T04:28:38.318618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.402518Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.402518Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:61851f8f7d89c75531cfc6553ca46fc24f5a5879291539e5a6a5470f7263637e","observation_id":"90f98f85-fceb-4b7b-8d52-d5e9a64d7d93","resolution":{"observed_at":"2026-08-12T04:28:38.402518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.423884Z","title":"Clip-art: Contrastive pre-training for fine-grained art classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.423884Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:cbd208737624ccb048f0712ca36eec48c57b9998ba8345961b6563c346dcfc9a","observation_id":"dd62fb5a-e778-4519-af9e-5bc7a3bf1f7d","resolution":{"observed_at":"2026-08-12T04:28:38.423884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.428640Z","title":"Learning sample difficulty from pre-trained models for reliable prediction.Advances in Neural Information Process- ing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.428640Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:f68e84d8208f91ae899ef11ac76d6178b435b3e5e2826e8730cab2e3acbf7997","observation_id":"993ed531-a51d-4f56-b838-f2b835c78e60","resolution":{"observed_at":"2026-08-12T04:28:38.428640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.433206Z","title":"Novel datasets for fine-grained image categoriza- tion","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.433206Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:ca88e726a32a653e9b0717acb4567c16e03e94ad53209a096cf2ab2a4a226d4b","observation_id":"45e79656-ab91-4148-8fd7-ecace7141253","resolution":{"observed_at":"2026-08-12T04:28:38.433206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.438200Z","title":"Noisyart: A dataset for webly-supervised art- work recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.438200Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:d04f61039aae4d6545316a699bf6f0abdec80a8496e7b6abe6ee5eafbd09697a","observation_id":"dc951444-420d-4949-908f-6d3910591cc0","resolution":{"observed_at":"2026-08-12T04:28:38.438200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.443109Z","title":"Webly-supervised zero-shot learning for artwork instance recognition.Pattern Recognition Letters, 128:420– 426, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.443109Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:464959cc8a8f4bdb2e55afd73f4e9d8deecf8faa5b72ee92d543b85bf05a417e","observation_id":"3e23ee05-b3d7-4684-a88d-373dbc491836","resolution":{"observed_at":"2026-08-12T04:28:38.443109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.448126Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.448126Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:043518955af0bd8cf4d170dd66541b39cccd8874619809bbf2360ed2923ebaa0","observation_id":"c87627a0-b92f-44e6-a460-ca8043706bd8","resolution":{"observed_at":"2026-08-12T04:28:38.448126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.452791Z","title":"Stytr2: Im- age style transfer with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.452791Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:8212707d9e7dd76cf841131c99fd24ff1a11cb15a1fc33e9300814048c93e47d","observation_id":"39835090-6393-42d0-a6f4-58b124e00f7b","resolution":{"observed_at":"2026-08-12T04:28:38.452791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.458317Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.458317Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:cca11207a8c9fa37b35830bf28589c790026cd0eb5b9adb7176002b18392a9f7","observation_id":"a5dd0a3b-ad59-40fd-869c-379dad4de782","resolution":{"observed_at":"2026-08-12T04:28:38.458317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.670777Z","title":"A survey on bias in visual datasets.Computer Vision and Image Understanding, 223: 103552, 2022","venue":null,"work_id":"0f935a6d-194e-4668-83ef-d6accaa61f21","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.462791Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:5059866eb021a5dd8ae6207798ee7a4ddce585f545e202da2488848d2d6b5b4e","observation_id":"ba65d43f-f6d0-4044-a369-8bacfcb9f522","resolution":{"observed_at":"2026-08-12T04:28:43.808497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.621283Z","title":"Are you talking to a machine? dataset and methods for multilingual image question.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"d7973dc1-0349-4d48-9457-1eec67567d3c","year":2015},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.525414Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:c5d93f22989582a7ff6fab83b4b867de008543f75f2c6664378c05a39efbdabf","observation_id":"d704fb76-e5b4-48f7-95a1-e172a16b8c4b","resolution":{"observed_at":"2026-08-12T04:28:43.625655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.605855Z","title":"How to read paintings: semantic art understanding with multi-modal retrieval","venue":null,"work_id":"abc8c68e-ee28-4e2f-961a-d51f85871838","year":2018},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.585444Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2be3980e960fce7912371d3f230f701e0878a1e2249f39cc244f3b425353665a","observation_id":"9dff17b3-abb8-4c4b-9996-d23ab488b45c","resolution":{"observed_at":"2026-08-12T04:28:43.611046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.588875Z","title":"Knowit vqa: Answering knowledge-based ques- tions about videos","venue":null,"work_id":"4dcdd5fc-42cf-4c47-82aa-38e15d5b0ddb","year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.642759Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:dc2bbdf83aa417f0a9041aaefddf9be569fcf8c368c18519e186eeb385dc84b2","observation_id":"37e29f7e-c594-4e44-b004-7ff0a3c51795","resolution":{"observed_at":"2026-08-12T04:28:43.594896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.459041Z","title":"A dataset and baselines for visual question answering on art","venue":null,"work_id":"7873b920-d58d-4119-bf27-8c74858ec6ff","year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.647582Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:e9da5811352755b34cac36abae7cb7cd10b26e08398944c3b28437dc8597ea22","observation_id":"93fc2cf7-a3cf-4e9e-9e18-10fcfd7a18e8","resolution":{"observed_at":"2026-08-12T04:28:43.547921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.415430Z","title":"A dataset and baselines for visual question answering on art","venue":null,"work_id":"69f787f6-a9c0-48e9-906b-51c8a85df8a6","year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.652677Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:614c0908b1072be7b834900b20069b0f81cd6f96060d921cf23d579c835f5197","observation_id":"0aa7eadb-4c48-4b01-8426-e79ec7ed97f1","resolution":{"observed_at":"2026-08-12T04:28:43.421716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.656505Z","title":"Im- age style transfer using convolutional neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.656505Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:814c9c46f80b09c713b2a3398e5aaffe4ae0d6cfe03ea554c9afcc0de8b53575","observation_id":"ba39c09d-9e5d-43fb-92dd-f939e800650e","resolution":{"observed_at":"2026-08-12T04:28:38.656505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.389642Z","title":"Aes- thetic image captioning from weakly-labelled photographs","venue":null,"work_id":"1a694e6d-d6e3-467d-a9e6-df870f829aad","year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.660234Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:65888086f686f9321e4dc0b581b26bae50bfc95806f1157bd3b52f701f3543cc","observation_id":"bd7ee42a-0928-46e3-976c-8a75fbd95d3d","resolution":{"observed_at":"2026-08-12T04:28:43.394999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.304081Z","title":"Beyond language bias: Over- coming multimodal shortcut and distribution biases for ro- bust visual question answering","venue":null,"work_id":"e37eef12-2e50-4c47-99eb-07c0bbeda059","year":2024},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.664520Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2a9777cd91f1994a79a36bf6c4efe0897e99811b82a6b559a04f6deb2e6958b6","observation_id":"73516bb5-921b-4289-be5d-a6e62b090371","resolution":{"observed_at":"2026-08-12T04:28:43.378533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-12T04:28:38.668359Z","title":"Open-vocabulary object detection via vision and language knowledge distillation.arXiv preprint arXiv:2104.13921,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.668359Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:0026d1523c169dc870ae39d8b365ab328ee87ac79bc48547b9a1ccd3b5b2483f","observation_id":"b4a5b2ae-22b6-481f-a7b0-5a8031636e2c","resolution":{"observed_at":"2026-08-12T04:28:38.668359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.215454Z","title":"Many- modalqa: Modality disambiguation and qa over diverse in- puts","venue":null,"work_id":"c779b849-9c03-453f-b2e2-526905a086a6","year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.673304Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:bbdb2d8a9aa9a8ad7e3d75a12d0cee64379ad029d031d1f815690494cb4cb545","observation_id":"f4d8dea0-41d4-4287-a82d-315618f7e9ca","resolution":{"observed_at":"2026-08-12T04:28:43.247869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.677467Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.677467Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:a82a48bcc294e4d91403a68c718c9f64a90433037b93ac2e29ef690872aafd1a","observation_id":"1e2af5e0-222f-4f25-bbba-534691a917ab","resolution":{"observed_at":"2026-08-12T04:28:38.677467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.681754Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.681754Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:10fe8d4d702c1c751bcca64dc286083d2a3814f32cdf468785b6af92371090e5","observation_id":"f9ac5b94-5043-4e0c-81d4-d2127b34d9d7","resolution":{"observed_at":"2026-08-12T04:28:38.681754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.181406Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"0fcd9ed6-443a-450f-bd98-3296392dcc53","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.689495Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:e03ae456e8588d95b7ee0f242a6cd065ce74bd378536158cc14917efaeb7b753","observation_id":"014e6e6c-03ae-4007-be21-1b55ee5b5f38","resolution":{"observed_at":"2026-08-12T04:28:43.186286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-15T22:53:17.165603Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-12T04:28:38.693551Z","title":"Fig- ureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.693551Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:eabdbc7d50f02176c5f1c521010116ab0262bda99b256ee69a9b8c7f5b0a8df5","observation_id":"56a5d640-b34e-4d6f-9d64-48d150e4c2b6","resolution":{"observed_at":"2026-08-12T04:28:38.693551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.164786Z","title":"Mdetr- modulated detection for end-to-end multi-modal understand- ing","venue":null,"work_id":"48798f01-62f7-4aae-8ba1-807a0e056009","year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.751828Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:0c07119aea217f2da9620d583d130aeda69e5921c9b147e41f41b6f2674b87e9","observation_id":"91a5111b-56c1-408a-b851-afc328280b05","resolution":{"observed_at":"2026-08-12T04:28:43.169881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:43.024132Z","title":"From word embeddings to document distances","venue":null,"work_id":"6c991802-ca5c-402d-af0f-7f52dd429e11","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.844763Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:844df03dc789feae275c9da0d6bc375c39460e45f45cde32a55fb35b9acad687","observation_id":"e9ad3cc9-660a-4927-9144-b1305de58ffc","resolution":{"observed_at":"2026-08-12T04:28:43.066016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.910429Z","title":"Clipstyler: Image style transfer with a single text condition","venue":null,"work_id":"de8ec1a2-a54d-4111-b272-7d1def9a070b","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.883392Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:d102dd999dff8ec5e340d0f397346c2498f8a25fb85b4175cfb1e0d73d9e5b55","observation_id":"f243837c-0604-4e8e-8bc2-d85da5c838bb","resolution":{"observed_at":"2026-08-12T04:28:42.938721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.894763Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"cb7d74d9-f6aa-4905-bd82-d1ab3f4179d7","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.888272Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:3936dafeb5a3972a8ee68e0f044c3a002aaca76fd3d9d59a6658833324a29307","observation_id":"a4071822-4b8d-42fe-8d76-44e138dbacfa","resolution":{"observed_at":"2026-08-12T04:28:42.899404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-12T04:28:38.892694Z","title":"Weinberger, Serge J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.892694Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:3d870511352124c1bc7a8305cb7f8241fdcf01ccd5101d128bf7dcba761039c9","observation_id":"354d88fa-3e2b-4e3a-b2e8-9ba7caf022bc","resolution":{"observed_at":"2026-08-12T04:28:38.892694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.877553Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"5e57626c-2552-4af0-a0b7-48ba536b518a","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.897377Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:777549634121e9b1f842cbea3382663b05e1f604cdc1a059a5d80f1e00b6a366","observation_id":"6c046909-4675-4dbd-aa31-1c2964475703","resolution":{"observed_at":"2026-08-12T04:28:42.883668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-12T04:28:38.901539Z","title":"Visualbert: A simple and perfor- mant baseline for vision and language.arXiv preprint arXiv:1908.03557, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.901539Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:c281fa343745f4f3ad610d49cd102b8e69bcc58e04c5b205ced719047fb91388","observation_id":"9753162f-58c1-49f5-b48e-d55cf528f2d4","resolution":{"observed_at":"2026-08-12T04:28:38.901539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.906247Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.906247Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:bb143b1deb3ff1adf11e7285f6510c65f7873e405e68c21c564953117bbd8eba","observation_id":"e9c55e5e-e360-4186-b272-66c623722a76","resolution":{"observed_at":"2026-08-12T04:28:38.906247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:38.910224Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.910224Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:5d325bee737cb8df5bd793923a4f080beac084712bfb601ea033e6bb2944fa97","observation_id":"668da33f-32df-46d9-9636-97f15eca9a50","resolution":{"observed_at":"2026-08-12T04:28:38.910224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.812607Z","title":"Fine-grained late-interaction multi-modal retrieval for retrieval augmented visual question answering","venue":null,"work_id":"ee80ae54-e8ae-43a9-9a3f-55d7fe3ba244","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.914415Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:14d9a2412d98787da0bb861a1a081f3a733dc0650c23555857fb8bda0eea5c94","observation_id":"acf6eea0-eca4-4a60-8565-670eac19241c","resolution":{"observed_at":"2026-08-12T04:28:42.844970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.654219Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"ddc952ce-b71c-404d-9837-b7d2539236c9","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.918582Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:a70dd3d17b34ec3492216ad0a455120c2a4b0cc2d6a8d2cdf054b2c70d8f59ab","observation_id":"098a63f3-b619-4544-9194-ea597e1a9687","resolution":{"observed_at":"2026-08-12T04:28:42.717687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T04:28:38.956848Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:38.956848Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:0356742e526fd26f5713bdf74947f03241d3c4838f5e1a366ebaa74bf84eec4a","observation_id":"c81f9129-ed1e-4b7d-a392-f2eea8294171","resolution":{"observed_at":"2026-08-12T04:28:38.956848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.001582Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.001582Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:dc5ee44e91ede16a5ffdc819feee4e603c730a730fd488ae8fe25c93e6e0fa32","observation_id":"003cb9a8-bf1f-47de-a4f8-cd0c19128723","resolution":{"observed_at":"2026-08-12T04:28:39.001582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.629050Z","title":"Data- efficient image captioning of fine art paintings via virtual- real semantic alignment training.Neurocomputing, 490:163– 180, 2022","venue":null,"work_id":"c728be3f-8596-4968-a909-0d1b458a49b6","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.068238Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:ace7f3066d59aa1bb317eb6f5e8c018a3f3640f05fd4e03c8b7cab90bfc9a555","observation_id":"8cbcad21-eaf7-44e9-8c4d-a5ae0d4fd08e","resolution":{"observed_at":"2026-08-12T04:28:42.635288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.613987Z","title":"Class-agnostic object detection with multi- modal transformer","venue":null,"work_id":"bd25e516-f501-4727-aca6-b7622b8c857a","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.090766Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:7e8e523b87801f580eeb0fd2f80485f470e39609e2963ecdbd2fc6128c596292","observation_id":"6cdcf8fc-e786-4aae-83d4-5b6c3ff86082","resolution":{"observed_at":"2026-08-12T04:28:42.618986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-12T04:28:39.096188Z","title":"Fine-grained visual classi- fication of aircraft.arXiv preprint arXiv:1306.5151, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.096188Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:9c43d9f55f687d792c6324b51ae3c9d8821f069a0ed145ba8a7fe9f20f71d73d","observation_id":"cbfab324-7c10-42f4-b27a-7158d197c08a","resolution":{"observed_at":"2026-08-12T04:28:39.096188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.598917Z","title":"A multi-world ap- proach to question answering about real-world scenes based on uncertain input.Advances in neural information process- ing systems, 27, 2014","venue":null,"work_id":"714a4654-9298-4de3-ab4e-b60772cdb4ef","year":2014},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.100756Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:fec9ba741ac49dadf8d665a2e9145d73befb190f7176c7b314c3edeea3c7a461","observation_id":"0748b918-e7fc-4108-9cd0-4ce397e63939","resolution":{"observed_at":"2026-08-12T04:28:42.603957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.583671Z","title":"Ask your neurons: A neural-based approach to answering questions about images","venue":null,"work_id":"d2a015ed-189d-4467-87f1-ddf0044f91cc","year":2015},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.105087Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:1a0b4bee112d9a5c1e73b5e0f4effed98bad37b8b59262dae7da333e2ab96738","observation_id":"e6246572-4564-4010-9ec5-c189df868763","resolution":{"observed_at":"2026-08-12T04:28:42.588756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.522766Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"f0f14b38-56c7-42cb-bd4f-dbf31cc0115a","year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.109382Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:4d57e2a4e2c052c65c21eb80379d2938d76f705cfca6d0de3d2ac856c6af120e","observation_id":"3c9a29dc-8cc1-4c7a-81d1-7531986fefe4","resolution":{"observed_at":"2026-08-12T04:28:42.573678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.328745Z","title":"Taylor & Francis, 2008","venue":null,"work_id":"0cef30ff-42ed-47f6-8ccb-d622de595c3e","year":2008},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.113376Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:15740b940f4d8a5ab8e65347d9f99838db50c09d6c33edfa91794a1fc698166b","observation_id":"eb64fad0-9d73-4b02-86f3-debbafd07243","resolution":{"observed_at":"2026-08-12T04:28:42.425263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06262","last_updated":"2023-08-11T17:54:44Z","snapshot_observed_at":"2026-08-16T15:09:03.318385Z","submitted_at":"2023-08-11T17:54:44Z","title":"Foundation Model is Efficient Multimodal Multitask Model Selector","version":1},"cited_work":{"arxiv_id":"2308.06262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06262","snapshot_observed_at":"2026-08-12T04:28:40.125211Z","title":"Foundation Model is Efficient Multimodal Multitask Model Selector","venue":"cs.LG","work_id":"5c374d00-56d0-4259-a1de-a96bd7a5c398","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.117862Z"},"links":{"cited_paper":"/paper/2308.06262","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:d2996804d7a3e2b026a66a8465d85302ac8d8fd77f79265ca1ab18490ccac3b5","observation_id":"a19689f0-cd54-4a7e-abc3-667faf400d9a","resolution":{"observed_at":"2026-08-12T04:28:40.216299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.313540Z","title":"The rijksmuseum challenge: Museum-centered visual recognition","venue":null,"work_id":"2625d7c5-d1c5-4823-bc3e-8ad54500f387","year":2014},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.123393Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:3df37a95252f15bc721231f325910a306c85efe59f094b22ac7dff50c6cf8717","observation_id":"f9aafe1e-cd7c-4ad7-b6d2-8e9df7233284","resolution":{"observed_at":"2026-08-12T04:28:42.318571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.296336Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"bd17f1ba-62bf-445c-afe3-0ea1a05971f2","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.127890Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:ad18096bd4e2c9877e1740d2c21d35a93d2630a3a7bd7961cb2663bb26a1521a","observation_id":"b784edc1-0dd0-4ff1-a425-551c1f242782","resolution":{"observed_at":"2026-08-12T04:28:42.302337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.279335Z","title":"A dataset and a con- volutional model for iconography classification in paintings","venue":null,"work_id":"a2b9c0a6-a092-4729-b952-81d3f6cc0cf8","year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.132310Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:4eb1f4a5d12a4d9207296c2c98add653ce6443a0bbaadbbb9523e0e7dcf69bb3","observation_id":"26c6844f-aa70-497a-9df4-85d53dd1cb30","resolution":{"observed_at":"2026-08-12T04:28:42.285300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:42.160046Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"03dbe5a1-aff0-4baa-9e0f-056c29930189","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.167324Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:81a899a42d397c77995e315e880d7850454cf7e46f4da7a3ae61802b0cd33ec4","observation_id":"51c3790b-0b65-4663-b441-bc3ac2f5e2e5","resolution":{"observed_at":"2026-08-12T04:28:42.267591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.968792Z","title":"A survey of geospatial semantic web for cultural heritage","venue":null,"work_id":"446b41bf-0c20-441d-bf0e-d822b47a440e","year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.222939Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:236ee24b291a5f2355b7a87d3b088f829936565c37a628bcb839a6e4294df47c","observation_id":"8b3dc484-7cf8-4189-9d71-02bb7a0dd433","resolution":{"observed_at":"2026-08-12T04:28:42.072177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.951674Z","title":"Suppressing biased samples for robust vqa.IEEE Transactions on Multimedia, 24:3405– 3415, 2021","venue":null,"work_id":"9e7a997f-56fd-4c13-b38b-c92bef2d2247","year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.285954Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:f9d048a02d7c8f3c19844d9969eb3ab64cd92e5a7e01886e38edbea320756687","observation_id":"7482a97c-7bc9-4211-b6ac-3a571966d964","resolution":{"observed_at":"2026-08-12T04:28:41.957607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.936666Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"cf10a72f-d054-4907-84db-9dc9dc8153e5","year":2002},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.314365Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:69ca5c74f3038a65534e14917cf7d81a184e5d06af12ec02fb975bb41f030848","observation_id":"dc5d31ef-e9c6-4d4b-9511-18ae44cab577","resolution":{"observed_at":"2026-08-12T04:28:41.941560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.874939Z","title":"Combined scal- ing for zero-shot transfer learning.Neurocomputing, 555: 126658, 2023","venue":null,"work_id":"41c76e77-5f2e-4ab5-8785-ce00ff4dc598","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.319230Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:cefa7ece7a866b434a88932aae603f2997b0522f9c8c76777476877b38a2782d","observation_id":"b795c7f2-ee04-4d8e-a045-5abfd8ee07a3","resolution":{"observed_at":"2026-08-12T04:28:41.925823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.324548Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.324548Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:523f8165f7b8f098c3e0b14a46ef1dbdcd8984b3078a9e8181627942bf682331","observation_id":"b3ce181e-f90d-4a03-993e-6941ebef5c9b","resolution":{"observed_at":"2026-08-12T04:28:39.324548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.330273Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.330273Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:a87735ce85be8d0b8afe733a725223c2606c540ad5a5a9a33e7bf254188a4501","observation_id":"3393842a-f175-4673-bf18-b1edf5d1071e","resolution":{"observed_at":"2026-08-12T04:28:39.330273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.724769Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"17c7cc90-c924-4586-a5dd-8f5a2e6bf5f1","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.334548Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:9841f16628c4ea874a9e1a85ce20af5af767247f8f7aaf8074a93dc724006357","observation_id":"74699bd3-f761-4f52-9766-8131ff3b5a6e","resolution":{"observed_at":"2026-08-12T04:28:41.730928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.708723Z","title":"Stylebabel: Artistic style tag- ging and captioning","venue":null,"work_id":"038c6c1a-9d4c-439d-bef1-fe4d9987759b","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.339012Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:85e534b16a64c3264a74d72795c770c9e8ae33ae3dca754980e55f30c4b0a3d7","observation_id":"dee15f97-4987-4f51-a781-fd26ff89b7d8","resolution":{"observed_at":"2026-08-12T04:28:41.713807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.670850Z","title":"Viske: Visual knowledge extraction and question answering by visual verification of relation phrases","venue":null,"work_id":"2f182f4c-18c9-4d70-8432-43c492b06931","year":2015},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.343060Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:b7a19b419252cca1025c7342b7e3f9eb43e2b3d6257a0beeb08235c0176f4396","observation_id":"c979b1ca-624e-4080-8416-cca8ccfa4758","resolution":{"observed_at":"2026-08-12T04:28:41.698238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.512285Z","title":"A dataset for multimodal question answering in the cultural heritage domain","venue":null,"work_id":"281c2600-a4c3-45ed-9696-ab6f789ce2fa","year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.347348Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:21f0549fca31c0b66a2930569f7591908d3cf95c3ce13bc20fa381cad426ffcf","observation_id":"c7124083-46a9-4827-bd99-77b995396922","resolution":{"observed_at":"2026-08-12T04:28:41.559034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.351442Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.351442Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:59d296bd8e5a93dcd8468cade4291298f55225392b2a4f7aafe0a5a468d97c6e","observation_id":"e259545d-07a7-4e8d-b1c1-de2dc9a6d980","resolution":{"observed_at":"2026-08-12T04:28:39.351442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.355265Z","title":"Bioclip: A vision foundation model for the tree of life","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.355265Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:03381eaacc4b637765e88574596a6914c87a335233196206c376438e7bcfc91e","observation_id":"d8483041-520a-4f3e-835b-c6508cc17e72","resolution":{"observed_at":"2026-08-12T04:28:39.355265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.379494Z","title":"Omniart: a large- scale artistic benchmark.ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM), 14 (4):1–21, 2018","venue":null,"work_id":"d3ee1a91-942e-4bcf-86ab-9ff02f472145","year":2018},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.360221Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:8e03efc801df1cfe8a2c2dea5620b20444694a82b296bd3a73a55466fe42168b","observation_id":"bba0832d-4e52-4df3-b4e9-8017004c2042","resolution":{"observed_at":"2026-08-12T04:28:41.384474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06039","last_updated":"2021-04-13T09:14:28Z","snapshot_observed_at":"2026-08-16T18:32:00.582791Z","submitted_at":"2021-04-13T09:14:28Z","title":"MultiModalQA: Complex Question Answering over Text, Tables and Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06039","snapshot_observed_at":"2026-08-12T04:28:39.364514Z","title":"Multimodalqa: Complex question answering over text, tables and images.arXiv preprint arXiv:2104.06039, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.364514Z"},"links":{"cited_paper":"/paper/2104.06039","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:081771ae147b8d78d5cf3f8d6eb863f4143cddd942e49599774346a1387374c1","observation_id":"a9614f6d-52ae-4f24-bfa0-b516f6e0cca1","resolution":{"observed_at":"2026-08-12T04:28:39.364514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.225359Z","title":"Ceci n’est pas une pipe: A deep convo- lutional network for fine-art paintings classification","venue":null,"work_id":"279bfd1b-cc66-4c49-b649-d7dc2f43858e","year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.369035Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:20ba804b04ad6e69c8527a4f7659d15cea2a82d9f81a5b3beb8e65b715fd681c","observation_id":"c06e7cdc-e446-442e-b6e8-a092dee5fe18","resolution":{"observed_at":"2026-08-12T04:28:41.291712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T04:28:39.373214Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.373214Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:545eedac7bbaef63c0d076276514c0273610c0472865a169199963413f694c34","observation_id":"cd9533cc-20c9-4381-b957-369923c57141","resolution":{"observed_at":"2026-08-12T04:28:39.373214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.173830Z","title":"The caltech-ucsd birds-200–2011 dataset","venue":null,"work_id":"599e170c-0040-4425-a783-ee642d80bbb5","year":2011},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.377956Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:265c1a26b6235523c1bc061cd1fd803f101a771a14931475741fcb2a37db8dd7","observation_id":"f73830ac-b551-4adf-b5fa-53ed64e0ebd8","resolution":{"observed_at":"2026-08-12T04:28:41.178391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-12T04:28:39.410964Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.410964Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:d7394bdd7816ef030e482764da9be91474e7dc4195bc303437d82f22014bda5a","observation_id":"9dbba161-2b99-46c5-a7e2-96ae1cca3792","resolution":{"observed_at":"2026-08-12T04:28:39.410964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.02570","last_updated":"2015-11-12T01:10:38Z","snapshot_observed_at":"2026-08-14T22:24:18.672290Z","submitted_at":"2015-11-09T05:25:57Z","title":"Explicit Knowledge-based Reasoning for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.02570","snapshot_observed_at":"2026-08-12T04:28:39.481628Z","title":"Explicit knowledge-based rea- soning for visual question answering.arXiv preprint arXiv:1511.02570, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.481628Z"},"links":{"cited_paper":"/paper/1511.02570","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2343ba13813aed484c458f157368e756e030c7076774a65988ac37f7a77bdf8e","observation_id":"3abc7c45-00ef-4af2-a55a-71ade113b9d1","resolution":{"observed_at":"2026-08-12T04:28:39.481628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.157057Z","title":"Fvqa: Fact-based visual question an- swering.IEEE transactions on pattern analysis and machine intelligence, 40(10):2413–2427, 2017","venue":null,"work_id":"b52c841f-6964-4eba-90ea-ae7b3141cf61","year":2017},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.508493Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:f83e121120d237a7c825366409634a1b1ff7be3a5c58980cffa7e63a9f01695d","observation_id":"d5deeac1-c870-458c-aa33-2d7f6d327429","resolution":{"observed_at":"2026-08-12T04:28:41.162644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-16T16:23:03.490700Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-12T04:28:39.513298Z","title":"Medclip: Contrastive learning from unpaired medical images and text.arXiv preprint arXiv:2210.10163, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.513298Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:f535e48da73f32f593deeb46d2f9aba4994d75297dd8a4d8944eb9e63d370857","observation_id":"d8ad7152-db21-408c-8a55-867df9072f73","resolution":{"observed_at":"2026-08-12T04:28:39.513298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.141055Z","title":"Im- proving clip fine-tuning performance","venue":null,"work_id":"92b5f85b-10e0-4910-b6ca-27b3da4a0a39","year":2023},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.519200Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:916830bbab6f908cdf2d3e8237475d7ac802d5d067d235369c4210608b8f0c44","observation_id":"bde93852-87da-444a-9af4-350c3fbebaab","resolution":{"observed_at":"2026-08-12T04:28:41.145829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.125668Z","title":"Bam! the behance artistic media dataset for recognition beyond photography","venue":null,"work_id":"2aa87eff-3037-4d20-a1d9-ddf4257b3a61","year":2017},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.524116Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:17b28b093fe459d873c0bdabc96b1f3c39981e7aeae965af0f21bb7c30ea3fee","observation_id":"3e1bf36c-3379-4ffa-80aa-57ff33191ce3","resolution":{"observed_at":"2026-08-12T04:28:41.130513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:41.110789Z","title":"Ask me anything: Free-form vi- sual question answering based on knowledge from external sources","venue":null,"work_id":"80929912-a402-4ebf-bf72-bb3ac2b45fbf","year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.528325Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:d61ee6b652af012116d289792c330a0a069deaf86eabdb524d4d4047fa2970af","observation_id":"ad4bd166-652f-48e3-a8b3-01743e97da80","resolution":{"observed_at":"2026-08-12T04:28:41.115755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08531","last_updated":"2021-11-16T15:01:24Z","snapshot_observed_at":"2026-08-17T09:41:53.647643Z","submitted_at":"2021-11-16T15:01:24Z","title":"Language bias in Visual Question Answering: A Survey and Taxonomy","version":1},"cited_work":{"arxiv_id":"2111.08531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08531","snapshot_observed_at":"2026-08-12T04:28:40.031579Z","title":"Language bias in Visual Question Answering: A Survey and Taxonomy","venue":"cs.CV","work_id":"fbde439e-29e0-408e-b147-3a76d9fc4167","year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.532262Z"},"links":{"cited_paper":"/paper/2111.08531","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:7fbff0e3724dada7bebee7af51dd016ea57106aeb76bfd3910d8b12acf9f8608","observation_id":"c61d608d-9033-4403-bef2-4b8ff3d2fab9","resolution":{"observed_at":"2026-08-12T04:28:40.036189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.912618Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"f2a3c1e5-9803-4f4b-ba72-66ad2599ccab","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.537077Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:069a3ba8baf20731b9f822b609263e0a2cc3850df9ff559986d59ade9d71691a","observation_id":"9481fe34-7874-4896-803e-f8985656b4b9","resolution":{"observed_at":"2026-08-12T04:28:41.049754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00901","last_updated":"2019-06-04T02:37:29Z","snapshot_observed_at":"2026-08-14T16:21:45.634753Z","submitted_at":"2019-06-03T16:10:14Z","title":"The iMet Collection 2019 Challenge Dataset","version":2},"cited_work":{"arxiv_id":"1906.00901","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00901","snapshot_observed_at":"2026-08-12T04:28:39.877896Z","title":"The iMet Collection 2019 Challenge Dataset","venue":"cs.CV","work_id":"4d5fcc03-37d6-468b-9f69-470ab3ec71e4","year":2019},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.541446Z"},"links":{"cited_paper":"/paper/1906.00901","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:69a93dce521a22d7b603e91734bf7279f9480d66c1be541d6bbec4d5bcce3c15","observation_id":"6333fb85-8626-4a9a-b17e-2f6f341026e1","resolution":{"observed_at":"2026-08-12T04:28:39.948829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-08-18T14:02:33.902650Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-12T04:28:39.545705Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling.arXiv preprint arXiv:2111.03930, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.545705Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:6ea9179d424a36e2db2a6bc52094afc25385ae9d81bb24989fb8d64fec7883e6","observation_id":"6f322d1f-f461-4a98-a33e-59c7ec488409","resolution":{"observed_at":"2026-08-12T04:28:39.545705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.897390Z","title":"Extract free dense labels from clip","venue":null,"work_id":"61bdc015-b946-486c-b1e9-092eaebd896c","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.622118Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:989d4dafaca5cb29c57e8836c2c43dfbdbd3db9a35efb2abf2502aeff1ab4377","observation_id":"0795a025-0709-4b0d-a524-20aa8616c062","resolution":{"observed_at":"2026-08-12T04:28:40.902216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.722009Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.722009Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:5c031bf693b8d9f3cad0f6c715e567038f535a60f853c7e43cd10fd9f084ba84","observation_id":"f0398813-e35d-4c93-a692-fdfb94ee4b49","resolution":{"observed_at":"2026-08-12T04:28:39.722009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:39.774502Z","title":"Learning to prompt for vision-language models.In- ternational Journal of Computer Vision, 130(9):2337–2348,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.774502Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:df2effcaa06fbc721bc1e14a55d3d68cf82f43cdf7fd3afca1d9f4478558c014","observation_id":"80673caf-d90d-4d30-a895-4da7219100f5","resolution":{"observed_at":"2026-08-12T04:28:39.774502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.863218Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"e8bf6898-36eb-4f0b-bcad-a0b408ddd948","year":2022},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.778885Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:0d227a6b1bb09ebf849c1abe7c40f86a5ca807f3e3ecfb4e43847036418d9f2a","observation_id":"7af21584-2ef2-4c9b-88e2-43a4b8a837ac","resolution":{"observed_at":"2026-08-12T04:28:40.867945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.847645Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"bebe2383-9938-4cbf-acba-4cfe66b5f2ef","year":2016},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.783992Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:1725fe1c4158b0cfd0dc4237c9880af04498a3eeefd9ec6275e5a33171dcb7aa","observation_id":"76d54b7f-72ef-45a1-a906-56d441fc0fe2","resolution":{"observed_at":"2026-08-12T04:28:40.853371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-12T04:28:39.788524Z","title":"Who is the artist of the object?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.788524Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2d98c03b01e285e719b3bafd87cdab7d04bbaaf16aeab68ae49b6a7a69649037","observation_id":"8433939e-def4-4455-b368-f57453b87aea","resolution":{"observed_at":"2026-08-12T04:28:39.788524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.629532Z","title":"• These aggregators provide access to extensive digitized collections from major museums across Europe and America and offer structured data through platform- specific APIs","venue":null,"work_id":"c37c4a2a-556e-403b-993b-746d3bfc6aec","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.793770Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:59deb834bbf46a42b46ea4f02840c3edf861bbd0faf10bb93acc65e25a548b46","observation_id":"9e1d174e-af6e-49ce-ba92-ccce016abe46","resolution":{"observed_at":"2026-08-12T04:28:40.751013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.614267Z","title":"Curation in- volved minimal edits: removing redundant attributes (in- ventory numbers, bibliographic info); extraneous symbols and numbers","venue":null,"work_id":"a68efffb-e55e-4aae-b33e-60a6a2df03c5","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.798428Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:4053e83a86cbf7ff82a7428babf6c02ac05c51b899be19ce6ede84713dce7685","observation_id":"ebe8df6b-8dac-4910-a943-ebc0d528d8f1","resolution":{"observed_at":"2026-08-12T04:28:40.619143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.599324Z","title":null,"venue":null,"work_id":"2a4424c6-e3dc-4212-9386-da0369a82fd6","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.802733Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:364223fdda4d33266cb542ab8e4c28672d2da926ae32aa873d3c471f41d96081","observation_id":"91b95f06-7661-4bdb-bbf8-2a5fae826243","resolution":{"observed_at":"2026-08-12T04:28:40.604256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.583025Z","title":"Which primary material is the object made of?","venue":null,"work_id":"d9b94bdc-431b-4501-9337-d786144d25de","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.806871Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:da298e25a2c2844aefa8b9f1b152786d13f575a0364ff3164e127975173ae8be","observation_id":"68c51512-01ec-4ae6-99e5-3cc2bb9dce3b","resolution":{"observed_at":"2026-08-12T04:28:40.587709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:28:40.567958Z","title":"For each object, we now have a list of images and a set of question-answer pairs, omitting the answers for which the value is not known","venue":null,"work_id":"4d0e2c9a-8838-4ced-a8b3-e9b6f1a56972","year":null},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.810901Z"},"links":{"citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:61f438c50e9bc6f5badc484443509f8ccc7ef2a6b3c5fa867c8b578e2acb4137","observation_id":"fc021a6f-b5f5-4beb-af3d-2e790aefa241","resolution":{"observed_at":"2026-08-12T04:28:40.572404Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":4,"verified_fuzzy":49},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2412.01370."}