{"as_of":"2026-08-13T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5deecf087696ad77d3be8bf457cc39f0515dba482b75944657d48112bf1b9dd7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:19:45.886327Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T20:44:09.047810Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-12T16:19:45.886327Z","title":"Vl- checklist: Evaluating pre-trained vision-language mod- els with objects, attributes and relations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.886327Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:3ae6274666c7285eed0cb1c6eb74ab511d69e54a4bc5a430e17916c05c3a3986","observation_id":"f76ee1ca-8be6-4b4d-8d62-c1543f2210fa","resolution":{"observed_at":"2026-08-12T16:19:45.886327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-11T18:17:18.657659Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-13T09:04:33.481949Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.657659Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:adc3369ce980ba1b9610c7a5ec4d050f3431783129ddb3d46eb53d5c9d0d2dae","observation_id":"a418555b-8f7d-4cb4-8f58-b38d546dc182","resolution":{"observed_at":"2026-08-11T18:17:18.657659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-11T18:17:06.258515Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08125","last_updated":"2024-12-19T05:46:29Z","snapshot_observed_at":"2026-08-11T18:08:56.992999Z","submitted_at":"2024-12-11T06:21:33Z","title":"Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T18:17:06.258515Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2412.08125"},"observation_digest":"sha256:6df48cc4b00383610a1a916dd53e7d8de898c71398de528964a2fba09c6f2c87","observation_id":"06c6fe06-7548-4ce7-b2f1-1f808c4ebe90","resolution":{"observed_at":"2026-08-11T18:17:06.258515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-11T17:10:44.372152Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-12T10:51:41.369589Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.372152Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:c5ff500d0a3ef7fabd833ed8cb17770b8040c274aba655de3945b07759461005","observation_id":"2df23896-35c7-4108-b3f5-1628aab206ea","resolution":{"observed_at":"2026-08-11T17:10:44.372152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T14:05:41.725304Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-12T17:30:28.025690Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.725304Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:aba15d95172d88196ee67e3212cead8667afaea9bb555f058a1fd7cdda08b698","observation_id":"7b581a1c-981d-4577-bf25-65524f03fa8f","resolution":{"observed_at":"2026-08-07T14:05:41.725304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T12:00:18.753401Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00869","last_updated":"2026-06-23T01:17:54Z","snapshot_observed_at":"2026-08-13T09:19:14.569709Z","submitted_at":"2025-06-01T07:17:46Z","title":"What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:00:18.753401Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.00869"},"observation_digest":"sha256:c2a94e23d0da5de440a8b91625bcebc27b585859123ee4b28d15f53eaf397dba","observation_id":"e405d9a0-45e7-4a0e-a115-2c5228d7f9f2","resolution":{"observed_at":"2026-08-07T12:00:18.753401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T05:21:35.157557Z","title":"Vl- checklist: Evaluating pre-trained vision-language models with objects, attributes and relations.arXiv preprint arXiv:2207.00221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08227","last_updated":"2025-06-09T20:53:43Z","snapshot_observed_at":"2026-08-10T11:16:15.032911Z","submitted_at":"2025-06-09T20:53:43Z","title":"A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:35.157557Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.08227"},"observation_digest":"sha256:2312d19bea07f1d0f5f60f9d5ed45f95dc1bf8c571f18109b695df0d63337641","observation_id":"42821a0d-6d10-4218-a568-1379fe734f45","resolution":{"observed_at":"2026-08-07T05:21:35.157557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T05:01:07.140504Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.140504Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:fc1b1490ceab2e48d31df0b8a72bf79a7c9a823f2dc27ccdfbd0ca1faebacee7","observation_id":"e0bd20ed-6479-47b0-bb65-0026b8d5f9d2","resolution":{"observed_at":"2026-08-07T05:01:07.140504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-06T22:22:37.649660Z","title":"inaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-09T21:07:26.169953Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.649660Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:24eba36bad0b7ebf6b1312ddb7318bf34bf468f3f9f6757eed8663a4f8d50f88","observation_id":"3ccfcbb2-0c3b-4b86-ac09-df84f94e9a8b","resolution":{"observed_at":"2026-08-06T22:22:37.649660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-06T19:45:53.011960Z","title":"Vl- checklist: Evaluating pre-trained vision-language models with objects, attributes and relations.arXiv preprint arXiv:2207.00221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.011960Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:0e790d37d64ec9f8cea796c8ccc275ad1737f21c4a22b54536ba30c7267deb1e","observation_id":"b54f18df-cf1d-496b-8186-365b28cf9c0a","resolution":{"observed_at":"2026-08-06T19:45:53.011960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-13T19:17:12.798847Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23867","last_updated":"2026-06-29T20:11:27Z","snapshot_observed_at":"2026-08-04T10:23:16.494751Z","submitted_at":"2026-03-25T02:48:42Z","title":"Can VLMs Reason Robustly? A Neuro-Symbolic Investigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T19:17:12.798847Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2603.23867"},"observation_digest":"sha256:cb6edaea07820d98d66b485bb1d6b5ff0cc422d3ab2d14a60c37d779f667054d","observation_id":"6460b670-f6d7-44a2-9ea5-af64b6d2838c","resolution":{"observed_at":"2026-07-13T19:17:12.798847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2604.12335","last_updated":"2026-04-14T06:17:35Z","snapshot_observed_at":"2026-08-11T09:39:12.749021Z","submitted_at":"2026-04-14T06:17:35Z","title":"All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-10T15:26:55.369840Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2604.12335"},"observation_digest":"sha256:76008d854992909875be1017bc2a300306659e8e86b90805e6211c3e6c62a4a8","observation_id":"a32aa503-64ed-4cca-ac3d-733737cd2430","resolution":{"observed_at":"2026-05-11T10:31:03.860342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2604.13313","last_updated":"2026-04-14T21:28:46Z","snapshot_observed_at":"2026-08-06T18:52:27.264982Z","submitted_at":"2026-04-14T21:28:46Z","title":"Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:57.169737Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2604.13313"},"observation_digest":"sha256:bfb69638efae9a438dddac475045fcfb71e7f6cb29f7a726c5937e2a131ff4f9","observation_id":"15c11f3d-0ed5-49cb-b08a-6ea5281eac64","resolution":{"observed_at":"2026-05-11T10:36:04.985463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2604.22822","last_updated":"2026-04-18T06:54:02Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-18T06:54:02Z","title":"DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T06:34:29.555022Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2604.22822"},"observation_digest":"sha256:70ff7b67dcf29155e88a93347dea408ffe1bd08e95ea47d461fa9b06878cb8d8","observation_id":"53fbf125-c7e9-4ec0-84c5-e10536b15f1c","resolution":{"observed_at":"2026-05-10T06:36:36.527792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2606.13288","last_updated":"2026-06-11T12:45:25Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T12:45:25Z","title":"Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T07:03:50.311891Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2606.13288"},"observation_digest":"sha256:f963dd750e18e8d661a43bf0a51718402016bda8d01556d5b38fe6272f5d950b","observation_id":"b19db82b-644c-4afe-bfda-2e8a4cad5b6b","resolution":{"observed_at":"2026-07-03T14:28:31.484644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2607.00428","last_updated":"2026-07-01T04:40:11Z","snapshot_observed_at":"2026-08-12T23:53:51.654855Z","submitted_at":"2026-07-01T04:40:11Z","title":"HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-02T15:15:24.784685Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.00428"},"observation_digest":"sha256:ae0c765a5d722525b26a6bb847d1e9b2727044a2eee9e03e112d4f509463c4ef","observation_id":"32673b3f-e221-4c90-a8fa-5f2088c1bd37","resolution":{"observed_at":"2026-07-02T15:17:07.117700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":"2207.00221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-07T20:44:09.047810Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":"cs.CV","work_id":"41d77b03-3719-4a51-a69a-1549cf164061","year":2022},"citing_paper":{"arxiv_id":"2607.05268","last_updated":"2026-07-16T17:22:10Z","snapshot_observed_at":"2026-08-12T12:24:16.898424Z","submitted_at":"2026-07-06T16:18:05Z","title":"Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-07T20:38:37.820535Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.05268"},"observation_digest":"sha256:fc4b2891ab5051bcdf2f179aac31de1f10640cb7b1612894d2965d8b3721eedd","observation_id":"b4105ae4-4d75-4c85-b84d-a6f71f50aedc","resolution":{"observed_at":"2026-07-07T20:44:09.056579Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-07-14T16:16:24.318000Z","title":"arXiv preprint arXiv:2207.00221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05268","last_updated":"2026-07-16T17:22:10Z","snapshot_observed_at":"2026-08-12T12:24:16.898424Z","submitted_at":"2026-07-06T16:18:05Z","title":"Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T16:16:24.318000Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.05268"},"observation_digest":"sha256:0840f22aeada193de4dea442d8a0e83028844c7a92bc0c7fdea7ebf08b6377c8","observation_id":"a3a95dcf-3f05-4d4f-8d53-d081e05c16cb","resolution":{"observed_at":"2026-07-14T16:16:24.318000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-02T08:32:59.699718Z","title":"arXiv preprint arXiv:2207.00221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05268","last_updated":"2026-07-16T17:22:10Z","snapshot_observed_at":"2026-08-12T12:24:16.898424Z","submitted_at":"2026-07-06T16:18:05Z","title":"Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T08:32:59.699718Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.05268"},"observation_digest":"sha256:c593273c26cdee0fcb9b128caa55f9906634e9c3a166b206c4200a991b27d88f","observation_id":"6a600bcf-6fe0-42fc-be01-71f7d9b3e9e3","resolution":{"observed_at":"2026-08-02T08:32:59.699718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-01T06:09:22.367179Z","title":"Vl- checklist: Evaluating pre-trained vision-language models with objects, attributes and relations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21998","last_updated":"2026-07-24T05:55:29Z","snapshot_observed_at":"2026-08-13T01:31:07.653746Z","submitted_at":"2026-07-24T05:55:29Z","title":"Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T06:09:22.367179Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.21998"},"observation_digest":"sha256:52a4b23bda30996bc31bf5eece5054a32b16ad7778ef23e17d170a6ee62267bb","observation_id":"d8815c50-dd81-4662-b334-57cfb1ad0e28","resolution":{"observed_at":"2026-08-01T06:09:22.367179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-01T00:14:11.250291Z","title":"2207.00221 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27857","last_updated":"2026-07-30T08:34:40Z","snapshot_observed_at":"2026-08-10T11:59:44.638244Z","submitted_at":"2026-07-30T08:34:40Z","title":"EEG-EditBench: Probing Visual Information in EEG-Image Retrieval Models with Controlled Image Edits","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T00:14:11.250291Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2607.27857"},"observation_digest":"sha256:7b64a838009ee14565da8643b8cfe010facdd6166aac0f913ed6ba47cb97c68b","observation_id":"e4d9758e-34a0-445b-9616-93d4ca47a694","resolution":{"observed_at":"2026-08-01T00:14:11.250291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2207.00221/citation-record","integrity":"/paper/2207.00221/integrity","json":"/paper/2207.00221/citation-record.json","paper":"/paper/2207.00221"},"outbound":[],"paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2207.00221."}