{"as_of":"2026-08-19T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44e83e1ccc0f1f9df4608e1ca530ce31f16a31c1df9a56dd716f79e2789c33a0","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:10:44.412768Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:07.218215Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:01:07.714487Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"cited_work":{"arxiv_id":"2412.09353","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09353","snapshot_observed_at":"2026-08-07T05:01:07.714487Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","venue":"cs.CV","work_id":"8a8dc35e-50da-48dc-9b52-31dd04031b3b","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-14T19:05:16.545014Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.218215Z"},"links":{"cited_paper":"/paper/2412.09353","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:4d7eb7679e67250347b9dd282a0dc1ff5a604c429087d92ef3c3fcc9e3fb6bd2","observation_id":"75ad03d2-c6ca-4845-a852-39b0a661e028","resolution":{"observed_at":"2026-08-07T05:01:07.719377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09353","snapshot_observed_at":"2026-08-04T13:52:15.916851Z","title":"Causal graphical models for vision-language compositional understanding.arXiv preprint arXiv:2412.09353,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24566","last_updated":"2026-07-16T09:55:58Z","snapshot_observed_at":"2026-08-16T07:58:25.495952Z","submitted_at":"2025-09-29T10:19:22Z","title":"TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T13:52:15.916851Z"},"links":{"cited_paper":"/paper/2412.09353","citing_paper":"/paper/2509.24566"},"observation_digest":"sha256:85ce61ce7882475c754225b92110f83dd87f96b7ff8e17b24a511ee86a6ca571","observation_id":"b1e25a89-abf9-437f-b3b4-88327a90ce22","resolution":{"observed_at":"2026-08-04T13:52:15.916851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09353","snapshot_observed_at":"2026-07-14T09:11:59.440912Z","title":"Causal graphical models for vision- language compositional understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10797","last_updated":"2026-07-12T15:09:33Z","snapshot_observed_at":"2026-08-14T16:59:22.785195Z","submitted_at":"2026-07-12T15:09:33Z","title":"Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T09:11:59.440912Z"},"links":{"cited_paper":"/paper/2412.09353","citing_paper":"/paper/2607.10797"},"observation_digest":"sha256:e04325738a21756fd9b051823ec4b63b935256d38010ab30c1cbe516cb7703ea","observation_id":"576ef09b-e008-4df1-987f-8bad43299b75","resolution":{"observed_at":"2026-07-14T09:11:59.440912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09353/citation-record","integrity":"/paper/2412.09353/integrity","json":"/paper/2412.09353/citation-record.json","paper":"/paper/2412.09353"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.642339Z","title":"head” word and its “dependent","venue":null,"work_id":"a74d7f5d-155a-42ac-bfa9-446e73290acd","year":2005},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.383990Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:7b92242ba5ef7d29dcbfb75a4183233125d9187ec59b3167d551aa945b61f2c4","observation_id":"bbf244e4-63ba-4f69-9ac6-8f700047bdc3","resolution":{"observed_at":"2026-08-11T17:10:44.644892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.560297Z","title":"Three teddy bears laying in a canopy bed under the covers","venue":null,"work_id":"ba77ebbe-0b2d-4797-bbf0-e969b632aefc","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.410663Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:c331caf3bfcb1c2e9f45a67299ab691ff3d50eade5ce35624f6fbca77d2c98a3","observation_id":"201a70e7-41be-4705-bc70-aa5b1244e6bd","resolution":{"observed_at":"2026-08-11T17:10:44.563092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04492","last_updated":"2024-08-06T17:31:33Z","snapshot_observed_at":"2026-08-16T14:20:47.881612Z","submitted_at":"2024-02-07T00:31:49Z","title":"ColorSwap: A Color and Word Order Dataset for Multimodal Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04492","snapshot_observed_at":"2026-08-11T17:10:44.316881Z","title":"Colorswap: A color and word order dataset for multimodal evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.316881Z"},"links":{"cited_paper":"/paper/2402.04492","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:d2c97d0d62dfa4768e4ee0bde74e01b039ad0e6f804bf2f5578a1ec415ee7698","observation_id":"825c0731-e720-4d20-8ff7-ddef98e39e14","resolution":{"observed_at":"2026-08-11T17:10:44.316881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11759","last_updated":"2022-10-21T06:37:25Z","snapshot_observed_at":"2026-08-16T16:22:19.403823Z","submitted_at":"2022-10-21T06:37:25Z","title":"Syntax-guided Localized Self-attention by Constituency Syntactic Distance","version":1},"cited_work":{"arxiv_id":"2210.11759","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11759","snapshot_observed_at":"2026-08-11T17:10:44.510924Z","title":"Syntax-guided Localized Self-attention by Constituency Syntactic Distance","venue":"cs.CL","work_id":"14f18bea-3c10-44eb-8946-f5fdea129817","year":2022},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.330776Z"},"links":{"cited_paper":"/paper/2210.11759","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:579723d8ddd2e8feb758889fb089292e20b076c1da63422bcfe7b7ff6160f413","observation_id":"cdd71c4c-c8f6-499b-998a-a70f5e1c2a22","resolution":{"observed_at":"2026-08-11T17:10:44.513979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13854","last_updated":"2024-04-13T00:14:03Z","snapshot_observed_at":"2026-08-16T16:13:28.529164Z","submitted_at":"2022-11-25T01:37:48Z","title":"ComCLIP: Training-Free Compositional Image and Text Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13854","snapshot_observed_at":"2026-08-11T17:10:44.333379Z","title":"Kenan Jiang, Xuehai He, Ruize Xu, and Xin Eric Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.333379Z"},"links":{"cited_paper":"/paper/2211.13854","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:409876696e9cb8b41d8a4de16032824ad0ef52ca517751f65a18b409e151499f","observation_id":"8a77a9fd-5413-4eeb-9b7a-fc16d4850385","resolution":{"observed_at":"2026-08-11T17:10:44.333379Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T17:10:44.335639Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.335639Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:9cbf275d142d8b41c28bcf6c98fe9f6de0b8579efff84d4cbf6eea58c17d67e3","observation_id":"bf57a8b0-04fe-4075-b07f-2f5ade4bdaf8","resolution":{"observed_at":"2026-08-11T17:10:44.335639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.681011Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"afa03f01-5112-4c5f-867d-72b50b8d5839","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.338078Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:b8545de1fd2d994dc27754cce5274179f408b6ba01d6c3c9a41d00b55c956413","observation_id":"a7ee15e4-391d-43a5-be99-fca1043ed5d4","resolution":{"observed_at":"2026-08-11T17:10:44.683166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-16T13:12:52.666205Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-08-11T17:10:44.340058Z","title":"Selective attention improves transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.340058Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:67e1c9095d4f407c37f3bf19eee7d70fba4bad78da723d5ead1fa43af46f3618","observation_id":"81baf5be-a9e1-4a81-975e-c2947915c3b7","resolution":{"observed_at":"2026-08-11T17:10:44.340058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.674695Z","title":"Zixian Ma, Jerry Hong, Mustafa Omer Gul, Mona Gandhi, Irena Gao, and Ranjay Krishna","venue":null,"work_id":"38f7ad39-ca21-4dca-963d-16794a2a20ee","year":2024},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.344849Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:6cc19c865013703c76c1cd605deba3debf9ecd02b9a57200cbe9251ee40da57c","observation_id":"9bf66ed8-85f3-4dfc-b021-690b0a3af09b","resolution":{"observed_at":"2026-08-11T17:10:44.677197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03875","last_updated":"2020-10-29T06:17:11Z","snapshot_observed_at":"2026-08-19T12:48:43.997088Z","submitted_at":"2019-11-10T08:17:11Z","title":"Rethinking Self-Attention: Towards Interpretability in Neural Parsing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03875","snapshot_observed_at":"2026-08-11T17:10:44.349412Z","title":"Rethinking self-attention: Towards interpretability in neural parsing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.349412Z"},"links":{"cited_paper":"/paper/1911.03875","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:d91f6d50907a7e622c27b9babce7e40e4c2e2e23f8c80c07f4d7769eef0f1473","observation_id":"dbc2fdf1-294a-405e-b6bc-92b1d73ae60d","resolution":{"observed_at":"2026-08-11T17:10:44.349412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-16T14:27:28.314257Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07669","snapshot_observed_at":"2026-08-11T17:10:44.355968Z","title":"FiGCLIP: Fine-Grained CLIP Adaptation via Densely Annotated Videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.355968Z"},"links":{"cited_paper":"/paper/2401.07669","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:899d7c0a0a6dd47c3639529aed0dfeffa11234e4b17f54a27ab98c05c8e6db15","observation_id":"56508762-49ad-4f89-8690-5929d7a40e62","resolution":{"observed_at":"2026-08-11T17:10:44.355968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.668382Z","title":"Coarse-to-fine contrastive learning in image-text-graph space for improved vision- language compositionality","venue":null,"work_id":"97864827-50e6-4807-bd43-4c267a3dd113","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.359033Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:1f16d2411c58cd88eb070ff624702a685e8587842daeeb686d9740039361a104","observation_id":"7f37d222-4a4f-445b-87c4-5422b71d5183","resolution":{"observed_at":"2026-08-11T17:10:44.671010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12359","last_updated":"2024-03-27T10:18:04Z","snapshot_observed_at":"2026-08-17T01:42:24.762814Z","submitted_at":"2023-12-19T17:40:27Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12359","snapshot_observed_at":"2026-08-11T17:10:44.364395Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.364395Z"},"links":{"cited_paper":"/paper/2312.12359","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:b0d1abbe2846e859c0eacd3541b76ff6a7ac1526ab01811c30a42a9f61c75c21","observation_id":"69530690-b4b4-4d70-b092-d26aa33fe939","resolution":{"observed_at":"2026-08-11T17:10:44.364395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05258","last_updated":"2025-04-07T12:04:28Z","snapshot_observed_at":"2026-08-16T13:11:48.518180Z","submitted_at":"2024-10-07T17:57:38Z","title":"Differential Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05258","snapshot_observed_at":"2026-08-11T17:10:44.366991Z","title":"Differential transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.366991Z"},"links":{"cited_paper":"/paper/2410.05258","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:7ac230f26237d1fdd05742a0820bc3a08ea0765ea0a479150b824280932b5363","observation_id":"6c8dc105-95b2-4711-a5f2-f7b5c1730207","resolution":{"observed_at":"2026-08-11T17:10:44.366991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17345","last_updated":"2025-01-15T12:46:07Z","snapshot_observed_at":"2026-08-16T14:31:03.489973Z","submitted_at":"2023-12-28T20:26:03Z","title":"3VL: Using Trees to Improve Vision-Language Models' Interpretability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17345","snapshot_observed_at":"2026-08-11T17:10:44.369610Z","title":"3VL: using trees to teach vision & language models compositional concepts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.369610Z"},"links":{"cited_paper":"/paper/2312.17345","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:1577bc7896dddc9048bba6c955ef808842766a4d77d1dd175417c1a566bd0bdd","observation_id":"f12e40bd-4537-459c-9a49-31e8a19d0625","resolution":{"observed_at":"2026-08-11T17:10:44.369610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-16T16:49:03.285397Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-11T17:10:44.372152Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.372152Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:6abe28b54425254400ada13781cd98b6cc76f30513ea79fea12014e23c25c018","observation_id":"2df23896-35c7-4108-b3f5-1628aab206ea","resolution":{"observed_at":"2026-08-11T17:10:44.372152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.662163Z","title":"Iterated learning im- proves compositionality in large vision-language models","venue":null,"work_id":"33a59e48-33e6-4ca8-8fa8-8c375b7db3a5","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.374996Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:67435e8acde64317a42ff17d4702a7d2727b801d582e52f0c50e2a5b0b68684d","observation_id":"647d2543-82b7-4c7e-be38-0fa1213a05cb","resolution":{"observed_at":"2026-08-11T17:10:44.664649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.655982Z","title":null,"venue":null,"work_id":"7e5df62e-b480-4aad-a19c-e40d52ce8c38","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.377364Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:8367d3b648ec96252ea25b0ff05a22c3d55134e943febbc8bb76d8a7f53bc780","observation_id":"ab116f1c-037a-4f64-a310-70309f2bece7","resolution":{"observed_at":"2026-08-11T17:10:44.658424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.648971Z","title":"The difference between a CGM and a Directed Graphical Model is that the former assumes that P A(Xj) are direct causes of Xj","venue":null,"work_id":"bbe8187e-56c3-4951-8bf6-c05a123225f3","year":2021},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.380490Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:b82427f1d027657520c7a28b1365d03e1683ffd64d4fc168862dc4f312b70a8a","observation_id":"8d85ae82-75a8-48b4-bb63-74185cb427c0","resolution":{"observed_at":"2026-08-11T17:10:44.651866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.628943Z","title":null,"venue":null,"work_id":"a6b27c4a-69bf-4811-a6a2-d4fc5654532c","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.389014Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:0ba1e56dde7b74c4f5509ef32da1fd614bce6136034ad276897847225d76e964","observation_id":"bd283f59-95b9-4072-a6c8-fe4f0d7071f3","resolution":{"observed_at":"2026-08-11T17:10:44.631397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.621784Z","title":"The same applies to those methods based on CLIP, such as NegCLIP (Yuksekgonul et al., 2023), GNM (Sahin et al., 2024), Plausible Adj","venue":null,"work_id":"d64baf26-60c6-45fa-bff6-ab08a927d272","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.391392Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:b74faae1a52e71af21954c752a49de05eddb82232828d48553b009f8aadf208d","observation_id":"0410b5f0-87db-4ba5-8795-663842f0e09b","resolution":{"observed_at":"2026-08-11T17:10:44.624684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.614494Z","title":null,"venue":null,"work_id":"aa648e64-f05a-4e10-a874-7257a09040ca","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.393346Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:be800a5018d9fe28366a7bd246c3eecc2515724200206289763b210b5b817782","observation_id":"3f9655f1-5bc5-40db-8631-9f795efe05b5","resolution":{"observed_at":"2026-08-11T17:10:44.616932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.608552Z","title":"instruction","venue":null,"work_id":"49210115-9f9f-4809-aa36-870147742cab","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.395328Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:e1a3dee2c54c3e90accca6dae9b6a13621c1640f59fc20eb02588186344f8ed0","observation_id":"8ed8d0d0-c64e-43ce-bdc3-c3b504322b4f","resolution":{"observed_at":"2026-08-11T17:10:44.610626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.602519Z","title":null,"venue":null,"work_id":"a7c0c70c-bfb7-4faf-a8af-93cdc9c4247d","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.397427Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:1f5f03fcb583b9ecf73766e3ff9b3cb96013ae6f5763088bc3be0eaf731bc2ee","observation_id":"f4b88e7f-e53c-4e5d-b067-06be1535f1e2","resolution":{"observed_at":"2026-08-11T17:10:44.604623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.596256Z","title":"Write a description for the photo","venue":null,"work_id":"453be7d6-d1e3-4869-9ee1-7866c7afd9e3","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.399533Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:ba6f1dabe8c91f603097f87a9f2f1a0d043a0372016440140fe5790daac873b7","observation_id":"53f213fa-6fde-48aa-8f99-11d5b67165eb","resolution":{"observed_at":"2026-08-11T17:10:44.598741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.589291Z","title":"It is composed of two main tasks: Visual Genome Relation and Visual Genome Attri- bution","venue":null,"work_id":"fbf7257f-25e7-4333-8c25-6b23998035fd","year":2024},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.402581Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:2d9f550944048ba450704dd82795602c66dfa610bd3faf81797793403890511f","observation_id":"281cbfd7-c3e7-4756-8559-003e45f132ec","resolution":{"observed_at":"2026-08-11T17:10:44.591996Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.582488Z","title":"Replace”, “Swap","venue":null,"work_id":"8a16d601-0e62-4628-8380-31f7c06f1296","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.404587Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:5523397961803679f82de62269f7ffffbe1e72ff12c89ff2817a9e9ea0178737","observation_id":"4e5ace5d-99f9-4c6a-8d29-684a4dbe8c66","resolution":{"observed_at":"2026-08-11T17:10:44.584674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.575629Z","title":"Each image is associated with two descriptions: a true and a false caption","venue":null,"work_id":"47a5423d-3df1-4e7f-ac2b-f34efe1b7ad2","year":2017},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.406416Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:4e6337ae646631a8585d279022c99662cef535deda0e89ca1d53136decd6a484","observation_id":"80ab0835-f486-408b-96be-b027dec86e77","resolution":{"observed_at":"2026-08-11T17:10:44.578231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.568042Z","title":"color-swapped","venue":null,"work_id":"abe6eb18-22dc-46dc-945d-a1d68b1d236f","year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.408328Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:6d278fd7bd7c3ade3937eb8d23ee3081a66be7d3c3e96f952d05d15a7053ed32","observation_id":"2e328e0b-25fa-4168-afc4-b1acb1f7562e","resolution":{"observed_at":"2026-08-11T17:10:44.570998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.553062Z","title":null,"venue":null,"work_id":"69ae8958-18eb-4cfb-b195-990fb7fc8d20","year":2014},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.412768Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:2efad73d97a9cb711dc7d07759a09e4cf5a2c430f56432e889534afffe5e8af3","observation_id":"2e75a373-0573-43f3-bb9e-f0b7355e1839","resolution":{"observed_at":"2026-08-11T17:10:44.555722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.635591Z","title":"Specifically, in the Trivial task, negative captions are randomly sampled from unrelated objects (of different images), offering a basic challenge for retrieval","venue":null,"work_id":"31ef7ce1-e617-4bd7-8dd6-74f4ce037b8b","year":2024},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.386378Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:24b29038028375140631f25d58a2ad12cfdf0d5c2373aea6b17ff7a3dac040e9","observation_id":"e8844bff-36e6-4808-a45a-24dc834561c5","resolution":{"observed_at":"2026-08-11T17:10:44.638195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06708","last_updated":"2023-04-13T17:57:01Z","snapshot_observed_at":"2026-08-19T00:32:21.127181Z","submitted_at":"2023-04-13T17:57:01Z","title":"Verbs in Action: Improving verb understanding in video-language models","version":1},"cited_work":{"arxiv_id":"2304.06708","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.06708","snapshot_observed_at":"2026-08-11T17:10:44.475912Z","title":"Verbs in Action: Improving verb understanding in video-language models","venue":"cs.CV","work_id":"924c47a6-a94b-41e3-8341-ab95e27ba1e6","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.347225Z"},"links":{"cited_paper":"/paper/2304.06708","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:9c4e120afcb18ff5729a6f4dd3d0e3b32067f7f4b3c41228b4f66a78af4e9f58","observation_id":"84517f84-2ab7-41c3-87ec-ae41c01244ac","resolution":{"observed_at":"2026-08-11T17:10:44.480082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05210","last_updated":"2024-10-07T17:16:20Z","snapshot_observed_at":"2026-08-16T13:11:49.563591Z","submitted_at":"2024-10-07T17:16:20Z","title":"Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05210","snapshot_observed_at":"2026-08-11T17:10:44.351701Z","title":"Preserving multi- modal capabilities of pre-trained VLMs for improving vision-linguistic compositionality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.351701Z"},"links":{"cited_paper":"/paper/2410.05210","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:ce70465cd39c9570fd6e9f234242412ab2399af7ca1a5ecd3cd3ab218659e521","observation_id":"c25eb1c7-2e98-4100-baeb-4f8e20af2636","resolution":{"observed_at":"2026-08-11T17:10:44.351701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15233","last_updated":"2023-09-05T18:21:16Z","snapshot_observed_at":"2026-08-16T15:45:02.604769Z","submitted_at":"2023-03-27T14:15:17Z","title":"Text-to-Image Diffusion Models are Zero-Shot Classifiers","version":2},"cited_work":{"arxiv_id":"2303.15233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.15233","snapshot_observed_at":"2026-08-11T17:10:44.533321Z","title":"Text-to-Image Diffusion Models are Zero-Shot Classifiers","venue":"cs.CV","work_id":"3f3b18e6-03dc-4874-894a-ee287b909839","year":2023},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.319840Z"},"links":{"cited_paper":"/paper/2303.15233","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:0846899d8865c307dfcddd8abf918b3a8cfeed1d11f4134838a391b85751b73b","observation_id":"2a1733a4-cc87-4e24-9482-dfc9c766bdcf","resolution":{"observed_at":"2026-08-11T17:10:44.536700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02325","last_updated":"2024-03-04T18:55:30Z","snapshot_observed_at":"2026-08-17T02:41:16.165464Z","submitted_at":"2024-03-04T18:55:30Z","title":"Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02325","snapshot_observed_at":"2026-08-11T17:10:44.361548Z","title":"Contrastive region guidance: Improving grounding in vision-language models without training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.361548Z"},"links":{"cited_paper":"/paper/2403.02325","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:a58af13a9ac68d283c6b0c28793f29954222d8b66e32865e9d6526b5ad72f9b9","observation_id":"55857164-6169-45dc-bdde-741f83c2d8d4","resolution":{"observed_at":"2026-08-11T17:10:44.361548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.686862Z","title":"A generative dependency grammar","venue":null,"work_id":"87ebde6a-111e-4423-98df-db39f8db4c24","year":2002},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.322674Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:69f55cd2c1d0e942d3998d688151bbb620c265bcf1ca85c7a95caabfccbe74da","observation_id":"908a225e-76d2-4368-96b6-cc2f5e864581","resolution":{"observed_at":"2026-08-11T17:10:44.688834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-16T16:08:57.411307Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T17:10:44.328119Z","title":"What do vision transformers learn? A visual ex- ploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.328119Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:861e97ee5800aefa051d4a4f752f9d4c3a05279e1a9b9de9bc6754b24e41c9e1","observation_id":"4d7426b4-84cc-4554-8330-4ebe450de04f","resolution":{"observed_at":"2026-08-11T17:10:44.328119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01734","last_updated":"2017-03-10T04:37:03Z","snapshot_observed_at":"2026-08-16T19:24:07.110905Z","submitted_at":"2016-11-06T07:26:38Z","title":"Deep Biaffine Attention for Neural Dependency Parsing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01734","snapshot_observed_at":"2026-08-11T17:10:44.325149Z","title":"Dense and aligned captions (DAC) promote compositional reasoning in VL models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.325149Z"},"links":{"cited_paper":"/paper/1611.01734","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:3b10b7e0f506b30b241f859f58cca502bb08025afd93e0aaed32b09ab615abe5","observation_id":"49858b05-ed72-4883-898b-c3696339e1ec","resolution":{"observed_at":"2026-08-11T17:10:44.325149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-11T17:10:44.342559Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.342559Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:47474179c54027dc6f3149686554785a17e1f8544403361efa53414a492c3df7","observation_id":"4fa538cf-a18f-4f5a-8df9-c3f91b7a724b","resolution":{"observed_at":"2026-08-11T17:10:44.342559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09233","last_updated":"2024-07-01T17:48:16Z","snapshot_observed_at":"2026-08-16T15:15:21.270514Z","submitted_at":"2023-07-18T13:10:11Z","title":"Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09233","snapshot_observed_at":"2026-08-11T17:10:44.311602Z","title":"Distilling knowledge from text-to-image generative models improves visio-linguistic reasoning in CLIP","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.311602Z"},"links":{"cited_paper":"/paper/2307.09233","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:2559c17ebf01caf8007ececb134ca1066d46044885a92c960fe94d75c97d6f41","observation_id":"9554776b-1b51-4296-adf9-b7e16ac15cdc","resolution":{"observed_at":"2026-08-11T17:10:44.311602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:44.692374Z","title":"A hierarchical quasi- recurrent approach to video captioning","venue":null,"work_id":"7a0e3ebf-3f2c-4d72-9935-e8233664540b","year":2018},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.314276Z"},"links":{"citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:86eac9f65c876afcd5fc1c1faeeec346f01afed341ab4b7f644b66b9ca47219b","observation_id":"59aa08d0-dd88-4b2e-b6f4-7edee3a087db","resolution":{"observed_at":"2026-08-11T17:10:44.694677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:37:28.389117Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2412.09353."}