{"as_of":"2026-08-07T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4807a0e202372ca20c32ab60a6e497cc8c9ab8c1a55159e9a8e3fad1d409bd9d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:45:53.015838Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04699/citation-record","integrity":"/paper/2507.04699/integrity","json":"/paper/2507.04699/citation-record.json","paper":"/paper/2507.04699"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:45:51.395705Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:51.395705Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:f07525a04038eac9202bddff8ca9b14658a1e854001250bc0aa5cafcce38d53a","observation_id":"e541e223-0112-4f2b-bbc9-a9d01ba6a773","resolution":{"observed_at":"2026-08-06T19:45:51.395705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.562709Z","title":"Vismin: Visual minimal-change understanding","venue":null,"work_id":"3b35319e-49da-4a79-a83c-dc4e89c8d12b","year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:51.925349Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:86364ee2d671531bcd79562f59aebab80c0f5422ed67712c10ce41cf61aa6d41","observation_id":"227d747f-b29e-408f-a3b9-4f62ce9cb1cb","resolution":{"observed_at":"2026-08-06T19:45:53.566352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:45:52.329853Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.329853Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:aa49d6a9959caecf8f92128b9607ae7dc01966bdc28aa87c1f4f2eba03265562","observation_id":"3880f207-f9cf-4cb5-b486-27be3270d16f","resolution":{"observed_at":"2026-08-06T19:45:52.329853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T19:45:52.383239Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.383239Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:0d2d9ed678f81355d3a0cfd8ab7a02b08d579aaeed349932cde6e4faa031692a","observation_id":"1c97579e-5679-49a4-bffb-f94465bededd","resolution":{"observed_at":"2026-08-06T19:45:52.383239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.551638Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":"9f804f36-f278-4845-975b-84ca8f4f4dda","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.413537Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:dbf78837215a6127aaffceefe58be5739ec0d396b653144297cb250f34c6a026","observation_id":"9a65d044-fa8b-44fe-9df2-d56f09da7c57","resolution":{"observed_at":"2026-08-06T19:45:53.555147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.539268Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"2453a90f-169b-4220-b944-41c3a4740c29","year":2020},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.487593Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:8a2e65557a4cc9aa64d3196eab91c933482a7db4de52e6978871be2db918f3e7","observation_id":"92458099-43b3-46b0-9043-596746f5c15e","resolution":{"observed_at":"2026-08-06T19:45:53.543996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T19:45:52.563298Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.563298Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:576973f66644681ec85a3add76ce7c04c8c5e083df5ee444dbc5997c1025c453","observation_id":"3f519064-4f4e-4d59-9604-802108f68bf0","resolution":{"observed_at":"2026-08-06T19:45:52.563298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T19:45:52.624039Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.624039Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:58cee8ffb90df7e4a3d7ef2612bb1f4a12afb47e9172090465d8c3a16d653ac8","observation_id":"d1ed6828-d923-4682-b1cd-7e32a88ecf1c","resolution":{"observed_at":"2026-08-06T19:45:52.624039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:45:52.695270Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.695270Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:e22d0eb32411b135c4f65fad7a88ed2130687dbc6da0aae828a19d958c8cdc39","observation_id":"255f7f21-4cc0-4c52-b8bb-4f8f972f554a","resolution":{"observed_at":"2026-08-06T19:45:52.695270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.527909Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"5b045c65-272b-4cc7-b532-6f36413dbe85","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.724114Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:20aca25e840100e5ee91f1d8fc9e3556d2515832d8d5555456089c4837bb2b21","observation_id":"907d0124-c006-4743-8192-02908b83132e","resolution":{"observed_at":"2026-08-06T19:45:53.531705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-06T19:45:52.761831Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model.arXiv preprint arXiv:2401.16420, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.761831Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:c0997767548f18ae7eb88bc4542ebb5730b78a32968a932f08d53f131fa0bc72","observation_id":"8fe1138b-f0b8-424d-8daf-e48f4b130349","resolution":{"observed_at":"2026-08-06T19:45:52.761831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.516420Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models.Advances in Neural Information Processing Systems, 36:76137–76150, 2023","venue":null,"work_id":"7ad5ee94-9d2a-4266-bb4a-5e92b89fb322","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.779677Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:8e5b835347e1451df2f53937e0387bc1bb68db96ddebb676ac0c0b29be472fcd","observation_id":"2870a00f-fa24-45d3-8a1f-15b453fb94fe","resolution":{"observed_at":"2026-08-06T19:45:53.520358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.504878Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"a9d44f79-6958-44f0-9a2b-fcb28880e5cb","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.873754Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:47db816b46966178689406c679b347e654e72372c679ff8c4bb6ac266af2a858","observation_id":"53581e1d-5568-463a-a2ed-2a178875b130","resolution":{"observed_at":"2026-08-06T19:45:53.509035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.492434Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"41be22dc-b46c-471c-a4d5-eb45d426771a","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.904104Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:f2d11925039d8e684f39c913d6b4e326698a15516916efca331ab3c6760d4e8a","observation_id":"b3cbef5f-286e-4ca8-abc8-4dc10f2b40d7","resolution":{"observed_at":"2026-08-06T19:45:53.497514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.480774Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"92bd21d1-f363-4164-a0b8-30c874056437","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.907558Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:7c386443cf806aea03800974d03934de691156d74b132a2f4184a93793365cb1","observation_id":"ff1e9ff5-461c-410f-99de-bdf4a9bf2b57","resolution":{"observed_at":"2026-08-06T19:45:53.484864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.468654Z","title":"Advances in deep concealed scene understanding.Visual Intelligence, 1(1):16,","venue":null,"work_id":"89b73493-05ce-45d8-9cab-4b871d69a054","year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.910679Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:431a7333e69f9a89c030faf1de7f058fd41c8f2fdfd734823ea566526f5b1e4f","observation_id":"bc526a0e-7a79-435c-b2c1-9d0b1222b699","resolution":{"observed_at":"2026-08-06T19:45:53.472951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-08-06T19:45:52.913989Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5% parameters and 90% perfor- mance.arXiv preprint arXiv:2410.16261, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.913989Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:869977f56479fe606b04be2ab433bee1080da6f021fe022e2abb95ea1ca629f6","observation_id":"7883666e-4ec6-4b91-a616-a090dfa88957","resolution":{"observed_at":"2026-08-06T19:45:52.913989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.917752Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.917752Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:19d05ea16c6a6233a48ae01896e3f3dcc32e35e9cf20e1508dd2139844d79f97","observation_id":"ff800481-a222-45c8-80db-7d4383db1b2e","resolution":{"observed_at":"2026-08-06T19:45:52.917752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.449369Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"1d789d86-4b62-41e4-95de-cf51e553f2c6","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.921818Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:2a651f5efc7e16f2117e496204d24e57ee2fc007f43ec961808cb7efb5a4505f","observation_id":"034cbaee-71a7-48be-bae9-c85b71a30a3a","resolution":{"observed_at":"2026-08-06T19:45:53.453433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:45:52.925907Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.925907Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:aee9eb2adf8501f2a919773b3219ad658e77927039bcdffdf565ab567c9b859a","observation_id":"37d2f436-fce2-4aec-9234-3c5a9aa599ab","resolution":{"observed_at":"2026-08-06T19:45:52.925907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07323","last_updated":"2025-02-11T07:42:44Z","snapshot_observed_at":"2026-08-06T03:36:14.984453Z","submitted_at":"2025-02-11T07:42:44Z","title":"Semantic to Structure: Learning Structural Representations for Infringement Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07323","snapshot_observed_at":"2026-08-06T19:45:52.929510Z","title":"Semantic to structure: Learning structural representations for infringe- ment detection.arXiv preprint arXiv:2502.07323, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.929510Z"},"links":{"cited_paper":"/paper/2502.07323","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:df59a78a658901a13e940d02c8537f98058ca0ddc961952106fe85ce4f31899a","observation_id":"784193e0-7fa7-4c41-970e-390885a53cf6","resolution":{"observed_at":"2026-08-06T19:45:52.929510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.437345Z","title":"Secret lies in color: Enhancing ai-generated images detection with color distribution anal- ysis","venue":null,"work_id":"ccb818f3-dbb4-4cab-8376-0172811795fa","year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.933305Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:9d60478fd4f948360bc4400c0db9da11f0a1d8df19c58479c2cec34ee9dddc21","observation_id":"56f713ab-86a7-4915-b5d1-57a18790bbda","resolution":{"observed_at":"2026-08-06T19:45:53.441738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.936493Z","title":"Elevater: A benchmark and toolkit for evaluating language-augmented visual models.Advances in Neural Information Processing Systems, 35:9287–9301,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.936493Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:7f3d3295ffdeb4e4ea6932433805e636f545fec3f04f45b6ab9d6b788816cc01","observation_id":"d19b3da0-5082-4a78-aa13-25f335ec430d","resolution":{"observed_at":"2026-08-06T19:45:52.936493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.939887Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.939887Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:56b8bc8798bafef4fb6701a63f39f3d7e99eab28b604784b6848a2bd53755d0e","observation_id":"3398b2d4-3be4-426a-a529-90823f509958","resolution":{"observed_at":"2026-08-06T19:45:52.939887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.411056Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"15bf248d-6c9a-4879-a965-f09a2624add0","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.943579Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:a3223673925816c8a35b2e452bd1bb58a66de102918fd56c0ee92428d14396be","observation_id":"d0c50298-4162-40d0-a531-ad5605347184","resolution":{"observed_at":"2026-08-06T19:45:53.415920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.399882Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"ee682d98-f6f2-48f6-b76c-9d1ecfc9a26a","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.947716Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:97aaff58715076a685548a7d9afc4b82234649d994eb04923ea12d6876be989a","observation_id":"8a3fd584-54a8-4495-8687-75df5a833d64","resolution":{"observed_at":"2026-08-06T19:45:53.403872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.388673Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"3ae02e91-00b4-4908-b196-81384c724219","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.951149Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:1c83a053a0cd51d145842bb3c0393171cf36bf065bb4a7e0c71d679545dfbefc","observation_id":"e46b6ba9-fbad-431f-a29a-0b7d99b39aa6","resolution":{"observed_at":"2026-08-06T19:45:53.392740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-06T19:45:52.956170Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training.arXiv preprint arXiv:2403.09611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.956170Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:cd80a2414b75ea946c56bb25c8f2312825cdacb3cd4f73c938b6a3b00617cf03","observation_id":"2280f4f3-b2b0-4be1-838b-7c667339728c","resolution":{"observed_at":"2026-08-06T19:45:52.956170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.377758Z","title":"Synthesize diagnose and optimize: Towards fine- grained vision-language understanding","venue":null,"work_id":"3223bcde-4899-402c-a8c3-b1267241b053","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.960323Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:6e0dfc2589eb85ad3d75d498763bf414a755d5c8067a37635d8c0e4e18606122","observation_id":"0c1b60e1-3386-462d-a2d7-9aa857a4ddf5","resolution":{"observed_at":"2026-08-06T19:45:53.381845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T19:45:52.963677Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.963677Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:21a19db85fe7bc233b805147aa9ef6d116bc60e54279ba1e58b2c62be2c72c32","observation_id":"d93327d3-3d0c-4963-85bc-6477f84f3fa1","resolution":{"observed_at":"2026-08-06T19:45:52.963677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.366975Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"74e5ba46-dcda-4f62-b224-89a40860bc6f","year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.967774Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:08cd81f9bcf01f8a6d342be84a9f049d5fb68c3af99787b6ed853d2bfa34cf8a","observation_id":"66df1fac-28a3-490d-ab5e-9321e882a381","resolution":{"observed_at":"2026-08-06T19:45:53.370750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T19:45:52.971449Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.971449Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:ea11f2ecf91e68272fe915d975cb70a695e37dee28a91c330c8a9b51719f624b","observation_id":"5f425da8-9735-4cc6-9291-eed2103a7e35","resolution":{"observed_at":"2026-08-06T19:45:52.971449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.355302Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"b6bfa729-fba6-4c0d-8b03-d263b19ad653","year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.975175Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:f9ef1c72fc3e1cd8710bb128115b2e50cf5bc47d3863dd870f37e186e1ab848f","observation_id":"e4bcd0cc-39f7-4c3a-9b0d-7c18cb48a168","resolution":{"observed_at":"2026-08-06T19:45:53.359516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.344358Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"567dc0fd-2c36-4fd3-8ea0-ac86a4b1f738","year":2016},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.978562Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:93634e1d0f5b5ca91583a0be622463b64f5a3df540509a615793a0cd17933840","observation_id":"76d185f6-1d9b-4154-9f2f-b3e45f382573","resolution":{"observed_at":"2026-08-06T19:45:53.348027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.331424Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"2ef7d1d5-96bb-48e6-bbc3-efeab37150ef","year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.982108Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:b9cdb8e59318f9b1bd0788ba5114a2dca7e438d7e147172db12a3c7c8bbce7dd","observation_id":"82a8c44b-5adc-4a9c-babc-da6136a43e44","resolution":{"observed_at":"2026-08-06T19:45:53.336292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.318943Z","title":"A picture is worth more than 77 text tokens: Evaluating clip-style models on dense captions","venue":null,"work_id":"90666997-b31e-426c-a3e2-858fbe6984cf","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.985873Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:a61b2af91205ad4d5f5b2caea7eddfb2f69aaae1f947096f494bea6685de9ad3","observation_id":"d6a37b8d-b988-4cf3-8ecc-a2c11124e0e8","resolution":{"observed_at":"2026-08-06T19:45:53.322934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.989662Z","title":"xgen-mm (blip-3): A family of open large multimodal models.arXiv preprint arXiv:2408.08872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.989662Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:b215fc7f4205084df521b19327e6e0be29a61ce8bb497dff934839a5cf150051","observation_id":"eefbe169-f499-4469-9781-0b24b3d440ee","resolution":{"observed_at":"2026-08-06T19:45:52.989662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.306595Z","title":"What you see is what you read? improving text- image alignment evaluation.Advances in Neural Informa- tion Processing Systems, 36, 2024","venue":null,"work_id":"cb00dd2e-de5e-4cb5-9f0f-49fd691de47b","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.993852Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:82514f08ac533e21b5a553aa39005d0eecfdb451b42814821eef4f14d3380986","observation_id":"5d2c2618-0cf4-4fb8-a16d-838f722ac5b8","resolution":{"observed_at":"2026-08-06T19:45:53.311324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.294622Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? InThe Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"059cd523-843b-4113-be67-aa2ed97d2dea","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.997084Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:1c4dff00e1f4a7440f585be6d479eaf6513518cffbe365680005b7db89e7610d","observation_id":"3b220d1b-48cf-46f1-8116-12b54b6a27ea","resolution":{"observed_at":"2026-08-06T19:45:53.299125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08276","last_updated":"2022-06-01T16:45:09Z","snapshot_observed_at":"2026-07-06T12:08:57.241574Z","submitted_at":"2021-11-16T07:55:26Z","title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08276","snapshot_observed_at":"2026-08-06T19:45:53.000363Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts.arXiv preprint arXiv:2111.08276, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.000363Z"},"links":{"cited_paper":"/paper/2111.08276","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:9c9727787a5d2f03d7cb012c77283caa010a5edb1ea5840dd0058c4f13dde716","observation_id":"ed6d5e29-6cf9-4f0b-bf71-73cdb6b0e7d3","resolution":{"observed_at":"2026-08-06T19:45:53.000363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.282966Z","title":"Investigating compositional chal- lenges in vision-language models for visual grounding","venue":null,"work_id":"efe33915-1ae4-4fb5-8c01-2427e445976d","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.003972Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:3b3cb49893386f519a73f0394a8c59c6c52ffa9e8a011c4a6dda38fbe008e468","observation_id":"9b14da76-f3fe-4ef7-9011-0ab3907d6449","resolution":{"observed_at":"2026-08-06T19:45:53.287164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.268414Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"26bae1bd-e5ed-4d21-8132-d4b535935127","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.007487Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:59f72894a4da6bacd81a0f8bcdacfec10d356ee4002db4c480fc9aeec610d9b2","observation_id":"6bec6939-e9bd-4efe-a87d-d4f9fac82942","resolution":{"observed_at":"2026-08-06T19:45:53.274342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-05T08:04:30.259196Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-06T19:45:53.011960Z","title":"Vl- checklist: Evaluating pre-trained vision-language models with objects, attributes and relations.arXiv preprint arXiv:2207.00221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.011960Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:7f7b4284f5eb79b734053b25bf4d8028a0da9750f9910f067fbcecee88be52eb","observation_id":"b54f18df-cf1d-496b-8186-365b28cf9c0a","resolution":{"observed_at":"2026-08-06T19:45:53.011960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:45:53.015838Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.015838Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:ee278396ded46f887e447434adb7165b03d1f8be091f40e121f020a11304f75d","observation_id":"6faa031f-bd95-4ea0-9866-de705e61db24","resolution":{"observed_at":"2026-08-06T19:45:53.015838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2507.04699."}