{"as_of":"2026-08-08T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce032d611f7d6ecd658a2e44d594636f1b660e6ab6c42c8151540e57e98b2d86","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:48.742052Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08000/citation-record","integrity":"/paper/2507.08000/integrity","json":"/paper/2507.08000/citation-record.json","paper":"/paper/2507.08000"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.342357Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"84f75a10-d146-43d3-b221-a454760569fd","year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.404148Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:aca4cf7b935bcf8eec8faf1df75286b2658ceb58a301489fdb013febb9a2a1eb","observation_id":"b196439a-1861-4339-b27d-57c23a0700be","resolution":{"observed_at":"2026-08-06T18:32:52.403863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:44.526529Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.526529Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:13466052e9c25ed7ce75c07de8bef02348362e064e7ad116c3731e1385d496cb","observation_id":"c88cb4d2-17f0-4076-a45d-90484707a1c3","resolution":{"observed_at":"2026-08-06T18:32:44.526529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:32:44.629556Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.629556Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:c24bd5395d44fa04bda854330bd8e5d224a7dffbbec78c2479edd65b5a79dc7e","observation_id":"c011eae3-7836-4a3b-b2ea-870a6c0caea6","resolution":{"observed_at":"2026-08-06T18:32:44.629556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.191634Z","title":"Visualinstructiontuning","venue":null,"work_id":"533ea222-20ee-48f9-8765-355204df1029","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.743931Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:9459da7a395c5c95eb7ffadc7df9929fe03820d04bb59757ae47b222a9b9429b","observation_id":"0a4e9da3-a4ec-46ae-bc55-b4275ba7210d","resolution":{"observed_at":"2026-08-06T18:32:52.252715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T18:32:44.845309Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.845309Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:465752a24cd4909a2ae83a0e80824f17e6d7a2d317cd012549ab97118d770248","observation_id":"c41c3b77-5c8b-437a-9899-718f0553e9b6","resolution":{"observed_at":"2026-08-06T18:32:44.845309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:32:44.933692Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.933692Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:d694e8d73ecef0c8c746a46818545491efb43f31ebb7650e67b4b3c46ff15090","observation_id":"40584af3-8ba4-42ac-aa75-446cec0fdab3","resolution":{"observed_at":"2026-08-06T18:32:44.933692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00644","last_updated":"2020-09-14T09:55:13Z","snapshot_observed_at":"2026-08-02T01:40:39.854832Z","submitted_at":"2020-07-01T17:53:26Z","title":"Measuring Robustness to Natural Distribution Shifts in Image Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00644","snapshot_observed_at":"2026-08-06T18:32:45.071477Z","title":"Measuring robustness to natural distribution shifts in image classification.arXiv preprint arXiv:2007.00644, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.071477Z"},"links":{"cited_paper":"/paper/2007.00644","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:6494c9cead5f260e5a52db77a36b6c99d838104a1c8c719a98b2926f9c7d8bd1","observation_id":"83d88bc5-375e-4231-84ed-706503d94dec","resolution":{"observed_at":"2026-08-06T18:32:45.071477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16241","last_updated":"2021-07-24T04:28:58Z","snapshot_observed_at":"2026-07-06T09:33:44.070039Z","submitted_at":"2020-06-29T17:59:10Z","title":"The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16241","snapshot_observed_at":"2026-08-06T18:32:45.197907Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.197907Z"},"links":{"cited_paper":"/paper/2006.16241","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:7541c55b600b378a69610279ba9df88eb5560ca773804c6fc4cc402b71d74527","observation_id":"cdeac91e-f2f1-46a2-b25d-d012f3d9d14f","resolution":{"observed_at":"2026-08-06T18:32:45.197907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.163199Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"5bd9a0c1-415c-42d4-915d-3440190d6da4","year":2019},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.324151Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:1e5e9edb840b9e22cd54494f1fefd87b477aed43e1cc24baa3753e6a8b23efc8","observation_id":"9b5d6ad1-921b-4dcc-8427-8a7f921c63ca","resolution":{"observed_at":"2026-08-06T18:32:52.174976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.008924Z","title":"Data determines distributional robustness in contrastive language image pre-training (clip)","venue":null,"work_id":"14708a5b-7e23-42b5-95e7-26436e3fd1d7","year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.443919Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:99131d877ef4bc9f8660abb9c53b7ffba32242a874b790ba060801944c32fd77","observation_id":"1e89ab05-e4e0-417c-a567-7af021e4aec6","resolution":{"observed_at":"2026-08-06T18:32:52.066083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.885403Z","title":"The neglected tails in vision-language models","venue":null,"work_id":"15afe2d0-2d48-49e5-8895-e9a57d2c5c86","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.583592Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:965e5a813caee6d9bba72cc7d49e41b5e513cf1c8123eb40e4fdaff8939cec53","observation_id":"6e24f533-29e8-4405-80ef-4b3ca13b1423","resolution":{"observed_at":"2026-08-06T18:32:51.945896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.750235Z","title":"zero-shot","venue":null,"work_id":"13e12f82-4381-46d8-bc48-3592c8bfa7c1","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.659673Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:5a522e51a8523785b6dfdf0b6a3fbd79579c01caef99c8f7abd180d8fda25a97","observation_id":"98585498-f97c-4134-b086-41f08b14aaf2","resolution":{"observed_at":"2026-08-06T18:32:51.840210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18326","last_updated":"2025-02-17T16:52:02Z","snapshot_observed_at":"2026-08-07T18:11:44.825960Z","submitted_at":"2025-02-17T16:52:02Z","title":"Pretraining Frequency Predicts Compositional Generalization of CLIP on Real-World Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18326","snapshot_observed_at":"2026-08-06T18:32:45.745787Z","title":"Pretraining frequency predicts compositional generalization of clip on real-world tasks.arXiv preprint arXiv:2502.18326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.745787Z"},"links":{"cited_paper":"/paper/2502.18326","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e4c5f34c409c6d97ae2e4f6e36a2bfe705cae95c5e93f717cfbc7d36d5418ca5","observation_id":"4ee03997-7c78-4265-b26f-1a83e7a71c79","resolution":{"observed_at":"2026-08-06T18:32:45.745787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.601360Z","title":"Deciphering the role of representation disentanglement: Investigating compositional generalization in clip models","venue":null,"work_id":"166a8094-005b-445c-91a9-6a82422a91a6","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.842927Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:98a68c260d7923c7a4f97e1d03aa9119c6fb4744ff9857748c9373a31407f05a","observation_id":"fd56ea5e-25a5-4d91-9f4c-6d6187645e1b","resolution":{"observed_at":"2026-08-06T18:32:51.676249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:45.923104Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.923104Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e9ad4621d8637def5e8d95df5127ed52decfc24b5e6530251f8976761bf8eec8","observation_id":"25838902-9322-43f2-ba82-ce2c655a5bce","resolution":{"observed_at":"2026-08-06T18:32:45.923104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.096827Z","title":"@ crepe: Can vision-language foundation models reason compositionally?2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10910–10921, 2022","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.096827Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:8b83e3d6c8abc2c7c0ed36372dffd11b14b25d3f5743780fc8982e78f39b7b1c","observation_id":"6f1add8e-df0b-4439-932e-52027ab2d4e3","resolution":{"observed_at":"2026-08-06T18:32:46.096827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.476681Z","title":"Sugar- crepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36:31096–31116, 2023","venue":null,"work_id":"31a420b0-c3d2-4ce0-ac11-79e1cb20e9e6","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.233303Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:db47814f01eaa0e027b04aaa09dec2f4fa825ae2ae02102ac93c6fb4ef8ca7e5","observation_id":"207f01f4-20ed-485a-81b0-a50c81a42ec9","resolution":{"observed_at":"2026-08-06T18:32:51.545135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11497","last_updated":"2024-11-02T04:58:15Z","snapshot_observed_at":"2026-08-04T23:23:42.517974Z","submitted_at":"2024-03-18T06:04:02Z","title":"A Sober Look at the Robustness of CLIPs to Spurious Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11497","snapshot_observed_at":"2026-08-06T18:32:46.319612Z","title":"A sober look at the robustness of clips to spurious features.arXiv preprint arXiv:2403.11497, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.319612Z"},"links":{"cited_paper":"/paper/2403.11497","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:04661d6db5962b5cc6b387a34a90a120b426411d27628d1d4fcff6bfcec73168","observation_id":"60d29984-4d5e-4197-be41-e06da54d3ebe","resolution":{"observed_at":"2026-08-06T18:32:46.319612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.338121Z","title":"Word association norms, mutual information, and lexicography","venue":null,"work_id":"e8cb2db6-1ae1-4ca1-9bdf-1a98e220a25c","year":1990},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.419843Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:c8df9619116a7c2b643371aeb07e1ea754cd0fc925e8a7e01529e0759dc34d28","observation_id":"ba669502-0b95-4bcf-994b-d60523b9e356","resolution":{"observed_at":"2026-08-06T18:32:51.407432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.490093Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.490093Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e00310b6e48d8f3eb64398c005698b8921b72c499f1afb3810d1507b706a8248","observation_id":"28885a78-4344-42a2-8dc0-c171b6de1729","resolution":{"observed_at":"2026-08-06T18:32:46.490093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T18:32:46.563950Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs.arXiv preprint arXiv:2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.563950Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:f81e51b7b0870de8396c88fc6a9a7ae6737af6b12278788b8b385804d0fb718d","observation_id":"f16bf04a-f7e2-4076-9a3b-7985e3121b76","resolution":{"observed_at":"2026-08-06T18:32:46.563950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.173687Z","title":"Two multivariate generalizations of pointwise mutual information","venue":null,"work_id":"db3e4298-c5e3-4f40-b775-a5d03caeed0a","year":2011},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.701812Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:fa4de9a21e782df25b5e4051e958d040ab38f3b1f4632d384273a018ba428822","observation_id":"b72d4b65-5d59-420b-a6f5-e07168d0e385","resolution":{"observed_at":"2026-08-06T18:32:51.247942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.035405Z","title":"Lawrence Zitnick, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"bebc31d4-3637-4562-86ba-55a208d83af5","year":2015},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.817205Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:f08f0cad7b1c4f6e8c237452beda38946ea3906354bbc62b3a6b99fa049e3a48","observation_id":"1dd04bef-0152-489f-bd1f-a6b49fee3bc1","resolution":{"observed_at":"2026-08-06T18:32:51.128937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:32:46.919345Z","title":"Thellama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.919345Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:8a71a61ac164560e65c582776532cac50a487c0a952a532861493e3e58f4e7f1","observation_id":"2121567b-7e69-49a4-bde3-1243b2b32d97","resolution":{"observed_at":"2026-08-06T18:32:46.919345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.040675Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.040675Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:5f688f914d21b56a5384a499348c1424c1abdf2d0612b82eadb44e0b81684365","observation_id":"2ca3ebd8-02d4-4d88-aed2-02bb93b9094d","resolution":{"observed_at":"2026-08-06T18:32:47.040675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T18:32:47.160787Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.160787Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:0ff8e3b00b97552b095bddf68cfe30ea136be3d35a8c95957077700ae1e9a188","observation_id":"29bd6e86-cc0b-483e-b38c-3a47cc355b84","resolution":{"observed_at":"2026-08-06T18:32:47.160787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.262926Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.262926Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:dbbe51d787a95f828bed83090065fd97fa093ccd2a94d18e66d7f3ffa102add8","observation_id":"250aebb7-906b-4c67-9cf9-ee4314c75f4f","resolution":{"observed_at":"2026-08-06T18:32:47.262926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.979662Z","title":"Towards vqa models that can read","venue":null,"work_id":"a389fe40-0a46-4303-8736-e97fb10f7d2e","year":2019},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.314389Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:6fe8110b428c277318c0db5569144aada50c46f8ac8a7b47b5ea11ab01e9c6dd","observation_id":"339cc28c-f88e-461b-a376-9e1d25dc31cc","resolution":{"observed_at":"2026-08-06T18:32:50.999667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.673841Z","title":"Recognition in terra incognita","venue":null,"work_id":"781a72df-a854-47e9-92b6-cced6a1a5f96","year":2018},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.418010Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:6088023cf1338a2c181a1516ed9d43ab7ad4d84147d5ea38f6d76c767c2b1a1a","observation_id":"09724e1e-11fb-4555-88d7-7bb5ee6c3fcb","resolution":{"observed_at":"2026-08-06T18:32:50.800409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.333279Z","title":"Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs: a cross-sectional study.PLoS medicine, 15(11):e1002683, 2018","venue":null,"work_id":"cd05a4c8-f05d-49b4-8e58-04fbf1441205","year":2018},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.520665Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:080f2ace3d4a0abd6097e617784f646bbc8a6f9e025b1f9f997db713fa0e26b7","observation_id":"266d094f-4272-4fc4-ad49-9c6785ed3322","resolution":{"observed_at":"2026-08-06T18:32:50.443100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.603989Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.603989Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:a261099778fa7e148228ee122a93a3ed6eb71a2053440b18b6cdaa7d6c193985","observation_id":"47a9c4c8-3021-4671-9691-255ae3e0b563","resolution":{"observed_at":"2026-08-06T18:32:47.603989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.042587Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2020","venue":null,"work_id":"b3e76575-a388-4fa3-a659-d77842476d88","year":2020},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.674980Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:42c32bbf57cecc0000aea12d1a1872b47dcf992f3cc27309342363f51940f96e","observation_id":"3eb9b301-b9c7-4258-9f7d-2ec1efb4b97e","resolution":{"observed_at":"2026-08-06T18:32:50.185552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.772692Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"88705367-6aaa-45a3-9857-4c383654fd2a","year":2017},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.791137Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:4f0a703bb330b2287b7a57f161651c8fadab9203025cd5d43f6f4eb991f12682","observation_id":"cd90cc6b-1161-4104-862c-38303358836a","resolution":{"observed_at":"2026-08-06T18:32:49.863554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10613","last_updated":"2021-09-22T09:25:41Z","snapshot_observed_at":"2026-07-30T23:36:30.900578Z","submitted_at":"2021-09-22T09:25:41Z","title":"COVR: A test-bed for Visually Grounded Compositional Generalization with real images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10613","snapshot_observed_at":"2026-08-06T18:32:47.888275Z","title":"Covr: A test-bed for visually grounded compositional generalization with real images.arXiv preprint arXiv:2109.10613, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.888275Z"},"links":{"cited_paper":"/paper/2109.10613","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:47c7c7400a70820bbaffe32d52c0719147b27b7b5aeaecce7faaa22cc07d5979","observation_id":"a353761a-8675-4775-ba49-8e40afb2a124","resolution":{"observed_at":"2026-08-06T18:32:47.888275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-06T18:32:48.029297Z","title":"Does clip bind concepts? probing compositionality in large image models.arXiv preprint arXiv:2212.10537, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.029297Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:a8f84688e14eda6420921b1e0357284dbf246ee9a8a15aec7fcf87112b547a3f","observation_id":"cddf270b-ab97-4fbf-939b-36699f877d03","resolution":{"observed_at":"2026-08-06T18:32:48.029297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:32:48.147656Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.147656Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:504cada6a5e7db84abf169e06cb08f94db69b9457bdd24140eae41979fa263f5","observation_id":"e72a3b76-2f3c-414e-b73d-298ca1be321a","resolution":{"observed_at":"2026-08-06T18:32:48.147656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.223641Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.223641Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:2fc9914c69228fc5d10c8bb58afd3d9e4f1ae186ebae442723f31efeef23652e","observation_id":"9cc3661c-57d7-4361-ab1d-fe160a633f48","resolution":{"observed_at":"2026-08-06T18:32:48.223641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.297322Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.297322Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:5a87d9781fb7ae387606c2e71f74db3ee03d361bdb8afdf7f595d873681e65fe","observation_id":"c98760e6-266c-46ff-82b8-da61dc20f370","resolution":{"observed_at":"2026-08-06T18:32:48.297322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.326309Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.326309Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:3ff982275bc4b86bc1640a9624985619d26ad645b1ae6891697c306641b1560a","observation_id":"8b821a8e-93e2-45bc-a01f-1e1abb7fc48b","resolution":{"observed_at":"2026-08-06T18:32:48.326309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-08-06T18:32:48.390311Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.390311Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e0714ead88736e03759728d22100b035312c1203b4849dcad8c5a4dcac9c1342","observation_id":"08c3f604-a780-46fe-b6b7-cb5b067c7cd4","resolution":{"observed_at":"2026-08-06T18:32:48.390311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.461452Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.461452Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:12c245b0ecdcc453ed6fe3c856cd72a02882b39b27d456c64fcedddbe22b2627","observation_id":"353242e8-6191-4d6f-b25c-f2d98f403f79","resolution":{"observed_at":"2026-08-06T18:32:48.461452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.610794Z","title":"Segment anything","venue":null,"work_id":"e176942e-0c26-466a-a53a-a15271180529","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.536131Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:816ce2899f11ad39ae42c4a1bdc4d873697d992e1e3cdfd00ba4ba37b2b11013","observation_id":"63fcb153-04db-4f4e-a61f-25e58fd4085f","resolution":{"observed_at":"2026-08-06T18:32:49.683465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01903","last_updated":"2022-06-21T21:50:28Z","snapshot_observed_at":"2026-07-06T11:44:19.030296Z","submitted_at":"2021-09-04T17:11:28Z","title":"Robust fine-tuning of zero-shot models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01903","snapshot_observed_at":"2026-08-06T18:32:48.612236Z","title":"Robust fine-tuning of zero-shot models.arXiv preprint arXiv:2109.01903, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.612236Z"},"links":{"cited_paper":"/paper/2109.01903","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:cd060c0a16d4691cb4470d986fe40908c41d6042846bf434231344288378473d","observation_id":"0293cf60-53c7-4324-bdb7-91f2a2f60ea7","resolution":{"observed_at":"2026-08-06T18:32:48.612236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.462444Z","title":"Openclip, July 2021","venue":null,"work_id":"152a9406-7c2c-4bdf-964e-a71af071dcd9","year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.687684Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e523e100e042e90318bbaf4da8c94ae63bc7663cca39653a7fbb03f6e0bf3705","observation_id":"9adf4580-b315-4ca6-9b5c-3bc902cd207a","resolution":{"observed_at":"2026-08-06T18:32:49.533161Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.326194Z","title":"visualizable","venue":null,"work_id":"8813f9af-6d0e-45f9-96e1-3a8807b52bcf","year":2009},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.742052Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:7cb30754d1b7ef050c6ca017ad91b4a559cb951ea9ff3046d5a52728b98b09ba","observation_id":"2026a014-5c8c-4b95-bae7-1d3c8799e045","resolution":{"observed_at":"2026-08-06T18:32:49.387084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:25:27.627651Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.08000."}