{"as_of":"2026-08-10T23:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc124b1572bd11839f6d022e74233aa40e91c4a988930bc029e72c20cb8ce132","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:17:42.908883Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15576/citation-record","integrity":"/paper/2505.15576/integrity","json":"/paper/2505.15576/citation-record.json","paper":"/paper/2505.15576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:47.349796Z","title":"Distill- ing knowledge from text-to-image generative models im- proves visio-linguistic reasoning in clip","venue":null,"work_id":"76f508be-03ff-4c76-8cbe-f41794434650","year":2024},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.136324Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:4528e34cbbef11bbfef355e6e6648234a48cc1e45301bf0510569519cd6bc920","observation_id":"ec091c7e-84e8-4160-8c8d-34a155b859f5","resolution":{"observed_at":"2026-08-07T15:17:47.435271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:46.122558Z","title":"Cross-modal common representation learning by hybrid transfer network","venue":null,"work_id":"724878ff-3c74-44f8-89e4-3ffd389351f0","year":2017},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.338903Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:825dedbd389150ac69c561180ea3f9884dc9bfe5cb341d53778cfa6f6422817a","observation_id":"92b560c6-34bd-476c-b3a9-d2147cb97ed8","resolution":{"observed_at":"2026-08-07T15:17:46.255343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:45.957876Z","title":"Structure-clip: Towards scene graph knowledge to en- hance multi-modal structured representations","venue":null,"work_id":"313707db-c69b-44cf-a564-9d34a636a213","year":2024},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.386167Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:94d32b3c0afdaebc0f5d4f234c273c0c5e41693116fcf4530f8c207349100d47","observation_id":"02561694-c93f-40cf-8a5b-ae8bedb68762","resolution":{"observed_at":"2026-08-07T15:17:46.073325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:45.721452Z","title":"Adaptive prompt-based semantic embedding with inspire potential of implicit knowledge for cross-modal retrieval","venue":null,"work_id":"49ebf98e-656f-4b05-bfa9-1b81c56bb068","year":2025},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.435335Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:e7300ad662982d9e735df72248dfc73fc43c98fff27d10f5961f319a3f1b31e3","observation_id":"e666f391-3fb3-411a-9ee2-73ff1fef7a39","resolution":{"observed_at":"2026-08-07T15:17:45.795270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:45.222239Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"d35b7793-3d85-4c6b-9d46-a939f343926a","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.522432Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:63a7d056e47534f02a66705d3cc4172e2c42d3c17b10f911d1b972344b74f091","observation_id":"85db73d7-d937-4086-91b1-bef36901bcea","resolution":{"observed_at":"2026-08-07T15:17:45.322222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:41.562217Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.562217Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:9eb53eae8fc83eb50aa63be1fb8623b77a85ad61df1fa19d2ac10024b0993083","observation_id":"b3abd114-552d-46df-bc4c-e6de579628bf","resolution":{"observed_at":"2026-08-07T15:17:41.562217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.735967Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"6c9f5bb4-020d-4537-9fe5-6cf72272d232","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.689003Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:533c9bd3068e3435976a22cdfb6d33a6be566e135a11f37ab09ab529028059c2","observation_id":"02da6426-1133-42ef-abc0-1f88d3ffe75b","resolution":{"observed_at":"2026-08-07T15:17:44.823487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16414","last_updated":"2024-08-14T09:06:00Z","snapshot_observed_at":"2026-08-10T14:28:42.365294Z","submitted_at":"2023-09-28T13:08:08Z","title":"AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2309.16414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16414","snapshot_observed_at":"2026-08-07T15:17:43.069565Z","title":"AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models","venue":"cs.CV","work_id":"c7ab8080-1051-422b-b15e-ec2bfe11f334","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.738117Z"},"links":{"cited_paper":"/paper/2309.16414","citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:38a5aa4ab011857d45f6e0a0b1066f80be3c5a1dc74a737a3b57a972744fe9bd","observation_id":"72b8af50-9fce-4487-bdc8-3f60a2142d9e","resolution":{"observed_at":"2026-08-07T15:17:43.137060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.603097Z","title":"Textattack: A frame- work for adversarial attacks, data augmentation, and ad- versarial training in nlp","venue":null,"work_id":"b8a233ea-e24b-4f16-bee2-e2ed43027257","year":2020},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.771940Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:5d102da3eda5b39699640ae285ac0c234099306627103bc2a9668e50f01cf5d4","observation_id":"6b11b91a-b0be-477e-896a-6acd0a4a5ea5","resolution":{"observed_at":"2026-08-07T15:17:44.653688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.262753Z","title":"Valse: A task-independent benchmark for vision and language models centered on linguistic phe- nomena","venue":null,"work_id":"bd52d20a-2a45-4c07-aa30-264bead8da3e","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.867429Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:0d1cbdad36c64fa251ff0c33c088f36a9402521b06189e8e9c7405e9ba412bb8","observation_id":"5d4cd703-11a3-4ee7-9db8-1a5e6f0ca69d","resolution":{"observed_at":"2026-08-07T15:17:44.362580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.112587Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":"03500f46-ff40-4271-aa0f-71f6e6e7be0e","year":2021},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.987278Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:b4b8295ba5baadeaddb0ec56cf8c856e7965cbf64555ab62170c23f5ec114951","observation_id":"0cbf1f8a-a4bb-4e26-8d84-6aa6fd31065c","resolution":{"observed_at":"2026-08-07T15:17:44.179538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:43.860732Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"bc6f26ad-8ddc-4f47-a266-82919615cb94","year":2017},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.271735Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:329d2070f830e6f7025bd2a215840aceee5494a04a15345dbe07fdfcfbba34a9","observation_id":"cb4a62ac-5a42-473d-9441-1154ee5e00a6","resolution":{"observed_at":"2026-08-07T15:17:43.907616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:43.725577Z","title":"Image as a foreign language: Beit pretrain- ing for vision and vision-language tasks","venue":null,"work_id":"32e5ee88-7175-42df-b215-af5f12ccefa9","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.417377Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:e4a851f83ae2903b32408e680ee9914cfc0481c57eb8e0f43b06f2127fb9b942","observation_id":"84b12e22-3366-4d4b-8043-9a845ee50fa2","resolution":{"observed_at":"2026-08-07T15:17:43.788994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:43.492937Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"19364b25-c4ea-4253-99a5-6036aae3dca3","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.546581Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:043bed74dea63bcb71bee9cebf89861385dc3a21cb45db1097fc080485012177","observation_id":"a201851e-5b78-4fa4-8326-dfef90c5a8e3","resolution":{"observed_at":"2026-08-07T15:17:43.593934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:43.275759Z","title":"CREPE: open-domain ques- tion answering with false presuppositions","venue":null,"work_id":"5f1d6aa9-4d07-4782-9f71-1ecba3ba70ee","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.679353Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:0421eab062bf3793c6939b674b68ce10df4b8b7a9b344f8dcaa2ea2f380f8a36","observation_id":"f15431b8-7660-43e9-abf1-13e05e3da31f","resolution":{"observed_at":"2026-08-07T15:17:43.376201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-10T14:28:08.728516Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-07T15:17:42.791864Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.791864Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:758f4d34c34f36a6b6a2608659e5a08a329ac7e1eda497c4e1696c63a0495925","observation_id":"dff164eb-6c6a-4acf-8cb4-bee651993ea6","resolution":{"observed_at":"2026-08-07T15:17:42.791864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T15:17:42.908883Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.908883Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:06bfd4bfcda76ace2ffe97f047a2999fa5b6bb2e3d9545a6214aec237843fce2","observation_id":"e203c0d3-7549-434a-9fba-2910c9f836f2","resolution":{"observed_at":"2026-08-07T15:17:42.908883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T15:17:41.609162Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.609162Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:74919b7343325a25d057a7bdf8fcaef5fc6a5e2488244c3f62c1fdebd83a2718","observation_id":"330b64f6-7ef8-41e1-ab72-c3da8578474a","resolution":{"observed_at":"2026-08-07T15:17:41.609162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:46.410893Z","title":"Sugar- crepe: fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"9d879402-4d35-4616-b708-74b2e3f485ea","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.309512Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:fe3d3b75ff257450b4745a1b1b0b79437002b7738a80eba6e5a26057b847f2a0","observation_id":"e2954376-bc86-4cf7-a5db-f3cedd1d4238","resolution":{"observed_at":"2026-08-07T15:17:46.523237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.920392Z","title":"Smith, Yejin Choi, and Hannaneh Ha- jishirzi","venue":null,"work_id":"39e189bf-e69a-4d7e-bfee-13a2e24ca417","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.654189Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:d6d3bea13a57389ab4377f6af5efe22076da6015dc7b829d9519415cd9b9f692","observation_id":"8a557498-957f-4da6-bc18-93cd963a7d59","resolution":{"observed_at":"2026-08-07T15:17:45.063534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:44.448890Z","title":"Chils: Zero- shot image classification with hierarchical label sets","venue":null,"work_id":"01e1ad5d-edec-41a0-ae35-1d1e6b0d10d8","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.832915Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:b917a91f0d438b2e944fcda059e7821c3f021516c54c552d5f8e014b786c1248","observation_id":"7ccaf003-a3a7-45dc-8058-ea0b90f595cf","resolution":{"observed_at":"2026-08-07T15:17:44.506009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:43.979991Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"16a4187b-6d29-4029-821c-df815627e818","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:42.143732Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:0ccc04de4cf45ae6d7d26553f0355bf227558c32712679278a5770cc320f2f7f","observation_id":"a189848c-4dbe-48c3-b195-b6e52c4a40f6","resolution":{"observed_at":"2026-08-07T15:17:44.043181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:46.700260Z","title":"spacy 2: Natural lan- guage understanding with bloom embeddings, convolu- tional neural networks and incremental parsing.To appear,","venue":null,"work_id":"1a6fdc42-49de-4ec2-ba19-897cd8f4f367","year":2017},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.274371Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:9fb9dde79e48ede30495877bc86535f6825fba6e7e57873b350b4a8898ecf4b0","observation_id":"c418a5b3-7238-4f24-87f9-f94242e88f99","resolution":{"observed_at":"2026-08-07T15:17:46.855712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:46.937041Z","title":"CyCLIP: Cyclic contrastive language-image pretraining","venue":null,"work_id":"a0210e05-d74b-4dc3-a9ca-2bb723eb798c","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.221150Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:9d77ac0668fdc235ad92e8299192596bf96a7bb4f73f367ba024707b90104f57","observation_id":"6ef37cb2-d20d-4616-82b2-d37e257a9bfd","resolution":{"observed_at":"2026-08-07T15:17:47.015340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:47.138977Z","title":"Going beyond nouns with vision & language models using synthetic data","venue":null,"work_id":"dedc91ee-976d-4734-95d6-4a2b14105c63","year":2023},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.177955Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:5ceb5b19aec21d245916b2c6ea6b988a9ef39e35c586c4b3b9dd70443b357ee8","observation_id":"8e556a4b-9df3-43d6-a5e9-a246ffaee2c1","resolution":{"observed_at":"2026-08-07T15:17:47.220575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:45.415403Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"d4fe2f4a-ccef-4fd2-a337-688ae0b65f34","year":2022},"citing_paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:41.478450Z"},"links":{"citing_paper":"/paper/2505.15576"},"observation_digest":"sha256:eaec771f3f2d9626c7aa268dadf6ba6677745600c848620f0ddb7327899f772a","observation_id":"00bc3172-cf4b-41a1-a036-4a5a0eb713bf","resolution":{"observed_at":"2026-08-07T15:17:45.559757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15576","last_updated":"2025-08-28T04:15:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:28:30.080125Z","submitted_at":"2025-05-21T14:28:43Z","title":"Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2505.15576."}