{"as_of":"2026-08-08T03:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cc398de2dacec4e6487057edab9c577afe02c01a3c96f5fe6a3a5e1a964ad17","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:03:27.907091Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22943/citation-record","integrity":"/paper/2505.22943/integrity","json":"/paper/2505.22943/citation-record.json","paper":"/paper/2505.22943"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:32.026809Z","title":"Generated Caption:","venue":null,"work_id":"d75930ca-1cd5-42d1-af1f-786ee3712761","year":2020},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:24.192467Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:ec9da6cc384fa3248cbdc7185d27b400a2df82a1f3929e7dd2cb954d13a8f930","observation_id":"bd77411f-eeaf-40ac-9e8f-71093929505e","resolution":{"observed_at":"2026-08-07T13:03:32.135976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:31.502246Z","title":"Generated Caption:","venue":null,"work_id":"d2f72dfa-33bd-4e02-a380-63af3bc84c99","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:24.587198Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:816e2206a114ae66687441b5a477d3ea950b189943e8e27ea7d304ceef280fea","observation_id":"5db80748-a755-4cb2-9b17-b6edff055445","resolution":{"observed_at":"2026-08-07T13:03:31.611148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:31.740451Z","title":null,"venue":null,"work_id":"88869040-1832-4d31-964e-84906752c74b","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:24.293166Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:89ae59d579bf204798e129abe077183cba83a16485b817e2e267783cd4c82dcd","observation_id":"56651823-46b8-4779-a46d-1b7018d143d8","resolution":{"observed_at":"2026-08-07T13:03:31.880859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:31.252439Z","title":null,"venue":null,"work_id":"766370e1-52cf-4011-83c3-52b959c8fc4e","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:24.670254Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:38b9110302ba94d708a3878d11900c0681823041abae142231096e777febe7cd","observation_id":"58d51f95-3331-4538-815e-5b0e1a3ada5c","resolution":{"observed_at":"2026-08-07T13:03:31.396163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:31.006029Z","title":"Generated Caption:","venue":null,"work_id":"f57563af-c7a7-4dae-93b6-403e27a7529c","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:25.028185Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:29d3b6d70b52f593e659cddf2c1cf6f9c6a9d820da8043b9d859f2142823c749","observation_id":"5d65069e-17ec-4bb4-b5ca-45d5188d3b11","resolution":{"observed_at":"2026-08-07T13:03:31.128502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:30.798425Z","title":null,"venue":null,"work_id":"309cf7e3-d082-4d4c-b999-2c57518554c6","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:25.138186Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:3a378f2c2b4d320247fa0b0157d629a29f87bd24e949aa4fe8e05ac498825f1f","observation_id":"5c30c388-c76f-45d1-acf5-f15ada91d3e5","resolution":{"observed_at":"2026-08-07T13:03:30.900311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:30.546679Z","title":"Generated Caption:","venue":null,"work_id":"e42616a9-da9b-4219-9de9-32be06250e5d","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:25.477645Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:428ec3d24c9b604118faa07ad72b5c32c97de7ef01be6625768594ccc5ed219e","observation_id":"1f698652-5f2b-4cd2-acf3-b4e4b0700469","resolution":{"observed_at":"2026-08-07T13:03:30.665279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:30.276390Z","title":"two\" to","venue":null,"work_id":"1539ecc6-4b26-404c-9262-d0b66c801d37","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:25.587960Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:9bd20857ebe3e495fc50da92f84b87207c402884593fc7ea70db4492f702bf24","observation_id":"eaf17d0d-44ba-4a1f-8ce8-a6e3eb1e24fd","resolution":{"observed_at":"2026-08-07T13:03:30.401493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:30.108709Z","title":"Generated Caption:","venue":null,"work_id":"e800b26e-3c74-4eed-bb79-8cbba1efcb18","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:25.933385Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:b53b03a51bdfeb23d094e0ab3768e586daa9406cca4e5b545010441dd0e29747","observation_id":"5f03481d-a958-4467-9716-b4e9626181f5","resolution":{"observed_at":"2026-08-07T13:03:30.177243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.959360Z","title":null,"venue":null,"work_id":"7500cd57-83ec-4ce5-bddf-322eaf78ce4a","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:26.063298Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:f3d547792871b7b3a417deebb87a9904e909b3fd368b4db7623f1697521495c4","observation_id":"f56e1532-cafb-48d5-bcfe-8733701b67fb","resolution":{"observed_at":"2026-08-07T13:03:30.026424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.837017Z","title":"Generated Caption:","venue":null,"work_id":"9a5813c6-5973-48ac-9915-b2b1e69ae073","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:26.435869Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:206b828ec8594af51d63310d702f92b3616b17d1d841b9595c2627a41b0eafc4","observation_id":"3e6f94a8-8ec3-4f1f-a9e1-0b143c4c1122","resolution":{"observed_at":"2026-08-07T13:03:29.890834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.707291Z","title":null,"venue":null,"work_id":"88624626-3b5a-44b5-8dd4-67809eee9971","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:26.589257Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:a456ce542597931faae3e9a51f7c2364b5205cac99fb7964229adc5526002679","observation_id":"360cc445-622b-4b9b-ae47-086087b6188e","resolution":{"observed_at":"2026-08-07T13:03:29.759656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.560976Z","title":"Generated Caption:","venue":null,"work_id":"69ce4ae3-5cae-44cd-8b1b-d448f0b16368","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:26.871455Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:c7a651080b5ebc42d856ddb0dee7dbfe0ae573380e80f16e823f18774d2d8820","observation_id":"90763670-9554-4175-8df5-b4e9b07818e3","resolution":{"observed_at":"2026-08-07T13:03:29.636168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.441960Z","title":"woman looking at elephant","venue":null,"work_id":"e78b5b35-3b03-40ba-b0ba-eff67caccb57","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:26.942960Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:9d369cb311abaa915e81c67bd7b90e7571ad639465d503198bd202fe18b9478d","observation_id":"0648eaf3-d0a0-4439-b498-8f596280b9a2","resolution":{"observed_at":"2026-08-07T13:03:29.505309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.288201Z","title":"Generated Caption:","venue":null,"work_id":"6981152d-4f16-4e70-9f0a-427dba66570e","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.146824Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:55cc9e187f487b6a2e084cea95705291155c7ac0da8e3d44d52d24701a00347e","observation_id":"112439a1-5232-4c2d-8a64-da0c18786d75","resolution":{"observed_at":"2026-08-07T13:03:29.341367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.154489Z","title":"a red apple and a purple grape","venue":null,"work_id":"08e6495b-db0b-430c-9709-3e4e5fb7ef81","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.200308Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:c8adfb50e19c6f7d656b54377ad262a1e451a3a3dde26d2092ecf991b522ec9e","observation_id":"6cac1fc0-a57c-493e-b09f-064839ae7bb8","resolution":{"observed_at":"2026-08-07T13:03:29.213278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:32.505850Z","title":null,"venue":null,"work_id":"cced3415-9bd3-4bb3-96cc-7e7bf376e999","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.270150Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:7509623d0c972cf240f57c52c55c16c15646f298d2d109245365ad334f1e9ba5","observation_id":"3b3bd504-1f00-48e4-84cc-87588b9b5f4e","resolution":{"observed_at":"2026-08-07T13:03:32.609322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:32.282052Z","title":"no\", \"not","venue":null,"work_id":"c950d470-5c72-4799-a0e7-3b4542ed64ce","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.339596Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:57b42dd83c1b0a399cd5a0190c502ff22c5a607b023262bb5674b579ae6f55b3","observation_id":"478ee17e-cd4a-4e98-9482-dc8752cbd321","resolution":{"observed_at":"2026-08-07T13:03:32.379731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:29.026314Z","title":"Generated Caption:","venue":null,"work_id":"388e8af1-8a58-487a-83dc-172f6687975c","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.402973Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:ca47dff934d24726cac689d3a43e59d9256a2971f9c2b3bd3d76313c0aec5f5f","observation_id":"1c154188-28ca-42c0-86c3-a77aa5f3b54f","resolution":{"observed_at":"2026-08-07T13:03:29.090619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.719919Z","title":null,"venue":null,"work_id":"057d5ba3-4dcf-4029-b11e-528b560e0a4c","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.535721Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:0dcf13bd0eff9810bb49dc889b240f9c41ead62312712b25c87ba7e3d40e944c","observation_id":"b1b27cf8-4516-4adf-a3b5-f9fc878b3fbd","resolution":{"observed_at":"2026-08-07T13:03:28.793263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.568752Z","title":"Are two sentences contradictory based on the video?","venue":null,"work_id":"b8bc15ec-9dce-4272-ad91-f6b2f21b2cd8","year":2022},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.595774Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:acc25d381b65550e5cfbf8de94a0fe13c0f71e1e2a242cf4fe6642ee98f79275","observation_id":"50407dc4-ed1f-4d02-984f-e5ef0c0ea697","resolution":{"observed_at":"2026-08-07T13:03:28.640131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.873168Z","title":null,"venue":null,"work_id":"fd67e999-f4cb-42ce-a6e2-fdac721a9dc6","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.686828Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:f04cc30ff1b6156db62188cefe2bf6151e98f0310602a2ef73ce8143bb9639ff","observation_id":"9a438ecd-66f0-4a14-a012-8fac3d5871c0","resolution":{"observed_at":"2026-08-07T13:03:28.947788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.432442Z","title":null,"venue":null,"work_id":"57b15e56-9be9-4385-9df7-9320ec00681e","year":null},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.765510Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:62dc36bc3a9a2694473ab054e4fc38830d13bf635bdfb95b69c14b703c0adba5","observation_id":"4c33dc6f-5c22-4462-a0b3-b717711d64c3","resolution":{"observed_at":"2026-08-07T13:03:28.490465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1093.30100","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.297088Z","title":null,"venue":null,"work_id":"71413e10-47f4-4c46-a7fa-2973f7f93d04","year":2023},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.832893Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:7b3f30c5e0ac7c3303bac7a1ace339ff142a808cf19c6956e2eecc38195a6266","observation_id":"454eeccb-7337-46aa-8a25-72ba1e2e3407","resolution":{"observed_at":"2026-08-07T13:03:28.340863Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4890.28761","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:28.121863Z","title":"Does this image I match the following captionT? Answer Yes or No directly","venue":null,"work_id":"74ecc085-df55-406a-bc78-0469af913786","year":2018},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:27.907091Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:2b535a86f7bf69ff7601c397229ce5c95d4052e31d13fecca3966c4acaf307f3","observation_id":"4af1bbe1-ff21-40f9-b9f3-43595f78a485","resolution":{"observed_at":"2026-08-07T13:03:28.184069Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T13:03:23.784740Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:23.784740Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:4863c12f969fcf57b8d5309dd4842c0ef3dfb0563b6b3ce7b9cf7f015e371a7d","observation_id":"73a6ba4c-b22a-42ca-8bb8-42c084618fbc","resolution":{"observed_at":"2026-08-07T13:03:23.784740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:32.695440Z","title":null,"venue":null,"work_id":"38d7c627-dfaf-4a3a-b4f3-dea219f99cfe","year":2021},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:23.861538Z"},"links":{"citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:3f47f43bb51e5ba7700175d1930f92f3a3420028dd0d700b512f7953e416c0c8","observation_id":"9c05eac7-4813-495a-8713-457e65196fcd","resolution":{"observed_at":"2026-08-07T13:03:32.800619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:03:23.704320Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:23.704320Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.22943"},"observation_digest":"sha256:1751be79a622ff39a3b79789eb1bfc4254d4b61e262a093353fb28cf28ea7bf1","observation_id":"1a9df769-951b-4c9b-a0bf-5577854c22e7","resolution":{"observed_at":"2026-08-07T13:03:23.704320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22943","last_updated":"2025-05-28T23:45:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:54:34.406951Z","submitted_at":"2025-05-28T23:45:55Z","title":"Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2505.22943."}