{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a656858f5d97868a5d8c3e12a847a91d8321194d152ca4ba92fb38a788e4cd72","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:19.895071Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20764/citation-record","integrity":"/paper/2505.20764/integrity","json":"/paper/2505.20764/citation-record.json","paper":"/paper/2505.20764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.458349Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"0eb17de6-1ba4-4bd0-9039-6f7321a77478","year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.124342Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:68c75b98719aa94d5b64dc3ab2266d41dcdcffd210d2b40bc40735ee7ff7ccd8","observation_id":"0e16bcf2-47c4-415f-a55a-450b1059486d","resolution":{"observed_at":"2026-08-07T13:53:38.625286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.172906Z","title":"Effective conditioned and composed image retrieval combining clip-based features","venue":null,"work_id":"eee5974a-c4e8-48fd-a66b-7c5f0fb8fa96","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.197032Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:1e444fc1b50c9b12e8bed4e0079a2869c53a22e674f929818252f0c6c18f950d","observation_id":"667c98f4-0393-4f4c-8814-e10c0df1159a","resolution":{"observed_at":"2026-08-07T13:53:38.338521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.921837Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":"0dcebfec-aab6-4f22-9285-ba4003d6b487","year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.305277Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:433d89812230ce2a182f1ffc27c602f44ac2f950b9162cbb8699af9140c61cc9","observation_id":"cf345bce-49a1-49a5-8afb-e7530f98b9eb","resolution":{"observed_at":"2026-08-07T13:53:38.042754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.613544Z","title":null,"venue":null,"work_id":"214ff00b-c058-43e5-a270-1ac378cf8432","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.364365Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:9ff2ed2f3b2b23f92d9f259b82a79835a8cb19993dd4565e22215f48ae0f3517","observation_id":"d27dd8a0-7e04-484b-b27b-c37ba42586b2","resolution":{"observed_at":"2026-08-07T13:53:37.770141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-07T13:53:13.438855Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.438855Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:32e6b27c3f01d1e101a0cf901cf5a520ce21157696d94b288d2fdb4310acac3f","observation_id":"3bee0394-b482-426b-abc3-b620aa31cd07","resolution":{"observed_at":"2026-08-07T13:53:13.438855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.376653Z","title":"Emerging prop- erties in self-supervised vision transformers","venue":null,"work_id":"14f1455f-3e63-40e0-90ba-a010a6e8fe8e","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.523889Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:7f9bea059f3c34bed56a4e6f99b8b418565c7e9f5bc8a6b81f686e98a16c473b","observation_id":"86093759-a6c7-4633-980b-0d98204f749b","resolution":{"observed_at":"2026-08-07T13:53:37.482535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.099922Z","title":"Bakker, Theodoros Georgiou, Paul Fieguth, Li Liu, and Michael S","venue":null,"work_id":"21b91398-5371-4b9c-af73-00c35aab9ce6","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.604925Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:4d6b17617ad4dcdf629e31dad21f16bac7ad512c82aeadd330623fac5afcbc01","observation_id":"ce7a19ea-59b2-4921-a5c3-5c87af67dcc8","resolution":{"observed_at":"2026-08-07T13:53:37.216807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.769339Z","title":"Image search with text feedback by visiolinguistic attention learning","venue":null,"work_id":"338fb244-7437-45b2-9527-b5e4b8d51bfb","year":2020},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.683266Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:6af328cf272a1cd004a5220f2496941fb44a7e781ff15ff2dffc6e3a9cb77c49","observation_id":"a015c7e0-ef56-4cd7-ab0a-7787d5c5dfd0","resolution":{"observed_at":"2026-08-07T13:53:36.955768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.460998Z","title":"Metaxas, and Hongxia Y ang","venue":null,"work_id":"6a6992f5-9cba-44b6-ad33-72f890cecaf5","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.767747Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:10346a3fd5a3c33e577db12b8789b82f448daf3829b59dc8683f2b768846915c","observation_id":"8ca25717-e3cd-49b7-bbf3-9b5563b0b93e","resolution":{"observed_at":"2026-08-07T13:53:36.585814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.230078Z","title":"Instructblip: towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"60f99b80-dade-4baf-b685-91e5e3d71f35","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.848278Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:b203980650a6c9b1b64dedf89598d5af4d29973241598406e1540cbee6f68ba4","observation_id":"94480b25-89d3-4497-ba7a-00a8fd51302e","resolution":{"observed_at":"2026-08-07T13:53:36.335618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.053280Z","title":"Artemis: Attention-based retrieval with text-explicit matching and implicit similarity","venue":null,"work_id":"582a6aa4-5869-4ea3-bee7-b8d9ba12da07","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.933244Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:d00e8c63b5f2c5793e63807c9a8cd80256f687447e43ceb16481c03b48e5a0c9","observation_id":"4cbe4594-2d16-4e2f-b819-0d1c28826c5e","resolution":{"observed_at":"2026-08-07T13:53:36.135283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.846022Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"27d890f9-d0a8-44ad-ae94-c71c99b2eca2","year":2009},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.014178Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:93d110182c70ca618312cf616e8f562e3dc970ea2393fcf8eb2cab2e53e55ed7","observation_id":"14000f4b-78bf-4f11-8d98-9cb72596877c","resolution":{"observed_at":"2026-08-07T13:53:35.911527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.550455Z","title":"Characterizing context influence and hallucination in summarization, 2024","venue":null,"work_id":"319e9d9c-8653-4030-95bc-f734d5a79c36","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.087643Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:099d302353f16d3dcc1655a14d08fcf7efef46ecbc24bec698d8d87586691e98","observation_id":"50c8937a-f4e8-4d1b-b8c2-a24d17c00b12","resolution":{"observed_at":"2026-08-07T13:53:35.736915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04101","last_updated":"2019-11-14T01:19:36Z","snapshot_observed_at":"2026-08-06T13:36:04.298242Z","submitted_at":"2019-09-09T18:54:40Z","title":"Neural Naturalist: Generating Fine-Grained Image Comparisons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.04101","snapshot_observed_at":"2026-08-07T13:53:14.156914Z","title":"Neural naturalist: Generating fine-grained image comparisons.arXiv preprint arXiv:1909.04101, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.156914Z"},"links":{"cited_paper":"/paper/1909.04101","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:fbc12bf0b4d9cd0dae6126a668b6b944767e1049e810a86be0bb17fd9a711a06","observation_id":"34efb20b-61dc-42c5-8c67-ecf090b1c580","resolution":{"observed_at":"2026-08-07T13:53:14.156914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.118557Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":"b98fc12a-1429-4e46-9192-b5bb9306bf03","year":2017},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.239266Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:89639a1a5bd12f120f2f26e96bcaaaa540ee6ccf31e8c653d5297d908308e366","observation_id":"b99788ce-a506-446b-ad5c-47b9363e8673","resolution":{"observed_at":"2026-08-07T13:53:35.339953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:34.728672Z","title":"Language-only training of zero-shot composed image retrieval","venue":null,"work_id":"95ecc6a5-3b4c-4273-8258-9e8c51a59fea","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.325582Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:61e68bcc664c824003353eb52a9fd50fff86509cb613b80426595fc28606947b","observation_id":"14de4d38-995a-4644-a4d3-03762f826796","resolution":{"observed_at":"2026-08-07T13:53:34.877612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:34.448391Z","title":"Compodiff: V ersatile composed image retrieval with latent diffusion.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"43796ab5-6275-414b-a91a-3ce65b445aae","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.430586Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:81a3f6a4d0a0b27ba6953fb658fc87f3b83820b99bb23773553ced3e3b2697e0","observation_id":"13c54050-6741-483a-b5f3-6eeb70d6b074","resolution":{"observed_at":"2026-08-07T13:53:34.566641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:34.273329Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization.ICCV, 2021","venue":null,"work_id":"29f84a64-89ab-41fe-8de8-22e3e03c145b","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.514498Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:06a9bce06708f46a79f93616fe1f0253b70c6ec666ee1c38a0813e2573c56f6d","observation_id":"c390f1f1-9b59-405c-84b1-3045bd99c03b","resolution":{"observed_at":"2026-08-07T13:53:34.356744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:33.951064Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":"7c62f260-2cfa-49b7-ad58-e069fd078b87","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.607782Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:83278355bb9550658425459103695461f40a982da9747441f58db7f5e9ad2777","observation_id":"ad5ad618-b0c1-408f-a8bb-d139a11f2c80","resolution":{"observed_at":"2026-08-07T13:53:34.125049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:33.774090Z","title":"Referring image segmentation via cross-modal progressive comprehension","venue":null,"work_id":"5ba0553b-21da-4cad-a89e-c4af9cce5fb1","year":2020},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.720384Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:52ee567a45eb6c1a21414d3cf05b820f8f1d6258c1aaff84ba0bee8d00e3169b","observation_id":"9d7ad53c-725b-42f7-b687-d77195f50cab","resolution":{"observed_at":"2026-08-07T13:53:33.849238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:33.590119Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question an- swering","venue":null,"work_id":"4aab1906-e074-44ff-a3b8-2f8ddd3dec77","year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.788468Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:017f60aee150ea5ea51933b0b6a45c373eae9d579cbff195abf8cd4ee7df9079","observation_id":"3b589a80-ec07-4acb-ac5a-8705aff68b05","resolution":{"observed_at":"2026-08-07T13:53:33.666063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:33.385691Z","title":"Openclip, 2021","venue":null,"work_id":"abc2d2f4-653d-4c9c-8af1-c9319c13cc4a","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:14.854301Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:6fe730f584b8e73a77d58172ca7c3ef8cbc7aee88c24c0593ae4aa5dd6d72a54","observation_id":"18c53142-8e92-4dc7-bf01-2587911baee2","resolution":{"observed_at":"2026-08-07T13:53:33.486972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00571","last_updated":"2024-05-01T15:19:54Z","snapshot_observed_at":"2026-07-06T18:08:13.456457Z","submitted_at":"2024-05-01T15:19:54Z","title":"Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00571","snapshot_observed_at":"2026-08-07T13:53:15.042076Z","title":"Spherical linear interpolation and text-anchoring for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.042076Z"},"links":{"cited_paper":"/paper/2405.00571","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:16819deadcef2c9f90a6c6c7ccf92cab6aa7595321c6c875211012df6b17a524","observation_id":"801e9490-c023-4dec-9ba6-c6a56967a9e9","resolution":{"observed_at":"2026-08-07T13:53:15.042076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:33.121516Z","title":"Dual relation alignment for composed image retrieval, 2024","venue":null,"work_id":"aa5b4e71-fefd-4d51-9eaf-03b3c74b25b5","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.178063Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:464e74c345fbb27c5ffb2f03b6d966921135a56a281993e1f3acd7231ded680e","observation_id":"41583a15-7754-4104-a2e6-91177d45ac3e","resolution":{"observed_at":"2026-08-07T13:53:33.262667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.838117Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"dfae2037-159b-4704-8a95-59663c3740b7","year":2017},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.251348Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:2471fd6f86e11cc0a334a91ac5e1cbb30bbe62e046cd9e3a5cb45f2f293dbe7f","observation_id":"598d8020-d927-4caa-b978-23f2cbfc846d","resolution":{"observed_at":"2026-08-07T13:53:32.967836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.604389Z","title":"Vision-by-language for training-free compositional image retrieval.International Conference on Learning Representations (ICLR), 2024","venue":null,"work_id":"63e8c77f-6bd1-466d-997c-dd9a6b6c8477","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.394856Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:8f5a93bfba68da4f5ea6f5b94540478f3588b4a4a395a14523a79c255fac3884","observation_id":"d4f6fc72-2db4-4e6e-a7f1-5fed4d5dbd9a","resolution":{"observed_at":"2026-08-07T13:53:32.714545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T13:53:15.534016Z","title":"Berg, W an-Y en Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.534016Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:ee0324ea95ef47c7b6bbdca0c03c258f0ec63e7f5ca06173c125e7c710f34bf3","observation_id":"756ce0bd-bcf5-472e-918f-b14508a60a55","resolution":{"observed_at":"2026-08-07T13:53:15.534016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.330481Z","title":"good4cir: Generating detailed synthetic captions for composed image retrieval, 2025","venue":null,"work_id":"962955fc-aa60-4e9a-9118-d9c8d5bd7567","year":2025},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.627355Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:b1ef43e430a98cb5ba3e4e8d0364a15646e8801ff0dda60e5e3557dc71bf7b70","observation_id":"5cbcdecb-0289-4851-a1f2-c27ba783af70","resolution":{"observed_at":"2026-08-07T13:53:32.463828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.116167Z","title":"Set transformer: A framework for attention-based permutation-invariant neural networks","venue":null,"work_id":"5c57198a-5cfd-41de-baa2-2cc491832c53","year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.707751Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:929053bcdcda7bdb62ab42ba75115405a650ab12d0f2f4d533e7158dee02ae0b","observation_id":"6588d827-524b-42f3-a5d9-cad0809061b2","resolution":{"observed_at":"2026-08-07T13:53:32.217250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:29.730795Z","title":null,"venue":null,"work_id":"4f2f8ed7-73d7-4a90-b358-e60fccbff25e","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.767582Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:2808c39093a245ea5537af7fd12e9343390a28d8889f3d5468dfdb442c72665f","observation_id":"8f3ca08b-349e-4188-8e91-f3ace5477ec0","resolution":{"observed_at":"2026-08-07T13:53:31.986218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.947973Z","title":"Language-driven semantic segmentation","venue":null,"work_id":"d9f3dd72-a2af-4dc9-8a43-bad36ec81551","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.841439Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:5dd764d56be932c55bc451771f3906dfb6504b5851347d0b708cb58d7de0e5ae","observation_id":"0a89f735-1b20-4135-b7b3-1e280971ec19","resolution":{"observed_at":"2026-08-07T13:53:29.090917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.658604Z","title":"Visual-linguistic alignment and composition for image retrieval with text feedback","venue":null,"work_id":"beb6a4a9-92d5-45a9-b231-85d00e7aa1d2","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:15.930023Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:c4223f1a6242626cdb6713444f4dd3a1561ebd7c3f78d9cd3ca7a809f30b7ec6","observation_id":"9b4b330b-b6f4-439a-b233-c13ba9881626","resolution":{"observed_at":"2026-08-07T13:53:28.801344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.241102Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":"495823fd-29f6-4dfb-91de-2980748a2dc5","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.027913Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:3d7e313747d69f1a9e0c2050867b3fced7ff96f5ddb44ad87c0767b841934486","observation_id":"681ecd32-8f77-4405-badf-3deebd23f8d2","resolution":{"observed_at":"2026-08-07T13:53:28.437227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.850083Z","title":"Grounded language-image pre-training","venue":null,"work_id":"5e220a10-8c59-4b7c-91b2-774d8c958172","year":2022},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.130248Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:4e3f98d18817c5a35faf81ef369fb6c1fac9c9562bda7529d5624bf5940ad30b","observation_id":"6b34bb79-07ea-40ed-901b-2f9fc9a8beab","resolution":{"observed_at":"2026-08-07T13:53:28.020897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.430478Z","title":"Lawrence Zitnick","venue":null,"work_id":"8f3abf60-f170-4d37-9a0f-b49f7017b80e","year":2014},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.185567Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:b8a59d9d04517131ed5886e93dd2a6ae72ac282db0749694b41bc5c835deceae","observation_id":"2d405a9c-1a89-4252-8dfc-2f1cb19bdfbb","resolution":{"observed_at":"2026-08-07T13:53:27.675395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.143103Z","title":"Visual instruction tuning","venue":null,"work_id":"0dead09e-cd36-4099-9aab-55d1377b9c65","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.268170Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:98255966f8e3a8a684da87f0b0d70a6e2d33cec56662d6ca00b38d3e0358feb6","observation_id":"22033fd0-0fa2-49d6-8f93-a4a9cdbc8706","resolution":{"observed_at":"2026-08-07T13:53:27.299036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:53:16.358127Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.358127Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:99847d35d01363966184d6b719c09ee2d70a7c8a73fdfa58dfad5d62e918f239","observation_id":"4d8630f8-b367-4e87-b3e0-7b93a9d4a8ff","resolution":{"observed_at":"2026-08-07T13:53:16.358127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.834638Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"3e29d1b5-421b-42f6-8c90-576b66178c6d","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.425960Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:fa968d401d1edffdebf097bc7b47779b192f13a24687173e8e51ada9cc0df61b","observation_id":"f050aa26-1349-4da4-8452-a8fd3622d3c9","resolution":{"observed_at":"2026-08-07T13:53:26.965663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.620449Z","title":"Cfir: Fast and effective long-text to image retrieval for large corpora,","venue":null,"work_id":"0181551f-09b9-4967-8eed-ab47fa632380","year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.488377Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:d63387e806dd1040641d524bc9c826fe8cd1a6f984d9f72c6c9c3e1c7a8687e9","observation_id":"151029ad-8440-4250-a669-36bd70e1ad9a","resolution":{"observed_at":"2026-08-07T13:53:26.722582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.571774Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.571774Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:4aca5ee2f40be232aac3ef4f6fa6713ed3a97c961c7bdc8cb604ea11d83d8014","observation_id":"16da114a-0493-4ff6-83fe-ab7efd8391d4","resolution":{"observed_at":"2026-08-07T13:53:16.571774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.329657Z","title":null,"venue":null,"work_id":"a3fd0702-dd30-4b36-a7fa-116437743b90","year":1990},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.643036Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:9e69d78ff41c26b6bd8d2b89e2b0dec2a6d701a8e50d06ba42e3769e912110ee","observation_id":"1dc25055-a045-4b8b-8484-286661570d8b","resolution":{"observed_at":"2026-08-07T13:53:26.449126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.972620Z","title":"Psomas, I","venue":null,"work_id":"4d59f7d7-53ae-482e-9315-d323f94905c8","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.716507Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:73b22352da5dbdd039a3a7b7b83a645b3d990012a274315f7b615044456ac877","observation_id":"3f7aa597-b34e-428e-aaca-51ba06c4bcaf","resolution":{"observed_at":"2026-08-07T13:53:26.137636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.775268Z","title":null,"venue":null,"work_id":"7912647e-b943-4322-853e-a40ef0716d89","year":2020},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.779158Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:0227c4c86a6e298bdbef8157e79cb7ca7eb4f390d5ff3049206765f9069b81f2","observation_id":"24e3afd7-7e4c-4fde-bf8c-58cb8792f21b","resolution":{"observed_at":"2026-08-07T13:53:25.908521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.556097Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f851e61c-6be8-4218-ae7a-daa832356e15","year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:16.908593Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:1d5a429b13ddfbf6884e0056a06514eaee6e9593574fa290b620aefb1230f6a4","observation_id":"f866e023-011f-409c-a8fb-349d33ddd9a2","resolution":{"observed_at":"2026-08-07T13:53:25.620101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.334643Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"03316b9f-2866-4dc9-96c3-4102db46a81f","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.072122Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:3138d464fbf5ea1f6b844641f316e8b185a4a77ab24d783dacbdb9a4f7b5f167","observation_id":"253076f7-02be-4dd2-babd-9b82be663122","resolution":{"observed_at":"2026-08-07T13:53:25.476334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.124659Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":"37a281ab-5e4b-4c7f-b98a-e7b0c8f5a7aa","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.164897Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:4ed802c4bbf26bdaf0f6d59557ec01e22528fab26c9a47c532e926198f061aef","observation_id":"d0f0a0cf-b19e-4c80-97be-fed33448eb41","resolution":{"observed_at":"2026-08-07T13:53:25.230668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.942610Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval.CVPR, 2023","venue":null,"work_id":"e026c310-d798-4c72-87df-6b51c45662ac","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.235481Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:554487b9259c70145b753f28a7b9b3a2cb3f623e2df8dc926c76aca9b97d44e1","observation_id":"4a667b63-3bc9-496a-a373-713ef595ccad","resolution":{"observed_at":"2026-08-07T13:53:25.027558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.794875Z","title":"Deep learning based large scale visual recommendation and search for e-commerce, 2017","venue":null,"work_id":"db7e8d09-44c8-416c-8b7a-7869852ba259","year":2017},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.374387Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:66d07a5c3622573b690495fedbf03326ce26d4ff40b3009368ff241100d3f7b0","observation_id":"d4bdc26f-1fd7-458b-826d-93d8afdf0257","resolution":{"observed_at":"2026-08-07T13:53:24.880532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.451521Z","title":"Lime: Localized image editing via attention regularization in diffusion models, 2023","venue":null,"work_id":"c7761541-d35d-483e-9ac8-e6488a7f4518","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.471222Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:c9f06e0a4f858e7dcaecb1da76e3eb2a9342904df2cae9bb498117c230ce7ab8","observation_id":"7b1c9a3f-1111-4d75-9f48-283f93235647","resolution":{"observed_at":"2026-08-07T13:53:24.629061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.142915Z","title":"Syncmask: Synchronized atten- tional masking for fashion-centric vision-language pretraining","venue":null,"work_id":"6f84b672-ff9e-48b9-9c79-828f3d875bbc","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.541139Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:f703b82ea1baab11f52deb9c5a273490c7fee87ec72206abada0f67fa0499b80","observation_id":"d8274385-b0b4-440e-aaa7-ff631afc1145","resolution":{"observed_at":"2026-08-07T13:53:24.297438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.888841Z","title":"Fd-align: Feature discrimination alignment for fine-tuning pre-trained models in few-shot learning.NeurIPS,","venue":null,"work_id":"8e89988a-e05b-4216-8b0f-afa01d7756d5","year":null},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.591837Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:d08a05c65482c6df441db52fa28013bf6c3f09754bdf50bb381de9eeeca04937","observation_id":"89191c24-4c69-4ece-92f4-f622f93684fb","resolution":{"observed_at":"2026-08-07T13:53:23.996150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.691909Z","title":"Hotels-50k: A global hotel recognition dataset","venue":null,"work_id":"ac4867f9-b1b6-4a2a-90fe-6fda2ef8211f","year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.756046Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:9f22114d73a82fc591b6041510e86c1fc6136b2582c041ff9111a5cdf3cb2014","observation_id":"d7c8675c-94a0-42f6-9d2e-cf0b92ebb1ba","resolution":{"observed_at":"2026-08-07T13:53:23.782219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.505085Z","title":"Sudhish, Latha R","venue":null,"work_id":"e2d16d36-30e8-433c-90b1-73c4224d964b","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:17.888684Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:8edacc73de33008148a54c63d82b82dc26cc9641c33e0a298b55ec6dbb699daf","observation_id":"ac81a119-f6d7-4bc9-923b-f9c05486950d","resolution":{"observed_at":"2026-08-07T13:53:23.609485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.134635Z","title":"A corpus of natural language for visual reasoning","venue":null,"work_id":"2901018f-eba7-4015-b45c-43aafe9f48ed","year":2017},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.003789Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:7eb09993ca0e2c07b877f720c9250e0f1f01b18b72fef31ed8371e692f79020a","observation_id":"eccdea3d-ed82-49a1-b789-a27536121295","resolution":{"observed_at":"2026-08-07T13:53:23.373719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.825096Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":"9f36b9c6-1ffd-4d9e-a4b4-bec9ad6ea620","year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.107847Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:79cd4b19dc7fd9f291934d6b5618de8d758b4de1badf0b44191c08cc50240988","observation_id":"ac7fe180-e6dd-4ac2-b987-cec711878427","resolution":{"observed_at":"2026-08-07T13:53:22.969195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.549591Z","title":"Exploring clip for real world, text-based image retrieval","venue":null,"work_id":"8ecaba37-6bc1-4447-8951-fc85161fa17d","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.181206Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:6bd9dae8ee9ec25cf7581e6340e0bf5dd4d6a862547421cc1e2785f10ddde31c","observation_id":"de0be5c8-e40d-42ff-8259-a95d2d9b9a82","resolution":{"observed_at":"2026-08-07T13:53:22.676266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08924","last_updated":"2024-03-24T14:23:59Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:31:01Z","title":"Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08924","snapshot_observed_at":"2026-08-07T13:53:18.246700Z","title":"Training-free zero-shot composed image retrieval with local concept reranking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.246700Z"},"links":{"cited_paper":"/paper/2312.08924","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:8567ecad0e570459d5adac47efc8602e58a2ecdf0fb97cb63d0dc07e242caec1","observation_id":"3a28f359-cd90-4571-85c5-c83b505a390c","resolution":{"observed_at":"2026-08-07T13:53:18.246700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.327348Z","title":"V entura, A","venue":null,"work_id":"cb867ea1-df02-4d05-83f4-e59edcd8df10","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.332719Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:feece93fbd1b26f1a06bf11c4f8958d11ee2279cbdbb09e21dbaec21b1e2f51e","observation_id":"3fd0e105-c94e-4c07-9696-723af3ff9aad","resolution":{"observed_at":"2026-08-07T13:53:22.425049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.111455Z","title":"V entura, A","venue":null,"work_id":"fe289a6a-c5f6-403e-93cf-eef81b5640c5","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.441154Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:01271e3952de705448906e5188344e1543a0c51be6cab3315689e99155d47d97","observation_id":"0a4996b6-d046-4046-8550-4d0996115a08","resolution":{"observed_at":"2026-08-07T13:53:22.205913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.890524Z","title":"V entura, A","venue":null,"work_id":"6a1fa172-9cff-4bea-b8b8-b3829654d1cc","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.552193Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:0fc78f1072b4fd8a9e29b539a38eae1e39a17f6115a1640d107e97e70e0b327f","observation_id":"c9ed4e7d-44af-402b-88e0-db1409bc26ea","resolution":{"observed_at":"2026-08-07T13:53:21.998457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.667115Z","title":"Composing text and image for image retrieval-an empirical odyssey","venue":null,"work_id":"50975145-60b9-460a-a67a-8d81aa23c3e1","year":2019},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.610827Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:a7f26c07179e39fc963257fdc3e966260065c04c3cea2eb4af601fdfba1cfd49","observation_id":"09f29962-04cf-4ac5-a6ad-3f8020165b14","resolution":{"observed_at":"2026-08-07T13:53:21.781822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.474439Z","title":"Contrastive region guidance: Improving grounding in vision-language models without training","venue":null,"work_id":"6a0a9ee6-e787-4fb3-aa8b-e96e15d45c38","year":2025},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.721468Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:da4beb53f9fa885141f80bad06dfc0968ea3d1727e84120ab25221fb2218e9db","observation_id":"eac0e310-5951-482e-8f90-ae29091a6998","resolution":{"observed_at":"2026-08-07T13:53:21.575823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.295588Z","title":"Cross-modal feature alignment and fusion for composed image retrieval","venue":null,"work_id":"be3797a9-2a7c-431f-9fba-d70d522e9ffa","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.788882Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:28a739bfbaa02d2c3c48589e873e3a41b38a4ed92178841ca327289865d5cfbd","observation_id":"182e85c0-1bb8-4ac9-9d7d-a57c05a0c883","resolution":{"observed_at":"2026-08-07T13:53:21.376439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.191934Z","title":"Dynamic prompt learning: Addressing cross-attention leakage for text-based image editing","venue":null,"work_id":"4d249a32-74e6-493f-8bfe-60ef7e28e9bd","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:18.887974Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:5a7cd2e912689946c48c9c8cedf509548c13930ffbb60c756608b8c6188a4fe8","observation_id":"72bd1285-831b-4732-8082-1736ae7a6165","resolution":{"observed_at":"2026-08-07T13:53:21.233462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.005782Z","title":"T arget-guided composed image retrieval","venue":null,"work_id":"1f95fd07-eb9f-428c-aa75-4811f26dffcf","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.068373Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:a8930c037298f39f69f871dd9a0b20caa592a47ace4eb6339cb3c6e280a8af84","observation_id":"56ea9133-6960-4cd4-a7e8-975aa0f8f92c","resolution":{"observed_at":"2026-08-07T13:53:21.113605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.823369Z","title":"The fashion iq dataset: Retrieving images by combining side information and relative natural language feedback.CVPR, 2021","venue":null,"work_id":"fa541f87-a996-4e37-bed5-7a0b45995d62","year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.202224Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:71621667e3c863ee3ea7da3a4682bf537be782a08d03378d57a50ba82fee89b8","observation_id":"e0733654-2d8c-4067-85af-edd6a7518b65","resolution":{"observed_at":"2026-08-07T13:53:20.894439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.706128Z","title":"Asymmetric Feature Fusion for Image Retrieval","venue":null,"work_id":"a7717ab9-d008-42cb-b1d3-dc55009eb226","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.364477Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:2a39fe3f80a03fcf1edb4423759074a772ea21a63ca4d76f1e52b89c4e1e3f66","observation_id":"ab1e5f64-bc47-4674-9d49-71804d0ab630","resolution":{"observed_at":"2026-08-07T13:53:20.755138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.590425Z","title":"Align and retrieve: Composition and decomposition learning in image retrieval with text feedback","venue":null,"work_id":"baa59b38-7cf4-4c73-b526-78c56b4eb3ba","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.458362Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:a75f46923fd7c6f12d21c01206f20a0748fe5bd92d2f44c49e7a6806fbe615ce","observation_id":"e339a626-b098-459d-83e4-fa1565c36fad","resolution":{"observed_at":"2026-08-07T13:53:20.637482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.473918Z","title":"Ldre: Llm-based divergent reasoning and ensemble for zero-shot composed image retrieval","venue":null,"work_id":"09c1bea9-1e68-4e2b-ad45-6bcf65bd51d2","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.549274Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:3896cfaaaf4421c73c29e8c13a80c4da5b942c94a556fa3ef235b26827cf3958","observation_id":"c0b607a7-5d25-4ebd-866d-c3e60425332b","resolution":{"observed_at":"2026-08-07T13:53:20.530297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-07T13:53:19.694499Z","title":"FILIP: fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.694499Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:f62e7ebac676067f5b278e12b7de683e1cec21214dadf801a113ccd34cd1295b","observation_id":"2c35fb94-e3e6-4786-b4bf-a649b9ea3e60","resolution":{"observed_at":"2026-08-07T13:53:19.694499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.329790Z","title":"Geo- localization via ground-to-satellite cross-view image retrieval","venue":null,"work_id":"0efe9cee-0509-4f61-a0a4-e015a2a4d116","year":2023},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.759320Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:06f24685fe67cd6bbaa1e3131913740a2627139ab9aa2d0ef62b9b6fd1227cbc","observation_id":"5a853ded-7111-4fdf-b1ed-90146dfa2d63","resolution":{"observed_at":"2026-08-07T13:53:20.400919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.179201Z","title":"Zhang, Y","venue":null,"work_id":"7e92749a-3b7f-45ce-8fa9-2c69e786df63","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.845608Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:08296b2af82e23ea0224da6ec80127f7f78bf5680ce11672c9e9b0863b019616","observation_id":"5ae3a642-a2c6-471f-97ab-a8961500c948","resolution":{"observed_at":"2026-08-07T13:53:20.256362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.071862Z","title":"Irgen: Generative modeling for image retrieval, 2024","venue":null,"work_id":"163df0d4-8aa4-42c2-b0a8-6aa7438f1cfe","year":2024},"citing_paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.895071Z"},"links":{"citing_paper":"/paper/2505.20764"},"observation_digest":"sha256:315700081981e32c7cd359ce9451692f79eeaa6d334073a281cdac740b94c834","observation_id":"53454af1-95de-415c-9a12-738bf735cf95","resolution":{"observed_at":"2026-08-07T13:53:20.115089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20764","last_updated":"2025-05-27T06:09:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:27:51.296755Z","submitted_at":"2025-05-27T06:09:57Z","title":"ConText-CIR: Learning from Concepts in Text for Composed Image Retrieval"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2505.20764."}