{"as_of":"2026-08-18T16:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a750ddcc6c6b3b9cc12510908482c41cca3a359a694ac2d8c5f11f5f65df568a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:32:53.746199Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:52:20.768497Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:41.146631Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":"2504.17990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17990","snapshot_observed_at":"2026-07-01T10:05:41.146631Z","title":null,"venue":null,"work_id":"1a80741f-9378-41cc-8ed2-c6751c220d1d","year":2025},"citing_paper":{"arxiv_id":"2606.31222","last_updated":"2026-06-30T07:04:05Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:04:05Z","title":"Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T05:52:20.768497Z"},"links":{"cited_paper":"/paper/2504.17990","citing_paper":"/paper/2606.31222"},"observation_digest":"sha256:5c122771c865f4f497925abb326e2598ab415046993380f98b0b7b39c35870bf","observation_id":"d0abb623-5c05-41f3-836d-9538536a9a9b","resolution":{"observed_at":"2026-07-01T10:05:41.148243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17990/citation-record","integrity":"/paper/2504.17990/integrity","json":"/paper/2504.17990/citation-record.json","paper":"/paper/2504.17990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.468479Z","title":"Cross-domain diffusion with progressive alignment for efficient adaptive retrieval,","venue":null,"work_id":"87c170eb-f7f3-4db9-ba64-bd64b6248158","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.564218Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:dda3388d1136481c95f0e2256bbdc94cc5b51cc9d23f9154c452afe7b16cee10","observation_id":"810d838a-9392-4c79-a719-e7b46ccbfaf1","resolution":{"observed_at":"2026-08-16T10:32:54.473230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.569154Z","title":"Dual-view curricular optimal transport for cross-lingual cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.569154Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:29758d875a30f5113944ac262da1b1087262183b5e7d508f9e2dd2f24950f225","observation_id":"900791ef-d932-43fd-a3ea-c0dd3b54c983","resolution":{"observed_at":"2026-08-16T10:32:53.569154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.443996Z","title":"Reading-strategy inspired visual representation learning for text-to- video retrieval,","venue":null,"work_id":"7e98fa1b-514b-48ca-a221-184c0a50b7bd","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.573591Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:103dbd137604175746552b71a6adbb57baf4a80da84371b2a01bd17b1b6406a1","observation_id":"188fa890-4060-4416-9f27-ab9669b74989","resolution":{"observed_at":"2026-08-16T10:32:54.448806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.428308Z","title":"Semantics disentangling for cross-modal retrieval,","venue":null,"work_id":"491b0ffa-c4ae-405b-9c11-11c6cbde6e19","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.577981Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:cb0e93ada68e194c98ed5fb79bba2f98890daa1d414ff47be8a4fc1648a7ad70","observation_id":"e2dd37f9-b44d-4bb2-8ada-4aa7614a9ce2","resolution":{"observed_at":"2026-08-16T10:32:54.433283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.412973Z","title":"Cross-modal retrieval with noisy correspondence via consistency refining and mining,","venue":null,"work_id":"048eb692-1671-48d5-9431-00dc3b1c8d0d","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.582720Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a69a5bc8fe429edfaee6c707a6174a68f90dbb86e245f98040ff09ebce43c1c9","observation_id":"cade58d0-11c8-4d04-84e1-8b7550be136e","resolution":{"observed_at":"2026-08-16T10:32:54.417489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.397955Z","title":"Efficient token-guided image-text retrieval with consistent multimodal contrastive training,","venue":null,"work_id":"3cb4f42e-a593-4e92-aed1-6bf4b753f8db","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.586957Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:edbc678b3cc2522787cb8f87fe50409f989ac3d5f088d2ffd54693d7fdf69416","observation_id":"d044af83-bbe3-4213-b8fb-2e0a75607c84","resolution":{"observed_at":"2026-08-16T10:32:54.402758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.384074Z","title":"Target-guided com- posed image retrieval,","venue":null,"work_id":"7af277b4-6442-4b18-8a06-1e5e86b800c3","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.591566Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:b3e4e13a01eec5296988add43fa2bdada79a9ee9db3824e7ac2394f097e9da2e","observation_id":"fb8bc878-84ab-4676-80c0-b828f9bf6d31","resolution":{"observed_at":"2026-08-16T10:32:54.388555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.370087Z","title":"Dynamic weighted combiner for mixed-modal image retrieval,","venue":null,"work_id":"7aef1e64-733c-4105-84f1-786eda515c8a","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.595865Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:e9901c45bc82600e83b9a990217fecb2a608963e35602c1558442c2c885a3f92","observation_id":"66bb14a4-562e-412f-87fd-70a181feb114","resolution":{"observed_at":"2026-08-16T10:32:54.374357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.356042Z","title":"Covr: Learning composed video retrieval from web video captions,","venue":null,"work_id":"deb41042-c868-4342-9b69-4207592ee98a","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.599895Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:6f125a93b439ede2921c7d6b0c10c5ff13704edc885483085636ede0fc26f9c0","observation_id":"8da27648-a772-402e-ba4a-56e680c31c4b","resolution":{"observed_at":"2026-08-16T10:32:54.360840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.604042Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.604042Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:96adf8f8308d1ce0e9242eda005892229bcba94e4198b696c4050166e3cb26d9","observation_id":"1e7dcf7e-f13c-42e0-b60c-58a0f97b03c5","resolution":{"observed_at":"2026-08-16T10:32:53.604042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.333146Z","title":"Pic2word: Mapping pictures to words for zero-shot com- posed image retrieval,","venue":null,"work_id":"f50ab94c-6d18-42d7-97ea-84e3ccac3c42","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.608382Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:37f8c1f8a964f6523803e7bf07946f3c4dd86aa4af16cc0e18d2ef5fce9185c1","observation_id":"71e31679-5d02-49db-a7fc-2d11ce09277b","resolution":{"observed_at":"2026-08-16T10:32:54.337583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.319182Z","title":"Context- i2w: Mapping images to context-dependent words for accurate zero-shot composed image retrieval,","venue":null,"work_id":"2c67b2b6-eaba-4dc0-9d8a-c9aaaa6c0576","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.612877Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:750979aac96ce69bf51bd22608a00a6a23682191d2ac981fe4448ffd33132228","observation_id":"9024f8a6-e650-448f-abeb-6ff0e7460c2b","resolution":{"observed_at":"2026-08-16T10:32:54.323600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.305560Z","title":"Language-only training of zero-shot composed image retrieval,","venue":null,"work_id":"b6eccdf3-8b14-4549-9a48-6a1677ae5cfa","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.616951Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:691d41a8c8496afe19e45256363971d31223c40fb4c951121d84d8a30fc4709e","observation_id":"4aaf62d9-b8d2-4b1f-ad36-9337d8d45024","resolution":{"observed_at":"2026-08-16T10:32:54.310032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05795","last_updated":"2024-07-09T03:44:55Z","snapshot_observed_at":"2026-08-18T14:24:40.960400Z","submitted_at":"2024-07-08T09:55:36Z","title":"HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05795","snapshot_observed_at":"2026-08-16T10:32:53.622110Z","title":"Hycir: Boosting zero- shot composed image retrieval with synthetic labels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.622110Z"},"links":{"cited_paper":"/paper/2407.05795","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:59e77be2870e0845d72484b42781b3d38d5cc17b3637a16d70b6d8cbf98191b1","observation_id":"2c0537ca-5d03-478a-a2c7-7763e8ff998d","resolution":{"observed_at":"2026-08-16T10:32:53.622110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.626882Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.626882Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:e7f477f9ff68f34faae391228857d828cf3b55d3505e85a2c48191146748b816","observation_id":"530a876f-7956-46ec-aae7-c43eda185dee","resolution":{"observed_at":"2026-08-16T10:32:53.626882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01431","last_updated":"2024-03-03T07:58:03Z","snapshot_observed_at":"2026-08-16T14:13:23.158828Z","submitted_at":"2024-03-03T07:58:03Z","title":"Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01431","snapshot_observed_at":"2026-08-16T10:32:53.630976Z","title":"Image2sentence based asymmetrical zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.630976Z"},"links":{"cited_paper":"/paper/2403.01431","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:6acb6ac200a79910ede18a15edd50df8cef01716b16f77f9b81ad3985a0f57fc","observation_id":"71617fd9-1927-4f85-a153-3624d85c1fc4","resolution":{"observed_at":"2026-08-16T10:32:53.630976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.283019Z","title":"Spherical linear interpolation and text-anchoring for zero-shot composed image retrieval,","venue":null,"work_id":"7370c731-d5a6-4381-961e-c4b372001cad","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.635310Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:f6c52a69ca9b820a179764cfd238a0c21aa86e5ba75ee44884d0e23eba07caf4","observation_id":"50c95646-129d-40fd-a0ac-31541893992b","resolution":{"observed_at":"2026-08-16T10:32:54.287521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.269238Z","title":"Compodiff: Versatile composed image retrieval with latent diffusion,","venue":null,"work_id":"7f59e465-8290-4c33-accd-869c8a2d9fd5","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.639558Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:19a1830c6a45c979454a66f72365a85d5ded196c3ea77885b85a41c623835e45","observation_id":"cbcd1caf-68cd-462a-8b8d-1fea0174064c","resolution":{"observed_at":"2026-08-16T10:32:54.273720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.255235Z","title":"Fine-grained textual inversion network for zero-shot composed image retrieval,","venue":null,"work_id":"108f07f8-e015-4269-8555-0842ea97e94e","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.644001Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:00c932b911258a49142ead7ba81d292c1f7376ea1ca3bddffebba1937928efad","observation_id":"90f33e41-89bc-4d43-862f-f1a8c53321b9","resolution":{"observed_at":"2026-08-16T10:32:54.259884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09188","last_updated":"2025-03-18T04:06:55Z","snapshot_observed_at":"2026-08-16T13:43:18.869502Z","submitted_at":"2024-06-13T14:49:28Z","title":"An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09188","snapshot_observed_at":"2026-08-16T10:32:53.648312Z","title":"Reducing task discrepancy of text encoders for zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.648312Z"},"links":{"cited_paper":"/paper/2406.09188","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:ed6ec3981ee7f35d4ba458328c1daf2e3786c78239daabc0f6736c1dd2483125","observation_id":"dfcbe2b0-b51a-4a64-8942-231604fec4ef","resolution":{"observed_at":"2026-08-16T10:32:53.648312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.240179Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback,","venue":null,"work_id":"2dd0ae64-0ba7-4ece-a866-9d9e38052364","year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.652765Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:dd6e798d54bebc35949f373cac99a84b603ed2eeea2c284bea22e89ea9f62125","observation_id":"a59e34b9-3e94-413c-acc7-67c4b4668255","resolution":{"observed_at":"2026-08-16T10:32:54.244884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.657072Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.657072Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a0eca4180f8377eda91fc16591a8063ea4b1a1ffcfea74f95e8b47d0ed2f7ce6","observation_id":"38fc6c8c-45c0-46ec-a6c7-2baba7534467","resolution":{"observed_at":"2026-08-16T10:32:53.657072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.216468Z","title":"Zero-shot composed image retrieval with textual inversion,","venue":null,"work_id":"32ff23fb-21c3-4e2a-90b5-e7a44addefce","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.661165Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:8140bedd84d7dac2ac4e7e325d367fac7e0f95a5ce9d4d9ae3e816e83fe08b42","observation_id":"029ba515-cb40-4df0-86b1-a8951ffad342","resolution":{"observed_at":"2026-08-16T10:32:54.221016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.202873Z","title":"Cross- lingual cross-modal retrieval with noise-robust learning,","venue":null,"work_id":"c7a6ba52-b5cb-43a5-be03-ee4d3c86655a","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.665396Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:25720db698641841ec33d1268ab2c4db09dbd007f4dcdd6e17f254a189f06626","observation_id":"77451e9e-9a5e-4a50-b0e3-c634c8f6de0e","resolution":{"observed_at":"2026-08-16T10:32:54.207201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.189097Z","title":"Cl2cm: Improving cross- lingual cross-modal retrieval via cross-lingual knowledge transfer,","venue":null,"work_id":"7ca8d362-8d53-4375-ab6c-b609dbc3fc50","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.669598Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:1dc09145d3d4b0fda62b8eee53be2b9d15b45f1bdd3a6a758dd7612dac3a85a6","observation_id":"3a20d69b-1506-4e10-8e97-08a262979673","resolution":{"observed_at":"2026-08-16T10:32:54.193486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.174173Z","title":"Multimodal llm enhanced cross-lingual cross-modal retrieval,","venue":null,"work_id":"bc289d94-786e-4177-bfda-dd8e7437e58e","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.673586Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:9b81d3fbb839a63a54a6d9c17bc0f127531f898d74e84cd4e89a4bfb36109e45","observation_id":"d8c1d1bd-24af-4f7b-ad83-1009b9c66f22","resolution":{"observed_at":"2026-08-16T10:32:54.178289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.161098Z","title":"Cross-lingual cross-modal retrieval with noise-robust fine- tuning,","venue":null,"work_id":"b1ea9dc7-0b0d-484a-a602-30e98e6ef2fa","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.677657Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:b2128ee1bf3408043c1b32435eaf8d6f2313adc13856776caaef10787d64773d","observation_id":"40c29172-b9f5-434d-ba86-10dbfc591806","resolution":{"observed_at":"2026-08-16T10:32:54.165359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.147901Z","title":"Revealing security flaws in cross- modal retrieval models through video poisoning,","venue":null,"work_id":"c43c99ae-108b-4dbe-a867-0916ff0d3bb8","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.682282Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:27ca03d9a541402508465f64b1c061e4f9414977fbd8a8bedce4d936855adbb2","observation_id":"f26f2422-d3fa-4b75-84a2-00df27f5850f","resolution":{"observed_at":"2026-08-16T10:32:54.152422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.134656Z","title":"Deep reversible consistency learning for cross-modal retrieval,","venue":null,"work_id":"c49b6a57-8ca6-4460-b64a-286306970b3e","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.686436Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:8a278659d8a9f4c285b2922300c1d70a788a9eb04d780ef3f1012882da597b53","observation_id":"9d2ca54f-ac32-4279-8c5c-5872dcd8501d","resolution":{"observed_at":"2026-08-16T10:32:54.139101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.121266Z","title":"A large cross-modal video retrieval dataset with reading comprehension,","venue":null,"work_id":"74e8482e-3bae-42a5-beca-bb4622e3a3fb","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.690431Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:9de92f82b4b84b8962661a8b25f1c5a5554bb8e159c00d14ae0682fb35ec4d3c","observation_id":"93e295e7-c44b-478b-8c76-8af13739ab0c","resolution":{"observed_at":"2026-08-16T10:32:54.125605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.107624Z","title":"Sda: Semantic discrepancy alignment for text-conditioned image retrieval,","venue":null,"work_id":"ef750b8b-77dd-4fbe-bb64-501c7a757692","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.694328Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:da369f3c1f7751bf6249441ea87d58fc12dd8f4213d0deaa4c71c5f1c1ba656a","observation_id":"d48959d4-5d72-4b30-bf96-43b3d1424bd2","resolution":{"observed_at":"2026-08-16T10:32:54.111916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.093558Z","title":"Improving composed image retrieval via contrastive learning with scaling positives and negatives,","venue":null,"work_id":"88464279-44e3-4d52-b549-dc7913439cdc","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.698322Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a8dca940477bd3c474f3fe69aa4a174fd392df720f29d964cdbc6e60cc0b4db0","observation_id":"08a645cd-5865-4f76-967a-d6c37408c8a9","resolution":{"observed_at":"2026-08-16T10:32:54.098240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.079449Z","title":"Progressive learning for image retrieval with hybrid-modality queries,","venue":null,"work_id":"b213be37-ac04-4469-aa93-6341dcb40646","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.702635Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:66d12579a774bd2b4ea345a267cea727337297604775b7d761ce67349cf3b4c5","observation_id":"33748156-29d7-4d53-9ddb-2ff9ef08930a","resolution":{"observed_at":"2026-08-16T10:32:54.083975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.064823Z","title":"Conditioned and composed image retrieval combining and partially fine-tuning clip- based features,","venue":null,"work_id":"337361e8-394b-42a1-ada4-11bde8616f6c","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.706517Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:4cb89934fb9db50ca2a12e93095de4ce3f9f660bfd450218fc70dc9dd197510f","observation_id":"98f9b5dc-f2bb-4e53-aa41-6b3b0bd84944","resolution":{"observed_at":"2026-08-16T10:32:54.069596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.710855Z","title":"Composing text and image for image retrieval - an empirical odyssey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.710855Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c0912424a829d2a471150a057dce94ece6f888c99a1f2fd2aefd817d46a01f78","observation_id":"c59aadab-6e15-4bbf-bc0e-f1a5ae152371","resolution":{"observed_at":"2026-08-16T10:32:53.710855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.049907Z","title":"Cala: Complementary association learning for augmenting comoposed image retrieval,","venue":null,"work_id":"cd3ede7e-70cf-4c0a-975a-72935b635625","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.715342Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:e532585b52e43ed16a134eb7d5254b3f5cdae281b168d6aa182cc908f35a56e3","observation_id":"96685f58-a240-4f8f-ab24-9d206c05e52d","resolution":{"observed_at":"2026-08-16T10:32:54.054321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.035799Z","title":"Ldre: Llm-based diver- gent reasoning and ensemble for zero-shot composed image retrieval,","venue":null,"work_id":"cfdf8fdc-3059-47f9-a578-225f8b47fd86","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.719559Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:97e0c811c8159f698922b64d5a063319df9053606601ebe5d0360719dff755f2","observation_id":"30fe452d-8b41-4203-b64d-673a3c003c64","resolution":{"observed_at":"2026-08-16T10:32:54.040459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08924","last_updated":"2024-03-24T14:23:59Z","snapshot_observed_at":"2026-08-16T14:34:47.178793Z","submitted_at":"2023-12-14T13:31:01Z","title":"Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08924","snapshot_observed_at":"2026-08-16T10:32:53.723992Z","title":"Training-free zero-shot composed image retrieval with local concept reranking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.723992Z"},"links":{"cited_paper":"/paper/2312.08924","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:8ee2c6f6f8c12d0a28b11768e00cfb85c9bd3291fd52594e8c778042f93fa3ea","observation_id":"9014324f-2aa7-45d6-8a03-f18e077ad1b6","resolution":{"observed_at":"2026-08-16T10:32:53.723992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.021135Z","title":"Seman- tic editing increment benefits zero-shot composed image retrieval,","venue":null,"work_id":"8eefb56a-374d-49cf-8e22-3d37685bab44","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.728472Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:eee0b80baafc441c9d4abe94fb62e377ba2a09deae31d69e6b9e51b8edda0778","observation_id":"d389e062-031e-4aca-9df9-cc925ec32007","resolution":{"observed_at":"2026-08-16T10:32:54.025441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.006908Z","title":"Zero-shot composed image retrieval considering query-target relationship leverag- ing masked image-text pairs,","venue":null,"work_id":"0847bca2-6257-484f-a894-3729378d7332","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.732700Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c8b0f2fe3b573d0d57a029b8dfd0506dff75c8bf2d92259e62af9945676f8f77","observation_id":"7ccc90a0-0439-40bb-ad1b-d02e92627f7e","resolution":{"observed_at":"2026-08-16T10:32:54.011633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07272","last_updated":"2024-03-06T07:16:06Z","snapshot_observed_at":"2026-08-18T13:09:42.960044Z","submitted_at":"2023-06-12T17:56:01Z","title":"Zero-shot Composed Text-Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07272","snapshot_observed_at":"2026-08-16T10:32:53.737107Z","title":"Zero-shot composed text-image retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.737107Z"},"links":{"cited_paper":"/paper/2306.07272","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:7581bdfbdf0a656e830eb4d84fb00c926af603fb28b779927fa22ecdd02c90f2","observation_id":"c9c431dd-2c66-46a5-98b5-54b8e12f80eb","resolution":{"observed_at":"2026-08-16T10:32:53.737107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-16T10:32:53.741590Z","title":"A corpus for reasoning about natural language grounded in photographs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.741590Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:4d1abe21a8b4d22e3ffce8ab7b9a8c6c7f24297aa32c1f5a8260bd2029fafc07","observation_id":"0c2bf7b2-3ac9-4c9e-9a8a-4f6b200cd057","resolution":{"observed_at":"2026-08-16T10:32:53.741590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.989795Z","title":"Knowledge-enhanced dual-stream zero-shot composed image retrieval,","venue":null,"work_id":"139a570b-0b76-428e-93e8-05186052bd45","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.746199Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:9662e63e26aded8ec61d5378cb31acd0d6c6287f9aa287a4b8b34d566e035df4","observation_id":"7a6f5d45-217f-40e4-ab61-958eef9d4ba1","resolution":{"observed_at":"2026-08-16T10:32:53.995890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:11:10.582419Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2504.17990."}