{"as_of":"2026-08-07T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3346c988f2fc1902bc803cf5227e9604cd2ef531de9f07b874af2ea79de87f68","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:45.312578Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20155/citation-record","integrity":"/paper/2506.20155/integrity","json":"/paper/2506.20155/citation-record.json","paper":"/paper/2506.20155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.523645Z","title":"In: Eu- ropean Conference on Computer Vision","venue":null,"work_id":"af7dea9c-f8cc-49cd-abf3-aef8194b8792","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.229697Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:3c30e63753a7e55cc708058096b15f215a34a011a82b9a94b9c4c29b62b4eefb","observation_id":"63842f2a-a4f4-426d-84f7-9719f0a8d446","resolution":{"observed_at":"2026-08-06T23:01:45.525858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.232608Z","title":"Advances in Neural Information Processing Systems35, 25005–25017 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.232608Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:006fb3884537ce018efc6dfa8fe22de771ff7a22f8741d187da6ed4726cd82b9","observation_id":"7a9c4dc9-f9cc-4346-a289-f053b251e658","resolution":{"observed_at":"2026-08-06T23:01:45.232608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.235520Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.235520Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:634636cf94758f47ef352061fa67b16c40c070a8af5d9d1c271395bdc70df1b1","observation_id":"f8d52d0a-0b8c-498b-9b2e-a49dacac768a","resolution":{"observed_at":"2026-08-06T23:01:45.235520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-06T23:01:45.238141Z","title":"arXiv preprint arXiv:2210.11427 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.238141Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:9d03e6b39af1e0db01248555fdf46d4f850a0f8297f7f93cd6aee78f952b626e","observation_id":"26216aec-dd4b-4631-bdb3-2504119f249f","resolution":{"observed_at":"2026-08-06T23:01:45.238141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T23:01:45.240497Z","title":"arXiv preprint arXiv:2208.01618 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.240497Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:58a5f25ac5b6a81772d09bb24bfe9d647de9e6ea210611b90023989c45fb7317","observation_id":"2d5b915b-9238-4344-bc73-ff7e2a55b5e7","resolution":{"observed_at":"2026-08-06T23:01:45.240497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.510586Z","title":"ACM Trans- actions on Graphics (TOG)41(4), 1–13 (2022)","venue":null,"work_id":"b33c21ca-4d3f-4e33-85f2-601983a2da34","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.243496Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:d28b51fc8d837a406770c19d0b3acbcf915ba7b1fe4c49eba2a2e9b813a71016","observation_id":"f369d4c6-545e-4ce1-a20c-7614b311dc57","resolution":{"observed_at":"2026-08-06T23:01:45.512517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00946","last_updated":"2021-12-16T17:05:46Z","snapshot_observed_at":"2026-07-06T11:34:48.175803Z","submitted_at":"2021-08-02T14:46:46Z","title":"StyleGAN-NADA: CLIP-Guided Domain Adaptation of Image Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00946","snapshot_observed_at":"2026-08-06T23:01:45.246786Z","title":"corr abs/2108.00946 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.246786Z"},"links":{"cited_paper":"/paper/2108.00946","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:30f02d3153817ba5d56296737e1b125983ddddc03e60366338940a4aa377c5cc","observation_id":"4934b2df-c7be-49e9-b650-e1d05ee493f7","resolution":{"observed_at":"2026-08-06T23:01:45.246786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T23:01:45.248861Z","title":"arXiv preprint arXiv:2208.01626 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.248861Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:f89c86d3d1e45766c2d89b614ebd3e5b54d71e5d938f507161f3bdf4f817ef63","observation_id":"e34c8a15-1589-4969-828d-987e952791b5","resolution":{"observed_at":"2026-08-06T23:01:45.248861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.504645Z","title":"In: Seminal Graphics Papers: Pushing the Boundaries, Volume 2, pp","venue":null,"work_id":"beb0c4b7-4ba6-490f-b529-4f5c8584622c","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.250924Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:1c783c41155cdcf20163b8c72e5330fa3ea2938d55ff549d89b74f09326f24e6","observation_id":"d0c51ae3-6939-4672-bb59-bfdf9b5d6f39","resolution":{"observed_at":"2026-08-06T23:01:45.506900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T23:01:45.253190Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.253190Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:7946bb018494d1cb148996b26e8729ed1f60e6adf8b22526aed4fdc8df8e1e94","observation_id":"105111a4-c3de-4497-b8ff-0da809f39dc9","resolution":{"observed_at":"2026-08-06T23:01:45.253190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.256268Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.256268Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:fac94dbf5a07f297d648ec1ea8c374203394396ef3a739f4c639c5123f60db3b","observation_id":"6cbc26f2-1ba0-4598-b454-aa31b300031e","resolution":{"observed_at":"2026-08-06T23:01:45.256268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13495","last_updated":"2024-12-01T14:04:22Z","snapshot_observed_at":"2026-08-06T06:27:20.237446Z","submitted_at":"2023-03-23T17:56:10Z","title":"ReVersion: Diffusion-Based Relation Inversion from Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13495","snapshot_observed_at":"2026-08-06T23:01:45.258068Z","title":"arXiv preprint arXiv:2303.13495 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.258068Z"},"links":{"cited_paper":"/paper/2303.13495","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:e494100421e23ecb12d018eb81b7de29cdf0b530509b933dd4cb9f625210a7f8","observation_id":"9abc3702-6b80-470c-ae08-dab24f450d5b","resolution":{"observed_at":"2026-08-06T23:01:45.258068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-06T23:01:45.260035Z","title":"arXiv preprint arXiv:2404.09990 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.260035Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:759144ab103dbece2fc43d3475b6d4335f875211ff0492a95a35d8f7c65f52a0","observation_id":"b0baf622-1999-46c8-b38d-23b2e2f7f2fa","resolution":{"observed_at":"2026-08-06T23:01:45.260035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12974","last_updated":"2024-02-21T14:04:30Z","snapshot_observed_at":"2026-08-06T01:12:23.608786Z","submitted_at":"2024-02-20T12:51:17Z","title":"Visual Style Prompting with Swapping Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12974","snapshot_observed_at":"2026-08-06T23:01:45.262389Z","title":"arXiv preprint arXiv:2402.12974 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.262389Z"},"links":{"cited_paper":"/paper/2402.12974","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:32cc0d37fc3726dd4306da94ee00f987540b82da68c9d5a966d658a05424856f","observation_id":"21b567c9-9b21-4e09-84fb-8251b44c839e","resolution":{"observed_at":"2026-08-06T23:01:45.262389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.264208Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.264208Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:0b30a838b6bc5c2e7488997abbdab66d12c97054edb91002199eddde229217ef","observation_id":"b3cdd97b-0cdd-4f8e-b9cb-c635a6775789","resolution":{"observed_at":"2026-08-06T23:01:45.264208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.492419Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"6234f32a-e076-4362-b1e9-08acee1f8468","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.266091Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:cadd77b845e573c9f6b83a10d984c8360d2bfe2f1ba890fa7c28c4c3f25e54d5","observation_id":"71c56441-30b6-48ae-9e55-ddb8d0edebcf","resolution":{"observed_at":"2026-08-06T23:01:45.494392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.485260Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"75882bc0-7f13-41be-b2e6-d481689a0b23","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.267725Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:0819c8a0ea46eb57b6ecfffb46ae136bdd433f1cfc054bf4a2d6622454fddf94","observation_id":"2834c3ec-0d68-4381-8cf3-761c4a8be13d","resolution":{"observed_at":"2026-08-06T23:01:45.487638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10960","last_updated":"2023-03-29T06:39:50Z","snapshot_observed_at":"2026-08-06T07:04:39.017029Z","submitted_at":"2022-10-20T02:07:23Z","title":"Diffusion Models already have a Semantic Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10960","snapshot_observed_at":"2026-08-06T23:01:45.269442Z","title":"arXiv preprint arXiv:2210.10960 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.269442Z"},"links":{"cited_paper":"/paper/2210.10960","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:ce7a0a9c4e14f86fec39f7d0154942f2ab7910fdb757b2f2316e6f3afa7d2ffd","observation_id":"6bea4e3f-dd61-4cf3-a3ef-ef0225c73abb","resolution":{"observed_at":"2026-08-06T23:01:45.269442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.01088","last_updated":"2017-06-06T15:16:19Z","snapshot_observed_at":"2026-07-06T05:40:31.165782Z","submitted_at":"2017-05-02T17:44:01Z","title":"Visual Attribute Transfer through Deep Image Analogy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.01088","snapshot_observed_at":"2026-08-06T23:01:45.272000Z","title":"arXiv preprint arXiv:1705.01088 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.272000Z"},"links":{"cited_paper":"/paper/1705.01088","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:51d7a9c7ab8e1cb06eeecf7a1e58e2ce2125eaa3773ea89209f9d91bea2a38f1","observation_id":"58c40735-d3a7-4b17-9039-954907774a6f","resolution":{"observed_at":"2026-08-06T23:01:45.272000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.274265Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.274265Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:051fa6c0c0fbc0e833d8a70f39a038e2f554411e349d7510e96e81431a59d77b","observation_id":"8d7ee6fe-8ef2-4e4d-b2e8-5fa26769f3b3","resolution":{"observed_at":"2026-08-06T23:01:45.274265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.276351Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.276351Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:09a220e0dc9f833b752c0cb2382885a3ed87cf9b0a177f0404c54db23f6a98ff","observation_id":"8deb9195-55cf-491c-bd84-f1d4935b364b","resolution":{"observed_at":"2026-08-06T23:01:45.276351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.278560Z","title":"Advances in neural information processing systems36(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.278560Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:83df9934afc798c3d2dad2043e858c54c6d9a7c9876aae98e48b5006db7d1718","observation_id":"c47c203b-50ac-4780-866f-bfebb66343c5","resolution":{"observed_at":"2026-08-06T23:01:45.278560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04040","last_updated":"2022-02-08T18:08:24Z","snapshot_observed_at":"2026-07-06T12:35:45.839780Z","submitted_at":"2022-02-08T18:08:24Z","title":"Self-Conditioned Generative Adversarial Networks for Image Editing","version":1},"cited_work":{"arxiv_id":"2202.04040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.04040","snapshot_observed_at":"2026-08-06T23:01:45.351930Z","title":"Self-Conditioned Generative Adversarial Networks for Image Editing","venue":"cs.CV","work_id":"42afa1f0-6bc6-4b44-bec6-6a98a6f7cbff","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.280479Z"},"links":{"cited_paper":"/paper/2202.04040","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:ce175ac8328522317414f4de14ce380d5330202ce77a084641874923c5f14140","observation_id":"39171219-d684-40ba-add2-30ac1086b6eb","resolution":{"observed_at":"2026-08-06T23:01:45.356190Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-07-06T11:34:54.333802Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T23:01:45.282474Z","title":"arXiv preprint arXiv:2108.01073 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.282474Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:2cb95e84c7f5c2c1d6ba0ddb1013c3906ac5831706d10e8356926f275c5014d6","observation_id":"8402d21b-fbe6-4127-a2b9-a02fa61fdc37","resolution":{"observed_at":"2026-08-06T23:01:45.282474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.467179Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"3f17330b-be51-4fa6-b242-ead9771b5cb5","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.284521Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:6bff24da274e14d0fb3a0747a0eb7831cded669f8b4fcc2741153f820a40f6b9","observation_id":"d599e44a-63e2-43c4-9112-8ae192f773ad","resolution":{"observed_at":"2026-08-06T23:01:45.470118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.460467Z","title":"Advances in Neural Information Processing Systems36 (2024)","venue":null,"work_id":"ada0cfeb-5bb2-4151-9e34-9a94ccbbe091","year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.286698Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:fc77f74ae2e1cace4f857b6181e64d7cd14831c93cd5abebeacd1f7985961154","observation_id":"2c658cac-b56d-471a-8773-500518eeabe9","resolution":{"observed_at":"2026-08-06T23:01:45.462818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T23:01:45.288371Z","title":"arXiv preprint arXiv:2112.10741 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.288371Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:473b5d35ef56f5eefefb8bb61ef7ce303bf1f3fdf324d289f426319630941739","observation_id":"f7b71cce-8b33-4546-9127-3ad99d450057","resolution":{"observed_at":"2026-08-06T23:01:45.288371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.290692Z","title":"In: ACM SIGGRAPH 2023 Conference Proceedings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.290692Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:5ee5b3715e59a5dd91fa2e6defdfe03b3c0bf0f21c828054abfb5b14bbc3b897","observation_id":"8aa51fc3-2f46-4484-b968-4093d8037714","resolution":{"observed_at":"2026-08-06T23:01:45.290692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.292311Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.292311Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:06e0008acc001b28ae6de62fade8bb523f73f7c4e956b21201896d026d0d9a04","observation_id":"751e79de-6253-47d4-b8f6-73730eb21ec5","resolution":{"observed_at":"2026-08-06T23:01:45.292311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T23:01:45.293871Z","title":"arXiv preprint arXiv:2010.02502 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.293871Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:cc8a25fa54f026dd4a7474e59a2437dd5c646415ce58944db93e73c79f695f36","observation_id":"bfaf7c27-9c29-4668-84ee-5f8db63db33e","resolution":{"observed_at":"2026-08-06T23:01:45.293871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.448286Z","title":"In: ACM SIGGRAPH 2023 Conference Proceedings","venue":null,"work_id":"314b5543-51f4-4b21-b1c3-c17977f6813e","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.295669Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:6d12d21dc302241854c829cb4057835e07c5ede5a49343c2d988d56a85ad7135","observation_id":"64db538b-27e0-4416-a65d-efb3bbd75e41","resolution":{"observed_at":"2026-08-06T23:01:45.450239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.441919Z","title":"In: Proceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition","venue":null,"work_id":"b01c4a15-954d-4eec-b98e-a768f40cf281","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.297670Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:14c7a59c937510f78840dc890fd32e746cba4324dd8ba619abf7d3ad909ab2f2","observation_id":"6a6681aa-8972-41bf-aa6e-d74f7025c196","resolution":{"observed_at":"2026-08-06T23:01:45.444563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.299381Z","title":"IEEE transactions on image processing 13(4), 600–612 (2004)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.299381Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:82c1e5e7dfd6b3038b7d54e8c4da381fb2062b6a7c91c22d09aa94a4d350482c","observation_id":"787c204e-ae6f-4844-8ae5-aef6cf94a459","resolution":{"observed_at":"2026-08-06T23:01:45.299381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.301015Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.301015Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:4018c9273e5f7604ef249c7d6a7cfa6c8b55e7a42365d6caf37f3d64b1a97f41","observation_id":"ce3abd96-e015-47a2-a4bb-d9846fc5d5a4","resolution":{"observed_at":"2026-08-06T23:01:45.301015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.429273Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"282193b1-e9c1-444d-a94a-a8cd426ee203","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.303045Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:f23af3be8733ce4ad4752c3622249315513f30cf4df562f04dd859a66cfd8de0","observation_id":"857c6975-e461-497b-a6ad-45751ac944cd","resolution":{"observed_at":"2026-08-06T23:01:45.431350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.423581Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"2aa80d5e-96fe-4553-a4b4-ced813173764","year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.304887Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:3577a6a1291ec8ac80465f1e716bcaba1a402cc0a83d821559024e05dbd10c14","observation_id":"5c9b7524-6092-46e0-8cf5-7457ab91b62c","resolution":{"observed_at":"2026-08-06T23:01:45.425581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12149","last_updated":"2024-03-18T08:36:02Z","snapshot_observed_at":"2026-08-06T13:30:35.015470Z","submitted_at":"2023-10-18T17:59:02Z","title":"Object-aware Inversion and Reassembly for Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12149","snapshot_observed_at":"2026-08-06T23:01:45.306612Z","title":"arXiv preprint arXiv:2310.12149 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.306612Z"},"links":{"cited_paper":"/paper/2310.12149","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:dc98524df9116a5078473100533810e7572e7deff67611a60bd0ab86aa899b0f","observation_id":"77c5360f-6e25-470e-9d49-77d3f099229c","resolution":{"observed_at":"2026-08-06T23:01:45.306612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.308626Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.308626Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:34813334587f84a7b69b562d5650463272ee09ebaf88220ded2ad2b9729580d8","observation_id":"1fe0a712-0ad0-4684-bf72-d80ffc01ea95","resolution":{"observed_at":"2026-08-06T23:01:45.308626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.310339Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.310339Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:05451f49e7cf543a4ba2fc9916b81bd789abe338753a417dab47486acbc69f60","observation_id":"e8896f84-c290-4ec2-a2bb-902e102321dc","resolution":{"observed_at":"2026-08-06T23:01:45.310339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.411479Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"3c127e3e-8145-4f07-a88b-b8f8132162c6","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.312578Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:c6c7a2dcbb5da16bf9b3030a1ceb3f3cc2282a6f6a04077ffc32cbd986319a5c","observation_id":"cc9d4e10-4d87-42cd-aa45-fcde98b9ce88","resolution":{"observed_at":"2026-08-06T23:01:45.413558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:52:57.537214Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.20155."}