{"as_of":"2026-08-09T16:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d55c3e55fa8f76f81afb30147a8fd8a8772db02a0873adc107760e4e55fe05a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:43.649274Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:31:05.979325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T14:33:21.485124Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"cited_work":{"arxiv_id":"2505.19352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19352","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond editing pairs: Fine- grained instructional image editing via multi-scale learnable regions","venue":null,"work_id":"6c3082a1-30fe-45b5-a8e7-c08c994430e8","year":2025},"citing_paper":{"arxiv_id":"2605.17244","last_updated":"2026-05-17T03:58:01Z","snapshot_observed_at":"2026-08-03T01:10:09.382150Z","submitted_at":"2026-05-17T03:58:01Z","title":"Drift Flow Matching","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T14:31:05.979325Z"},"links":{"cited_paper":"/paper/2505.19352","citing_paper":"/paper/2605.17244"},"observation_digest":"sha256:61617bdecf3e9dd2b3726c85e8fdd40225e62dbca5b8b62e99d6f7b41b0728d5","observation_id":"77720712-e23a-4f8e-8bc1-d1f5ffb72f37","resolution":{"observed_at":"2026-05-20T14:33:21.486742Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19352/citation-record","integrity":"/paper/2505.19352/integrity","json":"/paper/2505.19352/citation-record.json","paper":"/paper/2505.19352"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:49.498926Z","title":"Introducing llama 3.1: Our most capable models to date","venue":null,"work_id":"614fc10a-b9f7-460e-94d1-1a8e26c3db37","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.175952Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:832cb668bf4a3062df6037d91d8f0573e88da5c61532217726dfea9170453847","observation_id":"28cf88ce-ec49-4ac5-81cd-91191d62cc1a","resolution":{"observed_at":"2026-08-07T14:20:49.574163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:49.341511Z","title":"Introducing claude 3.5 sonnet","venue":null,"work_id":"75db0c4f-28a7-4a9e-bb2d-1985d9324b60","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.250588Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:3c157f619d2d040c1513e9ceb4839c1152ac95f02fda6cab8b3fe88b1c848e32","observation_id":"22529c85-5712-4c65-978b-0546b247d086","resolution":{"observed_at":"2026-08-07T14:20:49.397206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.425225Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.425225Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:b9f8df94700886981a63142e7b2d48fc4cbed3ef5cbca378d240e3969df9fc59","observation_id":"17d40d7d-fdc2-47d3-b2e3-8b015609b439","resolution":{"observed_at":"2026-08-07T14:20:40.425225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:49.022373Z","title":"iedit: Localised text-guided image editing with weak supervision","venue":null,"work_id":"b9babf75-ebec-4de5-b084-ce7e82ea7b2f","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.482522Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:decb66b279fbc901b1731b37e1fd9a47c00ebaf8a2224445c8367e1a4629ba23","observation_id":"fc8ecb79-6982-4cf1-b829-387a91b034bd","resolution":{"observed_at":"2026-08-07T14:20:49.076668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.858363Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":"fa87adbf-b075-4e5f-8612-8660663ee8c3","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.561668Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:fe7a776f60ee2e320a34c82ad4966dfb507955f0778a726830de29ef429f93de","observation_id":"176d852e-3240-4248-9da5-eb6f0354f7a8","resolution":{"observed_at":"2026-08-07T14:20:48.927791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.708697Z","title":null,"venue":null,"work_id":"5c0532c4-68f1-4592-bf88-a9b8656e82e7","year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.622773Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:940ce2ac5037132ec33da8ea9236752e366a6fac647e6db31030611d3c6dd217","observation_id":"c8e860dc-055f-4345-be8c-f48540db0461","resolution":{"observed_at":"2026-08-07T14:20:48.776219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.569015Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"c8182825-80d3-4b89-be91-0970efb0effa","year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.695354Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:6c48adc26ad04b4cfca8fd2d2e039341caeff7726abeb9f4c045ec5390e952a6","observation_id":"8f785a53-9a58-4020-b075-c938ee96aa62","resolution":{"observed_at":"2026-08-07T14:20:48.638463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.740531Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.740531Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:d11e1d59c2f92850c60c4023e32356c5ca8d4dd047b68dbba021386626c6ac52","observation_id":"d14abc10-f18c-457c-8521-0acca6403203","resolution":{"observed_at":"2026-08-07T14:20:40.740531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.352973Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"7b98584e-a6b3-4b76-81f8-863b4ed7e45a","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.801241Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:b8d8781897c8a20a93414c8bc98275c31829d92187881a238480d9ac97f791a1","observation_id":"0d843fc7-d54c-46ef-9d2d-d2de55881a5d","resolution":{"observed_at":"2026-08-07T14:20:48.413005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.174320Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance, 2022","venue":null,"work_id":"19f3b89d-edb6-4bf3-a71f-617c697653ab","year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.893648Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:f7520ba672f665369cdff8c5834c819585c6bc8c8c4e1f4179455b73fef59d65","observation_id":"a878a92e-81ca-4acd-9ede-fa0b339d0af6","resolution":{"observed_at":"2026-08-07T14:20:48.269842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:48.020315Z","title":"Vqgan-clip: Open domain image generation and editing with natural language guidance","venue":null,"work_id":"cc706b87-431c-420b-bf74-aa2cac926f5c","year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.012908Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:32f53bb1a45400cdb658989021211da7bb9cd09d34cac39e7a9742662bf40d68","observation_id":"0028c1fa-8c0a-4a30-a871-851bc21507f7","resolution":{"observed_at":"2026-08-07T14:20:48.080093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:20:41.061314Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.061314Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:75547cf0bd22351221b5e424235387ff9ff844cbfdf36eb5cbcb6a6aac95ebb7","observation_id":"1614e1a3-3500-4594-a6e6-ef53ad82de7f","resolution":{"observed_at":"2026-08-07T14:20:41.061314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.890118Z","title":"Pair diffusion: A comprehensive multimodal object-level image editor","venue":null,"work_id":"8f6f242e-c09b-4cc6-917b-a06ae1b45449","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.145761Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:8cae2048ec8eb870f65a6f8ad6a1f7dd9445e2d85d913630b2d67d0defe8df4f","observation_id":"572e79f2-08c3-4dee-a111-59fb625a27ee","resolution":{"observed_at":"2026-08-07T14:20:47.943097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.742037Z","title":"Gemini 2.5 pro announcement (placeholder)","venue":null,"work_id":"22a24733-bfd8-45ee-8042-e4ad6cf44dc6","year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.247734Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:c9e1c642eaca1dba2f9791d201fb9393e95639503a88dd3cbe82328c085daaf7","observation_id":"45bafe9e-04a3-43ce-89bb-2837d844e9f4","resolution":{"observed_at":"2026-08-07T14:20:47.810336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.618390Z","title":"Focus on your instruction: Fine-grained and multi-instruction image editing by attention modulation","venue":null,"work_id":"8ac5ff55-51f7-4ab9-b225-3f0280c79fbd","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.313404Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:de6127780a6b2fb5f94c1f0f9ba6c037ce01ede0ed6ccf0866b373e886ba3af6","observation_id":"2bbcdb6f-d100-46dd-9cb9-92258d163687","resolution":{"observed_at":"2026-08-07T14:20:47.670716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.485690Z","title":"Prompt-to- prompt image editing with cross attention control, 2022","venue":null,"work_id":"48ccaa51-cb0d-4b65-bc39-48f08225c3d4","year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.361731Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:d7059f9f8131b69604dd26229bb348f28c0e23f08c9b94ca4eb238b352408726","observation_id":"91ab9073-34e2-464f-a497-f66ebec8770b","resolution":{"observed_at":"2026-08-07T14:20:47.536543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.274093Z","title":"Paralleledits: Efficient multi- aspect text-driven image editing with attention grouping","venue":null,"work_id":"c5b01187-8917-4b55-ad01-4fb5efa1b9f8","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.429643Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:52ee880f9a33afbbe14d1d5291e07c716e4ec63263c5e2a6953d4a6308c06ad2","observation_id":"25fbfa75-87f7-470a-a6fa-6b7a2f70f6c9","resolution":{"observed_at":"2026-08-07T14:20:47.371578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-07T14:20:41.500059Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.500059Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:ba034c33f46fec5d5aeb3d2216fbd2b1b89062d8678f029658e693a8f3c1b4ef","observation_id":"dc4bb4a2-1826-4a00-89a3-1b089bb1df2b","resolution":{"observed_at":"2026-08-07T14:20:41.500059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.576015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.576015Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:186c28e44b607234c5358fc8bf6911aa88bbddd6070fc8b9fd4e58b6dd37600c","observation_id":"4106838b-72de-45af-8501-5a04160f210e","resolution":{"observed_at":"2026-08-07T14:20:41.576015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:47.090060Z","title":"Zone: Zero-shot instruction-guided local editing","venue":null,"work_id":"f33c31c0-17e4-4739-b689-38c068d73e5a","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.633906Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:0bbcea4ccdaafe57b91e9a746b87651371816f230447213a9643ad54cab9b029","observation_id":"5b1f28bc-1587-4014-a25c-123e9695cb20","resolution":{"observed_at":"2026-08-07T14:20:47.156402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.898211Z","title":"Text-driven image editing via learnable regions","venue":null,"work_id":"8d2e6eeb-7c88-4540-a858-b5a5172c68ef","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.680620Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:f482d2464ea79751bfa72e28afd037c0c70c67c02ee7f5c9e87b5173d848f982","observation_id":"f06f0ee7-f69c-43d2-838c-f5b7ddd773df","resolution":{"observed_at":"2026-08-07T14:20:46.976710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:20:41.740954Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.740954Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:9061f92ba0e350f17aa85d7f42289914bd0193e716d81bf0ee90a26c8b4db9d2","observation_id":"385e18ce-6995-4b26-9a67-111d90ef9349","resolution":{"observed_at":"2026-08-07T14:20:41.740954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.618931Z","title":"Referring image editing: Object-level image editing via referring expressions","venue":null,"work_id":"15ee58b5-0912-4445-a78a-414a6b9f3e33","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.814439Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:aac458de004f3179d84cdb710b266a01e85dc065eeeec924878576ac8712420d","observation_id":"9c15cb5d-39bd-4f93-9881-ba212ac50884","resolution":{"observed_at":"2026-08-07T14:20:46.767369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.363475Z","title":"Pd-gan: Probabilistic diverse gan for image inpainting","venue":null,"work_id":"455947ea-b100-4a04-b21c-2927cceab6ed","year":2021},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.896641Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:02cb53fa6328d9e766a0af64a17f3782f85a420952d4f2c77966217ebe4a15f4","observation_id":"1ff3dbf7-3042-4aa6-a781-dd4d3e341109","resolution":{"observed_at":"2026-08-07T14:20:46.503879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.965549Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.965549Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:eb6b464321aa8f344235a6afebcabdea5ce8922999179bc9638e1c631aa2cb98","observation_id":"6f78ffdc-3ff6-4645-9089-e2493832b196","resolution":{"observed_at":"2026-08-07T14:20:41.965549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.024877Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.024877Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:149a7b3ac27fd9bfe9a61475a6f38d52074d9900348a49c3cdde1f46df78c4d0","observation_id":"5143dd83-287d-4fc5-a141-c2ee464b31d2","resolution":{"observed_at":"2026-08-07T14:20:42.024877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.166545Z","title":null,"venue":null,"work_id":"78f7e4e0-3942-4614-871b-89d24031610a","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.100720Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:ddb8d84e23a86efb047dfbdd39336d52ccb4eca00b1e5de53778f06c26fc9cab","observation_id":"e15e3013-bd9a-42e4-b27d-12817a215ec0","resolution":{"observed_at":"2026-08-07T14:20:46.251952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.040218Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"49bf16fd-d679-4bd7-bd29-579205019d22","year":2021},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.140181Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:7836e9b8f757430eab17e010ad0f3444eac18ef4c8ecd225679aa2e4da8609b7","observation_id":"c2ff6c3a-8c49-4fdc-b5b1-cf14719eda89","resolution":{"observed_at":"2026-08-07T14:20:46.100092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.186770Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.186770Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:6b77208d84e1307199eb0bb3ee5f82e215e5eb12fdf4f8c5a2989861c32a93bb","observation_id":"7f6a44eb-ab8e-42fc-831b-d8ad4f8eee29","resolution":{"observed_at":"2026-08-07T14:20:42.186770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.246605Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.246605Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:80ca5d404d68f66b9feba77c256eab4ad674f7bcca195d6794b411bce83efd1e","observation_id":"af94e8f9-dbc4-4a23-ba5e-c97e9b09b2f1","resolution":{"observed_at":"2026-08-07T14:20:42.246605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.272643Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.272643Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:5a1b38389035c636b66b7f1236776e9eb8606ce5acc35db70fb264c643518f42","observation_id":"c62b1d82-5ae8-4159-9fef-1bc04ef6214a","resolution":{"observed_at":"2026-08-07T14:20:42.272643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.305248Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.305248Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:7861e9f389d47c0c0096d2f933aede01c9f4a978ae94345328b9d1a977b8b0ff","observation_id":"659d46ea-396c-4c73-a974-02e7728363dd","resolution":{"observed_at":"2026-08-07T14:20:42.305248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T14:20:42.348361Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.348361Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:1db9ed62485413ebb6849d07163440da52455de040f537d3eae78df590ebe76b","observation_id":"f6109faf-26d0-48b0-a037-2881affbe116","resolution":{"observed_at":"2026-08-07T14:20:42.348361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.812950Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"40e65c7e-2055-46a6-a573-5395cb8a3f64","year":2022},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.381545Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:37b097fe6c71d52b8e4ea0e28b84842ce8ec59b10dbc2f9b5a637d4a540e2a73","observation_id":"f15afbd8-63f3-4402-9e4b-48efa7203cd8","resolution":{"observed_at":"2026-08-07T14:20:45.885542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.674519Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"660b5c88-49a1-450f-b20c-d5b309a63952","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.450848Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:cba440a9224b0619f56d04b513c93223fd07128d90f6d4a5eecaf7a904c18f8f","observation_id":"f5da0bfc-3980-4d2b-b5aa-efa0ac15a98a","resolution":{"observed_at":"2026-08-07T14:20:45.710131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:20:42.523009Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.523009Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:65ef8b59a68ec24a8235a2088774d8f82710fbfd35452ab9a0bca6764675aa98","observation_id":"b69f7415-16fb-42cd-8515-b40ff078421f","resolution":{"observed_at":"2026-08-07T14:20:42.523009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.552366Z","title":"Qwen2.5 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.552366Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:1e5cac7a4e860d53c68e35d5928210561deae45eed937302fff91790b1fbfdc5","observation_id":"b3e2f00d-2d65-4485-b492-a60ae15658fd","resolution":{"observed_at":"2026-08-07T14:20:42.552366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.614886Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.614886Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:33bafae886385391248673e5c27fb127df36236f50070c2c12eabfcfed488f64","observation_id":"a3b85c4a-cead-4c10-becc-68cd243e2d88","resolution":{"observed_at":"2026-08-07T14:20:42.614886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.472408Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"3b6f1d40-a412-4c23-8e96-a43d8d582979","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.692639Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:483a40a87da6bacf901f13f60ba87c5d88586b2100c701e33c1639bb97a3f10e","observation_id":"46ddd841-9f76-42be-8cfb-d02a0e29b1dd","resolution":{"observed_at":"2026-08-07T14:20:45.536667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:42.755197Z","title":"Plug-and-play diffusion features for text- driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.755197Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:6d29ddee2817cf360e93859b0784e60f7b13d2d9ec16c2c827594489fee9cfdf","observation_id":"728f4ffd-84bd-40ea-a2b3-093beebb58d9","resolution":{"observed_at":"2026-08-07T14:20:42.755197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04746","last_updated":"2025-06-13T02:29:47Z","snapshot_observed_at":"2026-08-07T03:44:44.446465Z","submitted_at":"2024-11-07T14:29:02Z","title":"Taming Rectified Flow for Inversion and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04746","snapshot_observed_at":"2026-08-07T14:20:42.843642Z","title":"Taming rectified flow for inversion and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.843642Z"},"links":{"cited_paper":"/paper/2411.04746","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:2a412e2c8f9ebf6d0ce7b1bc7a7ee2ec155ad0afc30137f99ab922a376f56010","observation_id":"9ac21f7a-0a32-41f1-9e1c-46b476e57cac","resolution":{"observed_at":"2026-08-07T14:20:42.843642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.277403Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":"d9b7635e-ad62-4a95-a05a-b6462fc16a72","year":2023},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.875026Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:eb4691fdfe5a17fbbeb0d7e09e3eef2088f0cdcdaf134d9864a08727a6478502","observation_id":"1ecde599-697f-400a-ac45-2e1e1b4c0af0","resolution":{"observed_at":"2026-08-07T14:20:45.394596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.164023Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"5168ee33-cab8-4fdb-a2ed-245ef8bc2919","year":2024},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.907547Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:0ea08bf89d1f07974e2bcf972c06ef18a0c4cdc6adf1faf03a5089e09386ae8a","observation_id":"c4de195c-a230-4c0d-82bd-7061957ba96d","resolution":{"observed_at":"2026-08-07T14:20:45.203911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.045189Z","title":null,"venue":null,"work_id":"420742c8-0c54-41ed-9ee0-d97a81557b8a","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.004128Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:f350d7ad0609b9459a9cc0b5a203b8e6b20923e61513cc4f4a3d8c43d371793a","observation_id":"aae73bb8-5e57-4ca3-aee0-cf39deb1569a","resolution":{"observed_at":"2026-08-07T14:20:45.089627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.890256Z","title":"We define mtrain = 1 for regions to be inpainted and mtrain = 0 for regions to be preserved","venue":null,"work_id":"f2121788-bbb6-4c24-95d0-ccd17f75fb2c","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.043717Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:7c127fa114934d6d2eaf24ad3ff7496611e78bf1120daa464297ca821115b138","observation_id":"9b5a0c36-3406-4ae8-b2e1-33f0acc9d496","resolution":{"observed_at":"2026-08-07T14:20:44.989574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.781956Z","title":"A common strategy for LDM inpainting [32] is to concatenate the noisy latent zt with the mask mtrain and the latent representation of the known (unmasked) regions (1 − mtrain) ⊙ z0","venue":null,"work_id":"f45b4cd2-8c02-450b-9365-fc451ae5ec98","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.088959Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:9106ccad3df9a617969927805b311d8633f511ffc64076603e2fca85356864f6","observation_id":"325267a0-1465-4ad9-a161-f7a58f13c614","resolution":{"observed_at":"2026-08-07T14:20:44.837437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.676269Z","title":null,"venue":null,"work_id":"77bb1ea0-3662-4028-ba82-87c97170f48f","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.216015Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:1e42885121c5859695323434631cd24a484d0a229d28638209dbbb9242abddf6","observation_id":"69408f78-8f45-49dc-9639-5b11b5f2ed32","resolution":{"observed_at":"2026-08-07T14:20:44.730634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.544204Z","title":null,"venue":null,"work_id":"9c847c38-7c40-43b4-9bb8-b135cdaf7f2a","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.299654Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:de63d715eb362bf13d678a8b41795da35fb77bfa61896a70006e99642c1e8477","observation_id":"bd82f6a3-e638-440c-8b18-0c6ef8c301b0","resolution":{"observed_at":"2026-08-07T14:20:44.572564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.459411Z","title":null,"venue":null,"work_id":"7a49c297-864e-4707-8a96-e36f9d241318","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.318830Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:8f00263cd26fa3fdf0436be8f42d9b995ae184d35126e3283d2c69f6bdf7afe7","observation_id":"f2f174f1-06a0-4ae2-b7c9-ade042d5250d","resolution":{"observed_at":"2026-08-07T14:20:44.500991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.329734Z","title":null,"venue":null,"work_id":"b3cfaad4-add9-4ba0-9fa2-c65501efadc3","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.366508Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:8c55da136d0f8817d16128469f780b5f62ccee4ffdb5bedc112cb8867d26cd19","observation_id":"3e52bf75-358b-4675-bf02-930c47b11bbd","resolution":{"observed_at":"2026-08-07T14:20:44.378358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.264768Z","title":"Here, m = 1 signifies the region to be inpainted/edited, and m = 0 signifies the region to be preserved","venue":null,"work_id":"72748f40-ff8e-424b-a669-ae4e597a0658","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.446762Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:5c3ab091e67bfdccdff6af199837e57e9e8e558b88f8452bbcb371806558560b","observation_id":"f84f07f7-0125-4644-8cc0-c7365c2affc2","resolution":{"observed_at":"2026-08-07T14:20:44.291463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.120305Z","title":",1: (a) Prepare U-Net Input: If the U-Net was trained for inpainting using channel concatenation (as in Eq","venue":null,"work_id":"7f9efcc9-0eba-4407-9b45-56728d548464","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.527926Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:aa926eaf4753fe742597c63230f8da7d763d1f9e1896a75157c7d073dce1b024","observation_id":"039752da-d3d3-45e3-8bb7-99f986ef6ecf","resolution":{"observed_at":"2026-08-07T14:20:44.222655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.008881Z","title":"For deterministic DDIM, σt = 0","venue":null,"work_id":"f6bfacae-46da-4b39-9639-2e02cb2df748","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.610644Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:a8c8dbbf95b098ec22fe870507238bbf275f1648d5aed5d62723a13a5456b481","observation_id":"e2daab04-126a-4118-9285-97e14871682a","resolution":{"observed_at":"2026-08-07T14:20:44.039209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:43.882650Z","title":"Move the cat to the sofa,","venue":null,"work_id":"df841e19-1fe0-4157-8b5c-183e19ba99c5","year":null},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:43.649274Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:ecc24dbf2021cb4a8b60f0d20de2802fa263dbedaee52b57d4cf0e732e53b6a4","observation_id":"87d9ecba-04a3-4b22-8fd3-25778950a280","resolution":{"observed_at":"2026-08-07T14:20:43.947935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:49.184962Z","title":"Note: Formal technical report might be available separately","venue":null,"work_id":"c1a1b2b3-35b3-48f8-8936-1d7117aec111","year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.346637Z"},"links":{"citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:0ff8a1495e434878fd55343980482683c80c8b614e7de529897c20158181177d","observation_id":"b8c91622-2188-4f07-a7e6-506f7c71af03","resolution":{"observed_at":"2026-08-07T14:20:49.256212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.19352."}