{"as_of":"2026-08-08T09:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be6779aa2be80dbf6b033af1a97d79449f615421ccea022169472be0c745c2b5","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:11.635467Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:56:46.514177Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:36:57.287687Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"cited_work":{"arxiv_id":"2505.19149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19149","snapshot_observed_at":"2026-07-02T12:36:57.287687Z","title":"arXiv preprint arXiv:2505.19149 (2025)","venue":null,"work_id":"423d581e-c553-4e33-9c1e-7327ca970ea9","year":2025},"citing_paper":{"arxiv_id":"2606.05730","last_updated":"2026-06-04T05:43:24Z","snapshot_observed_at":"2026-08-02T13:55:48.184123Z","submitted_at":"2026-06-04T05:43:24Z","title":"TextWand: A Unified Framework for Scene Text Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T01:56:46.514177Z"},"links":{"cited_paper":"/paper/2505.19149","citing_paper":"/paper/2606.05730"},"observation_digest":"sha256:1fcd92a0078c1a94ca0135d413ff507b40066b851658a57e62eff9f8e029b44d","observation_id":"0025a0dc-b722-4309-ab78-5eb73859901f","resolution":{"observed_at":"2026-07-02T12:36:57.289066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19149/citation-record","integrity":"/paper/2505.19149/integrity","json":"/paper/2505.19149/citation-record.json","paper":"/paper/2505.19149"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.290015Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.290015Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8b8489f83edaf3354786f9e50a8ecfb34f110135166b7e923b9a4ef42129ac86","observation_id":"2e6166ce-f527-4459-b734-4e4f87ae8b6e","resolution":{"observed_at":"2026-08-07T14:23:05.290015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04280","last_updated":"2025-05-06T09:56:18Z","snapshot_observed_at":"2026-08-06T16:38:02.520624Z","submitted_at":"2024-12-05T16:00:59Z","title":"HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04280","snapshot_observed_at":"2026-08-07T14:23:05.407350Z","title":"Humanedit: A high-quality human-rewarded dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.407350Z"},"links":{"cited_paper":"/paper/2412.04280","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:3f57756b9c12ba36c49b4b7bb12cf18c42cf6873021385bcb5cabc9fb6135bee","observation_id":"f7b4572f-e89d-450a-bb12-a64c87fed13e","resolution":{"observed_at":"2026-08-07T14:23:05.407350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.484280Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.484280Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ef16c534bbe13d1f07e7dfb8801cfa18fa0f4de72d7c3790f4f23775f7d72e1a","observation_id":"b6e93817-f659-499d-9034-4f6d70423030","resolution":{"observed_at":"2026-08-07T14:23:05.484280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.552410Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.552410Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b5540743a3d6824c7966d8774e383fdf5fcc372b82a3b6ebea1a35a2a77de4ae","observation_id":"d1b14510-6aab-402a-ac90-5245746e5a62","resolution":{"observed_at":"2026-08-07T14:23:05.552410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07547","last_updated":"2024-06-11T17:59:51Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:51Z","title":"Zero-shot Image Editing with Reference Imitation","version":1},"cited_work":{"arxiv_id":"2406.07547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07547","snapshot_observed_at":"2026-08-07T14:23:12.185984Z","title":"Zero-shot Image Editing with Reference Imitation","venue":"cs.CV","work_id":"46a3e6a9-bb90-4dbd-8791-49b178c68c36","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.622338Z"},"links":{"cited_paper":"/paper/2406.07547","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b12df8fbc251a7aa7e080c2afa1a42261b4cafd8174ba10ca502ff433ee6b4e0","observation_id":"52d020b0-924a-4840-82e2-70cde09142ac","resolution":{"observed_at":"2026-08-07T14:23:12.316270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.729789Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.729789Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:c292d2e028361651cdd3b0e52f434824d5135eacf18c2cbb9e5beaa2647924ae","observation_id":"ad20f985-a1de-444b-8ac2-69340bf30b0c","resolution":{"observed_at":"2026-08-07T14:23:05.729789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-07T14:23:05.812424Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.812424Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1a0eab167cb58e695cb6feff739f77db2b122ce48376d11a539e827b46893dd6","observation_id":"d692a309-d3a0-4e9a-873e-1454d442229b","resolution":{"observed_at":"2026-08-07T14:23:05.812424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.371996Z","title":"Swiftbrush v2: Make your one-step diffusion model better than its teacher","venue":null,"work_id":"ec6a37ab-74c3-431f-84bf-2b867b7e3007","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.893851Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:df7d04baac7e477de5726a7b9c71f2bca67cec6c6d65bf914ffc65a68f56b1b2","observation_id":"bb31ca85-84df-4703-b8fa-12cece736a53","resolution":{"observed_at":"2026-08-07T14:23:13.375314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.360303Z","title":"Turboedit: Text- based image editing using few-step diffusion models","venue":null,"work_id":"ecec9054-3ece-47fa-8a2c-275abea599ca","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.995294Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ddb0a01057c49f76e7e74adb704166e26dd51d1d07da28e6a09d410854b8a422","observation_id":"beb1240c-aab3-4b4b-9585-24117ff3a691","resolution":{"observed_at":"2026-08-07T14:23:13.364833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.129326Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes.arXiv preprint arXiv:2503.23461, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.129326Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ce7c3e4df21906132fc0becc291b80b1353c6926926a401bdc1b0069a3c39d9e","observation_id":"cc29225c-ccd1-442b-a46c-3a0f1384b12e","resolution":{"observed_at":"2026-08-07T14:23:06.129326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.349570Z","title":"Complex multistep image-editing dataset, 2025","venue":null,"work_id":"49a99ae4-bc1a-44ed-b255-6172c7efb820","year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.203916Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:61a5bc1dc534f4c08cfb556f1ca2a48b4cf66e1dfeb370d17200d2420994b907","observation_id":"3be98bb8-76f9-43c3-ac61-cbe3ad2df277","resolution":{"observed_at":"2026-08-07T14:23:13.353470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-07T14:23:06.307126Z","title":"Guid- ing instruction-based image editing via multimodal large language models.arXiv preprint arXiv:2309.17102, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.307126Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8b12cec0afce96740b7814e49cbcbf421d5e4b3675ebf88052219b5987f3a631","observation_id":"bc80ed0c-6205-467f-a165-7c0712f4bede","resolution":{"observed_at":"2026-08-07T14:23:06.307126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.408275Z","title":"Renoise: Real image inversion through iterative noising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.408275Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8404b1406f9e7e54a0095b2a952ce09c3205fd4f63dbb612137b6f07ea8956d0","observation_id":"6179cd9c-4a9f-4af8-9af2-4803e939fce2","resolution":{"observed_at":"2026-08-07T14:23:06.408275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.481834Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.481834Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:c128384eb2a77383004e79960510883adb09318d66dfac23985c1b0c84f0ab5a","observation_id":"4fb036e1-7338-4489-b762-6b96481cbebf","resolution":{"observed_at":"2026-08-07T14:23:06.481834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04713","last_updated":"2025-03-20T00:04:47Z","snapshot_observed_at":"2026-07-06T19:46:41.798193Z","submitted_at":"2024-11-06T05:02:29Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04713","snapshot_observed_at":"2026-08-07T14:23:06.580357Z","title":"Multi- reward as condition for instruction-based image editing.arXiv preprint arXiv:2411.04713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.580357Z"},"links":{"cited_paper":"/paper/2411.04713","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:a32f4d37dfc69570ff2d83259349f2df1fa3205ad1b2630ca73e059e52701633","observation_id":"18a4508d-02b4-4113-8c94-b06b31da0179","resolution":{"observed_at":"2026-08-07T14:23:06.580357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18071","last_updated":"2024-09-26T17:18:39Z","snapshot_observed_at":"2026-08-06T19:01:43.416449Z","submitted_at":"2024-09-26T17:18:39Z","title":"FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18071","snapshot_observed_at":"2026-08-07T14:23:06.656115Z","title":"Freeedit: Mask-free reference-based image editing with multi-modal instruction.arXiv preprint arXiv:2409.18071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.656115Z"},"links":{"cited_paper":"/paper/2409.18071","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:fe958f1d68c5fd1904c7e7add97fe9048dc04cc7eaeb311e9c62a973a3c116d6","observation_id":"e89e5aa7-2461-4333-884d-72f237573a52","resolution":{"observed_at":"2026-08-07T14:23:06.656115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T14:23:06.733485Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.733485Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b4cba8fe3ddf1199b9ca8625b0c200c3111838d85f64510d8e3cf093e276da53","observation_id":"e34b6a98-679d-4106-b753-83c1d60c63ed","resolution":{"observed_at":"2026-08-07T14:23:06.733485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.825599Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.825599Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1458a354a0ae57c215728a7793c175510e6e451d603225c665df40f056d5d855","observation_id":"bd5d451a-9dc0-4e6b-894f-3e0d9697428b","resolution":{"observed_at":"2026-08-07T14:23:06.825599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.886247Z","title":"Smartedit: Exploring complex instruction- based image editing with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.886247Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:d04afc4edc534c621cce79a74889c95f31b243b0594e0fc48091ac72656e08d8","observation_id":"0b967774-43c1-4d18-b6c2-5b40dc7ce02b","resolution":{"observed_at":"2026-08-07T14:23:06.886247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.320304Z","title":"Brushnet: A plug-and-play image inpainting model with decomposed dual-branch diffusion","venue":null,"work_id":"04c384f5-0b8d-4c3e-a285-9b369f286649","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.997606Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ed7c848f36dd1451bf99fba3f77f32d55ce32f80c91d6cec45e7009b593d09f1","observation_id":"fc4172b0-2a0d-4d7a-9a6a-f7500c1b3deb","resolution":{"observed_at":"2026-08-07T14:23:13.323963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13139","last_updated":"2024-07-18T03:55:33Z","snapshot_observed_at":"2026-07-06T18:48:12.383629Z","submitted_at":"2024-07-18T03:55:33Z","title":"Image Inpainting Models are Effective Tools for Instruction-guided Image Editing","version":1},"cited_work":{"arxiv_id":"2407.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13139","snapshot_observed_at":"2026-08-07T14:23:11.906602Z","title":"Image Inpainting Models are Effective Tools for Instruction-guided Image Editing","venue":"cs.CV","work_id":"557ff165-151e-4ea7-83c0-cfb2d9aa2ec8","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.084405Z"},"links":{"cited_paper":"/paper/2407.13139","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:035f2f1df69665f851afd6935be90ea2841afed1f1539eb4a94d3436d392f13c","observation_id":"35adf55b-9118-4577-a2c7-70df5da76cb4","resolution":{"observed_at":"2026-08-07T14:23:11.973222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.148075Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.148075Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:27c6afc61412adb75ea7314d3987fb6a104a26c17a2c638d4f5131cd68ad83b4","observation_id":"42379728-bd94-4049-a1bd-ee305d5d2994","resolution":{"observed_at":"2026-08-07T14:23:07.148075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.213831Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.213831Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:bed9122390098046b94362dca43f214def8d618a993f89b510d2e3909f30034a","observation_id":"b5cfbf33-76e4-4636-8adc-368730060563","resolution":{"observed_at":"2026-08-07T14:23:07.213831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.318655Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.318655Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:964aca4c2ce1cf4a581e04f8cfd12839c492232cd84747098fc303558aaf492f","observation_id":"1bff09a2-e945-41c2-b4f7-5b5baacb48fd","resolution":{"observed_at":"2026-08-07T14:23:07.318655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.418627Z","title":"Generating images with multimodal language models.Advances in Neural Information Processing Systems, 36:21487–21506, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.418627Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:aad37c39a38dfd1be05233875be040e248a3b09bfbee6527c5f34794bc0971ee","observation_id":"7cbfeb69-1b04-4dba-b626-80087ca8934b","resolution":{"observed_at":"2026-08-07T14:23:07.418627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:23:07.470068Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.470068Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:4ad322735625961dbacfdae69b65e3798e9e94747d554a3b6ec221c7e2e654da","observation_id":"d5ff60fe-417b-4454-8ebd-7287f5e77646","resolution":{"observed_at":"2026-08-07T14:23:07.470068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22679","last_updated":"2025-05-23T08:41:50Z","snapshot_observed_at":"2026-08-07T16:29:27.502751Z","submitted_at":"2025-03-28T17:59:54Z","title":"Q-Insight: Understanding Image Quality via Visual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22679","snapshot_observed_at":"2026-08-07T14:23:07.552002Z","title":"Q-insight: Understanding image quality via visual reinforcement learning.arXiv preprint arXiv:2503.22679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.552002Z"},"links":{"cited_paper":"/paper/2503.22679","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:3af18d9ea7a74a68ecb64bfcff25d9268bdfdf77aaafc097d97162bccc8899ce","observation_id":"6c8b85b2-4ba2-4ead-9039-fa2ec3d732cb","resolution":{"observed_at":"2026-08-07T14:23:07.552002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.288784Z","title":"Resvr: Joint rescaling and viewport rendering of omnidirectional images","venue":null,"work_id":"7e865756-320e-4501-854c-6fdd582cd17b","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.636743Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:10cf4d31be42bbc5fa0df7be0ee59a63444fb2cffd6e3a5c7f61a6c06e3d41da","observation_id":"4eb9912e-f721-4025-97c0-40031ef509ed","resolution":{"observed_at":"2026-08-07T14:23:13.292457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09623","last_updated":"2024-12-12T18:59:56Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:59:56Z","title":"OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09623","snapshot_observed_at":"2026-08-07T14:23:07.710615Z","title":"Omnidrag: Enabling motion control for omnidirectional image-to- video generation.arXiv preprint arXiv:2412.09623, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.710615Z"},"links":{"cited_paper":"/paper/2412.09623","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:75043d17538a478c9ab65476a9983786cb996cdc13a6146d8899992837263bbe","observation_id":"a4e84820-72e2-4453-b3ea-d26e37bf8cac","resolution":{"observed_at":"2026-08-07T14:23:07.710615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10316","last_updated":"2025-05-05T16:31:12Z","snapshot_observed_at":"2026-07-06T20:06:39.463209Z","submitted_at":"2024-12-13T17:58:06Z","title":"BrushEdit: All-In-One Image Inpainting and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10316","snapshot_observed_at":"2026-08-07T14:23:07.789904Z","title":"Brushedit: All-in-one image inpainting and editing.arXiv preprint arXiv:2412.10316, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.789904Z"},"links":{"cited_paper":"/paper/2412.10316","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1681698c84e81e4528b9fe08606d525cea6ede191a6ab48d501688c8c52447e2","observation_id":"1604f9f3-00db-4a10-b30c-a40fd6fab71e","resolution":{"observed_at":"2026-08-07T14:23:07.789904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.277014Z","title":"Adversarial supervision makes layout-to-image diffusion models thrive","venue":null,"work_id":"eab63ef0-c3d1-4559-81f2-ce26a738234a","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.849807Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e5fe80f5ad49615ad0ee9c75be7245433adf7590e0df0421263e9f7f5644ea31","observation_id":"aff9180f-e37b-4128-92cc-dfa09b296a79","resolution":{"observed_at":"2026-08-07T14:23:13.281552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.265967Z","title":"Drag your noise: Interactive point-based editing via diffusion semantic propagation","venue":null,"work_id":"03d6bb54-70e6-495d-a73c-f4487ee024c5","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.911521Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:59b26c9f627a510710847bc515086b13dc4345addbb5adbd6d131fdb2eb08518","observation_id":"918830ec-ccf9-4edd-aa77-01b5b8bc6c3d","resolution":{"observed_at":"2026-08-07T14:23:13.269834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.989663Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.989663Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:5324ff2ae8ade31f92cfe3a9b00d3132649f9d82af5506d31fa905a6ff4b63cd","observation_id":"0216285b-ef45-4c89-9d0a-cc1b30b8f39b","resolution":{"observed_at":"2026-08-07T14:23:07.989663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T14:23:08.052387Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.052387Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:98895306671ef2485f196bbffa233b8724125e22e1ebb9c380f88ad11dbc8464","observation_id":"f93afe6a-2e55-44bd-b5be-7f4a4feb3d03","resolution":{"observed_at":"2026-08-07T14:23:08.052387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.249329Z","title":"Magicquill: An intelligent interactive image editing system","venue":null,"work_id":"296887d6-040c-4141-bb85-319ce40c9da6","year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.111111Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f52fd2ef3f0734db7a842b7e8554ddbcf56672b74c773d72353203b430ccb2f4","observation_id":"b4db43ad-cf9d-489f-b737-f0535a7cf1c4","resolution":{"observed_at":"2026-08-07T14:23:13.252940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.156958Z","title":"Diffeditor: Boosting accuracy and flexibility on diffusion-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.156958Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ea1636c68df9ab2d8a38cdf15f847855805dd8592291c42f0cb2108c9a6cd0c6","observation_id":"26de2773-2e35-41dc-80b3-1fe414a377ba","resolution":{"observed_at":"2026-08-07T14:23:08.156958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.234173Z","title":"Dragondiffusion: Enabling drag-style manipulation on diffusion models","venue":null,"work_id":"854edd22-3fa9-4859-af7a-3bc65300867b","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.216468Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:aabc788ab965c2cde4396ed74aa683dada7c977a1e61e5404985c80010a74fac","observation_id":"a1e50af1-e713-44a2-90d2-cf6413222ae1","resolution":{"observed_at":"2026-08-07T14:23:13.237351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.307630Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.307630Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:d3ada4f9ba309e7d0fce105d59eb20e441137a0f75a9d8a5e26294bd0b40fdd7","observation_id":"bc87defe-6221-4c52-85a4-5b9f57067a60","resolution":{"observed_at":"2026-08-07T14:23:08.307630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.218532Z","title":"Handiffuser: Text-to-image generation with realistic hand appearances","venue":null,"work_id":"dce53eb8-4c51-4508-b459-f64cc64f05c4","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.367757Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:deebba8cebb0359fec372f45854ff06b97dd346a99fcd367b3ab4453fc0138b4","observation_id":"709b76fe-869d-46c9-ad80-238c731b80df","resolution":{"observed_at":"2026-08-07T14:23:13.221725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-07T14:23:08.422122Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.422122Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1c8e2b5c1a0bc7dbc23fbbb2767c31d6ce4304df750b9f112ea17c472a277423","observation_id":"8935cc25-1e62-46ae-8909-beac8916a29e","resolution":{"observed_at":"2026-08-07T14:23:08.422122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.494940Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.494940Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:5d7e18efe87aae4b1cee4d14b6036840bdf81094d5ce393260e7b670d05b947e","observation_id":"261e470d-a3b1-47ce-b1f6-9b32998d414a","resolution":{"observed_at":"2026-08-07T14:23:08.494940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:23:08.555573Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.555573Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:33c5c6f1aa0bb366edb98a9bfc050ee85f51050224dc3d6c6b8f5aed47d622f8","observation_id":"248cb43e-66ce-4cf6-8f70-34f87b5d6722","resolution":{"observed_at":"2026-08-07T14:23:08.555573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.617044Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.617044Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:2d1c335f2113438a86e152ae849eb88081942fdd7c7bd92b3f3dd3db8cce11a7","observation_id":"1fe2ce5e-4ff4-40db-bbb9-4a029952f774","resolution":{"observed_at":"2026-08-07T14:23:08.617044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.712174Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.712174Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e927b7e30e6b41a0115eb8917053da5cf2fa343045ec7c70b271140ef95fb32c","observation_id":"1266e1bc-ecbe-42e0-a468-dc2f0145448f","resolution":{"observed_at":"2026-08-07T14:23:08.712174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.840800Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.840800Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8771ccbd8fd5be3529fc3e76ec82b3f6844aa8f6971b01ed79aa228a16a36ef6","observation_id":"c1320835-73ca-48a9-a69c-5a5bfcbcd9c2","resolution":{"observed_at":"2026-08-07T14:23:08.840800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.176799Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"c776b16f-2e0b-4453-ad04-84ca93075895","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.922371Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:246283b99879169831d2b3302821670f7fd5b5d5f03098b01f8c2ed49eff1f40","observation_id":"9e154348-4e85-4f2d-ae28-df9b0607a3ce","resolution":{"observed_at":"2026-08-07T14:23:13.180735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.001818Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.001818Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b1dab8baa81a847e24684fe3258425904b5363c227852009c96e53cdb2b83f92","observation_id":"3dbd24ee-55f1-4e00-b648-d9568b50ec81","resolution":{"observed_at":"2026-08-07T14:23:09.001818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15009","last_updated":"2025-04-21T10:19:12Z","snapshot_observed_at":"2026-08-07T16:00:37.570235Z","submitted_at":"2025-04-21T10:19:12Z","title":"Insert Anything: Image Insertion via In-Context Editing in DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15009","snapshot_observed_at":"2026-08-07T14:23:09.117476Z","title":"Insert anything: Image insertion via in-context editing in dit.arXiv preprint arXiv:2504.15009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.117476Z"},"links":{"cited_paper":"/paper/2504.15009","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:912a1cf621636b7af3d6d0c69262127927c8d5eb9d60fcdfa6053fad7cc06722","observation_id":"74a839d2-7d8f-40ea-b90e-8fc5727eed50","resolution":{"observed_at":"2026-08-07T14:23:09.117476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14539","last_updated":"2024-12-02T16:26:57Z","snapshot_observed_at":"2026-08-06T02:45:18.512241Z","submitted_at":"2024-06-20T17:49:11Z","title":"Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14539","snapshot_observed_at":"2026-08-07T14:23:09.205192Z","title":"Invert- ible consistency distillation for text-guided image editing in around 7 steps.arXiv preprint arXiv:2406.14539, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.205192Z"},"links":{"cited_paper":"/paper/2406.14539","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ddcaa5e98340b657dcf07ffa18bd4bf13f6b18603f68b61a27ce76955506ea2a","observation_id":"38c37376-6b06-426a-9519-dd98316ca5ec","resolution":{"observed_at":"2026-08-07T14:23:09.205192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:23:09.297602Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.297602Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1c611ea16ea5901507f0d92e42e5cae3cc8914dce6b7b3e942c68353a750aacd","observation_id":"1a6114cb-3d3d-428e-8ad6-c3e28434033a","resolution":{"observed_at":"2026-08-07T14:23:09.297602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.385434Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.385434Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e177aff76a82adbdad7d69d28b8f49a6b2ed12c31f0edc54cbf0781e1f42c6f5","observation_id":"e986d506-1f5c-4c35-b9c7-24a90e475e81","resolution":{"observed_at":"2026-08-07T14:23:09.385434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T14:23:09.580072Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.580072Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:9f070858fbd94fc36cfefd036a63953fa6a6c9bff016e07fe6e0ad3b1fa0c058","observation_id":"f90c1bc6-8a38-4195-af3e-38350038b4a6","resolution":{"observed_at":"2026-08-07T14:23:09.580072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.686407Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.686407Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:5f73324f42269fda23a2feb53287490c803374f7b6d639b749cc8e4491f4b23b","observation_id":"40030a32-4388-47ac-be64-d4212c2b8a14","resolution":{"observed_at":"2026-08-07T14:23:09.686407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12429","last_updated":"2025-07-12T14:38:31Z","snapshot_observed_at":"2026-07-06T19:04:39.924866Z","submitted_at":"2024-08-22T14:22:07Z","title":"FlexEdit: Marrying Free-Shape Masks to VLLM for Flexible Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12429","snapshot_observed_at":"2026-08-07T14:23:09.768033Z","title":"Flexedit: Marrying free-shape masks to vllm for flexible image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.768033Z"},"links":{"cited_paper":"/paper/2408.12429","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1b19a3f24a3d1b799d2e8b991cf140be5fd31cdfd22edb161343aef877f828e9","observation_id":"94e5fa03-dff7-4e81-bb65-58b861e3ee4b","resolution":{"observed_at":"2026-08-07T14:23:09.768033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.890616Z","title":"360dvd: Controllable panorama video generation with 360-degree video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.890616Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8e93964ea568acecacff5923f12f6c32956de9f33fc3ace3a84de469dcd40fa7","observation_id":"850fd77c-bdfc-4d80-bbda-a51ff526850d","resolution":{"observed_at":"2026-08-07T14:23:09.890616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T14:23:10.024028Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.024028Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f3b7124a6c6078e85ca66d726f4cbd5eede780573645f3e43d41802377041fd8","observation_id":"3206f2f9-55c5-4c1a-ba13-1b381ed42fe6","resolution":{"observed_at":"2026-08-07T14:23:10.024028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.140840Z","title":"In- stancediffusion: Instance-level control for image generation","venue":null,"work_id":"5bfa2145-d46e-42ba-9978-1dac60823ab9","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.133279Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1546b117655f31ce14b7e485a2338969db1fd98df08f55769d464c138773ce47","observation_id":"d922f159-7107-48d9-afba-24819e1eeba1","resolution":{"observed_at":"2026-08-07T14:23:13.144422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.909521Z","title":"Genartist: Multimodal llm as an agent for unified image generation and editing.Advances in Neural Information Processing Systems, 37:128374–128395, 2024","venue":null,"work_id":"3eca1a1f-7372-433c-ab64-1d6ac213725a","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.221516Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:daa4c02f4ad6aed4cefbb9824e0714e41f901612792d14ed55e68cd85ffdce37","observation_id":"6e286aec-fcff-49d6-9e79-82842c48ebc6","resolution":{"observed_at":"2026-08-07T14:23:13.051692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:10.370380Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600– 612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.370380Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e24ed67a19951011a22ed6a7de05c4e9d6a905a977d4b734492dfbae7e27f53e","observation_id":"1516427e-e951-4437-bea2-2cad37912ca3","resolution":{"observed_at":"2026-08-07T14:23:10.370380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:10.504956Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks.Advances in Neural Information Processing Systems, 37:69925–69975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.504956Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:d11b3529aaf3871e36282710d1b2b56340d78b3a3fb0f2fd277275bf9d63942a","observation_id":"57fa69e6-d237-49bf-b1a2-53afc3db4e95","resolution":{"observed_at":"2026-08-07T14:23:10.504956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:23:10.608892Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.608892Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1af3c1ce5138958679e730385b3f3cf269009d90f34745388221217d71dd3b07","observation_id":"9a5c87af-ddff-4ea1-9bcd-82103e720673","resolution":{"observed_at":"2026-08-07T14:23:10.608892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T14:23:10.781055Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models.arXiv preprint arXiv:2308.06721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.781055Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:65cd39014412f0c6f777ee6fa882521aca3ce3958df0b90facac50b4ead0c16f","observation_id":"d328811f-6996-4525-912b-34f4991f13f7","resolution":{"observed_at":"2026-08-07T14:23:10.781055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15738","last_updated":"2025-03-29T04:08:47Z","snapshot_observed_at":"2026-07-06T19:56:04.259325Z","submitted_at":"2024-11-24T07:02:56Z","title":"AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15738","snapshot_observed_at":"2026-08-07T14:23:10.975139Z","title":"Anyedit: Mastering unified high-quality image editing for any idea.arXiv preprint arXiv:2411.15738, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.975139Z"},"links":{"cited_paper":"/paper/2411.15738","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:9fb4c3b49d964d20fd5fdf1a60db06c7b988c2f214637dcb88ad3c3473b3c82f","observation_id":"07d7c50d-9c33-495c-96bb-081da015947a","resolution":{"observed_at":"2026-08-07T14:23:10.975139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:11.145234Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.145234Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:fdbb20f02b08b9b982883104027d2500f07bb6c8c6c8c2beae4812dc27868d9b","observation_id":"d1a5f95d-8415-4ef0-9669-7b883dcc3d10","resolution":{"observed_at":"2026-08-07T14:23:11.145234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.730978Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"b4b18eb5-51ff-44d5-9e1b-2d09745c7e67","year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.296196Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f1030e5ac545ed52c9827569512a2f13b13779b9072c95b169abdfd311657e36","observation_id":"3abffb1d-1c68-472d-97e3-a1aa62985ec2","resolution":{"observed_at":"2026-08-07T14:23:12.809196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:11.402858Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.402858Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:06728aef6a0d79904b825eae98a89ddf27280fc709880fb16690eaac9e507ea1","observation_id":"f58d4b08-9b8a-4631-973f-5bfe97a10850","resolution":{"observed_at":"2026-08-07T14:23:11.402858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07206","last_updated":"2024-04-10T17:59:59Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:59:59Z","title":"GoodDrag: Towards Good Practices for Drag Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07206","snapshot_observed_at":"2026-08-07T14:23:11.514069Z","title":"Gooddrag: Towards good practices for drag editing with diffusion models.arXiv preprint arXiv:2404.07206, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.514069Z"},"links":{"cited_paper":"/paper/2404.07206","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:238d71212474a71362245f14a6acc7dece336a64114c6c82e2b81cd58b60406d","observation_id":"c353a799-e1be-4c50-8eb6-d00667549de2","resolution":{"observed_at":"2026-08-07T14:23:11.514069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.487590Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Processing Systems, 37:3058–3093, 2024","venue":null,"work_id":"aabc020c-ed05-4ac9-b449-7c0887d4a0d4","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.635467Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8b5b5e6cee95b344d068d31e89b158fe74233b61f69a9eebe017cb5096c5e95a","observation_id":"c66d4d9f-6be9-41e9-8238-2925bfbf133b","resolution":{"observed_at":"2026-08-07T14:23:12.600148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:17:30.270671Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2505.19149."}