{"as_of":"2026-08-07T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c947732f39c4f0efa72d6db42ef6354ccd6b038cdae8dfa5b9048aee2594342","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:48:46.673046Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07317/citation-record","integrity":"/paper/2507.07317/integrity","json":"/paper/2507.07317/citation-record.json","paper":"/paper/2507.07317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:48:36.859682Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:36.859682Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:be6e0b1fa0bab5f18699136828553fd7405e7d010d739e8031c730024431299e","observation_id":"73803670-10a8-400a-90f2-086b1f14f79f","resolution":{"observed_at":"2026-08-06T18:48:36.859682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:36.939717Z","title":"Cos stable diffusion xl 1.0 and cos stable dif- fusion xl 1.0 edit, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:36.939717Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1acdd4438c1ee02d71ab0bafdfc6691ec904537b3ffc1eec2f616e31cc4f9a58","observation_id":"b3b8855b-32cd-4c55-9187-c9a8286ff7c7","resolution":{"observed_at":"2026-08-06T18:48:36.939717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.088224Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.088224Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e547cd1c5f2fa636df656974cbfc67ad8acb07c65a6f7588e8a3ca93e6d36f4a","observation_id":"0443baac-97af-4ca7-b4a8-32a38837091b","resolution":{"observed_at":"2026-08-06T18:48:37.088224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:48:37.185937Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.185937Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:733ea1fc0415d13c462c7895fa9c226a61f6266dd8d05e97508c642d1279b16c","observation_id":"7760d3d8-8267-4825-8be7-572708b72096","resolution":{"observed_at":"2026-08-06T18:48:37.185937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:48:37.334872Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.334872Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e7f3c7835f7cafb5a939c0c473ec1d269daf4f50ce4e0871d10915b3016cbfe3","observation_id":"1fd3bd14-795b-438d-9757-48d709760987","resolution":{"observed_at":"2026-08-06T18:48:37.334872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.444474Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.444474Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5b1a50a5fbe323b17a28b0be79ae1c5e53d6688ff9e316ed94f77f49cb80ec20","observation_id":"1a00ba9d-c536-4cc8-8ecc-4ce29ebee588","resolution":{"observed_at":"2026-08-06T18:48:37.444474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.535105Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.535105Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:94a9dee2ed6c03a257240e16e09cec8b04df5adb60a098dbfa21d5d225327516","observation_id":"c1d90854-d996-4922-ac60-437f3c9f41bb","resolution":{"observed_at":"2026-08-06T18:48:37.535105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.672421Z","title":"Is clip the main roadblock for fine-grained open-world perception? In 2024 International Conference on Content-Based Multimedia Indexing (CBMI), pages 1–8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.672421Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:dbedf08baf2c6a9eef0beb24fe5319cbbd083133665d35a244057f72d01ea28a","observation_id":"6062fa7b-067f-4ecf-a83c-1ba8d949ddd2","resolution":{"observed_at":"2026-08-06T18:48:37.672421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.770834Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.770834Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:90116b34c37001c7533fc5365d3b7f6783cb5ee0d90d74b1d87099362e9c8fe6","observation_id":"55afb521-809f-451e-8042-e60ee9701ddc","resolution":{"observed_at":"2026-08-06T18:48:37.770834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.883358Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.883358Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:70bd910864c4a4df7a610bd9d59f5ed164ab19d470dd1dfa95c32adfc325460f","observation_id":"030b1cbf-c569-4ae2-b528-c72b49bda671","resolution":{"observed_at":"2026-08-06T18:48:37.883358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.978585Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.978585Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6ab725845e73c9dc421ca4b6bf810bed91ea256daaa33fadd9219223009a6939","observation_id":"31cdb809-1e0f-4bba-8d2f-ac017d213150","resolution":{"observed_at":"2026-08-06T18:48:37.978585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-03T06:33:01.378310Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-06T18:48:38.097897Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.097897Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:71582fe5ca0a7d725c8555d6898a3cadd0641a4f201c122c4dc48a12d2161267","observation_id":"1c8db78e-3087-448a-b247-82dc018016e8","resolution":{"observed_at":"2026-08-06T18:48:38.097897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T18:48:38.227993Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.227993Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:bbcf4c6394e857fbf5de4f56e158ea6710c4916dd47bc69dfdd1aacb1f645ec0","observation_id":"318e331a-086b-45b9-a626-cd80b3d6c8e9","resolution":{"observed_at":"2026-08-06T18:48:38.227993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:38.322722Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.322722Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ca07a07948d8f5e8c03f6dca8e2f94642448027be7bdf60f91564081a93c114f","observation_id":"841ff0b5-0a4b-4a14-81b7-9e66f2ce5a7b","resolution":{"observed_at":"2026-08-06T18:48:38.322722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-06T18:48:38.482789Z","title":"Diffedit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.482789Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:8b22ed6e3279a66f3e87c6a2070fa3e7757667572a520394303eccd453ca6706","observation_id":"00cdd155-fda2-4c85-922b-7ba276b3128e","resolution":{"observed_at":"2026-08-06T18:48:38.482789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T18:48:38.623306Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.623306Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:3616477e642cfce7dd56069ef75d1f892cc7b6cdb2ff972e7f40d68b137421b2","observation_id":"5e89a477-5d13-41d2-a3c4-40be01ee4a4d","resolution":{"observed_at":"2026-08-06T18:48:38.623306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:57.230576Z","title":"The epic-kitchens dataset: Collection, chal- lenges and baselines","venue":null,"work_id":"330e6021-8d4c-483d-ba2e-0360b37815c9","year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.694374Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2ece2a346e5d702f26c42fd51a1f3d8c5c04de66d84a682d910df972ba4c23ef","observation_id":"fcd48602-d109-4347-a20c-69e931a1a218","resolution":{"observed_at":"2026-08-06T18:48:57.287543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.979504Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"667513de-fc99-46a7-bb7f-5d850c1f49a5","year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.805037Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d7694fdf7b62f9b5f195ebd2b6fabd394cee6b8d2798a1935256c801e357e454","observation_id":"3df92554-ed0c-47eb-9ff2-99fdf29e2844","resolution":{"observed_at":"2026-08-06T18:48:57.107238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.802436Z","title":"Dreamlike photoreal 2.5, 2023","venue":null,"work_id":"53575588-5907-4b93-8478-4e67bec0b189","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.903563Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:c4cd0c52c665a719f727d4f56bb078faf9c3da8bc0574cf66a5e222470c37ddc","observation_id":"aa04f5c5-a8c4-414d-b9ae-cc4f7c45248b","resolution":{"observed_at":"2026-08-06T18:48:56.865429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T18:48:38.987435Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis, march 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.987435Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:c363337ce9cc60fd803c0840785bb7909305d0c1f9d1b0ca1c6ead2d3f573c85","observation_id":"315354ec-94f7-4a86-b2a4-6c612b76d4d3","resolution":{"observed_at":"2026-08-06T18:48:38.987435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-06T18:48:39.067547Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.067547Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6e4ef88d44cb032c134acb81729528bfb5792d255f1537b4ae6ef613c14c1a52","observation_id":"bf0f9e38-56d8-4007-b7e4-53875d7f8dfd","resolution":{"observed_at":"2026-08-06T18:48:39.067547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-06T19:09:09.229055Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-06T18:48:39.186905Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.186905Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2f3f3e0ba2c6b2112e29f5f332da23b592b234a1a64de1edf41406e0eab9c3eb","observation_id":"44dd0e9c-a8d4-494b-8314-94d6cda05bdd","resolution":{"observed_at":"2026-08-06T18:48:39.186905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T18:48:39.256568Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.256568Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:fd7185a9575c5576a79f6869ddf5bb835606c28d96a345ca89605669284c0846","observation_id":"812faeec-4c2f-4a18-a3a6-57115f07b1ec","resolution":{"observed_at":"2026-08-06T18:48:39.256568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.637035Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"3574f821-0032-4c5a-be59-3ebbb658f40f","year":2017},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.416699Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:019d970fff22bfd2e984b0dd436870a85bb377c223aaeeb59e6487768b3175b1","observation_id":"939bf505-b7a9-4d98-b509-d71f4ba618f1","resolution":{"observed_at":"2026-08-06T18:48:56.712513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.382090Z","title":null,"venue":null,"work_id":"5363665e-fee8-43ad-9a71-72cb06c45678","year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.526651Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:50778fc1b328bc83570100d1d765ebe1af82c5f3915e7318ba656aada80e1aa7","observation_id":"7e212353-a222-4a26-a374-efc1aa6b8390","resolution":{"observed_at":"2026-08-06T18:48:56.489778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04713","last_updated":"2025-03-20T00:04:47Z","snapshot_observed_at":"2026-07-06T19:46:41.798193Z","submitted_at":"2024-11-06T05:02:29Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":"2411.04713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04713","snapshot_observed_at":"2026-08-06T18:48:47.862524Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","venue":"cs.CV","work_id":"869aca88-bca0-4b1a-bf91-100cb1ef24f4","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.649531Z"},"links":{"cited_paper":"/paper/2411.04713","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d4d456184ab676e2f2cb45dd0aef3072055bb240a19069da20c346e325619cfe","observation_id":"45219a64-2c0e-4161-becb-94c209e23cef","resolution":{"observed_at":"2026-08-06T18:48:47.999415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-06T18:48:39.761303Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.761303Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f40bd554cf5315c342b08eb36163a85a0dedad08b063a0c36283365052bedbba","observation_id":"2c2f0c50-0fd6-480d-ad51-af2ed04f2177","resolution":{"observed_at":"2026-08-06T18:48:39.761303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T18:48:39.908378Z","title":"Prompt-to-Prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.908378Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:01a04c960ad8eec8de2260d9379589fc24f072742606c45b44e092cb9b163dd7","observation_id":"fc613fd7-3279-4765-9322-bd541e9a29f7","resolution":{"observed_at":"2026-08-06T18:48:39.908378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T18:48:40.054243Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.054243Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:25396419204408f092f704eb87fbd10550eef73c1e45a5b9bd30e618075afc7a","observation_id":"cc1f3b99-1f29-40b5-a64d-2094ddebe56a","resolution":{"observed_at":"2026-08-06T18:48:40.054243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:40.154473Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.154473Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:93f74d9ee247a287d85ad353f98fbd74c709a8315d979413bc0e133b7b8bf52d","observation_id":"e422a841-340b-42c6-9422-4d3695b107ad","resolution":{"observed_at":"2026-08-06T18:48:40.154473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.141344Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"4926029b-c6a7-44fa-8ece-2434b94b737d","year":2020},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.217599Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:459258e154e1ee1cd8cb8e83b71a4b456b7bdab1f12d91767fe0d07efc622e61","observation_id":"75f18027-de1c-4400-b27d-273d352bf943","resolution":{"observed_at":"2026-08-06T18:48:56.262111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04485","last_updated":"2024-11-11T06:32:24Z","snapshot_observed_at":"2026-08-05T09:52:25.597681Z","submitted_at":"2024-06-06T20:15:42Z","title":"GenAI Arena: An Open Evaluation Platform for Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04485","snapshot_observed_at":"2026-08-06T18:48:40.299542Z","title":"Genai arena: An open evaluation platform for generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.299542Z"},"links":{"cited_paper":"/paper/2406.04485","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:bfa3909ae48ee4b1f3bb37c07c62162931d471f2b06e1b5ead9d3558273cb1f5","observation_id":"2560f2a4-585c-465e-96cb-ecc9f473ae27","resolution":{"observed_at":"2026-08-06T18:48:40.299542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.920933Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"02c79add-bfc3-44b5-8bc9-2ab62a6aeaf5","year":2017},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.392429Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:850e933f3acf34f74caad5758e7e8d4e2eb3ce9835eac35d12f24576d13a4fb7","observation_id":"e91b6027-b560-4ee7-960b-ed6ed8549437","resolution":{"observed_at":"2026-08-06T18:48:55.981983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.667504Z","title":"What’s “up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":"85cbe8ce-b291-4cbf-9be5-ee7e3549a511","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.508645Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1364a50d715cce31e1128441013031dc1a3395afdacd0bf51fd7af4a4816c941","observation_id":"c37c56fe-5ab7-4df3-a94d-6b5ca9c7359c","resolution":{"observed_at":"2026-08-06T18:48:55.774617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.412678Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image genera- tion","venue":null,"work_id":"aeaab37a-38be-4c53-9131-6fbf3cd76e67","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.651286Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:19b96fac1701e32cc1aaf77a62c514d31969064f818d3170646b0fc2abed7d29","observation_id":"85d71823-4eb0-4e36-af0b-940643c377bf","resolution":{"observed_at":"2026-08-06T18:48:55.524988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.235469Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","venue":null,"work_id":"d2dc1ab3-b99c-4deb-a642-22586230c097","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.763102Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:874ed07c7264e49c30f3d0ddfeb2770f62634a7e878f8316094692e9651145c8","observation_id":"13b85a26-e7f0-47f4-996b-90bc6c1e1ba5","resolution":{"observed_at":"2026-08-06T18:48:55.296234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-06T18:48:40.925409Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.925409Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0ff8879c9859bda5f4f3bf195acd121f6f863e3fdfd894f5a72060ce687cf0c8","observation_id":"a3bd7ea0-470b-434b-9038-2b132119e827","resolution":{"observed_at":"2026-08-06T18:48:40.925409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.020125Z","title":"Imagenhub: Standardizing the evaluation of conditional image generation models","venue":null,"work_id":"5288ba87-0bdc-4ec7-8365-77e409fa5b3e","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.094239Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:9c71ffe58381181d17fa267dfc71a68f58a12c893551f4ebef97a04aa6e71f75","observation_id":"e38527a1-a279-4413-bc17-0dbf56168060","resolution":{"observed_at":"2026-08-06T18:48:55.134883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T18:48:41.170936Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.170936Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5c9300b7a1724a1259e1e114e56444555741b5e11d03b1483cad85a1a64148fe","observation_id":"273f83b8-2f55-4422-b866-b56ff5e11ddb","resolution":{"observed_at":"2026-08-06T18:48:41.170936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.784459Z","title":"Introduc- ing idefics2: A powerful 8b vision-language model for the community","venue":null,"work_id":"6659819c-3e14-4429-8981-f4b6c3837fe5","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.328554Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:9fad47bcc536d23c6d715ee7b2e1d629cde2cc3946ab223c66e764406ba9dd28","observation_id":"5d425981-fd93-4cfc-9610-296a2aac90b4","resolution":{"observed_at":"2026-08-06T18:48:54.842646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T18:48:41.472557Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.472557Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:395d72a9f823cb4b4528f830b69ab4fb2330c61e4fdee1608faf84738de67c8c","observation_id":"c2fa4195-ca75-476c-bac3-732febbd8811","resolution":{"observed_at":"2026-08-06T18:48:41.472557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:41.543773Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.543773Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:af4df5f7e1b95e8da849f49a194453254abcc3389d2fe9f3ef1ad3fd5d89274f","observation_id":"70baf567-1bc0-4c63-bd42-dea7ad167215","resolution":{"observed_at":"2026-08-06T18:48:41.543773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.556844Z","title":"ZONE: Zero-shot instruction-guided local editing","venue":null,"work_id":"e5a6e077-51e2-40a3-9de2-7cbe2181e15c","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.666684Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:345e97ca3793b94d71a6d0965c0785c8f9fc0c8c252de0b19ae95a4f6e0cb092","observation_id":"ffb0ec51-6caf-4aa3-89b2-77cf5dd41369","resolution":{"observed_at":"2026-08-06T18:48:54.663638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.305668Z","title":"Rich hu- man feedback for text-to-image generation","venue":null,"work_id":"f3b8c721-aa47-4067-a54d-ef1e6dd63bd8","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.778736Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:30500f271aec189e83813cc080bae396ac029ef063d1a5e65f0e3fe829238ec8","observation_id":"ed81f119-4d62-4a1e-b5d2-643bc5d08a86","resolution":{"observed_at":"2026-08-06T18:48:54.408687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.116961Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"9f1d38bd-4689-4588-8a47-061b46203d0a","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.932198Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d12dc4f3d028d119736099ea77a9eb119a20c1d551bde9520bd4222f43d8a379","observation_id":"35157127-5dbe-4d91-a02a-ebbc8c33f484","resolution":{"observed_at":"2026-08-06T18:48:54.181411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.942728Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"eb8fd14f-e342-4731-aefc-46989eb52046","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.044640Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0ce0928e91b6a6af521f0cd58371033981221db62a72888253e4d0cdcbaf9008","observation_id":"fe292af6-2fba-4015-b442-285d7662e961","resolution":{"observed_at":"2026-08-06T18:48:54.009132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.740563Z","title":"Visual instruction tuning","venue":null,"work_id":"02f4b614-80b6-4a37-830b-a74255d0c829","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.110125Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:3f4976bae4d66b0b37472221473d274c3591c279e9e7223a8c5c5b3a4afe9a60","observation_id":"de4403b8-8010-4dce-935d-617b596dc5a4","resolution":{"observed_at":"2026-08-06T18:48:53.803553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:42.239498Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.239498Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:dbd0b6378e117dc8c9a6d58db767c9173aceb2d9230fa5234cfea68fa33976c3","observation_id":"efd8b911-2f75-4d3a-8a9e-9659053125a4","resolution":{"observed_at":"2026-08-06T18:48:42.239498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-06T18:48:42.388687Z","title":"Latent Consistency Models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.388687Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:aa6a38b621c64147ea187832f9ea5affad83758b9ad62b542deb37e0fa61b220","observation_id":"dacaa74e-4b55-4d74-a232-6d874d6d3146","resolution":{"observed_at":"2026-08-06T18:48:42.388687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14180","last_updated":"2024-09-27T13:12:04Z","snapshot_observed_at":"2026-08-01T16:22:23.892762Z","submitted_at":"2024-08-26T11:08:44Z","title":"I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14180","snapshot_observed_at":"2026-08-06T18:48:42.511233Z","title":"I2ebench: A comprehensive benchmark for instruction- based image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.511233Z"},"links":{"cited_paper":"/paper/2408.14180","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:059972c491adb8e4be816a7c68653510b2596e490dbd82cc393c3c397d657bf0","observation_id":"07d900e7-ac67-43a5-9e58-24830fffbc03","resolution":{"observed_at":"2026-08-06T18:48:42.511233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-07-06T11:34:54.333802Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T18:48:42.647440Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.647440Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:eeaba2605e3863281ba1fcac2b3a874b01c408ae8627651dfc2786d977e5aa18","observation_id":"c4b4b26c-8708-43fa-a6a8-971199d3f9ae","resolution":{"observed_at":"2026-08-06T18:48:42.647440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.497975Z","title":"Watch Your Steps: Local image and scene editing by text instructions","venue":null,"work_id":"9aa58c4e-7650-44b3-bba8-487f097fb239","year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.778364Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:617bca4962aa6544fd972121e72b12bf45d5edee82dad1a54434f70ccc4d9bd2","observation_id":"3c18578f-3c62-4eee-9cae-6545d5f94e31","resolution":{"observed_at":"2026-08-06T18:48:53.622904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.272441Z","title":"Null-text Inversion for editing real images using guided diffusion models","venue":null,"work_id":"7a113587-d233-4e52-bfbc-8a13b9ea29a8","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.853041Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:bc9ea78fd2ec732e0e3c99f8aacbf67b9793f2e501f74fe85cc2ae0f8ea8984e","observation_id":"9a4772f2-fbac-487d-803a-c6815fa42fc7","resolution":{"observed_at":"2026-08-06T18:48:53.365096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:48:42.928679Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.928679Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:18d19d3ba182fee96e659451f5910b7ce162dc56cae7bc1f7d4e1c1693f856f8","observation_id":"601f0582-615a-48d7-b0ca-9a285694f71e","resolution":{"observed_at":"2026-08-06T18:48:42.928679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.032840Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"9d50e2e6-1df9-441b-bf70-43eba5b3557b","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.018862Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0c9f55976398f778142e9c08a16a2b8eeb0f01a39553e9f27e703fbec9f8553f","observation_id":"229a0c2d-1188-4b68-92e6-46532039745b","resolution":{"observed_at":"2026-08-06T18:48:53.165587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:48:43.156247Z","title":"SDXL: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.156247Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:907c0ce46c40d7456aa27a17226b14ec61a79b87d6d395724824be6cc1bf151b","observation_id":"b3080117-a3f8-4b4a-8d7d-6d700189f94a","resolution":{"observed_at":"2026-08-06T18:48:43.156247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.783310Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"91174db0-b4d1-40ff-9c78-b917f29c2b59","year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.294518Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f5abf911693dcca01c09740e82de85defb2d5613f778897dd8b25ef418f75900","observation_id":"09854faa-21f6-4fb5-8c77-519bf6872ec0","resolution":{"observed_at":"2026-08-06T18:48:52.881947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T18:48:43.438852Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.438852Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1873178b3ece1f010108ed57180a8f913250a48143c732be8a754c681807f613","observation_id":"09d01c24-5c1d-4661-992e-ce783d53ac0c","resolution":{"observed_at":"2026-08-06T18:48:43.438852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.508361Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"1df12cf0-7f4f-4d6a-8e2f-3bcc0a3042e3","year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.638757Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0a56213a1e8556f1203f3f2c755e3299f5e412d15811df10b51f43786a1aa902","observation_id":"4e3a6838-2556-48b7-badd-5e638a794f9b","resolution":{"observed_at":"2026-08-06T18:48:52.623565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.260691Z","title":"Emu edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"376ccad5-c90d-4b2d-8bc8-a71c043bb1aa","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.698204Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6e33a24fa9610815cd5265dbc85f6376923241375aadc0f44f753f889f5460c2","observation_id":"35f71e6b-2bfe-459a-b7b6-b6c4089570f1","resolution":{"observed_at":"2026-08-06T18:48:52.368993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.67890","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:47.199745Z","title":"Aria: Advancing multimodal ai","venue":null,"work_id":"f5a27e9b-48c0-432c-b069-39050950e25b","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.804495Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ae63d5755b39d19a59532d01c2201104710fb6650ee9e8268e3a7293660be877","observation_id":"b32463c9-32f5-4501-ae26-d93768503d1b","resolution":{"observed_at":"2026-08-06T18:48:47.318442Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T18:48:43.954569Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.954569Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:7f20b220c7df42f3197914c27104d6d14c4fb9e666183de047ece1b1962ecb40","observation_id":"2152a224-2206-4fba-8722-4e3ed131b37d","resolution":{"observed_at":"2026-08-06T18:48:43.954569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09927","last_updated":"2025-01-17T02:47:25Z","snapshot_observed_at":"2026-07-06T20:22:14.764479Z","submitted_at":"2025-01-17T02:47:25Z","title":"IE-Bench: Advancing the Measurement of Text-Driven Image Editing for Human Perception Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09927","snapshot_observed_at":"2026-08-06T18:48:44.077282Z","title":"Ie-bench: Advancing the measurement of text- driven image editing for human perception alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.077282Z"},"links":{"cited_paper":"/paper/2501.09927","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f8ed38db867637b0cb28b0260d37a8b77ee4fbe5ca8e97841baaeff024c2a24a","observation_id":"08b2c90e-c4ba-43fd-98e1-1110031dbea4","resolution":{"observed_at":"2026-08-06T18:48:44.077282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:48:44.180428Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.180428Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:33e045237ee9f7b624cc0de4cafacee9d7b16831ddfa22dd70350eaa0c7fe3f9","observation_id":"445f8659-fb5b-4566-8c39-0f50ed8a2670","resolution":{"observed_at":"2026-08-06T18:48:44.180428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.067059Z","title":"Plug-and-Play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"ff782d66-f666-4796-b009-2df3e75cb748","year":1921},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.295558Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b5f6b9e3738e92427649d40544c9ceb6f292e6a9b47b88dde5c8e85c16a0de41","observation_id":"05dfb526-9c39-40de-8b2e-3edbf472e13b","resolution":{"observed_at":"2026-08-06T18:48:52.143028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.822480Z","title":"EDICT: Ex- act diffusion inversion via coupled transformations","venue":null,"work_id":"b1520f3b-5cd7-4450-8a14-e57ee01e2237","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.405595Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:652c8f847b91fa042c60869631d3cd77365d5ca888863fe1b439af8ea8b11022","observation_id":"55527c56-02bd-4408-8d9d-e4e5ecbb3a97","resolution":{"observed_at":"2026-08-06T18:48:51.934383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:48:44.469725Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.469725Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e9a14bbccc8802b4ebfd065367c0cc9cc03182f5b3f889d5ca679b0fe51089b1","observation_id":"ee6d5465-21ad-4c2f-b1f7-cbfec2c7a076","resolution":{"observed_at":"2026-08-06T18:48:44.469725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:44.522758Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.522758Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f3163d6bc4451392979c1a3996b1bc3619a7be8a531adfd237505203b5d5dc8e","observation_id":"a542c4b8-016b-4404-9502-a97b63c1b5ea","resolution":{"observed_at":"2026-08-06T18:48:44.522758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.558583Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"7e853719-86c5-4025-981c-b88b318e0a41","year":2004},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.613567Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:442f0cd9f5b82d80fab13f1ba502314b9c38537539d1c8fc7ab38099e9d7e377","observation_id":"6c547196-5242-45f6-ad04-474f1adf368d","resolution":{"observed_at":"2026-08-06T18:48:51.661975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07199","last_updated":"2025-04-28T14:16:29Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:21:43Z","title":"OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07199","snapshot_observed_at":"2026-08-06T18:48:44.706303Z","title":"Omniedit: Building image edit- ing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.706303Z"},"links":{"cited_paper":"/paper/2411.07199","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:3db1c7efc5f81ebc3ec37b41d8521ea31baf5422ccd70ae56625575005eef60b","observation_id":"ec506cb9-3f42-4de6-b3f2-5ae60bd1a379","resolution":{"observed_at":"2026-08-06T18:48:44.706303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.369651Z","title":"A latent space of stochastic diffusion models for zero-shot image editing and guidance","venue":null,"work_id":"46fdc0b6-5c0f-4616-803d-a123f36c8b21","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.848440Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:58f8b0b9ce8a4d137ef81267b5a5f37f547f6cb2a768a086f887006712b6ee36","observation_id":"2df7148e-531d-4d25-9337-322a52b82641","resolution":{"observed_at":"2026-08-06T18:48:51.457038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.193318Z","title":"Uncovering the disentanglement capability in text- to-image diffusion models","venue":null,"work_id":"6d03a2bf-5041-497d-a4cf-743c5c357ac3","year":1900},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.968134Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:afa3bb85ab610dd1fef1c4035c1f946ed95827da60c478b1c9242b026ee94f2e","observation_id":"a72c81cc-f3fb-433b-a8bd-549b68e2626c","resolution":{"observed_at":"2026-08-06T18:48:51.269087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-06T18:48:45.124627Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.124627Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:12022f926fa1ae4985a6f1cdb700d6c362400a07f463b613639932d3b2cca0bc","observation_id":"98f7c310-02ba-486c-9cc2-3360905cbdde","resolution":{"observed_at":"2026-08-06T18:48:45.124627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.942423Z","title":"Multimodal large language models make text-to- image generative models align better","venue":null,"work_id":"352632e3-e8a4-44da-9675-7c2c8ba1950c","year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.244020Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ddc247064b58b5d7fdf3ab7ad683a87b432f06a497aed945639ab495fea939a4","observation_id":"5767bcff-6c33-422a-91c1-7e7ad09062b5","resolution":{"observed_at":"2026-08-06T18:48:51.082936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15100","last_updated":"2024-04-23T14:53:15Z","snapshot_observed_at":"2026-08-01T21:34:06.143524Z","submitted_at":"2024-04-23T14:53:15Z","title":"Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15100","snapshot_observed_at":"2026-08-06T18:48:45.322166Z","title":"Multimodal large language model is a human-aligned annotator for text-to- image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.322166Z"},"links":{"cited_paper":"/paper/2404.15100","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:eeb0accc32890832ec6d623d4b4633680da2e446c0574d8a33e66f433db3561d","observation_id":"f2883f65-6823-4ff0-ae40-905a7a59639b","resolution":{"observed_at":"2026-08-06T18:48:45.322166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.682622Z","title":"Human preference score: Better aligning text- to-image models with human preference","venue":null,"work_id":"1db3f9c4-142b-4c91-80d6-725b2590a75c","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.426857Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0e215554a49afb7ba5a8f6223fe4620f31836ea4ac767417da992b7683ce41ae","observation_id":"a236bf43-d83d-42a8-8ba2-a8ba8ae1c26f","resolution":{"observed_at":"2026-08-06T18:48:50.816393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.424502Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"6c32eddc-a44a-4d73-a9c7-83d2b10c18cb","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.562550Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:877e62c143dfb2e86f215ce96fc3b7a1cde2c6f007ab0cd18f671aadbfa84a6e","observation_id":"7bc553e3-d597-4a0d-96a5-3c733c4c4341","resolution":{"observed_at":"2026-08-06T18:48:50.561184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:45.697618Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.697618Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2a098655384640ea9a01bac434b98804102b8834d9a5c5111ea5fcd4f8961293","observation_id":"3e5e715d-3bf9-467b-be0d-808afe6ccbc4","resolution":{"observed_at":"2026-08-06T18:48:45.697618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T18:48:45.861490Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.861490Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:8847c03be9eec011bfd3512dea74e50e934f8adecdad0be2ac949d2a2ee320bd","observation_id":"9666feda-0088-42e3-b9bf-84424452a916","resolution":{"observed_at":"2026-08-06T18:48:45.861490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.179373Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"e105507e-6815-4130-9215-390d3ad9e17e","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.909446Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ad960fbb83f27f960f1cbb8e8f735c58079b4620e292a65d633cf40c5d888d78","observation_id":"a4d73f97-fff5-47e6-9079-cf3839a4e9af","resolution":{"observed_at":"2026-08-06T18:48:50.288946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:48:45.958345Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.958345Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:daa2fa26847373b678c8a9fd6c30becc9eca77edc6b2ad72ef45b0bac666ee86","observation_id":"48d636dd-8c85-446d-acd7-e7f440c730b8","resolution":{"observed_at":"2026-08-06T18:48:45.958345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.866856Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"c2cfea9d-6e03-4f56-b8ea-4155bdf0eb8c","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.055557Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:aeadeb578176f90dd666ae4f071a7679bcc0efca8fa767124acd0e829d7f544c","observation_id":"a979365d-1191-46f0-8491-d82a85753118","resolution":{"observed_at":"2026-08-06T18:48:50.019536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.644897Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"0804b321-2d3a-46fd-8d4e-598f26bb3965","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.208380Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b3002dbb028060439a11b502c89e6a3e430c4659915bbd26be12c655697b1745","observation_id":"75fd2958-d867-4973-a9a6-ac2e722471aa","resolution":{"observed_at":"2026-08-06T18:48:49.728766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.409653Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"e8e51d1d-79fc-4e45-812e-bc847f640f78","year":2018},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.313062Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ae8f793f68e5c22e7755fc52c09ad521611d2d3cf896f86d16d79b2f8a980616","observation_id":"03a1bcbd-f75b-4f0d-a28f-4bbefc6f4f15","resolution":{"observed_at":"2026-08-06T18:48:49.519550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.136929Z","title":"Learning multi- dimensional human preference for text-to-image generation","venue":null,"work_id":"f54858b6-e070-4bb9-9d82-366f91cd36a7","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.376211Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:99fe52fb4f4fdacd6342884c0f34135ba1fdbb7745a0bbd33d1b65e572d13ebf","observation_id":"e991b1d4-3cab-4cec-a433-a5ba5a8b1f55","resolution":{"observed_at":"2026-08-06T18:48:49.280332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:48.863419Z","title":"Hive: Harnessing human feedback for instructional visual editing","venue":null,"work_id":"9dfc8f17-cf3a-43b7-83ae-9af43d1e8246","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.496584Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:7ce809ee70efb42bfce7e829be122d9c6a985d947ed70b2f4ef7ce3414535996","observation_id":"aaa52f07-c2a3-4c94-b459-c7435d1050ce","resolution":{"observed_at":"2026-08-06T18:48:49.021181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-07-06T18:42:30.828375Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-06T18:48:46.618116Z","title":"UltraEdit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.618116Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:44b0a6bf896efa6d172a106681c7b516a5cc0969fce1dd432f10efc6e76ed4c6","observation_id":"1fef0756-b515-4779-be69-9de6e264fb0f","resolution":{"observed_at":"2026-08-06T18:48:46.618116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:48.574298Z","title":"Can you rate how successful the edit instruction [IN- STRUCTION] has been executed from the first image to the second image with a score from 0 to 10?","venue":null,"work_id":"1224fb61-2c77-44a6-8a61-e563011eec38","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.673046Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:714ab22e84c49935aee6feb4f424fd3983a8532bb7b78b8b8e28c802667acae2","observation_id":"1f9888cd-41c0-49be-a770-d0ce2f9a8846","resolution":{"observed_at":"2026-08-06T18:48:48.700573Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:41:29.945236Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":36},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2507.07317."}