{"as_of":"2026-08-17T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34cc68f0711967535c12444fb63189349c949918f813d27051224d728a3f6957","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:45:17.731765Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00502/citation-record","integrity":"/paper/2505.00502/integrity","json":"/paper/2505.00502/citation-record.json","paper":"/paper/2505.00502"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.404411Z","title":"Blended diffusion for text-driven editing of natural im- ages","venue":null,"work_id":"5287fd4f-68ea-4ce9-a636-fde07d577fe8","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.539978Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:c9a8c8142aacb055257ea483177f64eadfe1098d186db7e079e377483aa1985b","observation_id":"ccb7e29a-d456-40e8-9651-f28991f59cfa","resolution":{"observed_at":"2026-08-16T04:45:18.410012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02426","last_updated":"2023-10-03T20:46:10Z","snapshot_observed_at":"2026-08-16T14:55:20.395869Z","submitted_at":"2023-10-03T20:46:10Z","title":"EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02426","snapshot_observed_at":"2026-08-16T04:45:17.545949Z","title":"EditVal: Benchmarking diffusion based text-guided image edit- ing methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.545949Z"},"links":{"cited_paper":"/paper/2310.02426","citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:14f5ec696b11485f5516558bc7530cdd744ebb0ab06cafd7cf450b629ea1588a","observation_id":"c26728ca-486b-4e48-a3cc-671f7eb908d7","resolution":{"observed_at":"2026-08-16T04:45:17.545949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.387628Z","title":"InstructPix2Pix: Learning to follow image edit- ing instructions","venue":null,"work_id":"7d72078e-8154-468a-97ad-3bf3b62b835d","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.552038Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:e116fcb009d15a8cc7399135c03d0aa641354e4fde5f7801557bba64762ceb8f","observation_id":"64d3dead-a4af-400a-9d39-6752e6931f4d","resolution":{"observed_at":"2026-08-16T04:45:18.393116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.370284Z","title":"A computational approach to edge de- tection","venue":null,"work_id":"6b4b95f1-7ea8-4018-9965-31506a377576","year":1986},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.557708Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:f932e2dd062a8bf3a80d2b2a4283df9827592b81a7d0d2c498524852acf62e82","observation_id":"00955b95-86bd-4269-a641-b75dde70cda6","resolution":{"observed_at":"2026-08-16T04:45:18.375712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.351712Z","title":"MasaCtrl: Tuning-free mutual self-attention control for consis- tent image synthesis and editing","venue":null,"work_id":"eee067db-cb2d-423e-9d41-96e3d69e8d70","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.563312Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:b32c851b7dbd6d7a61ad94d93505b4433fcd69b3254f35616bbafb8a4d15d8c1","observation_id":"3f63c280-3ec2-4278-bdba-1929277b4085","resolution":{"observed_at":"2026-08-16T04:45:18.357832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.333048Z","title":"DiffEdit: Diffusion- based semantic image editing with mask guidance","venue":null,"work_id":"c2293d8e-15a1-40e3-8126-a71de157b05d","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.569325Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:41267a5aadcc39a4791c91a4156091ad83a5b1026a96560ce63fc4e10f51d7a7","observation_id":"e502a1ec-3b6a-4f52-911d-c1788dc693f5","resolution":{"observed_at":"2026-08-16T04:45:18.339817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.314541Z","title":"Imagenet: A large-scale hierarchi- cal image database","venue":null,"work_id":"cad3a6da-4329-492f-9e36-384002f59987","year":2009},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.574801Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:3448c71ca166fc11c73910dd2aae628b27d0d579ef2693328822eedbdfdefe0f","observation_id":"72d4d2e6-7433-47d6-bec9-5afb88063d9d","resolution":{"observed_at":"2026-08-16T04:45:18.320949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:45:17.580755Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.580755Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:a8f91e939522c0be7f58be8676fc0c278f895f6c371335a9ae002ca25d866a0f","observation_id":"46bdf76b-b5a1-41c1-aed1-e3239c5ded70","resolution":{"observed_at":"2026-08-16T04:45:17.580755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.297192Z","title":"InstructDiffusion: A gen- eralist modeling interface for vision tasks","venue":null,"work_id":"eeddbbb1-a04b-4577-9c80-5f2edcb632c8","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.585811Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:d1413b738fedad7292109d22e8e96dbee03c362f02e1ad28a21db5cf2cb29ac3","observation_id":"5d37916a-69b2-4b49-b609-e041ac3b2ab2","resolution":{"observed_at":"2026-08-16T04:45:18.302861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.272977Z","title":"Prompt-to- prompt image editing with cross attention control","venue":null,"work_id":"e8a77970-5b7f-4414-8175-ad391452e926","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.590979Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:4b53eb3fbc4246a185935e48e7717f95a619f2fcb6a036cecb036745fe6cde34","observation_id":"c0e276ec-1dba-48fc-8998-db2fb6a9bb3a","resolution":{"observed_at":"2026-08-16T04:45:18.278934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.253249Z","title":"CLIPScore: A reference-free evaluation metric for image captioning”","venue":null,"work_id":"e42dac59-e91d-4f9e-b2df-0bcfbdd53978","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.596376Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:4fc1c30cf0ddf9226a790e1acc23ba09ffb4de00f26b6dda24927c7243a0923d","observation_id":"9effaab6-29cb-4fb7-b9cd-ff2c0c8b0e6c","resolution":{"observed_at":"2026-08-16T04:45:18.259810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.235082Z","title":"GANs trained by a two time-scale update rule con- verge to a local nash equilibrium","venue":null,"work_id":"500a1026-2bf2-4f38-92fc-6c8e3af30da7","year":2017},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.602042Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:32ebfb6df69eb30addd7e851ed2aafd9b527addd6b50d0baf6b89e9962183e46","observation_id":"1eb7e3b2-2d7b-4ba6-aa3c-79c0a28ea829","resolution":{"observed_at":"2026-08-16T04:45:18.241035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.217876Z","title":"SmartE- dit: Exploring complex instruction-based image edit- ing with multimodal large language models","venue":null,"work_id":"40512097-5763-4210-bb81-46554ceb0912","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.607824Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:348527f9f973dc9ba2d409ad5c2086f58d0d72c69040e6dc8a958e05e837e679","observation_id":"f01b244c-e785-4b7c-89fc-ac038207a5e7","resolution":{"observed_at":"2026-08-16T04:45:18.223299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.201094Z","title":"GQA: A new dataset for real-world visual reasoning and com- positional question answering","venue":null,"work_id":"680319d1-d6d5-4cef-a06f-518ae98acce3","year":2019},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.612972Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:ec2f64ce33a9adf5fe015239e030a745f8dbf61ff4f095c5323665170e66a844","observation_id":"f9f44eac-5fae-4420-aba5-5659eecdb3a8","resolution":{"observed_at":"2026-08-16T04:45:18.206706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.182700Z","title":"Imagic: Text-based real image editing with dif- fusion models","venue":null,"work_id":"ee7dca58-9d89-4450-9742-cfafe84ecb09","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.618300Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:fbd46b29c147e06a88236c80ca2d7be96969e4f3fcbda04b9d4102d817576ed2","observation_id":"59c26e53-b349-4f94-a401-113ae17b30b6","resolution":{"observed_at":"2026-08-16T04:45:18.189129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.165874Z","title":"Diffusion-based im- age translation using disentangled style and content representation","venue":null,"work_id":"52485885-eb1f-4a37-8a82-e9c0c680afed","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.623655Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:76e42f040b66c5c5e16e9984a571bc113605c9cddc98774450e2c80fc5a9c6e0","observation_id":"2064fd3d-be28-4a24-9173-65032b4b036f","resolution":{"observed_at":"2026-08-16T04:45:18.171181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.148229Z","title":"mPLUG: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"0ea1098a-1e1a-4e44-888b-b73740911e21","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.629178Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:852344e3d12604f2437c200f5d3f30be3f259c97ba1c1116297878f546f83464","observation_id":"2f1e3f3f-e286-4427-b017-59a91e5d1534","resolution":{"observed_at":"2026-08-16T04:45:18.153816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.129919Z","title":"Microsoft COCO: Common ob- jects in context","venue":null,"work_id":"f19a54b7-6ee2-4034-807d-1d835ab62489","year":2014},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.634415Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:9a619acbb1561ad0b3ac515d184df39c06cf8bcc046cd859985137c160b756b3","observation_id":"e8d1a134-09b8-4161-b8a3-54c298b6dd92","resolution":{"observed_at":"2026-08-16T04:45:18.136307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.111363Z","title":"Text-driven image editing via learnable regions","venue":null,"work_id":"bff0f8c1-a239-4af3-9526-f18e11d58178","year":2024},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.639440Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:6e82e944f5b698513fd10e49e165ab8c65c8f81cfe04f28e92f41f88463eecae","observation_id":"283a2e09-5f34-471b-806e-ab08ab101a2f","resolution":{"observed_at":"2026-08-16T04:45:18.116960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.090361Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":"fde2654b-cd3b-4fff-b919-bf5fe2bcb5c3","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.644939Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:1eaac3c106fb9eab8334f924f43f0484eee761f86fdb4bbe2ab72ed5809c1fe7","observation_id":"3b2f79a4-43c9-4a80-a001-4d2fe0c4772b","resolution":{"observed_at":"2026-08-16T04:45:18.096081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.070652Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"1f08eb8e-062f-4dcc-84dd-5c8407d55ae4","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.650337Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:f7ed151c003a6a0f9191c8ada3a803d279b2151ad1024942bfa8c1b6369a19dc","observation_id":"1e58c0ae-fb77-4ea7-8718-38c2f392f86b","resolution":{"observed_at":"2026-08-16T04:45:18.076767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.052214Z","title":"GLIDE: Towards photore- alistic image generation and editing with text-guided diffusion models","venue":null,"work_id":"969f9a35-2bac-4349-a770-0e4c3c8f5f0f","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.656000Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:3c5fa212a89d9da14a41babefa89bf3dd9c41a0d6b9042402c826e0442e8584d","observation_id":"d62cbc61-5b59-4f13-94b4-819c28147a04","resolution":{"observed_at":"2026-08-16T04:45:18.058044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.033344Z","title":"DINOv2: Learning robust visual fea- tures without supervision","venue":null,"work_id":"c204edf2-a7a9-41bb-9acc-31528e93f78a","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.661013Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:77335a05c3e0737bca690086b90a6625fde20c558f5ade2364ea4a8847369446","observation_id":"ef670da1-3ab9-4fca-897e-c5ac77529e49","resolution":{"observed_at":"2026-08-16T04:45:18.039208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:18.015850Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":"18142cf7-158c-463f-8e79-c459ea9b7d9a","year":2021},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.666066Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:4b3fc5b40f9dbf035dd6b96acba952ce2908d45fb43995fe48acdbd868f30bac","observation_id":"9284455d-97b7-4de9-b223-cd520a2fd326","resolution":{"observed_at":"2026-08-16T04:45:18.021160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.670928Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.670928Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:5a6d6e588d101f718cca5bd727a4c6df4bc175dadf997bceaf423f7a66e9c329","observation_id":"59b23fcf-ff29-42d0-86c3-d3b3d4701b2a","resolution":{"observed_at":"2026-08-16T04:45:17.670928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.985713Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":"7bd3ff0b-a0a1-4df4-a4cb-cc7e26bd6ef8","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.675888Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:4930218ea11b30994b813a99fca129da5c64d6567e384ef6f13e15d9ba95de72","observation_id":"002b678c-611c-4dea-963d-66135511e5fc","resolution":{"observed_at":"2026-08-16T04:45:17.991188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.967764Z","title":"Photorealistic text- to-image diffusion models with deep language under- standing","venue":null,"work_id":"726b4b9a-0501-4258-81b2-72b4384f8909","year":2022},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.680807Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:6aa8d9f631ec4c24993e42caf8ecdc63dcb8b4964599f4ee807be0f11aec255b","observation_id":"3be782a4-4723-485b-bc81-b6aede96b273","resolution":{"observed_at":"2026-08-16T04:45:17.973990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.950130Z","title":"A benchmark and baseline for language-driven image editing","venue":null,"work_id":"dc4e0951-31f8-46a0-8fe7-aeba57e8b26b","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.686416Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:3279388264e16e4136466f9d0c24ffdde240f1d9847ff311fde86e4912920b7c","observation_id":"82ddcc0a-9cf6-4e57-b3af-043c9a0d0dbb","resolution":{"observed_at":"2026-08-16T04:45:17.955852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18047","last_updated":"2023-05-29T12:24:58Z","snapshot_observed_at":"2026-08-16T15:28:41.997107Z","submitted_at":"2023-05-29T12:24:58Z","title":"InstructEdit: Improving Automatic Masks for Diffusion-based Image Editing With User Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18047","snapshot_observed_at":"2026-08-16T04:45:17.691960Z","title":"InstructEdit: Improving automatic masks for diffusion-based image editing with user instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.691960Z"},"links":{"cited_paper":"/paper/2305.18047","citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:78e3667fe759569ae077028bc58e4cbfcb0927ff6d9982e38bac6493f840f039","observation_id":"cbd85b45-a3b4-4693-bbdb-e61398dbc8ad","resolution":{"observed_at":"2026-08-16T04:45:17.691960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.932069Z","title":"Imagen editor and EditBench: Advancing and evalu- ating text-guided image inpainting","venue":null,"work_id":"2e016faf-6156-4c5f-9222-c7aa64c58e48","year":2023},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.697779Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:c7871d78c410202a8b17d5043767ca5ae2834c6322360ecb04b713cdba2a08de","observation_id":"0ccf1947-d378-4d87-9a56-f3b52566663a","resolution":{"observed_at":"2026-08-16T04:45:17.937590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.913577Z","title":"FreeDiff: Progressive frequency truncation for image editing with diffusion models","venue":null,"work_id":"a736656a-5fb9-4b25-9d52-0aa516f93c45","year":2024},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.703235Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:fd574f9e5885417fa8ba76d3af93ce322454fe2660ab84db66131eadd37cbc02","observation_id":"68c3ada4-1e1c-499b-8052-c9d5ae131154","resolution":{"observed_at":"2026-08-16T04:45:17.919174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.896699Z","title":"Detectron2","venue":null,"work_id":"ff8ddddb-8ee6-4275-8c62-7d4751669002","year":2019},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.708701Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:2f290cd75b74c57ab11779d9d970bd6661fb3009e2552ade3edf3d2a50cd96c7","observation_id":"5d1bfc60-e543-454d-9215-4f8a4261f161","resolution":{"observed_at":"2026-08-16T04:45:17.902066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09781","last_updated":"2024-06-14T07:30:26Z","snapshot_observed_at":"2026-08-16T13:43:04.571006Z","submitted_at":"2024-06-14T07:30:26Z","title":"GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09781","snapshot_observed_at":"2026-08-16T04:45:17.713849Z","title":"GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.713849Z"},"links":{"cited_paper":"/paper/2406.09781","citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:99f9f230cb45282edb953f3e0d78bdaf549db48fbd612650ecffcaa0cbe2126e","observation_id":"459f9a35-a0bf-40e3-bc93-dc13061978b3","resolution":{"observed_at":"2026-08-16T04:45:17.713849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.879197Z","title":"MagicBrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":"a62ba40c-0c03-4b66-b59e-5196c7f579c5","year":2024},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.719688Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:531b9b0ebdda96575155c309f7f7a7b74e4b528c87e811a70298b37a63e88163","observation_id":"7f31698e-1249-4a5e-963b-8a078fe5689d","resolution":{"observed_at":"2026-08-16T04:45:17.885256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.862396Z","title":"a photo of a crimson cat","venue":null,"work_id":"3f7a250e-f6b5-4143-b33a-f3f512aba723","year":2018},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.725052Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:16df9fa038444b308f6cf92fc00c7a5179749a4a618f9eb36806af8c42c807e4","observation_id":"73e53cd0-7802-4afb-b2e4-636cce3d4165","resolution":{"observed_at":"2026-08-16T04:45:17.867477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:45:17.843992Z","title":"cream motorcycle","venue":null,"work_id":"eaf7270d-d63c-4d7b-8d67-ddadcc0f1ad1","year":null},"citing_paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:45:17.731765Z"},"links":{"citing_paper":"/paper/2505.00502"},"observation_digest":"sha256:263237d6cdfec79ac6af62c7e23cb859f00654295665e7410624a8dbb4d582e6","observation_id":"953fc53b-88e8-49ab-bf96-e52e15d48b20","resolution":{"observed_at":"2026-08-16T04:45:17.850118Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00502","last_updated":"2025-05-01T13:06:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:38:09.218200Z","submitted_at":"2025-05-01T13:06:05Z","title":"Towards Scalable Human-aligned Benchmark for Text-guided Image Editing"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.00502."}