{"as_of":"2026-08-09T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:836e1b0e3579eb0770c30504a8c0699897531045a0726c4d9bd5da59b3bb384c","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:10:14.568791Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20505/citation-record","integrity":"/paper/2508.20505/integrity","json":"/paper/2508.20505/citation-record.json","paper":"/paper/2508.20505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.217956Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"c733ac0f-38a0-43bf-accd-bac83a954c2b","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.366413Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:815ac68faa63ee92e12cd885ea4b15fdc335d5dfd42fb96b423e4e6d1b8f40bb","observation_id":"873047e1-45d2-4384-968a-1bdc6c5eb475","resolution":{"observed_at":"2026-08-05T15:10:15.221159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.207019Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"2b8687c5-88d3-4b02-9f78-9674e3734665","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.370756Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:60aab27ccedb774a43c84e2397f0397ac9b8000a3bbb22ccc00b0f3abc246898","observation_id":"6dd68923-635b-4985-9099-bf37db89baa0","resolution":{"observed_at":"2026-08-05T15:10:15.210951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.197701Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"45603bc8-0d6e-47a0-a14b-c7b21ccfa07f","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.375562Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:7ba1078973fd3608e02ce1588bba296aac13467159449cef67949efe049989fc","observation_id":"2c8724ba-6f65-414e-bccd-300728a1672a","resolution":{"observed_at":"2026-08-05T15:10:15.201010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.379319Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.379319Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:770df3a6a6c3171d9e8da2930923d6624b97c57174f8b71f6444e7f4dcfe591d","observation_id":"b6af6a11-5de4-4a0f-960a-b7c45fcfd6de","resolution":{"observed_at":"2026-08-05T15:10:14.379319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.182933Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion","venue":null,"work_id":"1f571198-9007-40f7-8349-f8ef2c88e3e5","year":2025},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.383783Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:426c27d1a5aaf3bea690be6c3564725d147cc57464bdfc8c177f8891cebe8443","observation_id":"9d4a29e4-45e6-493d-b2b2-3f4834ffbefc","resolution":{"observed_at":"2026-08-05T15:10:15.186609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.172683Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image syn- thesis","venue":null,"work_id":"84136412-2738-482e-9743-26f0f8d66ed5","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.387814Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:ded10563a77b592a01eb8166060526fd05b125f5a8a48174aa36f606b9fa829b","observation_id":"b74fd36d-8b90-4247-8966-49a76ef9ae26","resolution":{"observed_at":"2026-08-05T15:10:15.176450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-05T15:10:14.391535Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.391535Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:a92b805aa7daba5ab05780b95137b34cf253eac305de77b050f52cdd0312e7df","observation_id":"0bc4d044-4d0a-45d6-9088-17efc8330089","resolution":{"observed_at":"2026-08-05T15:10:14.391535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.163190Z","title":"Turboedit: Text-based image editing using few-step diffusion models, 2024","venue":null,"work_id":"18ce805e-b3bc-4c9e-a477-f35408695cae","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.395872Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:526f338232c51f29d183d27decceb195a171d4e03df37ba89b1ed9507ff2f880","observation_id":"cf3d2ddb-af56-4f52-b153-98ae7e90ac46","resolution":{"observed_at":"2026-08-05T15:10:15.166902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.152142Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"51d587e3-552b-4861-aaeb-16e880c606ba","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.399244Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:808af24d1d017c5ae67fee5a0a8d4497475687aab0ed31a850cc5c7ae00f0470","observation_id":"75025253-130a-49df-aa85-3c698b23b423","resolution":{"observed_at":"2026-08-05T15:10:15.156246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.141276Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"5d4f1921-849b-4438-99dc-d551661e5cf8","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.402557Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:0b03ead7ab3405498cdc1f9ae9f089fdb2aab99d124d00841a8f4c66bf3d5caa","observation_id":"741dd28f-0c68-444b-9116-163a8804632a","resolution":{"observed_at":"2026-08-05T15:10:15.144431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03286","last_updated":"2024-11-07T15:07:59Z","snapshot_observed_at":"2026-07-06T19:45:39.524410Z","submitted_at":"2024-11-05T17:35:41Z","title":"DiT4Edit: Diffusion Transformer for Image Editing","version":2},"cited_work":{"arxiv_id":"2411.03286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.03286","snapshot_observed_at":"2026-08-05T15:10:14.691345Z","title":"DiT4Edit: Diffusion Transformer for Image Editing","venue":"cs.CV","work_id":"8b2f7d2b-1f65-4d5e-88d9-c6027420b934","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.406081Z"},"links":{"cited_paper":"/paper/2411.03286","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:5824a15e876d2c027bd6bbdbf69eeddb18333923c9200c5aba141f82a3aec643","observation_id":"7155195f-817f-4bbc-ba7a-318e3916e328","resolution":{"observed_at":"2026-08-05T15:10:14.696710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.130901Z","title":"Guiding instruction-based im- age editing via multimodal large language models","venue":null,"work_id":"faafb28b-9367-4c73-80fd-27c3d2afea50","year":null},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.409650Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:4fe34a0b897e2fb84385ce4903a7fa7ed0ab421317ed8b4a4e4d7e11e13fd669","observation_id":"8207fb46-71d6-4e34-ae97-fb96b68a107c","resolution":{"observed_at":"2026-08-05T15:10:15.134167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.121525Z","title":"Generative adversarial nets","venue":null,"work_id":"2554dff7-02ad-432c-bb43-47c118f51792","year":2014},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.413283Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:3c38b52737d69572644c4e7c4be833d38b67eae651d04720548bbb04de026f57","observation_id":"7d481ae5-0271-4f94-8ed8-24a62f684f64","resolution":{"observed_at":"2026-08-05T15:10:15.124614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.111416Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":"187b2a6d-5a76-4795-ac30-f3052a380b5a","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.416974Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:2dfb7d4d8581be6f21966acaa6d3660a9c2b56dcc3a05dd9a2604ec216973d7d","observation_id":"a181feeb-481e-4705-8572-6dbf397e1820","resolution":{"observed_at":"2026-08-05T15:10:15.115136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T15:10:14.419892Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.419892Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:2a80a965ad4fdb5cd6104019ba760af3238791c580730762d1aaaa105af3e707","observation_id":"b847dcd4-d429-4a0c-96c1-bb86e4a46a90","resolution":{"observed_at":"2026-08-05T15:10:14.419892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.101252Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"7a12f207-bec6-44fa-a9cc-577987b4e8b7","year":2020},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.423659Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:820f2180c4b2fd2f7d2d32ee419bb8adcd2f92d1cf5f27fe9039425fe8b96f29","observation_id":"b11cba70-3b05-4cd3-92b9-b6b4d1a7e0a4","resolution":{"observed_at":"2026-08-05T15:10:15.104620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.090564Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"3c43e026-0629-472e-a463-b24f0f9dd6b3","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.427085Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:053305132fcf5f62a393b71ca508f0b7eaaff92eb54816a1328520a7f7387a75","observation_id":"65405db1-cb6c-4a2e-8f63-67a43f94a2da","resolution":{"observed_at":"2026-08-05T15:10:15.094425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.079571Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"8e13dc60-9719-4e7f-b955-5821e9825e05","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.429903Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:8578f757c945ba418d88a15afb1441a1f84caa3485901143e98b411fad47008a","observation_id":"7f0df120-c809-473f-ae42-02916aaf6471","resolution":{"observed_at":"2026-08-05T15:10:15.083347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.068544Z","title":"Smartedit: Exploring com- plex instruction-based image editing with multimodal large language models","venue":null,"work_id":"8501a459-88c1-43e8-bac3-f196963cb048","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.432942Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:ebf0bc228120fb45a66459dd9f23b70a25241e77340a45c05d77bff76e922e13","observation_id":"95e2efd5-f7c6-47f4-933d-ddfe32c05289","resolution":{"observed_at":"2026-08-05T15:10:15.072441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.058787Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"31a122e9-0dcc-4e45-9037-969eb122a9f5","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.436996Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:fd984a60e2396543c51f5bebae72cc79ace8d09d5d909e49187440a4ce4313d3","observation_id":"f80ef37f-7f00-4b8c-bbd6-66e41f8970d4","resolution":{"observed_at":"2026-08-05T15:10:15.062003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.441184Z","title":"Multi-concept customiza- tion of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.441184Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:d48b693977c46d968d511d734e7089f9bea686329f9bc444d481208c63dcf01c","observation_id":"b9052845-83d0-4a8c-a8ca-46880f4ab115","resolution":{"observed_at":"2026-08-05T15:10:14.441184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.041116Z","title":null,"venue":null,"work_id":"320a8bff-d058-42b5-bb6c-d4ba7eb68aa3","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.444737Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:cde91524855f61121d88a10b784f2ed8599bf6e0ffb1ef2c49733bb09a96e8f9","observation_id":"a2908287-a3f4-4a3e-bff6-c29aae809b22","resolution":{"observed_at":"2026-08-05T15:10:15.044026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.030711Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":"2ea8353f-b504-46c4-ab71-d98ad32297ae","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.448780Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:bb35e4b5d3f4237bd553aba166b807f388f5a97f22baa0707285bef1c3a2258b","observation_id":"785190e3-9f2f-46a0-a2a2-93f336272988","resolution":{"observed_at":"2026-08-05T15:10:15.034343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10316","last_updated":"2025-05-05T16:31:12Z","snapshot_observed_at":"2026-07-06T20:06:39.463209Z","submitted_at":"2024-12-13T17:58:06Z","title":"BrushEdit: All-In-One Image Inpainting and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10316","snapshot_observed_at":"2026-08-05T15:10:14.451707Z","title":"Brushedit: All-in-one image inpainting and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.451707Z"},"links":{"cited_paper":"/paper/2412.10316","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:f73b19a9c077c1092158d1d902ff86f56332f1cc923c72cb595b02889d1aea4d","observation_id":"72347049-456b-4cb5-b024-c6d207095713","resolution":{"observed_at":"2026-08-05T15:10:14.451707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T15:10:14.455855Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.455855Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:25817a40d3310aa3cc0d4676e064321a964e85c5ace858a8ec5805b77acdf3f6","observation_id":"04b12cb7-9f11-4a84-a4a2-1844c2f942c1","resolution":{"observed_at":"2026-08-05T15:10:14.455855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.019570Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing, 2024","venue":null,"work_id":"217aa54f-87d3-4cfb-93d0-cfc8f30848f0","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.460066Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:66eca9923fc645aa601043d0126adc6938962892aae2e937780165fd6fb6ba3a","observation_id":"21883f9d-c811-44b3-ba15-f7a42704f773","resolution":{"observed_at":"2026-08-05T15:10:15.023343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:15.010462Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing","venue":null,"work_id":"7458a965-0a7a-49c7-8b1a-00d4df8aa298","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.463689Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:9ad05d9bbd1fcac22d34813ce29f4d393864767ec4e31891ef4056f5662e8afe","observation_id":"0cdeaad7-b23b-4092-94d0-d1dd9802bd57","resolution":{"observed_at":"2026-08-05T15:10:15.013665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T15:10:14.467655Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.467655Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:c0cf0443f1a755b053c7f06640070e0481ca384d4fa646ecbb54724a7e1a88e3","observation_id":"7ff4a2cb-6245-4c9b-9a94-0da6fa1ad59f","resolution":{"observed_at":"2026-08-05T15:10:14.467655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.999489Z","title":"Glide: Towards photorealis- tic image generation and editing with text-guided diffusion models","venue":null,"work_id":"aa0923a7-3eee-42aa-bcf8-ea6f59f01bfa","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.471018Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:bbf00eebdc390ad89ff7a63d4a3dc28c20b6349249697f1739b2223a3be7517b","observation_id":"5095fcc8-9436-436a-858c-46da89a7462d","resolution":{"observed_at":"2026-08-05T15:10:15.004001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.989106Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"35a29282-e367-413d-b73c-20c662810d46","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.474297Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:dfd3c53b0d3076c4338a684d8035627755cad8ea04c4ac49d1a3a806e7ddd76a","observation_id":"e0d28f0d-feed-4503-b1ce-f0345b4f129f","resolution":{"observed_at":"2026-08-05T15:10:14.993046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.978400Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"e4198401-9cdf-465f-8be6-40c2daab03a4","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.477499Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:5d7865626a8a6bccc099926be48cfb2dab7b5678743757122f6aff72230c044c","observation_id":"3795b9d1-02ae-483d-bb8c-57e180178676","resolution":{"observed_at":"2026-08-05T15:10:14.982645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.968805Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"751e5ff8-d097-402c-9421-810358224e22","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.480384Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:1804a552f119bc72bef6ca858f2ba3e9b07b600e2944e3a6a87ebd67ca5b1fe7","observation_id":"176a27db-6ae6-45ba-99bf-dd33bcfdbd1f","resolution":{"observed_at":"2026-08-05T15:10:14.972046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.957639Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b01bb9c2-4533-46b8-a26d-1330e8330792","year":2021},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.483586Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:699ec4e45239e3a40540d80a15273e0d6a83ffffbff634e8a7af21fed17dce3c","observation_id":"6b3c34b5-3ba5-4928-9f67-15d8cc939a22","resolution":{"observed_at":"2026-08-05T15:10:14.961052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.946627Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"eb9caa8b-7e19-4411-9982-9591e4aafe8f","year":2021},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.487851Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:8a8cf0eb0b53f03b44e4d1cf37f1bd0a17660863be68ec614f95fd644b43ce3a","observation_id":"ef7fd576-e89c-41ce-9a2b-4b07bfb0470b","resolution":{"observed_at":"2026-08-05T15:10:14.949979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T15:10:14.491517Z","title":"Hierarchical text-conditional image gener- ation with CLIP latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.491517Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:cd2713c527c15be93c0917be7bf3c0ffa4ba8719c23be259698bc80b8788876a","observation_id":"aa758a2c-7ccb-4d69-8e70-66afa941e34b","resolution":{"observed_at":"2026-08-05T15:10:14.491517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.495189Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.495189Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:604f5bc17554ff584dc65355384529abc5097b7dc851e4fd0d66277dc4e9e6f9","observation_id":"3359af09-24a4-4f54-8224-87a62e8c1d5a","resolution":{"observed_at":"2026-08-05T15:10:14.495189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.927665Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"f0035577-01e7-4eb1-aaf7-17b1def7ed5c","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.499744Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:f0247dd7e73af6f58e427cb3a9676e58362e98fa8746e2cd35ef0807e610352f","observation_id":"790d3e38-52ca-44c5-83d9-b002e363691c","resolution":{"observed_at":"2026-08-05T15:10:14.931624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10792","last_updated":"2024-10-14T17:56:24Z","snapshot_observed_at":"2026-08-02T16:03:59.021980Z","submitted_at":"2024-10-14T17:56:24Z","title":"Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10792","snapshot_observed_at":"2026-08-05T15:10:14.502670Z","title":"Semantic im- age inversion and editing using rectified stochastic differen- tial equations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.502670Z"},"links":{"cited_paper":"/paper/2410.10792","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:b187be106aa4e0f1a34364198628dc80479f06b97410ea68504523e50e76b5f0","observation_id":"b8d947b9-dfbe-422a-b13e-f8894dc8e72d","resolution":{"observed_at":"2026-08-05T15:10:14.502670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.842845Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"762ad633-43cb-4910-9731-469528f8e5f6","year":2022},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.505793Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:ec299201d7a3fc1247dc8412093d15d0ec7e793446adcfd1f57dd1549893891d","observation_id":"33112e1e-f964-4b74-9887-4dd99c61a60d","resolution":{"observed_at":"2026-08-05T15:10:14.846170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.831923Z","title":"Emu edit: Precise image editing via recognition and genera- tion tasks","venue":null,"work_id":"211b3672-4d10-473d-ab7c-7f70476cfb06","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.508700Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:6053bb8f3ec2838af43f89add55b84109ac7398d0104e83c017c7af2a6e89cf5","observation_id":"906c8b8f-47f8-4a34-a8b7-a9994a281c00","resolution":{"observed_at":"2026-08-05T15:10:14.835840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.820598Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"dba3cd4b-75e3-44dc-a963-9326e900394c","year":2015},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.511512Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:acd2ec1fa6f1114c32fe5ea7f2d6cc5f4fa30ffb241e7b503ce9b71cd412019d","observation_id":"5599616e-50a4-4cfc-a11a-a5e193d26f57","resolution":{"observed_at":"2026-08-05T15:10:14.824680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.810046Z","title":"Postedit: Posterior sampling for efficient zero-shot image editing","venue":null,"work_id":"b45f1f65-7598-4925-b504-4b97bdf9de61","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.515010Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:8d0686f40d2f6936e42015a44b22901ce3badd423181d4bbc6f18351395f7292","observation_id":"7d4406f6-4a5e-466c-94f3-ffa9a0780f0e","resolution":{"observed_at":"2026-08-05T15:10:14.813397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.798859Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction.NeurIPS, 37:84839–84865,","venue":null,"work_id":"c1912bce-5e89-4536-b808-2fd61c33c419","year":null},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.518963Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:3481be0cafa93d6f808f48cc7e8856ca24556e6d65a6bbcfeab3734611be74d0","observation_id":"8de88ad9-579e-4f37-a296-3287fb0bcd45","resolution":{"observed_at":"2026-08-05T15:10:14.802201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.522030Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.522030Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:11666a3156b8fead62d72ceec148ea31165e037b73faf20e57cb9f95b349d492","observation_id":"3454e542-3ad7-4b0c-bb35-6577416bc056","resolution":{"observed_at":"2026-08-05T15:10:14.522030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04746","last_updated":"2025-06-13T02:29:47Z","snapshot_observed_at":"2026-08-07T03:44:44.446465Z","submitted_at":"2024-11-07T14:29:02Z","title":"Taming Rectified Flow for Inversion and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04746","snapshot_observed_at":"2026-08-05T15:10:14.525885Z","title":"Taming rectified flow for inversion and editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.525885Z"},"links":{"cited_paper":"/paper/2411.04746","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:2ecee1accc156f5f22724a173fb3b85ec471f02d2527413879807b13e7cb7fa7","observation_id":"2b5c21ab-2d1d-4977-8d09-d1988a10df65","resolution":{"observed_at":"2026-08-05T15:10:14.525885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T15:10:14.529340Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.CoRR:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.529340Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:456d0e0c4ff967e6ae11f72602c009a2ad716025fa5aba8820c405fd367f6739","observation_id":"986bfa1b-284c-479d-846c-14e29a296e5b","resolution":{"observed_at":"2026-08-05T15:10:14.529340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.779730Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided image inpainting","venue":null,"work_id":"5bc1ffdd-7ada-4c64-ba1a-5ff17f89c623","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.533590Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:13b47c164d63cd2de7fc7e12c8b8a3f4744a3a93e9092d1f6b7fb445c6f33032","observation_id":"b3d1845f-16c1-4fdc-98c1-692f79eb023c","resolution":{"observed_at":"2026-08-05T15:10:14.783609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.769086Z","title":"Bovik, H.R","venue":null,"work_id":"37dc427b-18a8-4cc6-badf-c210211f7cd8","year":2004},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.537735Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:2d56c369b35c0489e95f6fee88ee7d42efdb545faab8ff358607196d7a9c8f7c","observation_id":"a35bd1ac-47c3-4e41-91ea-16f59a137aa1","resolution":{"observed_at":"2026-08-05T15:10:14.772704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07199","last_updated":"2025-04-28T14:16:29Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:21:43Z","title":"OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07199","snapshot_observed_at":"2026-08-05T15:10:14.540887Z","title":"Omniedit: Building im- age editing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.540887Z"},"links":{"cited_paper":"/paper/2411.07199","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:3502347f4234540212c1e5815bf07a154cb269bbbea60125a3fb55e2634a0c90","observation_id":"10261733-2f2b-4e5a-8d5e-29c77663f06b","resolution":{"observed_at":"2026-08-05T15:10:14.540887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T15:10:14.544847Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.544847Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:695ade4e5c0560f562d8811b935373a7371aaf3f561b235e7d5ebfff92c2cfea","observation_id":"ea8b8b9d-bfa7-4506-97ba-63d9b40ee474","resolution":{"observed_at":"2026-08-05T15:10:14.544847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.756145Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":"22707709-93be-4d85-b7cc-a2c1a4aeb848","year":2024},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.549242Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:297ab88e14b664a5b8ef36a7342aed81ac1fc685019df25cedc7f83100a9ccf0","observation_id":"a97d97f2-d2c2-406a-851c-e3ada674ea4a","resolution":{"observed_at":"2026-08-05T15:10:14.760524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.745404Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"b8370e52-59a4-4354-ade2-7dd19914f663","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.552155Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:032f948d284e5f63abde987af476932366743ab9cc449c2fd0837e0ba1c9d186","observation_id":"59170675-8587-4e07-912f-c276f55ca17b","resolution":{"observed_at":"2026-08-05T15:10:14.748728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.734494Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"1fe5a691-d8e8-4a2a-83ab-734307797710","year":2023},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.556503Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:0317aa50cad8720c18077a111bb55cc5721ba4bcbe24840190cb4083dad2b6e9","observation_id":"697a6fbe-9b2b-454d-be59-2af1f795eb53","resolution":{"observed_at":"2026-08-05T15:10:14.738437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.724778Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"c9f26ddb-9e04-4cb2-86a8-fabc5bafdf2d","year":null},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.560703Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:ef0ac7b6cd03ccba9c7af49cdf3ada0eef51409e3433c3d7997591c0c5d283f9","observation_id":"405d20ab-3b90-4baf-9fdf-8bb96f082cc2","resolution":{"observed_at":"2026-08-05T15:10:14.728070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:14.713940Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"bc6be16a-91c6-4a2e-b0c5-f54ece2cc9e0","year":2025},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.564510Z"},"links":{"citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:dfb8b3556dc95e5a4e936da1dd3f9beb289732b9b8e3e61d90e188935fe4f3ba","observation_id":"3f34ab02-3de9-4167-aea1-5f5d7b4fcbd9","resolution":{"observed_at":"2026-08-05T15:10:14.717571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17363","last_updated":"2025-03-12T07:23:32Z","snapshot_observed_at":"2026-08-07T17:52:34.704103Z","submitted_at":"2025-02-24T17:40:09Z","title":"KV-Edit: Training-Free Image Editing for Precise Background Preservation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17363","snapshot_observed_at":"2026-08-05T15:10:14.568791Z","title":"Kv-edit: Training-free image editing for precise background preservation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:14.568791Z"},"links":{"cited_paper":"/paper/2502.17363","citing_paper":"/paper/2508.20505"},"observation_digest":"sha256:84f131538d7c0ff350f69c24d3659ab53b1b97e067fee2fcc8600c4575b66fac","observation_id":"98a3c2ee-c03f-4248-b490-3022c66f35d2","resolution":{"observed_at":"2026-08-05T15:10:14.568791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20505","last_updated":"2025-08-28T07:45:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T03:15:19.577471Z","submitted_at":"2025-08-28T07:45:08Z","title":"Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2508.20505."}