{"as_of":"2026-08-07T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4888e16f378ba5b172a551e010c65f5d4ce4a59437f8460f07546cbde5b542e2","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:24:55.510895Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02792/citation-record","integrity":"/paper/2507.02792/integrity","json":"/paper/2507.02792/citation-record.json","paper":"/paper/2507.02792"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:24:49.497593Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:49.497593Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:92d1c7b4125a01c05959d8a7434a7a0091dd972f4e44306721298754ab6d68b6","observation_id":"e266709e-355e-45ea-b8dc-3d50e8ec0c04","resolution":{"observed_at":"2026-08-06T20:24:49.497593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:49.607298Z","title":"Cross-image attention for zero- shot appearance transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:49.607298Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:69d59db747528d86155135df9ec7a98913ab8c7d58e26942e3a304d346b84efb","observation_id":"c1329692-d50b-4e13-a0cf-1f83fb474ee8","resolution":{"observed_at":"2026-08-06T20:24:49.607298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:49.757789Z","title":"Break-a-scene: Extracting multiple concepts from a single image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:49.757789Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:befd5567d7e7036e3fa3dc6cdaddb3a6e33ae1aca763b633e29a2d037bb77963","observation_id":"485a6cdb-665a-42f1-a0c5-6030b9be67c9","resolution":{"observed_at":"2026-08-06T20:24:49.757789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:49.872123Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:49.872123Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:5f7d25f37382b82f48604e341fb2c1023e0ab4fc2a9f3199beb42f65886bf514","observation_id":"b819adf7-286a-4a83-9a3c-abdf38596b1a","resolution":{"observed_at":"2026-08-06T20:24:49.872123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:49.996971Z","title":"Stable flow: Vital layers for training-free image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:49.996971Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:a0c3d3987e0fd36cad763f1348f26ae5a8cf1705b0e1d8b8297b8fdfd15c1ed1","observation_id":"b118e7f7-8aee-428d-8afb-e2fde7339934","resolution":{"observed_at":"2026-08-06T20:24:49.996971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.115532Z","title":"Universal guidance for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.115532Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:c3b5c0225f707f50ed4f71862c417f5c356bf0c2d9205488c8e90ba1bf906358","observation_id":"055b30d6-7348-4fe1-a69c-def567508852","resolution":{"observed_at":"2026-08-06T20:24:50.115532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.240522Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.240522Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:1789d992de6818d1cc697e546ec45556d5ee2c62ed00a06cba30e7667e4aa636","observation_id":"1f1c8c7c-d4c0-46ea-adec-9eed02116cbe","resolution":{"observed_at":"2026-08-06T20:24:50.240522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.349140Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.349140Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:e57de9410b72e62e21a74fe5baad6913658f99ace4f1a39066d7739ae52cfb27","observation_id":"5bfa0b53-e0bb-4826-b429-e5f657d84ff9","resolution":{"observed_at":"2026-08-06T20:24:50.349140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.481192Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.481192Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:6d5f058ace961e5619c917654c12884a45a2d841e8be7cccabcfdbe578fd1e91","observation_id":"3923c41a-307f-4c86-ae6b-b195fe61ff3e","resolution":{"observed_at":"2026-08-06T20:24:50.481192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.583071Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.583071Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:d421c3bea9f235e233e3fb66eaaf27f9298aa53e463114a6b1c8aeaf3bb640a8","observation_id":"4220aeca-190d-4366-a172-67ef3fbafbe4","resolution":{"observed_at":"2026-08-06T20:24:50.583071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.713859Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.713859Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:3a9f1c8d54dc6d2c0550454bcc43fd0b4303ad541dd3528293c7c89b2979517e","observation_id":"055474b9-420c-4920-9826-d8f7ff26d599","resolution":{"observed_at":"2026-08-06T20:24:50.713859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.814774Z","title":"Unireal: Universal image generation and editing via learn- ing real-world dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.814774Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:de575376d82c0e2d44dd9d63ba3bf028df5ba5a7034b96b49c330659068a4d14","observation_id":"847263c7-9b2d-4a62-8291-c8557a096088","resolution":{"observed_at":"2026-08-06T20:24:50.814774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:50.913306Z","title":"Style in- jection in diffusion: A training-free approach for adapting large-scale diffusion models for style transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:50.913306Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8c68c0e3f458acd34c280530d3581b1690fce3c8ea070443a7c1e163a8dc7fc8","observation_id":"de956882-21f6-4208-906a-6f4e5e8a8827","resolution":{"observed_at":"2026-08-06T20:24:50.913306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.007576Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.007576Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:78846366800e8e00e51f27cdea11f9e7f3c2f9a9e40eba32ea1b30790f2784d2","observation_id":"0368fc1c-f792-45bb-a362-91658d163183","resolution":{"observed_at":"2026-08-06T20:24:51.007576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.106831Z","title":"Fluxs- pace: Disentangled semantic editing in rectified flow trans- formers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.106831Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:1c51fe1acb338e6c56aba32c8d13bac6ce1657bca0f967406bb1970ac79de2e7","observation_id":"17f87e2d-1548-48fe-af4c-648d84336dec","resolution":{"observed_at":"2026-08-06T20:24:51.106831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.228684Z","title":"Freecustom: Tuning- free customized image generation for multi-concept compo- sition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.228684Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:afd2bd911cf230236b99bbd85593d6dfa668fea1e2addd31038f67396ecf485f","observation_id":"533a0ae2-12b7-4073-8309-e4f94d059899","resolution":{"observed_at":"2026-08-06T20:24:51.228684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.367662Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.367662Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:0d45decae31233710706f983711bb000efb221911d9c2b96d6e7410e3bf4e475","observation_id":"e62d770b-8e43-4065-a31b-013a6ccf51a5","resolution":{"observed_at":"2026-08-06T20:24:51.367662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.463412Z","title":"Efros, and Aleksander Holynski","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.463412Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:1e708560f209573f7908f7cbd30cf6f0536b525a5bf7e17891ebefaf0c765d67","observation_id":"c374d79d-171e-41fc-94c7-0f961b4497d4","resolution":{"observed_at":"2026-08-06T20:24:51.463412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.604238Z","title":"Scaling rec- tified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.604238Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8c4397970d06baf47a969516918aedfb937fbd7458e26c8e172bade90bb242dd","observation_id":"b9bd1199-f3ce-4610-8ef3-f314c34b6883","resolution":{"observed_at":"2026-08-06T20:24:51.604238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12590","last_updated":"2025-03-16T17:51:16Z","snapshot_observed_at":"2026-08-07T17:00:21.826953Z","submitted_at":"2025-03-16T17:51:16Z","title":"Personalize Anything for Free with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2503.12590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12590","snapshot_observed_at":"2026-08-06T20:24:55.663159Z","title":"Personalize Anything for Free with Diffusion Transformer","venue":"cs.CV","work_id":"cb26beef-2033-4618-b848-10857adee1c1","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.690968Z"},"links":{"cited_paper":"/paper/2503.12590","citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:603dc5a2825ae4dc71422ac2b1ee4d692a7194dc6f1e20988189e0ccdceb8ea4","observation_id":"220c09bf-79dc-43bc-b604-5052a5e62ae2","resolution":{"observed_at":"2026-08-06T20:24:55.670646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.786540Z","title":"Dit4edit: Diffusion transformer for image editing.Proceedings of the AAAI Conference on Artificial Intelligence, 39(3):2969– 2977, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.786540Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:6b72a4ed53313d898fcaf6bce60efdb6f89f408db7b2ad9868b4c9aba1d208d7","observation_id":"e3bf6a9d-8b53-47ec-8d19-d235ae651301","resolution":{"observed_at":"2026-08-06T20:24:51.786540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.895105Z","title":"Dream- sim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.895105Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:149b35aafd125ba6b68bed9b629b2586cf5a9bbdbb8787d8954c218062e19971","observation_id":"59eddcce-5385-4164-aa45-28cdd65f634e","resolution":{"observed_at":"2026-08-06T20:24:51.895105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:51.966682Z","title":"An image is worth one word: Personalizing text-to-image gener- ation using textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:51.966682Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:2164dd168fd1adc6762526efe91d52bfd0a7413001cb0a89f06997cb5c3d10f9","observation_id":"dd5cc86a-a996-4b63-988f-6390265380f7","resolution":{"observed_at":"2026-08-06T20:24:51.966682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.053278Z","title":"Instructdiffusion: A generalist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.053278Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:408f25cd446d1335cd174cb4f5fb4d0dde7d862cfc5a6b096af9f80aa7c00e6a","observation_id":"74a73dd8-7a0e-4b3a-9595-ad86050dfd48","resolution":{"observed_at":"2026-08-06T20:24:52.053278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.115912Z","title":"Eye-for-an-eye: Appearance transfer with semantic correspondence in diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.115912Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:592724bde53d8f8fcae6580d3c470fd69227294e346ad44f17a8a6f6a9e8e431","observation_id":"7b2706ca-8c6b-476a-ab0c-20984ababe23","resolution":{"observed_at":"2026-08-06T20:24:52.115912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.230225Z","title":"Pair diffusion: A comprehensive multimodal object-level image editor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.230225Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:82151805768b987b7f07bfc1fbb6f6598c862d51db66501facfce8b19921898f","observation_id":"8131ffcc-72c9-4787-9074-53554c20a5ae","resolution":{"observed_at":"2026-08-06T20:24:52.230225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.346305Z","title":"Ace: All-round creator and editor following instructions via diffu- sion transformer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.346305Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:4bd03fc65beab7ca0f85a904ffb8bc6809a8df02efdee61a5b8a3e42a9e00e7d","observation_id":"a75d61d2-ab5c-4f72-98ac-b48999b4e8a8","resolution":{"observed_at":"2026-08-06T20:24:52.346305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.446284Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.446284Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:3941f623b30abbd76fdc5db72a342f0bc797ecd0045cafc1f2893ca9e3bdfd5f","observation_id":"5e8552ed-c88b-486c-a147-3b3df9138c98","resolution":{"observed_at":"2026-08-06T20:24:52.446284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.586230Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.586230Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:15c7aa3ee22e2b9cbb641555937090fab85c0f02680ae383181cf44c75668469","observation_id":"2935d79f-702f-4c04-9f23-097ffb9e1623","resolution":{"observed_at":"2026-08-06T20:24:52.586230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.720503Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.720503Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:320639a88463d98eafb4b96d021f4e9f478cdfbd8a53dcf93d65a7ebf31acecf","observation_id":"9c4ba7a9-91be-4c4b-90c3-8672b09f3cef","resolution":{"observed_at":"2026-08-06T20:24:52.720503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.846727Z","title":"Cascaded diffu- sion models for high fidelity image generation.Journal of Machine Learning Research (JMLR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.846727Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:846fcbf7e61df498b9bcab318b24424da41243239417b6104bf2ddbb5d4e61de","observation_id":"91f10378-36e5-41da-a7b9-dcbc154e9264","resolution":{"observed_at":"2026-08-06T20:24:52.846727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:52.968113Z","title":"Anchor token matching: Im- plicit structure locking for training-free ar image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:52.968113Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8ac2a41061c2a024871c78033acae48936ad18d92e43d4ac50a58eb63f4c4b92","observation_id":"7014afd6-c2ba-42d9-b7ab-b9ff4e827e3e","resolution":{"observed_at":"2026-08-06T20:24:52.968113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.107448Z","title":"Attenst: A training-free attention-driven style trans- fer framework with pre-trained diffusion models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.107448Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:b816bb3a1026b17254caf5d4a89ff153a52801a11763ed8b5c4f98ea24c6fbd8","observation_id":"4f5f8f89-791b-4a2f-8469-4841e2776558","resolution":{"observed_at":"2026-08-06T20:24:53.107448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.242525Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.242525Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:88e97c6a860dfb35cdd41dad4b5c48a0e780bdfc5c2a7cef736a394dae4ea000","observation_id":"d417ddfe-01a1-46a2-bd0b-401645070aca","resolution":{"observed_at":"2026-08-06T20:24:53.242525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.392055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.392055Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:b1850877d8c76bb59dc4bcf2c056d5b246bfca803260536acda43c40df0c63ec","observation_id":"f4f2f04b-4e9d-4f60-834d-f2445ee30fc8","resolution":{"observed_at":"2026-08-06T20:24:53.392055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.500171Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.500171Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:ffad9ce59facfc62a5f69681158fb2fa052d5039d4bc3a0fed5bf9e3f23c8a48","observation_id":"9dd0bda8-899a-44b4-b418-c4e48a7c5bb5","resolution":{"observed_at":"2026-08-06T20:24:53.500171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.620035Z","title":"Dif- fusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.620035Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:820b1c708fdb65d357aa84bd723d5df785e27ec975f35edd3431341687ba6214","observation_id":"61aa3e54-646c-4d8a-bf29-25922a5651a3","resolution":{"observed_at":"2026-08-06T20:24:53.620035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:53.722395Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.722395Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:5727599680dc1d95527092a976c987826678752dd4146905dc1f26a056d38d01","observation_id":"b88d9e29-608c-4d98-97db-77b32fa67cd2","resolution":{"observed_at":"2026-08-06T20:24:53.722395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.617759Z","title":"Diffusion-based image translation using disentangled style and content representa- tion","venue":null,"work_id":"1c5925fd-a921-47e0-bef9-d6b5ce1132ac","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.871092Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:5816995d682ef70f046a34e8946ba1be0c24dbbfc6b8a57dbc9156d8c2ea6f9d","observation_id":"48a8d58d-4137-4c06-a0ed-d044a1fa04f2","resolution":{"observed_at":"2026-08-06T20:24:56.621882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.605512Z","title":null,"venue":null,"work_id":"8eb969f1-415f-43dc-83e9-c5d8b8c62fda","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:53.989615Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:4d08d983d1a92715c47865809e9e4db6fe568e4e07e51f35894a265d2c9a033c","observation_id":"9e0c75a1-a7ea-4ddf-85f7-b35930176e25","resolution":{"observed_at":"2026-08-06T20:24:56.610261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.594123Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space,","venue":null,"work_id":"eb6fab88-7a48-4d69-96ae-7efd6520d9db","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.120312Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:47571b823cf78c1b35f5c15070f679db7aaebb5b4f10a29688e043949f8f15d3","observation_id":"81b9b68e-b717-4d50-a74a-37720962dc1d","resolution":{"observed_at":"2026-08-06T20:24:56.598062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.582330Z","title":"Le, Tuan Pham, Sangho Lee, Christopher Clark, Aniruddha Kembhavi, Stephan Mandt, Ranjay Krishna, and Jiasen Lu","venue":null,"work_id":"a47cf144-a60b-44c9-a11f-88494ec7b1f7","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.272804Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:e869f32b6ada550830e2feaf06a3baae647f154cdfc3d7f0ad5ce1b9b507f555","observation_id":"f516df46-1b36-4140-91cb-31377f0446fe","resolution":{"observed_at":"2026-08-06T20:24:56.586454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.568781Z","title":"Scribble-guided diffusion for training- free text-to-image generation","venue":null,"work_id":"c43b4117-f144-4ec4-9c11-1c67d6100f82","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.413782Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:ca374817af94a404f3041ea59a38fb844be9bea9ed2f20011215e80206d1fc26","observation_id":"13fb5b3a-65d1-4568-ade7-d84ab7f10f58","resolution":{"observed_at":"2026-08-06T20:24:56.573719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.556041Z","title":"Control and realism: Best of both worlds in layout-to-image without training","venue":null,"work_id":"8ee3cf47-5eaf-4cf0-b15c-7f58ce16f52a","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.541193Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:60ef113f93e27e07c37dff1e59820eee17bd44bf73281b0dc0d9642ffddb6f3a","observation_id":"95650980-fe03-421c-b60c-6394730e1a59","resolution":{"observed_at":"2026-08-06T20:24:56.560246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.541642Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to- image generation and editing","venue":null,"work_id":"5af9794e-1def-47ff-869d-4f46dc8209c3","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.667169Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:6f50efeb9f13fa26a0193e3a4a0e1716bda74fd962f1c2cce605a8085fd7b30b","observation_id":"2790d098-00aa-493c-9028-770bc66b8674","resolution":{"observed_at":"2026-08-06T20:24:56.546732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.527676Z","title":"Controlnet++: Improving conditional controls with efficient consistency feedback","venue":null,"work_id":"6eeb7e54-fc37-4803-8674-c04b5fb8519b","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.815482Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:f8d47ec610aeaa67b8250e06c5d5093fc3860a0a690863ce93d51b8e96b19ad0","observation_id":"c09a79db-1b83-4a3d-b1ae-3a4cb9a3e29c","resolution":{"observed_at":"2026-08-06T20:24:56.532230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.515080Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"83eea4de-4316-4924-907b-f59f537a2151","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:54.965417Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:cf7a37a57e65d1bac40fec6b43ae4715f280082f82ada905d614bbe776c7d188","observation_id":"960a6e60-2c2d-4e2d-8ead-6536d116ef13","resolution":{"observed_at":"2026-08-06T20:24:56.519194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.501417Z","title":"Freecontrol: Efficient, training-free structural con- trol via one-step attention extraction","venue":null,"work_id":"f3374777-6cd7-4810-96e3-403adcabffe1","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.088700Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:7352ccf3e1419697204586fbb8eea52d67ed35186ddcb3b7985d728251e30dad","observation_id":"20c52763-bc6f-44e0-b33b-c82b4074c6b2","resolution":{"observed_at":"2026-08-06T20:24:56.506538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.489133Z","title":"Ctrl-x: Controlling structure and appear- ance for text-to-image generation without guidance","venue":null,"work_id":"10f5f1ad-bfb0-4697-aef9-d4d1e64e64da","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.092548Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:45fcdfde00eb68a5aac618e43923f6b44049946ead89cba4b3e8680ac5b96428","observation_id":"6a26d6cb-a69f-4d0c-af21-91379ce08e41","resolution":{"observed_at":"2026-08-06T20:24:56.493565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.476529Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow, 2023","venue":null,"work_id":"8426c677-9518-4972-b74b-a1d68f831ab0","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.120924Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:5e597adc04263e4fe01c049ece099e18a6abf9976a72aac82354027acee6f087","observation_id":"624db162-15ca-4b87-9a98-44d161ffc86b","resolution":{"observed_at":"2026-08-06T20:24:56.480812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.464295Z","title":"Dpm-solver: A fast ode solver for diffu- sion probabilistic model sampling in around 10 steps","venue":null,"work_id":"b26f9e31-5236-4452-8e3b-ed6e4ceec866","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.175981Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:7938562c950a9ba5f35a8d4654f584eb13e8014e20de21642587f2aa19569069","observation_id":"92d9a21c-d500-47dc-a4ec-6f284458b49f","resolution":{"observed_at":"2026-08-06T20:24:56.468254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.451662Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference, 2023","venue":null,"work_id":"718f8a9d-40a9-40c6-9360-ff051050bfd4","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.224034Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:37da68b292b928e5ee43937848d218fab3b90df6b5b94d5d2aacbb264c7c515d","observation_id":"cdd062f3-4148-4142-8f47-d8c8b8cc626b","resolution":{"observed_at":"2026-08-06T20:24:56.456444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.439596Z","title":"Hpsv3: Towards wide-spectrum human pref- erence score","venue":null,"work_id":"5d8104c5-aee6-4de0-a112-822f40201b03","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.254247Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:0ca4cc496860222998c149575d788b98d3225f05d95d43e75f9f4c82a0a024fa","observation_id":"029bdc42-df15-40f5-9af2-1b4ee6d90719","resolution":{"observed_at":"2026-08-06T20:24:56.443958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.426939Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"2de525c3-d4a6-4577-9fb8-09ef574ae21d","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.258418Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:0c077ff9dd05b48a5c6eeb163787ea0c1b3799f97dc5b36926fe425e3f3bfb34","observation_id":"cd6fd799-6b59-4c5e-9cf0-3e5a4ee95f9a","resolution":{"observed_at":"2026-08-06T20:24:56.431156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.414505Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"2cb70223-00dc-4f68-8841-3b01d284d68c","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.306480Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:292ac4f6300c96857ce0bb44ea453183a28f1f1c09021987b618c0920e20f68d","observation_id":"1405355d-3c07-4a1b-9126-56f32216a6d1","resolution":{"observed_at":"2026-08-06T20:24:56.418526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.401487Z","title":"T2i-adapter: Learn- ing adapters to dig out more controllable ability for text-to- image diffusion models","venue":null,"work_id":"65ba950c-7c96-4d81-b057-6aaf9f158da3","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.326191Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8a0636ac240977d1d8a9a7a0a938ffcf4bb2eefdd313e45e7f1ae55e43fd4636","observation_id":"fedd7da2-9b7d-4ec3-8029-8d09c57a5bee","resolution":{"observed_at":"2026-08-06T20:24:56.406467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.388424Z","title":"K-lora: Unlock- ing training-free fusion of any subject and style loras","venue":null,"work_id":"088bb516-1540-419a-9df4-8f7b3a0353f6","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.331027Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:2cb4ff0ffb281667fc2f18144c57c58639ba25752e4e3d9027498c58cdda1588","observation_id":"4babbe34-66e4-4906-9c59-7551354d83f3","resolution":{"observed_at":"2026-08-06T20:24:56.392800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.374891Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"1b11d421-118f-4f31-8894-fec68ac422b7","year":2019},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.335041Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:46a665e928d15ab2db3ba0807812797d1da4343f7a049a6d2c09abd3035168bb","observation_id":"47cf10d6-8c6b-436e-9101-2703203fac3e","resolution":{"observed_at":"2026-08-06T20:24:56.379168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.360527Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"9faee5e0-4da5-44f9-8514-8a0d3694f8cf","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.339841Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8d34db30ffe516a1fd6278f1099a5afae7fc61c5f62001a269fe1b90c3d91240","observation_id":"89bd3eb1-85c4-43f4-9d94-80b24ac4806b","resolution":{"observed_at":"2026-08-06T20:24:56.365639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.347087Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"f918b8d8-e6ae-4154-b564-01c960b46511","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.344874Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:c72c4d04bd57275e1c954db4b56063e18715b2a36780b3d8d3af38cacde60c6e","observation_id":"bef0e505-d58c-4249-b168-27a2004c3275","resolution":{"observed_at":"2026-08-06T20:24:56.352087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.334773Z","title":"Pham, Jingye Chen, and Qifeng Chen","venue":null,"work_id":"6df172df-350b-42db-890a-2474dfe68350","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.349070Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:dd644812fea8195f11ae89547119285fd58b125930a6233ece0bd03ba169e96d","observation_id":"fa5a37cc-e600-47bf-b8eb-e8fd20de525d","resolution":{"observed_at":"2026-08-06T20:24:56.339443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.323480Z","title":"Orthogonal adaptation for modular customization of diffusion models","venue":null,"work_id":"6d6e5f3a-ce69-4566-b3d8-3e2d073aa543","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.353017Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:8631a84c7c46e28975c0b6e00a07fb12e852685ac4e402c3df14b741f1561926","observation_id":"c9cfd424-ec8e-4fd9-a5b0-97aa92f65932","resolution":{"observed_at":"2026-08-06T20:24:56.327339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.311569Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"43b0ea1b-91d5-4730-b084-0a62c557933e","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.356925Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:fb1b075ed1349242ecb819166801955b40629497320a284daa2569e4ff892082","observation_id":"9eef02a9-41c2-4367-ba2a-de320f2c1c73","resolution":{"observed_at":"2026-08-06T20:24:56.315568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.299431Z","title":"Learn- ing transferable visual models from natural language su- pervision","venue":null,"work_id":"c0ba7e69-c057-48ea-a39c-c6926a0333cd","year":2021},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.360891Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:3d014aa55d520b1bac02d6fb586b13b63de2af845a7188cec55240758b2babab","observation_id":"87ff7e98-e8a8-48e2-bc91-3b10a5c1607f","resolution":{"observed_at":"2026-08-06T20:24:56.303233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:24:55.364539Z","title":"Hierarchical text-conditional image genera- tion with clip latents.arXiv preprint arXiv:2204.06125, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.364539Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:ef98faffe9f5ffdf6d8c5c1bd06d670c742e6f118ed70b083b751d1d884232e8","observation_id":"47adc399-c8fa-42b4-bf51-3737dbba611c","resolution":{"observed_at":"2026-08-06T20:24:55.364539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.287706Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"8f450c10-318e-4f7e-91a1-92e064bd8394","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.369174Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:e45c5e1df5c4b5a5fb7f9300465a042ce656b8b249d8c5b8cc29512c87963141","observation_id":"6c76d348-7d10-444f-a921-e0491374ae6f","resolution":{"observed_at":"2026-08-06T20:24:56.291610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.273816Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"f4e1cfad-cbe5-4247-bce0-0905e7bf24f4","year":2015},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.373557Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:33741aaac149dca08bba5b241883ed3ff89af1e5fd1cabd35d0302bfff8a8818","observation_id":"eae5be58-37b1-47f5-bfb8-f776d2ebfc94","resolution":{"observed_at":"2026-08-06T20:24:56.278787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.260639Z","title":"Rb-modulation: Training-free stylization using reference-based modulation","venue":null,"work_id":"7d01d9c4-4ab3-46b9-9496-c4298f7678b8","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.377718Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:f45edfe24e5c321e69b498eb73be84488ac4e8f1e54b4007a5b99da4b5349b49","observation_id":"aec79a41-6ec4-4772-ba48-515d69891350","resolution":{"observed_at":"2026-08-06T20:24:56.265352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.248961Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"55620302-b334-4c80-8862-bf90d9e92252","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.381993Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:cb1aad538ab1c888b5a76b0e4236f8ca294ca0230dfbeb6b29c59db3f5e5e1ce","observation_id":"a2166379-bc7b-48e3-b6bf-b447ee331d5e","resolution":{"observed_at":"2026-08-06T20:24:56.252920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.236145Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to-image models","venue":null,"work_id":"1bad6e3b-5e93-402a-afbf-1fe931e5ad85","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.386573Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:a4fa7009b082b4504fd454aebd788f6172b7598dd9b08126722195f6637f9243","observation_id":"537bf2ba-c88d-4fee-8c56-feda37266a81","resolution":{"observed_at":"2026-08-06T20:24:56.241435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.223898Z","title":"Palette: Image-to-image diffusion models","venue":null,"work_id":"5514e3a1-2959-4a12-9c24-f695a92d2333","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.390578Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:23694e4338bb4f33b1812cf73550065822f3f878b92e935feaefe1bf6e235bb2","observation_id":"0d832540-4ce0-4f70-ac7a-63d09e6fe44e","resolution":{"observed_at":"2026-08-06T20:24:56.227872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.210620Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"703f1be7-c644-438a-b613-2677ef38d1dd","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.394553Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:fa975bd133c2cea27e1173d0aff1f7136cb58f75f5b97a455477b645461db17e","observation_id":"9c3f62d6-e031-4f35-b656-47b1d7698bc4","resolution":{"observed_at":"2026-08-06T20:24:56.215554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.198163Z","title":"Emu edit: Precise image editing via recognition and gener- ation tasks","venue":null,"work_id":"9f01f2b7-9ea9-4c9b-a519-fb07d9dc98ef","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.398602Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:fa66e89216b73eae4ef05be497d177fee4c50e652a320ab1b0e812262419b98d","observation_id":"69f8e184-7542-414e-83a8-dad600acfb3f","resolution":{"observed_at":"2026-08-06T20:24:56.203089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.185453Z","title":"De- noising diffusion implicit models","venue":null,"work_id":"60a37f81-5b03-46c7-9da6-82c7f1dca10a","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.402785Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:1fa53c156f9cce4121bfdbfd604a34f9c9bbd07d54b5b8eca27783e00e81e8e4","observation_id":"9843ef30-ec77-43c7-b96d-bf12ef3c653c","resolution":{"observed_at":"2026-08-06T20:24:56.189793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.172705Z","title":"Consistency models","venue":null,"work_id":"8cbeb8b0-e410-447e-b9b5-f6b7ff52ecaf","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.407089Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:f06de31e89d927decf888ba45fff5cbc498a4a3109b32ac1d4e3d5f681c6b5de","observation_id":"5b9da0b5-8910-4774-8c02-a17891e457bb","resolution":{"observed_at":"2026-08-06T20:24:56.176988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.160706Z","title":"Dual diffusion implicit bridges for image-to-image translation","venue":null,"work_id":"b68faaee-afeb-44ec-9eab-3f9df0cff8ce","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.411072Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:96bf8929a368bf4fa37f0dc6252de16b26d43d75ea031071c3d551cc7096870a","observation_id":"fd29e967-4114-4e4d-b2de-d264cf3648c7","resolution":{"observed_at":"2026-08-06T20:24:56.164931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.148848Z","title":"Ominicontrol: Minimal and universal control for diffusion transformer","venue":null,"work_id":"ac84e67b-d61f-45bc-b26c-1be943dc09d1","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.414750Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:cafaa1262d6a6c5cfa9d9563c46761a4b3075a362fa93cfca5c147097b7132c9","observation_id":"1bcbe839-d806-47ad-8353-1327d10a478d","resolution":{"observed_at":"2026-08-06T20:24:56.152905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08280","last_updated":"2025-03-11T10:50:14Z","snapshot_observed_at":"2026-08-07T17:13:28.752920Z","submitted_at":"2025-03-11T10:50:14Z","title":"OminiControl2: Efficient Conditioning for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08280","snapshot_observed_at":"2026-08-06T20:24:55.418820Z","title":"Ominicontrol2: Efficient conditioning for diffusion transformers.arXiv preprint arXiv:2503.08280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.418820Z"},"links":{"cited_paper":"/paper/2503.08280","citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:60462189c853d8bb4a9d8a65ab4a778f7b67d61fc25e3df696cb2a44aecab760","observation_id":"e9a960a3-7627-4871-88ce-b2da58e6929c","resolution":{"observed_at":"2026-08-06T20:24:55.418820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.136878Z","title":"Add-it: Training-free object inser- tion in images with pretrained diffusion models","venue":null,"work_id":"a27c169a-4d80-422b-a110-d059aa9a8c45","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.422944Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:dd32ea626df4a636b21da1034ff3d0e00837e9a0f1f8f9feade8007d1a10eb10","observation_id":"a1006352-9c35-416f-8b68-3b934f468526","resolution":{"observed_at":"2026-08-06T20:24:56.141405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.124501Z","title":"Guide-and-rescale: Self- guidance mechanism for effective tuning-free real image editing","venue":null,"work_id":"9d80f649-6366-471e-85a7-38aeed12b6f8","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.427394Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:bab31162e333079bd7588e3a0b4d9e31f3faa92f607f8f4fc6e1790bf740c5a2","observation_id":"ab3a586d-1d3f-4d8b-aba0-80ba618e2810","resolution":{"observed_at":"2026-08-06T20:24:56.128545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.111761Z","title":"Splicing ViT features for semantic appearance transfer","venue":null,"work_id":"158094a6-2d31-414e-a58d-f58763da98c1","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.431794Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:7f524fcf6c85bb4c9432f515201483b35ba6a3dd62c6fd40fe51f8debc7bbd85","observation_id":"a378d218-8ff4-4248-833b-564ab939b5d1","resolution":{"observed_at":"2026-08-06T20:24:56.115871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.098173Z","title":"Plug-and-play diffusion features for text-driven image-to- image translation","venue":null,"work_id":"2842b4fd-99aa-4ec7-a76f-5b5d99e01fc9","year":1921},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.435872Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:a07488762a49f5a490a4430faf2e1440119215237c476490821a2ac327fb74b3","observation_id":"accdbfcd-734f-4fa6-94ec-83f4126ab00d","resolution":{"observed_at":"2026-08-06T20:24:56.103280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.086221Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":"e0ed96dc-e2a7-4050-bdef-b10acd1c9ad5","year":2022},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.440178Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:1b726e12b0c79b535bc414035914e452916b379ad6c4947ca98eb17c33ef62dc","observation_id":"cc3161d0-5cef-4c4b-9dc0-6abf21f778f4","resolution":{"observed_at":"2026-08-06T20:24:56.090597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.073162Z","title":"Taming rectified flow for inversion and editing","venue":null,"work_id":"b8a31003-d922-4385-8eca-a7c90cd8e330","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.444139Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:6db9cb74404185f6141b0afbd299d9e9139869166d1d245a85655ada0f5f586a","observation_id":"9ecec232-1529-4f0c-8e49-8b75efcf6708","resolution":{"observed_at":"2026-08-06T20:24:56.077209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.058022Z","title":"Fleet, Radu Soricut, Jason Baldridge, Mo- hammad Norouzi, Peter Anderson, and William Chan","venue":null,"work_id":"e352d872-c538-44a4-8f96-d79944f308ac","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.448035Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:99785abe0a6e9e80bf8455571870e554ff3a1827be1b3d1a66573d738020017f","observation_id":"3f931160-5402-467d-98f4-17128d193c34","resolution":{"observed_at":"2026-08-06T20:24:56.063153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.044598Z","title":"Instancediffusion: Instance- level control for image generation","venue":null,"work_id":"6b4461fd-dcde-4c90-9b56-f34739c83bfd","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.452743Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:5d7c3b28abde94e89b680e6b26d56d84205b52338e542382f5617da81fe37370","observation_id":"a30c6caa-e7a2-4129-b528-9a7ae2f176a8","resolution":{"observed_at":"2026-08-06T20:24:56.049945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.031733Z","title":"Event-customized image generation","venue":null,"work_id":"53fb7559-9416-4a86-8034-28b5d5553b4c","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.457190Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:fed3c8328925a284d04316c8321d39c1cadfc8e8594a87919e85e6db2e9d36e8","observation_id":"4b74cc81-6479-4344-a7e8-b57a3d5a6336","resolution":{"observed_at":"2026-08-06T20:24:56.036191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.019234Z","title":"Training-free dense-aligned diffusion guidance for modular conditional image synthesis","venue":null,"work_id":"cbf96ff3-cc98-4e2e-92a6-661f6a6923ed","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.461721Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:d88179845db747c67b9ae94e5b9b12e15fc08225418923d0d26f25ecb50fca3d","observation_id":"522d2c98-46dc-4308-a0b4-06447d0dd1f5","resolution":{"observed_at":"2026-08-06T20:24:56.023407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.006913Z","title":null,"venue":null,"work_id":"4955d7df-6ebd-4cff-a224-515b1ba3ec0f","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.466342Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:4aac87c2bd2678de73f646a0df29071a79dbb405a3589c0f2d06ce7afd8e6d85","observation_id":"1812adaf-4bc6-43e5-9448-393b37afd95f","resolution":{"observed_at":"2026-08-06T20:24:56.010988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.470098Z","title":"Qwen-image technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.470098Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:c43cac7833df7661ceb444eef2be906c7b6275a61611c6e9d289f1f0733304ca","observation_id":"255e6fe5-90fc-499b-acce-17b6100e686b","resolution":{"observed_at":"2026-08-06T20:24:55.470098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.986939Z","title":"Omnigen2: Exploration to advanced multimodal generation,","venue":null,"work_id":"9e7848b0-f640-4b1d-959f-d90cb2228d47","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.475011Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:17121482b2308b621dacfdb1bca02c271abca40642e768be03caf008ca18c9de","observation_id":"eb004c59-db39-4231-9f15-10b846ac1c48","resolution":{"observed_at":"2026-08-06T20:24:55.991151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-06T20:24:55.478869Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.478869Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:12887694d528457522ce9952039a664f357cb05e09c82c1a2da2952a4d05d75e","observation_id":"099b8b4e-5c8b-4af2-9252-0fe1a159a5e7","resolution":{"observed_at":"2026-08-06T20:24:55.478869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.975936Z","title":"Dreamomni: Unified image generation and editing","venue":null,"work_id":"f573d025-82f2-48c8-a6ae-e288ec1c4fde","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.482977Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:978cc84a79baeb610c0c798f3ad6b9b9dfd8e0a126a572a018773e0e2a68dd44","observation_id":"17bc27b2-8711-45a0-a138-558c55fbb0c4","resolution":{"observed_at":"2026-08-06T20:24:55.979628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.963522Z","title":"R&b: Region and boundary aware zero-shot grounded text-to-image generation","venue":null,"work_id":"4276ed1c-e96f-4edf-bfbe-82b82b8e94ce","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.487289Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:4929ac18c2169aa79dcf8ede3e89a7d3b5fe3c6d51b910881894bb90d7262084","observation_id":"9299858d-c3a7-41bb-989c-2e20e2f857d0","resolution":{"observed_at":"2026-08-06T20:24:55.967993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.950844Z","title":"Omnigen: Unified image gener- ation","venue":null,"work_id":"3f83bba9-0323-4e78-9ffd-72d4611f92ae","year":2025},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.491125Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:df93b2d0e10f6953490455cf242d85847fa2f6b44cac1e921663e2248f9e4c03","observation_id":"d8152988-beab-4dba-b0e9-7a90ac043f64","resolution":{"observed_at":"2026-08-06T20:24:55.954994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.939417Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"0041b00b-db20-42b3-b2e7-8d8f91c8701a","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.494874Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:620b48a4a824d511bb05ccdc7349dea0b3bc27f9706c78af218e08d256951a3f","observation_id":"d604960e-4e1a-477e-884f-f74ae1b07331","resolution":{"observed_at":"2026-08-06T20:24:55.943467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.926414Z","title":"Anyrefill: A unified, data- efficient framework for left-prompt-guided vision tasks,","venue":null,"work_id":"35ce54f2-f0b4-4dd8-a522-316fd466e37b","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.498993Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:9d9420191c1f3b400b46aee6ef49b75f11a431529329d383fe3426b939ff88f5","observation_id":"5b039525-bd97-4a5c-aaf5-f85dd4d3d2c8","resolution":{"observed_at":"2026-08-06T20:24:55.931415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.914873Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"9398e4a6-49e1-41b1-bf61-da8c2eb7369a","year":2023},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.502839Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:122c216d0bac7c77bcf490e94a8513d098aed844b0ce63d430e0797a159ea5a4","observation_id":"6e82d324-17da-45a4-83b5-8f9e4b8d3fdc","resolution":{"observed_at":"2026-08-06T20:24:55.918919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.902597Z","title":"Unveil inversion and invariance in flow transformer for versatile image editing","venue":null,"work_id":"eb46a7a2-60b5-4575-9c17-a7ac3d6ec112","year":null},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.506806Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:30258d7bd8f417ad982e379615c39c4a17b372397fc3710968f7f699b4723c5c","observation_id":"c41745bb-fb74-49ba-b467-a6dc6ff93970","resolution":{"observed_at":"2026-08-06T20:24:55.906896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:55.889821Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":"cb45e359-78d8-4dfe-804f-c183cd88a6e2","year":2024},"citing_paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:55.510895Z"},"links":{"citing_paper":"/paper/2507.02792"},"observation_digest":"sha256:c898cc428cdda0a7ece12ed68cb668cfc37782987f3ca7fcba16990e7bb8da57","observation_id":"c279068a-2cf5-47c7-a559-053d2fc529aa","resolution":{"observed_at":"2026-08-06T20:24:55.894544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02792","last_updated":"2026-06-01T16:52:28Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:18:28.344043Z","submitted_at":"2025-07-03T16:56:15Z","title":"RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":56},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 0 inbound Pith citation observations for arXiv:2507.02792."}