{"as_of":"2026-08-17T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6904cbd57c0d5a5c40e7b5734b06e703dea5e0d1eab71c3c69732cda39c50844","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:32:15.454530Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T19:51:31.657802Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T19:53:11.597613Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2509.04446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04446","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plot’n polish: Zero-shot story visualiza- tion and disentangled editing with text-to-image diffusion models","venue":null,"work_id":"48ef9816-3c45-4fc3-bc8a-83dd29dd63c7","year":2025},"citing_paper":{"arxiv_id":"2604.03448","last_updated":"2026-04-03T20:45:19Z","snapshot_observed_at":"2026-08-15T12:58:42.006720Z","submitted_at":"2026-04-03T20:45:19Z","title":"ExpressEdit: Fast Editing of Stylized Facial Expressions with Diffusion Models in Photoshop","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T19:51:31.657802Z"},"links":{"cited_paper":"/paper/2509.04446","citing_paper":"/paper/2604.03448"},"observation_digest":"sha256:978e4d2e01600432aae6c4d2006110fb441a561c11348b60e3f00c347910dc37","observation_id":"f7a7c12c-febf-4eba-9be0-d0a904557c90","resolution":{"observed_at":"2026-05-13T19:53:11.599109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04446/citation-record","integrity":"/paper/2509.04446/integrity","json":"/paper/2509.04446/citation-record.json","paper":"/paper/2509.04446"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T16:32:15.245097Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.245097Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:9e50f65b1f24b066e86650b6d5f7d3910b157bf07b8df5590829a81a4fc992fd","observation_id":"ec10e816-9bec-4557-833f-bc87b516bc56","resolution":{"observed_at":"2026-08-15T16:32:15.245097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02820","last_updated":"2024-06-04T23:39:08Z","snapshot_observed_at":"2026-08-16T13:46:05.530538Z","submitted_at":"2024-06-04T23:39:08Z","title":"ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02820","snapshot_observed_at":"2026-08-15T16:32:15.250967Z","title":"Oracle: Leveraging mutual information for consistent character generation with loras in diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.250967Z"},"links":{"cited_paper":"/paper/2406.02820","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:8b2765a36fd53738bb11e3f8c2e96320733ebfaa828e913e0a1547747f11bf1c","observation_id":"75cfc74d-c150-493a-8165-c7ef7faf0426","resolution":{"observed_at":"2026-08-15T16:32:15.250967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02779","last_updated":"2023-04-30T17:43:11Z","snapshot_observed_at":"2026-08-16T16:54:58.377348Z","submitted_at":"2022-06-06T17:58:04Z","title":"Blended Latent Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02779","snapshot_observed_at":"2026-08-15T16:32:15.255493Z","title":"Blended latent diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.255493Z"},"links":{"cited_paper":"/paper/2206.02779","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:3ce19490749b1e1c0ddb47aa096c263a04cc5b8ab0c385b75de245b14ed14a44","observation_id":"e99ba86b-632f-454a-9b4a-2a9cb832e62a","resolution":{"observed_at":"2026-08-15T16:32:15.255493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10093","last_updated":"2024-06-05T14:34:30Z","snapshot_observed_at":"2026-08-16T14:42:35.347831Z","submitted_at":"2023-11-16T18:59:51Z","title":"The Chosen One: Consistent Characters in Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10093","snapshot_observed_at":"2026-08-15T16:32:15.259614Z","title":"The chosen one: Consistent characters in text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.259614Z"},"links":{"cited_paper":"/paper/2311.10093","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:cc317a496bdd70b55376d27ec6e6e3cdfe03367ff9a65b9d75f842fc6e267d45","observation_id":"20b114b9-1580-4fe2-9611-e43ddc54dd4e","resolution":{"observed_at":"2026-08-15T16:32:15.259614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12247","last_updated":"2023-11-02T18:17:01Z","snapshot_observed_at":"2026-08-16T15:59:29.531445Z","submitted_at":"2023-01-28T16:43:07Z","title":"SEGA: Instructing Text-to-Image Models using Semantic Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12247","snapshot_observed_at":"2026-08-15T16:32:15.264293Z","title":"Sega: Instructing diffusion using semantic dimensions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.264293Z"},"links":{"cited_paper":"/paper/2301.12247","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:80a7f3fa759ff21b5e91f1b449044ab6d6c5988aa22ea8fc96bd4b24be1390a1","observation_id":"f56c5461-407e-4037-9d84-c9e1b26ee601","resolution":{"observed_at":"2026-08-15T16:32:15.264293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.090342Z","title":"Ledits++: Limitless image editing using text- to-image models","venue":null,"work_id":"e6bdd677-59cc-4054-98c1-80b011af9607","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.268891Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:a59b2d6fe459758ec6769fb36e293f14ddc76330ef556c32a449c19ed3b6aae1","observation_id":"567bd695-be3f-485a-92bc-78e9891a4310","resolution":{"observed_at":"2026-08-15T16:32:16.095550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-16T16:15:18.101197Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-15T16:32:15.273719Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.273719Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:38483c5cb36194f303c5450f70d6e61997e6f74d21281e7f290dc4f31f44bb2d","observation_id":"4bdf3bb4-eb11-4b9a-a585-9812b8da4bd2","resolution":{"observed_at":"2026-08-15T16:32:15.273719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.279215Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.279215Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:fb6f1caf1c03b2b10d380dd4a6af8db2f0deea98d53993357484cc85eab2a02f","observation_id":"05f043fc-a80d-404a-820f-de9b06d98443","resolution":{"observed_at":"2026-08-15T16:32:15.279215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01388","last_updated":"2025-05-30T13:55:44Z","snapshot_observed_at":"2026-08-16T13:46:42.642014Z","submitted_at":"2024-06-03T14:51:24Z","title":"AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01388","snapshot_observed_at":"2026-08-15T16:32:15.284324Z","title":"Au- tostudio: Crafting consistent subjects in multi-turn interac- tive image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.284324Z"},"links":{"cited_paper":"/paper/2406.01388","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c55bf9bd5bc3158977454853ac71976792108ea75eb4cdf14847a8ee0ccd6889","observation_id":"a08540ac-7be7-4f99-a965-535f544bbce4","resolution":{"observed_at":"2026-08-15T16:32:15.284324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18919","last_updated":"2025-05-30T13:52:39Z","snapshot_observed_at":"2026-08-16T13:56:52.444233Z","submitted_at":"2024-04-29T17:58:14Z","title":"TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18919","snapshot_observed_at":"2026-08-15T16:32:15.289174Z","title":"Theatergen: Character management with llm for consistent multi-turn image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.289174Z"},"links":{"cited_paper":"/paper/2404.18919","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c4ff77e2255e2e76600135e5a037fe64be7af5ade4d2ed50e95fd886c617be6a","observation_id":"72e2eba5-85a0-4c0e-9dac-c3c9333c742d","resolution":{"observed_at":"2026-08-15T16:32:15.289174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.061016Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"416e8094-c124-4cc1-b694-d30bef099477","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.294108Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:7c0b80ae22301eafe3f984c0ca4bb482dc4ae735285f9b58518ff581e13ae70f","observation_id":"023ed9d8-31c2-431f-afb8-441390605b70","resolution":{"observed_at":"2026-08-15T16:32:16.065920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.299028Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.299028Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:5c99e39fe164b9ddad79b142ff72a09a902a061f05f2f9fd88bcc47a415565be","observation_id":"abd3b556-d7d3-4824-b760-16f7c879e7c2","resolution":{"observed_at":"2026-08-15T16:32:15.299028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-15T16:32:15.303626Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.303626Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:b94e5cf691cc3cb544ff0947de7bec64c8df1386be07bed13c1492634d422430","observation_id":"cdfca3c4-af59-468a-aff9-9057c7e60484","resolution":{"observed_at":"2026-08-15T16:32:15.303626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-08-16T15:28:36.315658Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-15T16:32:15.310852Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.310852Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:9da8f7d7cc90bfeafd81ea363978dd37063cf0db088511a16f10b69bcd73aa94","observation_id":"1e24d965-133d-4d7d-b415-3e2ceb5a864b","resolution":{"observed_at":"2026-08-15T16:32:15.310852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.316405Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.316405Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:4b800e23bec1788a4abc82af4b0d542887ffbbfb8409a034b3f078751e595dd7","observation_id":"7f1d5e92-0182-4b6c-bc51-96102be9b408","resolution":{"observed_at":"2026-08-15T16:32:15.316405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.322765Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.322765Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:09844189b489486b1bb55a94d13e27e535b67fe73cea4bc56f366482063c03a3","observation_id":"3740d32d-9f22-4d50-a3b2-f79a0eaa0f06","resolution":{"observed_at":"2026-08-15T16:32:15.322765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T16:32:15.328415Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.328415Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:551593717cf1efffc6a80484a96cc6513c4b427b8f95c7d24529918befa97a8f","observation_id":"91c1462f-b309-44bf-880a-6e537600a9b3","resolution":{"observed_at":"2026-08-15T16:32:15.328415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.014399Z","title":"Zero-shot generation of coherent storybook from plain text story using diffusion models, 2023","venue":null,"work_id":"04fd0332-f3d8-4cec-89c9-0aef4bb804be","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.334093Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:4ce9972062d3776fd89387ee10dd28a45eba4d231debe7e83af5dc4de6358af3","observation_id":"5ae3d5ec-1f06-4366-be0e-93eb42d6e43f","resolution":{"observed_at":"2026-08-15T16:32:16.018633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.000344Z","title":"Rehg, and Pinar Yanardag","venue":null,"work_id":"ed9c5486-8125-4151-9636-e406570c0dba","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.338889Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c12e86ed9c97b5ae1c700996d8a638e1ac9a768bc0da31f86fed4c76d15d37e3","observation_id":"65fdaa25-bca4-4476-ae2b-64723c054408","resolution":{"observed_at":"2026-08-15T16:32:16.004941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.987459Z","title":null,"venue":null,"work_id":"e7f954f4-23e3-47c7-a6d8-f0b813665a84","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.345203Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:593fa41dab97b948c8fce038e3b43c71b5a3a5e7610d932d5385905420d35972","observation_id":"104fb183-4600-42f1-a24a-38400b5e14fc","resolution":{"observed_at":"2026-08-15T16:32:15.991864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.974744Z","title":"Intelligent grimm - open- ended visual storytelling via latent diffusion models","venue":null,"work_id":"f63014ff-1eb4-4e41-ac62-7ba49e5a263a","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.349572Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:dddd83bb2df171dc7416cf1763accc2c95c1b262c7721851709115bddbce1571","observation_id":"c35c054c-e6b4-4508-80a6-aaacac436d56","resolution":{"observed_at":"2026-08-15T16:32:15.979050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-16T16:55:27.102617Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-15T16:32:15.354327Z","title":"Compositional visual genera- tion with composable diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.354327Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:df3d1fc707098f1b23881f0563761d4934e3966c0e5848c97af707397c3b3059","observation_id":"0bec2a1c-7fba-4523-ae6b-a34d0af0ccfd","resolution":{"observed_at":"2026-08-15T16:32:15.354327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.959131Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt,","venue":null,"work_id":"7e92821a-9518-4e18-8ef5-8f7d24790e30","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.360081Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:1b117c7b0450a6aaebb4cb5f6cdbaf070fcdb40790f1be3bc50734119174ba1c","observation_id":"dfc7d8d8-0c02-4956-bdc2-44da5466c05a","resolution":{"observed_at":"2026-08-15T16:32:15.964746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.364085Z","title":"Storydall-e: Adapting pretrained text-to-image transformers for story continuation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.364085Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:7f904f05d7d810f64e8863639965a620b91a4be52ef16a6665d2cfd8850fa52f","observation_id":"0d48eccd-937b-49a4-99b4-a75eac916e2a","resolution":{"observed_at":"2026-08-15T16:32:15.364085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.368858Z","title":"Synthesizing coherent story with auto-regressive la- tent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.368858Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:7b86f4e155db27410d2e5910cae99c801cf358620ea802a61c32d834d8c47328","observation_id":"a20ec3eb-bb09-4089-ac12-fece52d407bc","resolution":{"observed_at":"2026-08-15T16:32:15.368858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.924090Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":"9abf7059-9a73-4c79-958a-f88690b8463b","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.372979Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:f5c8356d82f429c913724996da853523f6f43d6ac37a0a0b997b4cadf9487cc1","observation_id":"6fd444aa-4d76-48ed-bafa-c32787b56865","resolution":{"observed_at":"2026-08-15T16:32:15.928794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.376979Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.376979Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:1bfda77e6b2084771725d2ad12bc9dcc4f1692544aa0c099329175c1a74b73e0","observation_id":"7f431f05-1ad7-48e9-b8a1-deeba02e6abb","resolution":{"observed_at":"2026-08-15T16:32:15.376979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.380905Z","title":"Make-a-story: Visual memory conditioned consistent story generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.380905Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:6da37ac4e7b4f999ced5f2dfbd65607d66c96623f27b37a284ab0fc584957345","observation_id":"af38eb90-2aa1-4dc0-86ee-1560d61d0040","resolution":{"observed_at":"2026-08-15T16:32:15.380905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.385321Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.385321Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:e6e5ae47f552d82c4672da30854ce5bbf3ae9f87bbfa8919f61eff9818288805","observation_id":"d06b27e6-3103-4909-a357-87d18bb466b5","resolution":{"observed_at":"2026-08-15T16:32:15.385321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.388970Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.388970Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:3654f302c92efebad3d1e4d1e744207cf9a96ce2e41de91d1e8969b94aee55d4","observation_id":"8772e8a5-3c82-4e16-abba-4c9bacd3e796","resolution":{"observed_at":"2026-08-15T16:32:15.388970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05979","last_updated":"2024-04-09T03:22:36Z","snapshot_observed_at":"2026-08-16T14:02:32.904988Z","submitted_at":"2024-04-09T03:22:36Z","title":"StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05979","snapshot_observed_at":"2026-08-15T16:32:15.393267Z","title":"Storyimager: A unified and efficient frame- work for coherent story visualization and completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.393267Z"},"links":{"cited_paper":"/paper/2404.05979","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:d5938770f844a8c792706efb163aafc01147bfcb221e155a56dcf1663c4529da","observation_id":"31cb85f4-7843-4490-8a8c-8b02bffac400","resolution":{"observed_at":"2026-08-15T16:32:15.393267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.864223Z","title":"Training-free con- sistent text-to-image generation, 2024","venue":null,"work_id":"56b38b35-3279-4429-a0ef-f55ec38417b8","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.397679Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:400228b47213fe942ec7f6772a74f6b7eae4efd83d9f821fef1d6038e4ed863e","observation_id":"47cd6ce4-141e-45a4-a9d4-5c3bd58edf33","resolution":{"observed_at":"2026-08-15T16:32:15.868777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.850530Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"2e5a666d-4efc-431d-820a-102b6dfe3af8","year":1921},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.401911Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:5183cf01cda365d075549f1070c5b2255149b7e02485287f45464692635f699c","observation_id":"ebdea003-d86f-4b7d-982f-f65ec5672f68","resolution":{"observed_at":"2026-08-15T16:32:15.855287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.835704Z","title":"Unitune: Text-driven image editing by fine tuning a diffusion model on a single image","venue":null,"work_id":"5647b0bb-9e05-4975-b34d-8ddb065e7aa1","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.406601Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:cff472b88682ce305e6a7f75e01c5fe64a54beb76ebf84de495bde151569f88c","observation_id":"466afb1c-8997-48ae-a3fa-d403378039d2","resolution":{"observed_at":"2026-08-15T16:32:15.841121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11243","last_updated":"2023-11-19T06:07:37Z","snapshot_observed_at":"2026-08-17T08:13:48.431165Z","submitted_at":"2023-11-19T06:07:37Z","title":"AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11243","snapshot_observed_at":"2026-08-15T16:32:15.411330Z","title":"Autostory: Generating di- verse storytelling images with minimal human effort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.411330Z"},"links":{"cited_paper":"/paper/2311.11243","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:7d19f88b1b4b8c934069b1e91fd480516db8742fc6a3ca683daa7c281620960e","observation_id":"fb5c0268-3b07-4b19-9a57-ad596bd543a4","resolution":{"observed_at":"2026-08-15T16:32:15.411330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.818300Z","title":"Nerfiller: Completing scenes via generative 3d inpainting, 2023","venue":null,"work_id":"0878e912-81eb-40fd-a64d-d9e5b6ff0a4b","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.416686Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:359db917e80e0c1250c7ce9be199c3dac42977f9b0abfd50aa9e4d72e3a1ea98","observation_id":"7f7efe33-3ce6-4ada-84d5-a809d3f62ccd","resolution":{"observed_at":"2026-08-15T16:32:15.824288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.790428Z","title":"Efficientsam: Leveraged masked image pre- training for efficient segment anything, 2023","venue":null,"work_id":"4bad4fb4-f1e3-4b84-b3f5-e20fab0e8a8e","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.422393Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:4979dbe7e344cc2eae3d1f2d369177374b6303ddc7d801c0de399107ab204790","observation_id":"5a27e0b5-1a4f-48d1-b6e2-71a169312b34","resolution":{"observed_at":"2026-08-15T16:32:15.799095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-16T13:35:00.531280Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-15T16:32:15.429255Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.429255Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:0788b434b2024c7f0efec85ab6d7bc8d8a1f5cf18587b657897780bbbdd93e84","observation_id":"d6ca206d-e27c-4a3d-9ecc-e3e62a9f4729","resolution":{"observed_at":"2026-08-15T16:32:15.429255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.774316Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":"cad9181b-917d-475f-ac8c-f1de87fc0f59","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.433717Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:f55dfd42d92f7171f0818785735fbb777669ae4dbccc1286d8804530199694cc","observation_id":"f74521c4-473b-44d3-a342-98a6c9f39be7","resolution":{"observed_at":"2026-08-15T16:32:15.780780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.438012Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.438012Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:a766de5f15375699afa99e73e516c02e446158c96b1969340077f522594bcb52","observation_id":"49114b78-55e0-410e-9fca-66092e9fe2fe","resolution":{"observed_at":"2026-08-15T16:32:15.438012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.442490Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.442490Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:45b9797f3a79116e8bc604842ad228e06d565577ceb1025746c3c89fa138d651","observation_id":"bd67c397-40f9-4619-b1ae-87ea982011ac","resolution":{"observed_at":"2026-08-15T16:32:15.442490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.446611Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.446611Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:33fbb2ba668dd55345bae99c78ba7018ce8d22b7cc9c25933b3bcc72b41f7966","observation_id":"e37a885a-6bc3-474c-b000-8133b8e551e3","resolution":{"observed_at":"2026-08-15T16:32:15.446611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-08-16T13:55:54.505498Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-15T16:32:15.450281Z","title":"Storydiffusion: Consistent self- attention for long-range image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.450281Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:e69468af121bb540613cdead3bca035d18ab93a5f83934e3d5e827d2497ae5fc","observation_id":"450a8d1f-0422-441c-9e18-783561a3fae1","resolution":{"observed_at":"2026-08-15T16:32:15.450281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.734595Z","title":"Main Characters","venue":null,"work_id":"1d964d1c-9c55-426e-9ef4-9affbf75446f","year":2000},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.454530Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:983227c29ac862ffcb1aeb5fa347cae3aaff6a88ba87e32208ddcc50c090573d","observation_id":"38b223ef-d41a-4ad1-9634-bdaa3dc64c06","resolution":{"observed_at":"2026-08-15T16:32:15.739911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T09:13:45.801657Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.04446."}