{"as_of":"2026-08-16T04:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f77b16e4ebf4ce9f7d774de1e5c493080f581735c64d3cbeb8cacf1904c6dfe8","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:33:25.283022Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.08949/citation-record","integrity":"/paper/2508.08949/integrity","json":"/paper/2508.08949/citation-record.json","paper":"/paper/2508.08949"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.423004Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.423004Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:060e41b8c62898c6f72d01968083380942f85054323cc0a22fb6dce0480f710f","observation_id":"9a153ad9-2570-4a19-8272-5abe51057a6b","resolution":{"observed_at":"2026-08-15T17:33:23.423004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.485091Z","title":"The k-means algorithm: A comprehensive survey and performance evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.485091Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:f4500524ba101a40d7b17344b15768753c14ddb77a4fddbcbc2f545804b9620d","observation_id":"b79ab5b8-f52c-4b8a-81d3-b174b7efd0a4","resolution":{"observed_at":"2026-08-15T17:33:23.485091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.628278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.628278Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:e3f32613287b40537a78d3484b927dbb3d905cb15126ad5184b3daf5f4cead39","observation_id":"b3816dea-c621-4461-ac72-19c62defa4c8","resolution":{"observed_at":"2026-08-15T17:33:23.628278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.758984Z","title":"Automatic story generation: A survey of approaches","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.758984Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:b1d27708f75fde1cbe26e94a18bc477f90ddbdb1a3437263169dd71112fede0a","observation_id":"14873766-e3e7-46a2-bdfb-5ffd4bbe96e7","resolution":{"observed_at":"2026-08-15T17:33:23.758984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.794049Z","title":"Using my artistic style? you must obtain my authorization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.794049Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:4b7b93720169c32d4362b6c647a99462bc4bbb9151a32dfbf84501ba27e62538","observation_id":"73c29b68-d0b9-4f20-bc4e-6dd0c553bb1e","resolution":{"observed_at":"2026-08-15T17:33:23.794049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.799778Z","title":"Customttt: Motion and appearance customized video generation via test-time training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.799778Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:7ddd8a1be3525175fb46724d140a0fd49056dfb6a46e653fb34cd4d0aac04b36","observation_id":"94a65572-4ba3-4337-9818-98e262f3611c","resolution":{"observed_at":"2026-08-15T17:33:23.799778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.803328Z","title":"Relactrl: Relevance-guided efficient control for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.803328Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:758587c825ba94ad2f0d4e5588832e8415a6e4e7c17d534586a2990f5fc4dc3f","observation_id":"f9441d8d-66a2-4f96-aaaa-466ecc887bb3","resolution":{"observed_at":"2026-08-15T17:33:23.803328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00769","last_updated":"2024-12-06T13:09:43Z","snapshot_observed_at":"2026-08-12T22:09:33.469831Z","submitted_at":"2024-11-01T17:59:17Z","title":"GameGen-X: Interactive Open-world Game Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00769","snapshot_observed_at":"2026-08-15T17:33:23.807022Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.807022Z"},"links":{"cited_paper":"/paper/2411.00769","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d7f073ca5849926a1945c41c78b445e89952f1b5036f3e9310b7017ba7c1b284","observation_id":"574c7c3f-3f51-47a3-a02b-04ce1fc0b953","resolution":{"observed_at":"2026-08-15T17:33:23.807022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-15T17:33:23.811401Z","title":"Pixart- : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.811401Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:30ee96d566a42c1566e36220baef8437ea0b6c66a7951bb0cb85f4132ab71a56","observation_id":"1858322f-0de4-470a-9968-d39d9b35790d","resolution":{"observed_at":"2026-08-15T17:33:23.811401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.815428Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.815428Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:351bdc039e9a02acf8284858b1a4a57ea8ff7e2fbb47b128d73c1725d46e4460","observation_id":"c3f6fff8-b0db-4f43-ae56-15ba388b1508","resolution":{"observed_at":"2026-08-15T17:33:23.815428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.818732Z","title":"Ctr-driven advertising image generation with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.818732Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:de58369ccd5cf2e015ed1d5bf2cc149835dd65d15c4f6dd4872338deeb6f7269","observation_id":"b9137a17-e376-4acb-8901-6fb4feef56e0","resolution":{"observed_at":"2026-08-15T17:33:23.818732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.821747Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.821747Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:525b82b7e8914ef3e28cef440b09c804d9346b6b065ebd92fa21a24150429fd4","observation_id":"f5bdb7ee-ad4a-48fd-9ec0-b8fba88bdd7d","resolution":{"observed_at":"2026-08-15T17:33:23.821747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08189","last_updated":"2025-08-15T12:36:20Z","snapshot_observed_at":"2026-08-16T04:37:28.963655Z","submitted_at":"2024-08-15T14:47:44Z","title":"FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08189","snapshot_observed_at":"2026-08-15T17:33:23.826231Z","title":"Fancyvideo: Towards dynamic and consistent video generation via cross-frame textual guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.826231Z"},"links":{"cited_paper":"/paper/2408.08189","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:5fefa7727479cc6b86c672b8efc97f3adffda365321b02c1e04d9627221a03d9","observation_id":"fcd3e565-1c3e-43c4-8e9f-ef73f82f517a","resolution":{"observed_at":"2026-08-15T17:33:23.826231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-14T16:45:13.572276Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-15T17:33:23.830314Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.830314Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:54bb9b5c537c71719532186763f71c793e0f63a621a7f4fb79cf90a74f6a795d","observation_id":"09ad8088-0176-4842-bf59-d0a357f6b353","resolution":{"observed_at":"2026-08-15T17:33:23.830314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-15T17:33:23.833586Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.833586Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:fc894ac89e7708ab15b7885714ce6773bfd6975a1c5a619f52dd5d12e4c03392","observation_id":"cfa2aa51-d149-4c6a-ac4e-8189d353621f","resolution":{"observed_at":"2026-08-15T17:33:23.833586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.880149Z","title":"Check locate rectify: A training-free layout calibration system for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.880149Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d7844470568d73db18cafd0add898a7f5b8aca8d05ea66533d5315cfb7fbaf2a","observation_id":"ad49b46e-a83b-4ea0-ba79-7780497d9d9e","resolution":{"observed_at":"2026-08-15T17:33:23.880149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:23.986748Z","title":"Variational autoencoder: An unsupervised model for encoding and decoding fmri activity in visual cortex","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:23.986748Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:bad6911582e0f43c3bab08ea5f55d1eaba6b5381ccd9d65c9ef145d54edc80ff","observation_id":"3764a1ea-fe2f-4bf5-9c13-53f2064a0366","resolution":{"observed_at":"2026-08-15T17:33:23.986748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-08-14T15:32:46.083706Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09503","snapshot_observed_at":"2026-08-15T17:33:24.047782Z","title":"Anystory: Towards unified single and multiple subject personalization in text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.047782Z"},"links":{"cited_paper":"/paper/2501.09503","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:87b42ad08af10e37913d0851d61222044e869e09636d84f3408e5bf4dc2a286a","observation_id":"85092357-e61c-4f04-992b-6b5471059e14","resolution":{"observed_at":"2026-08-15T17:33:24.047782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18071","last_updated":"2024-09-26T17:18:39Z","snapshot_observed_at":"2026-08-12T22:36:42.986736Z","submitted_at":"2024-09-26T17:18:39Z","title":"FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18071","snapshot_observed_at":"2026-08-15T17:33:24.072511Z","title":"Freeedit: Mask-free reference-based image editing with multi-modal instruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.072511Z"},"links":{"cited_paper":"/paper/2409.18071","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:c6a761dce06eb22c2016f0fb8bf51aa6f32f4c9aecab9a98bcdebfced090be72","observation_id":"7a140623-3ef7-45b2-9cec-92099d566752","resolution":{"observed_at":"2026-08-15T17:33:24.072511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10127","last_updated":"2025-03-30T08:24:33Z","snapshot_observed_at":"2026-08-07T17:07:52.623446Z","submitted_at":"2025-03-13T07:37:09Z","title":"PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10127","snapshot_observed_at":"2026-08-15T17:33:24.076417Z","title":"Plangen: Towards unified layout planning and image generation in auto-regressive vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.076417Z"},"links":{"cited_paper":"/paper/2503.10127","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:52b999f11b28a9d61c9f9701575a76371804565de8e05bd49bc885c67815661f","observation_id":"2276d7c8-5825-4683-b471-4da4732d8072","resolution":{"observed_at":"2026-08-15T17:33:24.076417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.080756Z","title":"Context-aware layout to image generation with enhanced object appearance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.080756Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:2c60c65e9fbeda11bd68c8e3d729b5a1714d9755cecb721464f1b5bd423e2446","observation_id":"7ddaddb0-289d-4166-8d69-2b52b5f94bf3","resolution":{"observed_at":"2026-08-15T17:33:24.080756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.083969Z","title":"Style aligned image generation via shared attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.083969Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:a9c97d5d64d2b280f60a91f53262342020c587aa31623c50b47428327661974c","observation_id":"63c9bc9f-023d-4e09-8112-03a08a1cc5bf","resolution":{"observed_at":"2026-08-15T17:33:24.083969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-15T17:33:24.087115Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.087115Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:00c39d2152ad42fd8b7da7cea4610dce124b2e2a2dd599fdfeff9f5c2b20cb3a","observation_id":"99162a0a-8164-48c5-b214-c7d05e2b5fdf","resolution":{"observed_at":"2026-08-15T17:33:24.087115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.090494Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.090494Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:cd1e1b0cecef4f6f9a30e1bdf23c6cd540db137eb6c4cbded114883f6c468a46","observation_id":"0d917cee-0ebc-431c-8779-86237e0cfce6","resolution":{"observed_at":"2026-08-15T17:33:24.090494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.094729Z","title":"Interactdiffusion: Interaction control in text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.094729Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:08fc6d762822955db0d93bc15e3f67d868f653d7f27ba9346b5c7937a032ad48","observation_id":"2a32713c-c5d4-4c86-a384-1b7ab7c819ba","resolution":{"observed_at":"2026-08-15T17:33:24.094729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.098455Z","title":"Learning disentangled identifiers for action-customized text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.098455Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:7fb4612be544fabc510bf964ae124c3fffc90c88b89e4d3586584e0fbbf4ddc9","observation_id":"49dbaf7b-5848-4483-ac6b-314c7e4cbc68","resolution":{"observed_at":"2026-08-15T17:33:24.098455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.101637Z","title":"Reversion: Diffusion-based relation inversion from images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.101637Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:5aceb3411d58dcdc4b5014106eae00e48614d54dc2c1ab6dc1051655595996b3","observation_id":"d482c41e-101e-41ae-98db-b5241664a6f1","resolution":{"observed_at":"2026-08-15T17:33:24.101637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T17:33:24.104500Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.104500Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:f78e340a39b2dfa18dbda694eab76aad4186efa89d42471fdd2eccaf1506ab7d","observation_id":"b060a62c-0d79-4bd3-a1de-eb24e0dd11bf","resolution":{"observed_at":"2026-08-15T17:33:24.104500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.108839Z","title":"Res-tuning: A flexible and efficient tuning paradigm via unbinding tuner from backbone","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.108839Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:9d1a9b9d9db6127b4a7fcdb62dd856d4cdcb60940c4c630dcc43dde09cdf77d5","observation_id":"6c472417-f49d-49a7-9a7a-6d0cf9a07fd2","resolution":{"observed_at":"2026-08-15T17:33:24.108839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.112191Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.112191Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:6afd45a98f33e3c90ff0959172ab173f5bb9f12cff4574085e5725a4a5ff3696","observation_id":"fba4e7e5-7be6-4bf1-9b53-a838aa3e942d","resolution":{"observed_at":"2026-08-15T17:33:24.112191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.899269Z","title":"Story generation with crowdsourced plot graphs","venue":null,"work_id":"64a07d98-a3ec-4c7c-9513-11ca3e4c35e3","year":2013},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.115587Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:6d628a3c34a051d5fdf6418e5dac7b26d7a801a2a0314260a583025e19c7d6ba","observation_id":"9ea0dae7-108a-4462-a6be-3912e0a3b25f","resolution":{"observed_at":"2026-08-15T17:33:26.902936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.842309Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"3e104428-c8f7-4c9d-b4b0-8adf7a632e48","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.118900Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:51133b00a709d50e6709f27ae6c6ab3490ae9cd40986a7b6ec4b04a42c82931f","observation_id":"dea126fc-4284-42b3-9b65-0d85317f3d68","resolution":{"observed_at":"2026-08-15T17:33:26.892699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08822","last_updated":"2024-09-03T07:42:44Z","snapshot_observed_at":"2026-08-14T09:35:05.243452Z","submitted_at":"2023-12-14T11:11:50Z","title":"Planning and Rendering: Towards Product Poster Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08822","snapshot_observed_at":"2026-08-15T17:33:24.126150Z","title":"Planning and rendering: Towards product poster generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.126150Z"},"links":{"cited_paper":"/paper/2312.08822","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:c8b13d93141890dbec6ce7586e1c2ca43c2921afd5ea92078875a29af21551dc","observation_id":"d5c07ae1-e5f1-4e1b-8640-b9b410704517","resolution":{"observed_at":"2026-08-15T17:33:24.126150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.130318Z","title":"Photomaker: Customizing realistic human photos via stacked id embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.130318Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:f59a3ef135fd58a99b51d68c28b4f06e3136581d242c56350697fec046cfc0c8","observation_id":"03bafcd8-0473-4db7-8840-25cd6a28e4bb","resolution":{"observed_at":"2026-08-15T17:33:24.130318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01657","last_updated":"2025-08-13T15:02:50Z","snapshot_observed_at":"2026-08-16T04:37:51.612878Z","submitted_at":"2025-05-03T02:20:30Z","title":"RAGAR: Retrieval Augmented Personalized Image Generation Guided by Recommendation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01657","snapshot_observed_at":"2026-08-15T17:33:24.133845Z","title":"Ragar: Retrieval augment personalized image generation guided by recommendation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.133845Z"},"links":{"cited_paper":"/paper/2505.01657","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:82cb29d7adb333d385e8066c7f3263b890564eacf2e6d2888da738cff6e8d3ba","observation_id":"7b649b77-b8c4-40df-9824-4826f8188ae4","resolution":{"observed_at":"2026-08-15T17:33:24.133845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.756983Z","title":"Intelligent grimm-open-ended visual storytelling via latent diffusion models","venue":null,"work_id":"4ad53e65-056b-4ec1-93d8-a4796e2f010c","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.136961Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:27e2cd4f72f3cc95644e26c9d934cb34b82ca3efff77c707455af0aa6196667d","observation_id":"e65fbc0a-d02a-4112-83af-6beb6948299d","resolution":{"observed_at":"2026-08-15T17:33:26.785750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.746572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"31c33c11-3272-4649-bb6b-83271d7562be","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.155708Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:58abc2ede0f9e3f3a7c2feb91351dcba0f71c554fd2039f9569d7f12264611b1","observation_id":"b77eab5d-3720-4441-b301-075d7195ae73","resolution":{"observed_at":"2026-08-15T17:33:26.749861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.735695Z","title":"Bridge diffusion model: Bridge chinese text-to-image diffusion model with english communities","venue":null,"work_id":"e80d297d-2919-4dbe-baeb-33ed8aeceab0","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.213898Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:96d061863d6c8f8ab6cf63fc5adee2ef68846e89900094fd9d490302283235d1","observation_id":"6154288f-e28d-4526-b18e-9eb158dfceed","resolution":{"observed_at":"2026-08-15T17:33:26.739661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-14T07:08:54.928684Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-08-15T17:33:24.242171Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.242171Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:473864673898a6bb5504777f3400f52fc01c259df5f98acdf38dbf2de8f6071f","observation_id":"d89d4ae6-a570-468e-8ae1-a854c0d2cf37","resolution":{"observed_at":"2026-08-15T17:33:24.242171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11884","last_updated":"2025-08-04T11:43:24Z","snapshot_observed_at":"2026-08-16T04:43:32.017529Z","submitted_at":"2024-09-18T11:30:30Z","title":"Out-of-Distribution Detection: A Task-Oriented Survey of Recent Advances","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11884","snapshot_observed_at":"2026-08-15T17:33:24.367121Z","title":"Recent advances in ood detection: Problems and approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.367121Z"},"links":{"cited_paper":"/paper/2409.11884","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:a0cba77f5e77d8caf5ae217beb28b01aad43380260746837342505b62e205624","observation_id":"5d5aae18-5944-4dc6-9bba-5565ef3ae0af","resolution":{"observed_at":"2026-08-15T17:33:24.367121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02374","last_updated":"2025-08-04T13:02:23Z","snapshot_observed_at":"2026-08-16T04:43:31.217379Z","submitted_at":"2025-08-04T13:02:23Z","title":"Uni-Layout: Integrating Human Feedback in Unified Layout Generation and Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02374","snapshot_observed_at":"2026-08-15T17:33:24.398133Z","title":"Uni-layout: Integrating human feedback in unified layout generation and evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.398133Z"},"links":{"cited_paper":"/paper/2508.02374","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:a8b18cc1b517cccc33fb1032666ca8eff3ef3cbd1c6178b762f50cf6ab852f55","observation_id":"a4dc80b4-880c-405c-9f63-ffbf578484d3","resolution":{"observed_at":"2026-08-15T17:33:24.398133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09319","last_updated":"2023-03-16T13:50:20Z","snapshot_observed_at":"2026-08-16T04:43:20.980939Z","submitted_at":"2023-03-16T13:50:20Z","title":"Unified Multi-Modal Latent Diffusion for Joint Subject and Text Conditional Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09319","snapshot_observed_at":"2026-08-15T17:33:24.402742Z","title":"Unified multi-modal latent diffusion for joint subject and text conditional image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.402742Z"},"links":{"cited_paper":"/paper/2303.09319","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:7e7c78392fd5a621c40994437377d01df8fa8598a8ee23cebfa80332772182ea","observation_id":"644cf613-1b0b-48b4-b6bf-5832cb843d57","resolution":{"observed_at":"2026-08-15T17:33:24.402742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.723434Z","title":"Hico: Hierarchical controllable diffusion model for layout-to-image generation","venue":null,"work_id":"a6a67bf3-e87f-430b-8b60-c6294208736c","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.407102Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:5cab78021ddf1801693167e14d292f70f08956de1631813b78809d8c7cbd7606","observation_id":"99e84b07-4dd1-45b6-b714-96a39a604e48","resolution":{"observed_at":"2026-08-15T17:33:26.728107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19624","last_updated":"2024-09-29T09:15:51Z","snapshot_observed_at":"2026-08-16T04:43:46.844891Z","submitted_at":"2024-09-29T09:15:51Z","title":"Storynizor: Consistent Story Generation via Inter-Frame Synchronized and Shuffled ID Injection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19624","snapshot_observed_at":"2026-08-15T17:33:24.410785Z","title":"Storynizor: Consistent story generation via inter-frame synchronized and shuffled id injection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.410785Z"},"links":{"cited_paper":"/paper/2409.19624","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:3e27ba353d70dddbff5fb8f3895a1b581aee20e0ef5677abd357bb3d98b6db0d","observation_id":"8ed8abbb-803c-4f57-94fc-fd899bf49ee9","resolution":{"observed_at":"2026-08-15T17:33:24.410785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.417115Z","title":"Story-adapter: A training-free iterative framework for long story visualization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.417115Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:265a38a7726d50258e83ead2f4691498e2edaba028f48162268668884e3b9a5a","observation_id":"df6d8c64-a4d0-42dc-81ea-46e5aa9aa0fc","resolution":{"observed_at":"2026-08-15T17:33:24.417115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13833","last_updated":"2024-09-27T14:04:35Z","snapshot_observed_at":"2026-08-16T04:44:04.943890Z","submitted_at":"2023-11-23T07:33:38Z","title":"Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13833","snapshot_observed_at":"2026-08-15T17:33:24.420949Z","title":"Lego: Learning to disentangle and invert personalized concepts beyond object appearance in text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.420949Z"},"links":{"cited_paper":"/paper/2311.13833","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:9aec76b8bf925b24d67219ea08d0a1c8c218a351d4e03992dfe342c488cdc0ec","observation_id":"d47a579f-b1a3-4f8e-bcd6-acff12253461","resolution":{"observed_at":"2026-08-15T17:33:24.420949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-15T17:33:24.425113Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.425113Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:01615ffe3dc01bdea32d0587960ed756b06768d699fc97038683a2c109057966","observation_id":"f52a26df-380e-41be-a265-bd0640806667","resolution":{"observed_at":"2026-08-15T17:33:24.425113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.429567Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.429567Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:c93671237a66836815384021a904ef43ff0abbd0751080ab9f2478ed209fb4fe","observation_id":"b8bde0a7-82c1-40a5-92ba-b8b6dd891e66","resolution":{"observed_at":"2026-08-15T17:33:24.429567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T17:33:24.433574Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.433574Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:db159ca32978ec915691c28e645f5895ae73ae7984c81c02f877706fe8bee904","observation_id":"d657db4b-1996-4f24-8c44-b77ad0897f82","resolution":{"observed_at":"2026-08-15T17:33:24.433574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.437448Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.437448Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:4ca36e6603254e672a586c1cbd9e8fa0b664691853c9e9dfb6344c9259b50325","observation_id":"ac524da5-b662-45bc-8235-4f6f6fab8d26","resolution":{"observed_at":"2026-08-15T17:33:24.437448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.440942Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.440942Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:b3d98c9c874b1ce89f632f6bdf4d08fcf6259f03b1936a920f8b40b3c051376a","observation_id":"6696cfcd-a6e8-4928-8f1b-4f9acc1f5458","resolution":{"observed_at":"2026-08-15T17:33:24.440942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T17:33:24.444576Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.444576Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:052103b2d0cba9e5bf409326ba877c56faf90a20ececf63cce1eee7b023557bd","observation_id":"bf53bb84-b3a3-4dfd-83f9-f83ceb9b9fbb","resolution":{"observed_at":"2026-08-15T17:33:24.444576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.490970Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.490970Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:338f4de8d366e93a549bdc8775bf0c59e1785290c80a55ae478936dacfa6297d","observation_id":"1ba90154-10d8-4659-81c1-8bd0d345bf8f","resolution":{"observed_at":"2026-08-15T17:33:24.490970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.494435Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.494435Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:11c4bcc0752449802496a56ccdbf982613620ef1414bc211a1d1f072c4b20258","observation_id":"c4eb4316-a865-4437-afc4-9594a6432062","resolution":{"observed_at":"2026-08-15T17:33:24.494435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.497937Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.497937Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:8fb785eb5481c72aab00f4b908eb1303949b6864e30176c9f84ccfcd36846939","observation_id":"0bc37950-d33e-4bb4-9b63-e3505263b0ff","resolution":{"observed_at":"2026-08-15T17:33:24.497937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.667891Z","title":"Carvekit: Automated high-quality background removal framework","venue":null,"work_id":"6282023b-71b8-48f5-b2ff-8d1b67da60e1","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.501352Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:a82a223c21066c5ca39d1eacb287f5d39f8890f8de1437b9959fb2a1e5008d17","observation_id":"bbf0a86e-b3c7-4069-8cda-0f070345e064","resolution":{"observed_at":"2026-08-15T17:33:26.671466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13092","last_updated":"2025-07-28T05:51:49Z","snapshot_observed_at":"2026-08-16T04:44:22.542410Z","submitted_at":"2025-04-17T16:59:04Z","title":"EventVAD: Training-Free Event-Aware Video Anomaly Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13092","snapshot_observed_at":"2026-08-15T17:33:24.505916Z","title":"Eventvad: Training-free event-aware video anomaly detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.505916Z"},"links":{"cited_paper":"/paper/2504.13092","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d27cf0fbf5169686d3e8be349982771b34b754a17f66ba277d83a85207c727ed","observation_id":"14878054-7e70-4519-9123-535504af5875","resolution":{"observed_at":"2026-08-15T17:33:24.505916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06564","last_updated":"2025-03-09T11:37:11Z","snapshot_observed_at":"2026-08-16T04:44:06.809608Z","submitted_at":"2025-03-09T11:37:11Z","title":"TR-DQ: Time-Rotation Diffusion Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06564","snapshot_observed_at":"2026-08-15T17:33:24.509659Z","title":"Tr-dq: Time-rotation diffusion quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.509659Z"},"links":{"cited_paper":"/paper/2503.06564","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:2514b66a93cb94950eb948b024bd3580ba5523e241c3564b1f883530aca01747","observation_id":"8f15e1c6-d563-498c-8d6f-0ddd02e0f476","resolution":{"observed_at":"2026-08-15T17:33:24.509659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17635","last_updated":"2025-07-05T18:59:06Z","snapshot_observed_at":"2026-08-16T04:43:33.680513Z","submitted_at":"2025-01-29T13:12:01Z","title":"In-Context Meta LoRA Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17635","snapshot_observed_at":"2026-08-15T17:33:24.513403Z","title":"In-context meta lora generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.513403Z"},"links":{"cited_paper":"/paper/2501.17635","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:1b22c7a41b3be059cd9f4dfdee64e4f7de7ff75ff12babad18f5219fdac2bd30","observation_id":"7aca3f69-d998-4cb2-994f-ebd472c998ce","resolution":{"observed_at":"2026-08-15T17:33:24.513403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.656762Z","title":"Storybooth: Training-free multi-subject consistency for improved visual storytelling","venue":null,"work_id":"138758d7-e661-4e22-83ff-a8e0143cdb80","year":null},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.516406Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:aabd4b79195c52297255f93ee237fd70b71c772a4bdada7f8604aa6e8e09990b","observation_id":"1012e227-1a41-40c3-be63-102d8887161e","resolution":{"observed_at":"2026-08-15T17:33:26.661107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.606184Z","title":"Styledrop: Text-to-image synthesis of any style","venue":null,"work_id":"fb644354-fd3d-4509-870c-716f6d641826","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.519745Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:c9cdd71d1d45902cfd04eff6576103f17c33f86db4e3388582c95cd0df6ed3a9","observation_id":"ee9570da-aeae-4c8f-ae6f-26d6e4c34579","resolution":{"observed_at":"2026-08-15T17:33:26.649823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.469102Z","title":"Instantx flux.1-dev ip-adapter page, 2024","venue":null,"work_id":"824431b2-44cd-4da4-b678-ef313693037f","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.522702Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:ce76d3995701128ed161a2bec5c195a8c3a2bca19598bdfb5efd1989d64885d9","observation_id":"7465c189-c960-43b5-b1a1-f1e2c786dbf6","resolution":{"observed_at":"2026-08-15T17:33:26.511142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.422437Z","title":"Training-free consistent text-to-image generation","venue":null,"work_id":"ed547bdc-f7d5-487c-8b02-1faf1e1753c2","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.526275Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:c21de331871c7c795f5ec841ba09b500f3daf666e7e2c7b47118a294421b2627","observation_id":"05cc723f-532d-4a31-b1d9-3bd5f3c5aafc","resolution":{"observed_at":"2026-08-15T17:33:26.434035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.413504Z","title":"Converting video formats with ffmpeg","venue":null,"work_id":"79d11015-2516-40e9-8cae-eac44ff8aa77","year":2006},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.529619Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:e926eb6381ea83341cb0b1dcb146070c0e62babe6921a2f8262bab6e7fa7ab13","observation_id":"c802d7af-d252-423c-829b-a9528f1ff267","resolution":{"observed_at":"2026-08-15T17:33:26.416528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.533405Z","title":"Face0: Instantaneously conditioning a text-to-image model on a face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.533405Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:a75c567bf637a858a08f2d219c2bff114fe7ef1e717d26544bd6841fb0f8af38","observation_id":"493d489e-35f0-41e7-af30-f0e5743f9da2","resolution":{"observed_at":"2026-08-15T17:33:24.533405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:24.536634Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.536634Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:0e4f117b1e65858ea538f605516c38a7f72b644f39406a58ab0d7cf1a2d58cbd","observation_id":"d28c5608-8fc7-49e3-9565-f479c24dc70b","resolution":{"observed_at":"2026-08-15T17:33:24.536634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.392123Z","title":"Is this loss informative? faster text-to-image customization by tracking objective dynamics","venue":null,"work_id":"48060489-7e74-4d15-aaf7-fdf04994f9ed","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.572597Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:7f460b9d98d5ad05ff57c7f30a458fede2e384a0c7d36565562db5dbe51e58ff","observation_id":"39d6403e-4df9-4a85-a89d-7d0e4d3161be","resolution":{"observed_at":"2026-08-15T17:33:26.394968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-15T14:46:43.126675Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-08-15T17:33:24.692476Z","title":"p+: Extended textual conditioning in text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.692476Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:74c21ce92191b7b53a0cf5a34f77d21ae9aa28838e176ffbafb9a6dd8cf4eddb","observation_id":"8074d3a6-3acf-412b-a3dc-4ea4311d74f5","resolution":{"observed_at":"2026-08-15T17:33:24.692476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.382577Z","title":"Qihoo-t2x: An efficiency-focused diffusion transformer via proxy tokens for text-to-any-task","venue":null,"work_id":"bda5d635-2b64-44bc-a73d-23991383438a","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.879967Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:30ff4a915d35c88534dd38a4395b386d0e32458e873dc20101f89969320b5e14","observation_id":"c6bdc817-5fc0-4052-86fe-7d21afef8c8d","resolution":{"observed_at":"2026-08-15T17:33:26.386538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08153","last_updated":"2025-03-11T08:10:03Z","snapshot_observed_at":"2026-08-13T14:06:10.787372Z","submitted_at":"2025-03-11T08:10:03Z","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08153","snapshot_observed_at":"2026-08-15T17:33:24.883696Z","title":"Wisa: World simulator assistant for physics-aware text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.883696Z"},"links":{"cited_paper":"/paper/2503.08153","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:b9353620b4880a6d0814fb5b34acd2edf3afd5d6170eb75daec587c908ebb868","observation_id":"5ab2929e-b66d-4dc2-8167-7f61abd8df2c","resolution":{"observed_at":"2026-08-15T17:33:24.883696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.374597Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video generation","venue":null,"work_id":"2ea0df0b-7785-4dcd-859a-33bff028bbe4","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.888166Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:6f8f1fcd8e6f5903fc7a88404a98ec0a525fd3aa52b9f6e6ada68f68340414ef","observation_id":"ef5dbec5-4de4-44cd-8e70-9ef2870f1d0e","resolution":{"observed_at":"2026-08-15T17:33:26.377558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.365752Z","title":"Spnet: Learning stereo matching with slanted plane aggregation","venue":null,"work_id":"adbe9967-b285-4569-9a1d-98379791f456","year":2022},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.892065Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:2469ad5485b5d9c3c86a17c9b6a3eb036ae80809b993eda99ee4b0ff07d76ced","observation_id":"2eac308c-dd49-4730-bcb0-12c84322c412","resolution":{"observed_at":"2026-08-15T17:33:26.368976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-15T17:33:24.895483Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.895483Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:8ffa6b3d94359509b0fa57f2409f62efbbc1e746dbf5574dc6c904a5f95d90b0","observation_id":"1d4832bb-3a12-4737-9dde-d6afb7c9d02f","resolution":{"observed_at":"2026-08-15T17:33:24.895483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.355274Z","title":"Adstereo: Efficient stereo matching with adaptive downsampling and disparity alignment","venue":null,"work_id":"09b6e47d-0c45-4416-9eef-ccebd7c5ada4","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.899264Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:308d99974a8688a20f2784f23d9e71ce56979bb1704ebc37990d9d1676c6d4dd","observation_id":"2f12da01-1b8b-4999-907b-4e9d43b6216f","resolution":{"observed_at":"2026-08-15T17:33:26.358610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04631","last_updated":"2025-07-07T03:19:04Z","snapshot_observed_at":"2026-08-16T04:43:35.254854Z","submitted_at":"2025-07-07T03:19:04Z","title":"Learning Robust Stereo Matching in the Wild with Selective Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04631","snapshot_observed_at":"2026-08-15T17:33:24.902704Z","title":"Learning robust stereo matching in the wild with selective mixture-of-experts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.902704Z"},"links":{"cited_paper":"/paper/2507.04631","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:27a5c5f4862b5e5af852dbe3616735e84bdc48c87b0fd571cbb6602b47efae95","observation_id":"4d108ca4-d67b-4da1-835a-0623ebe08d67","resolution":{"observed_at":"2026-08-15T17:33:24.902704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.252654Z","title":"Dualnet: Robust self-supervised stereo matching with pseudo-label supervision","venue":null,"work_id":"a70a76c4-987e-4fb2-a83a-354a37f419e1","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.906219Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:fabee558f57063a0a622d58af2500f2bf2ce3879886e1036ce668689c243538e","observation_id":"33e4b485-7113-4f2a-a49e-af5766b3c201","resolution":{"observed_at":"2026-08-15T17:33:26.297882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01770","last_updated":"2024-10-30T17:05:17Z","snapshot_observed_at":"2026-08-14T07:29:02.612365Z","submitted_at":"2023-09-04T19:16:46Z","title":"StyleAdapter: A Unified Stylized Image Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01770","snapshot_observed_at":"2026-08-15T17:33:24.910052Z","title":"Styleadapter: A unified stylized image generation model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.910052Z"},"links":{"cited_paper":"/paper/2309.01770","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:630f895359b4d68ffa808e1df3cd5ca265ea352d6ab4826d43e884cdca08c731","observation_id":"bf120898-3370-458a-8fbe-53b31e199dcf","resolution":{"observed_at":"2026-08-15T17:33:24.910052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.141834Z","title":"Dropoutgs: Dropping out gaussians for better sparse-view rendering","venue":null,"work_id":"2b48a053-6ff6-4f33-b088-1c578d16f830","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.913665Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:6e5b7d4431876bd0d4b7678c623770fad92cdc2df4b1ade15cca6389ae7c6457","observation_id":"d02d64f1-c3d1-4d7d-9d7b-93cedf51295c","resolution":{"observed_at":"2026-08-15T17:33:26.197045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.132139Z","title":"Freestyle layout-to-image synthesis","venue":null,"work_id":"f12aebaa-f310-45db-92bb-cb4e57abcd2e","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.917354Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:bab5ee2369a1b29ef4c8c47964f6f83d2cd18968fe2dff8091af0842442b226a","observation_id":"187c33fb-64fc-4b67-84e9-c9c9c3c11eff","resolution":{"observed_at":"2026-08-15T17:33:26.135150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02663","last_updated":"2023-12-06T12:23:36Z","snapshot_observed_at":"2026-08-16T04:44:03.723455Z","submitted_at":"2023-12-05T11:02:45Z","title":"FaceStudio: Put Your Face Everywhere in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02663","snapshot_observed_at":"2026-08-15T17:33:24.920689Z","title":"Facestudio: Put your face everywhere in seconds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.920689Z"},"links":{"cited_paper":"/paper/2312.02663","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:fee91952bddf66ca8669c43655ec144c17f33bdfba954cc217ee4e8cbdc2707f","observation_id":"f5696252-57a0-4544-b1fe-4e0df41d83db","resolution":{"observed_at":"2026-08-15T17:33:24.920689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-16T04:36:55.503973Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-15T17:33:24.931590Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:24.931590Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:ddb44a95aa3ef2b073bce4b54e35fb78a2b75b0a8fe4533f7f8b1ce3087072f9","observation_id":"026d94fe-7633-4f3e-b69e-6c4944e7ad2c","resolution":{"observed_at":"2026-08-15T17:33:24.931590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.123283Z","title":"Reco: Region-controlled text-to-image generation","venue":null,"work_id":"cce8d1e9-7b04-447a-9243-b3248cbaad16","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.001520Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:ea91e086898ef4425cb46501512816aeb2a60007342b67c6b5b8b2c81c8e790a","observation_id":"570aa5e5-cc7a-492a-865d-4fe5ed740e49","resolution":{"observed_at":"2026-08-15T17:33:26.126220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-15T17:33:25.042293Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.042293Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d512c1a14f9256c256e13cc2fe7fd80e794b99c6c3523bb73cac7b3125256c38","observation_id":"9a153d8a-319f-473b-bc32-b9716c4347e6","resolution":{"observed_at":"2026-08-15T17:33:25.042293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.113456Z","title":"Controlnet-xs: Rethinking the control of text-to-image diffusion models as feedback-control systems","venue":null,"work_id":"8b2b83d9-4827-455a-ae2d-a90d9bf24015","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.045579Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:0126a786f849b776aa6178a8ed6ac5944bed57ff9a673c676de7318db70f3dcf","observation_id":"076aab37-bdeb-4466-8d02-74ac8923bb14","resolution":{"observed_at":"2026-08-15T17:33:26.116863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-15T11:25:03.847898Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-15T17:33:25.049145Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.049145Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:5ca879e2a023095924fe28f789eb2b5ad3710705f612be39ae09d73196e33e13","observation_id":"e3585d81-7fe0-4675-907b-3b983bb69ad0","resolution":{"observed_at":"2026-08-15T17:33:25.049145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:25.052551Z","title":"A survey on personalized content synthesis with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.052551Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:adaa275502fdb9200a827eaa61184cbd61cf89106dddda997cc308b11477f68c","observation_id":"cbcded5b-0c13-4992-88b1-ddc2120d7399","resolution":{"observed_at":"2026-08-15T17:33:25.052551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.104317Z","title":"Generative active learning for image synthesis personalization","venue":null,"work_id":"709a5283-5af6-4b8a-b540-d55e01cc1381","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.057330Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:79228ac5d5a6e4621cd27364a7a8e18d0461bb550e3f133c23f0700233b8f7cd","observation_id":"a779cdd0-d223-42ff-b991-83b083c247a5","resolution":{"observed_at":"2026-08-15T17:33:26.107500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.093469Z","title":"Towards highly realistic artistic style transfer via stable diffusion with step-aware and layer-aware prompt","venue":null,"work_id":"6f8dfbfb-74dc-473d-bd2c-cb9751601400","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.061420Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:52be15be0b3866aba7c458130c49d5c111144df568ee3fd144cbe1bc3e4b8988","observation_id":"5b39d0a7-5129-4cdc-98b6-e70f24729b1d","resolution":{"observed_at":"2026-08-15T17:33:26.097492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.080998Z","title":"Artbank: Artistic style transfer with pre-trained diffusion model and implicit style prompt bank","venue":null,"work_id":"888c6453-f003-4031-a1c1-40f40651f500","year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.065506Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:f07d0feb026fd6618098fa43f95fe87cbc5c07315ed94bfaca67476277df8374","observation_id":"8b287e06-a5d5-4fc3-9684-9011bc1dad8a","resolution":{"observed_at":"2026-08-15T17:33:26.085143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.068751Z","title":"Lgast: Towards high-quality arbitrary style transfer with local--global style learning","venue":null,"work_id":"d5434888-14a1-49f9-83a3-cb70b37a1f9d","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.068672Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:f8ffeff7ca41e98a6b01c8edd03f6086fd1e9f06320ef80bcdc6376aa015d223","observation_id":"067a07b0-cb44-4ff3-b48d-a592e4d65299","resolution":{"observed_at":"2026-08-15T17:33:26.072781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08157","last_updated":"2025-03-11T08:12:38Z","snapshot_observed_at":"2026-08-16T04:43:33.632422Z","submitted_at":"2025-03-11T08:12:38Z","title":"U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08157","snapshot_observed_at":"2026-08-15T17:33:25.071626Z","title":"U-stydit: Ultra-high quality artistic style transfer using diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.071626Z"},"links":{"cited_paper":"/paper/2503.08157","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:fb38defaccc9148a5b34e6f207408650b2c9244630639e6ab8b22cfa02be41d2","observation_id":"efa75ff7-9d5c-439f-bebd-cc72a0b060f0","resolution":{"observed_at":"2026-08-15T17:33:25.071626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.057375Z","title":"Spast: Arbitrary style transfer with style priors via pre-trained large-scale model","venue":null,"work_id":"1e7e9d44-c976-46e9-b3db-99edf0a54255","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.075155Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:99c6d86579470f20f31b4ab7499d36090aee1dde395f8079ae65ff99b811063a","observation_id":"4e12b688-2419-4e73-9d55-a9afb5a66f3b","resolution":{"observed_at":"2026-08-15T17:33:26.061449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:26.031722Z","title":"Vectorsketcher: Learning to create a vector-based free-hand sketch","venue":null,"work_id":"4b5b1979-fcad-4b85-911c-da1d735fa5a1","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.078262Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:4fe00be4380c25a851b5fc65c2ccc60d64f765fcfd7f7a62b7579e64308dd1ba","observation_id":"4d046ab3-eae6-4e84-bb24-0c7f0ba38190","resolution":{"observed_at":"2026-08-15T17:33:26.050314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:25.907962Z","title":"Image generation from layout","venue":null,"work_id":"6a9120c3-97e1-4123-9ed7-60c13215180d","year":2019},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.081923Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:4b5758ada5133b4b54be418c5294b552f5e155e8cc8ee2d0cddab51264fcecea","observation_id":"68d5348a-b873-4d39-a6ca-8987b713da9e","resolution":{"observed_at":"2026-08-15T17:33:25.980060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:25.085390Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.085390Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:8bd35275f8e607dad90ba3007c317e95e11643d228db0cd93d547838343cb68b","observation_id":"29f365ef-545d-478f-928e-e5ce52f440e7","resolution":{"observed_at":"2026-08-15T17:33:25.085390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:25.858462Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"3c057bda-a27f-4c65-93aa-ef444415d82c","year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.102452Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d5e5d9f585986bac76f5311ce865f3d0a4afe781ca80e70fea679e6701900b3c","observation_id":"5059c8ea-c45a-43d9-9e8d-e91dc928317d","resolution":{"observed_at":"2026-08-15T17:33:25.862408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13579","last_updated":"2023-05-23T01:14:53Z","snapshot_observed_at":"2026-08-16T04:43:34.913337Z","submitted_at":"2023-05-23T01:14:53Z","title":"Enhancing Detail Preservation for Customized Text-to-Image Generation: A Regularization-Free Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13579","snapshot_observed_at":"2026-08-15T17:33:25.201953Z","title":"Enhancing detail preservation for customized text-to-image generation: A regularization-free approach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.201953Z"},"links":{"cited_paper":"/paper/2305.13579","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:adee4f6e89cf4c2ea09d8af70026b68da781534b2de6e7d5297f966f7072ea9f","observation_id":"b6342a0b-8efa-4d95-add4-142dc6b16b32","resolution":{"observed_at":"2026-08-15T17:33:25.201953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:33:25.845512Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":"dc29128f-16e0-4202-9bce-9982f507b9f7","year":2025},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.279023Z"},"links":{"citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:d86eadca2b4f91c294116980a359fac5216c96d1b5b1c8a94e4a1d1164984702","observation_id":"1ea8d041-acb5-43e4-ad50-1523a30eb732","resolution":{"observed_at":"2026-08-15T17:33:25.851440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12576","last_updated":"2024-09-19T08:53:06Z","snapshot_observed_at":"2026-08-16T04:44:25.104254Z","submitted_at":"2024-09-19T08:53:06Z","title":"StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12576","snapshot_observed_at":"2026-08-15T17:33:25.283022Z","title":"Storymaker: Towards holistic consistent characters in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T17:33:25.283022Z"},"links":{"cited_paper":"/paper/2409.12576","citing_paper":"/paper/2508.08949"},"observation_digest":"sha256:04e2e50960317dec822619668956a1bf9039f9e00bb6e39c70c6d7c4734f3fb2","observation_id":"a1bd2745-0f78-427c-8f7b-06784ac589c7","resolution":{"observed_at":"2026-08-15T17:33:25.283022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.08949","last_updated":"2025-08-12T14:04:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:37:27.610295Z","submitted_at":"2025-08-12T14:04:56Z","title":"Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2508.08949."}