{"as_of":"2026-08-23T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7359669ecc470b7ea0a81ec6d3c8ba2a594029794104e28ed9ec545822ce3e98","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:47:00.786871Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:38:37.640445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T04:38:39.565150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"cited_work":{"arxiv_id":"2508.03735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03735","snapshot_observed_at":"2026-08-14T04:38:39.565150Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","venue":"cs.CV","work_id":"c6807052-9d59-495e-aaed-1a7942760ef3","year":2025},"citing_paper":{"arxiv_id":"2608.08460","last_updated":"2026-08-09T04:01:21Z","snapshot_observed_at":"2026-08-19T23:02:57.246274Z","submitted_at":"2026-08-09T04:01:21Z","title":"InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:38:37.640445Z"},"links":{"cited_paper":"/paper/2508.03735","citing_paper":"/paper/2608.08460"},"observation_digest":"sha256:f2c2870965524fd3730f7dc434b7bc069cddf2b2a3e466801ed9a883fe3718fd","observation_id":"82acd1da-56b1-429c-916a-bb4bb211287d","resolution":{"observed_at":"2026-08-14T04:38:39.637125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03735/citation-record","integrity":"/paper/2508.03735/integrity","json":"/paper/2508.03735/citation-record.json","paper":"/paper/2508.03735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.967385Z","title":null,"venue":null,"work_id":"49e27b36-8aad-43b4-b72b-9b43cd6f2a86","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.509179Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:2ad31aee2b3ee7204ebcc59bfcc8aef65eab47de55b609da2456702bb4cbf168","observation_id":"018a1c90-d249-4928-94ef-fd26d2c6f89c","resolution":{"observed_at":"2026-08-06T10:47:01.972732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.924445Z","title":"Kandinsky 3.0 technical report, 2024","venue":null,"work_id":"16ecc43f-a142-47e1-a201-502e72843048","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.515460Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3b8ea016806fa50c4ff91b3fb63eaef24e39ef6c04178de32f54eafbb4acca17","observation_id":"a092c6e8-e2f2-4182-b4ef-60315905d343","resolution":{"observed_at":"2026-08-06T10:47:01.930235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.905551Z","title":"The chosen one: Consistent characters in text-to- image diffusion models","venue":null,"work_id":"8ce15d8e-8031-42cb-9a9a-97fecdc5606f","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.521730Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:b729c18bb146acdcf8bdb434dce9a488d2a7b894d9a8ced6ba4deb9b65799e96","observation_id":"e6b0c73e-a936-4eb4-acd8-a936012f0ab3","resolution":{"observed_at":"2026-08-06T10:47:01.911168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-21T22:09:31.363918Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T10:47:00.530198Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.530198Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:19eea23abbd7f28d78fe57efbfb62c92efa05eff34fa36d8ba2f542529d66eab","observation_id":"07287fd2-36b5-461f-bb83-b7d6b51313a9","resolution":{"observed_at":"2026-08-06T10:47:00.530198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.885305Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and edit- ing","venue":null,"work_id":"4e35dea2-4ae5-4e70-8689-4a98fa2f7321","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.536152Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:328db37a6f6c74537cdf03da652b64bfd1bc145cc87c759d8214c14119b02711","observation_id":"14428dd0-dc76-4f88-b120-b1fcddd30d81","resolution":{"observed_at":"2026-08-06T10:47:01.891538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11337","last_updated":"2025-01-30T15:13:01Z","snapshot_observed_at":"2026-08-20T00:59:52.278826Z","submitted_at":"2022-11-21T10:37:56Z","title":"DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11337","snapshot_observed_at":"2026-08-06T10:47:00.541286Z","title":"DreamArtist: Towards Controllable One-Shot Text-to-Image Genera- tion via Positive-Negative Prompt-Tuning, Apr","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.541286Z"},"links":{"cited_paper":"/paper/2211.11337","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:e968b3b40443f6dccc7dfb8e24a44778e72ba6b870e0f86b6d24e10b543b278e","observation_id":"22e57c8c-9606-492e-9227-c891e2fe8fd9","resolution":{"observed_at":"2026-08-06T10:47:00.541286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-20T07:25:09.293308Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T10:47:00.547306Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.547306Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:fc077851db405e2e07fca2f145dd815a8dc721dba3c73b158575af07559290db","observation_id":"25999249-f595-49b7-89a0-68e4bd432bcb","resolution":{"observed_at":"2026-08-06T10:47:00.547306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16811","last_updated":"2023-05-26T10:43:42Z","snapshot_observed_at":"2026-08-21T03:45:49.050156Z","submitted_at":"2023-05-26T10:43:42Z","title":"Improved Visual Story Generation with Adaptive Context Modeling","version":1},"cited_work":{"arxiv_id":"2305.16811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16811","snapshot_observed_at":"2026-08-06T10:47:01.399220Z","title":"Improved Visual Story Generation with Adaptive Context Modeling","venue":"cs.CV","work_id":"3211dc0d-e110-4da9-a0ec-11390e3d400d","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.552932Z"},"links":{"cited_paper":"/paper/2305.16811","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:2784f8cb00b8d770b178486bf05d9f240e59d6bef9615569b46e8c25af4556ee","observation_id":"aec35b91-984b-4222-b953-b25f49f1e8ac","resolution":{"observed_at":"2026-08-06T10:47:01.404398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-17T00:52:15.316289Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-06T10:47:00.560554Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.560554Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:5518389f62f9f9f15d0e0c84f0a7b35f81d3ddd65aaa83d629d6654af35fdf0e","observation_id":"adce62b9-8e2a-4e76-ad60-b0d681ffd213","resolution":{"observed_at":"2026-08-06T10:47:00.560554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-20T10:39:03.872570Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T10:47:00.572791Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.572791Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3300b0b85d17e5efbc00d0034c96bb743996dac553f727966403d3b1887fd61c","observation_id":"6571d272-d148-4d71-a8e7-fd11c2d026c3","resolution":{"observed_at":"2026-08-06T10:47:00.572791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12228","last_updated":"2023-03-05T15:48:51Z","snapshot_observed_at":"2026-08-16T15:53:09.809719Z","submitted_at":"2023-02-23T18:46:41Z","title":"Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12228","snapshot_observed_at":"2026-08-06T10:47:00.577992Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.577992Z"},"links":{"cited_paper":"/paper/2302.12228","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:6b2c2a4c5657630de19c28d3400c7a5915bcc101ad7b978afc8995bf7d0d034c","observation_id":"b73d4ce0-5bfe-4ef4-9fab-81c3abb8e661","resolution":{"observed_at":"2026-08-06T10:47:00.577992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-08-21T18:18:14.301985Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-06T10:47:00.584961Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.584961Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:2337831f50af62b65a429e32fda2a8fa048e9f4a2802c9c36288cea7bcb1be92","observation_id":"9ade7593-8cb9-4394-b308-dce86cbb59de","resolution":{"observed_at":"2026-08-06T10:47:00.584961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18292","last_updated":"2023-11-10T00:01:55Z","snapshot_observed_at":"2026-08-19T05:49:35.817250Z","submitted_at":"2023-05-29T17:58:16Z","title":"Mix-of-Show: Decentralized Low-Rank Adaptation for Multi-Concept Customization of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18292","snapshot_observed_at":"2026-08-06T10:47:00.589744Z","title":"Mix-of-show: Decentralized low-rank adaptation for multi-concept customization of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.589744Z"},"links":{"cited_paper":"/paper/2305.18292","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:f91c05252e6c9ae106e1f80136455d633ce003742577b434b815d7dad9e56d02","observation_id":"79c0c6d2-a1c0-47e1-8b69-b24a56af1539","resolution":{"observed_at":"2026-08-06T10:47:00.589744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12899","last_updated":"2025-08-11T18:17:11Z","snapshot_observed_at":"2026-08-16T13:33:20.325370Z","submitted_at":"2024-07-17T17:54:12Z","title":"DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12899","snapshot_observed_at":"2026-08-06T10:47:00.594729Z","title":"Dreamstory: Open-domain story visualiza- tion by llm-guided multi-subject consistent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.594729Z"},"links":{"cited_paper":"/paper/2407.12899","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:48e223c32f841719d97a01818bcea7e67c3451d8ea5bdef172dfc914ba70b59b","observation_id":"a2e2c82a-bfd1-4f2d-96ec-257236ae6a7b","resolution":{"observed_at":"2026-08-06T10:47:00.594729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-08-14T15:32:46.083706Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09503","snapshot_observed_at":"2026-08-06T10:47:00.599692Z","title":"Anystory: Towards unified single and multiple subject personalization in text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.599692Z"},"links":{"cited_paper":"/paper/2501.09503","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:dc0b06eb18eacdf18b96247a810ab5427cc643962ff30fafe36a65c6ad2b5026","observation_id":"c7bff57d-9a73-403c-af65-7851b189d290","resolution":{"observed_at":"2026-08-06T10:47:00.599692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-06T10:47:00.604372Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.604372Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:045b9c23db052052b2e1b899539038484a3e4abff7b8d48358d383c81b00b17c","observation_id":"1645d4bc-b7a3-4586-979b-f79f8d788a03","resolution":{"observed_at":"2026-08-06T10:47:00.604372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T10:47:00.608886Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.608886Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:64226269e44b6738c9a7ddb467d3125bd87f5f8ba41c4cd35e7bd8042a2b48f4","observation_id":"cccccd20-6f7f-4c21-8642-fd32fcaffd38","resolution":{"observed_at":"2026-08-06T10:47:00.608886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13495","last_updated":"2024-12-01T14:04:22Z","snapshot_observed_at":"2026-08-20T14:18:55.921886Z","submitted_at":"2023-03-23T17:56:10Z","title":"ReVersion: Diffusion-Based Relation Inversion from Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13495","snapshot_observed_at":"2026-08-06T10:47:00.613396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.613396Z"},"links":{"cited_paper":"/paper/2303.13495","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3805caf145d626da2d3c99d8f40d665c31a26ccbc029b63a6432a6409b2436d8","observation_id":"9dd73ac3-cf52-419b-98c5-bc0a72023aad","resolution":{"observed_at":"2026-08-06T10:47:00.613396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03900","last_updated":"2023-02-08T06:24:06Z","snapshot_observed_at":"2026-08-17T12:54:30.107462Z","submitted_at":"2023-02-08T06:24:06Z","title":"Zero-shot Generation of Coherent Storybook from Plain Text Story using Diffusion Models","version":1},"cited_work":{"arxiv_id":"2302.03900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03900","snapshot_observed_at":"2026-08-06T10:47:01.184628Z","title":"Zero-shot Generation of Coherent Storybook from Plain Text Story using Diffusion Models","venue":"cs.CV","work_id":"dab6c624-2520-441c-94cf-d43934de41e5","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.617823Z"},"links":{"cited_paper":"/paper/2302.03900","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:5b825ef4ef69b20064086beb10c850bad3a5ff98c40d4551e09310e322ab6102","observation_id":"8ab4e140-2421-4a4d-9470-9f7527e7e5e6","resolution":{"observed_at":"2026-08-06T10:47:01.191150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.860962Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":"4014039f-4d3f-451a-9918-dff9a7f84b88","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.622363Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:aa5dd8500007f2b765ca97220d090c7fc372e285aa2c8ed335590a3da5d9b7a7","observation_id":"8045024f-401d-4538-8902-da1d7a8e78a5","resolution":{"observed_at":"2026-08-06T10:47:01.868230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.840722Z","title":"Multi-Concept Customization of Text-to-Image Diffusion","venue":null,"work_id":"13ea4468-a20f-4f80-b042-b09f8956b803","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.626882Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:6f8f2916fabc30d0b0ad67e007520d13f44dd22ac324768d3e3292be457b7f13","observation_id":"3f25451f-be29-4d99-851b-4c9275a5110b","resolution":{"observed_at":"2026-08-06T10:47:01.845910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14720","last_updated":"2023-06-22T02:36:06Z","snapshot_observed_at":"2026-08-17T19:30:41.517390Z","submitted_at":"2023-05-24T04:51:04Z","title":"BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14720","snapshot_observed_at":"2026-08-06T10:47:00.631610Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.631610Z"},"links":{"cited_paper":"/paper/2305.14720","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:05c401649ab436f6b4403bb198b0be9afaf89778d29cdb4a89249c9a5f587a0f","observation_id":"9132284e-050c-475a-96b0-468086712568","resolution":{"observed_at":"2026-08-06T10:47:00.631610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.818291Z","title":"Intelligent grimm-open-ended visual storytelling via latent diffusion models","venue":null,"work_id":"918dfcc1-b288-43f0-84e3-4f2f4a308c30","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.636587Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:2264dd8a6da76f3b76d956197fad57b04ec9ad83165fc7b1ea0d9de7411b0455","observation_id":"e7251611-9c29-4688-998e-b213aec37d65","resolution":{"observed_at":"2026-08-06T10:47:01.824993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.796310Z","title":"Intelligent grimm - open-ended visual story- telling via latent diffusion models","venue":null,"work_id":"2574cfc2-d879-4d12-9222-28b0a2d6c8b5","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.641246Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:daca635ea24b7e1abfc0301f1faba0d1506cebb2052bcc99af8a992dfd481591","observation_id":"264ccd52-ab94-4a42-8e16-690223903349","resolution":{"observed_at":"2026-08-06T10:47:01.802044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.768529Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection, 2024","venue":null,"work_id":"4af5d2fc-efe2-4aee-95ba-df3a26b6e659","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.645517Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:c10d36856f276aa24953ef1a0f3a524f3e736d219420a47efa6e9e6ef3257b4c","observation_id":"2f0714e6-472f-49c8-a2d5-b60d2b50ed1a","resolution":{"observed_at":"2026-08-06T10:47:01.776334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-17T17:58:35.312920Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-08-06T10:47:00.650209Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.650209Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:1a4f1fd45c240537046fdc3294cd0a869b700db371b463aee77682cf79e3a807","observation_id":"f27955d2-1ff9-4e2d-a38a-b1021b68719d","resolution":{"observed_at":"2026-08-06T10:47:00.650209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.748286Z","title":"Summary of chatgpt-related research and per- spective towards the future of large language models","venue":null,"work_id":"241f8166-25ea-4d88-9a3f-8a016e2cd647","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.655132Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:15aa3c96baaa744efb797e120d317c451d2f376dc3bc7dacc616b671e7d0e46e","observation_id":"81b192b7-dec2-4647-af9d-92ae36fed566","resolution":{"observed_at":"2026-08-06T10:47:01.753452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.725375Z","title":"A threshold selection method from gray- level histograms","venue":null,"work_id":"1887b31e-0f47-4b1a-82b4-5be832cce00e","year":1979},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.659585Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:c5e26e7dbb2aa1c43fa446c79509465593b58aae9cc785585dcf380fcf5b5f4d","observation_id":"fe898dac-3265-46f3-ace2-620d0d3f4aa3","resolution":{"observed_at":"2026-08-06T10:47:01.730940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.701073Z","title":"Synthesizing coherent story with auto-regressive la- tent diffusion models","venue":null,"work_id":"db9c05a0-3b3c-42e1-a7e2-89032cd2993d","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.664058Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:b2040c1aca7e40081a8a6f617075bf8ba31db9026f912a34066b987bc9d4dea0","observation_id":"da5d112d-a56f-41f2-b7ce-5f8d647ad88a","resolution":{"observed_at":"2026-08-06T10:47:01.708130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.674999Z","title":"Localizing object-level shape variations with text-to-image diffusion models","venue":null,"work_id":"95b06784-25d9-44bb-b623-b631761325ec","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.668418Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:d7b587c67293c6fda235d956557b44bacdf094031ea479fd709b04747d1ac63d","observation_id":"a6560ec4-8a5c-48e8-a5a2-1eceac642c53","resolution":{"observed_at":"2026-08-06T10:47:01.681051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.654852Z","title":"Orthogonal adaptation for modular customization of diffusion models","venue":null,"work_id":"3d7c7cdd-8f4c-4db5-be20-b1f783300246","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.672722Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3f637829715e0efba3e612c37a88a0e6f2939466e207d7e1bb79143e1767412d","observation_id":"f0e30f7a-20a3-49c9-a3f4-f93d9e897865","resolution":{"observed_at":"2026-08-06T10:47:01.660916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T10:47:00.677299Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.677299Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:499fbbac42a8315794680e8cf4781287256a8d9ceaf16549851054e9943c2ac3","observation_id":"8fc822b2-2a81-418f-890d-e800765249d4","resolution":{"observed_at":"2026-08-06T10:47:00.677299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.638208Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"6b1da868-f9b9-4214-b639-fd2f422f60be","year":2021},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.681785Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:75126aa651ccab548e2c167e335b99a0431e388ae7b94b2fcf926f7e5ae9f2ca","observation_id":"fcbbc347-f342-4fb1-a131-003d70b4b2d6","resolution":{"observed_at":"2026-08-06T10:47:01.643135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02669","last_updated":"2023-12-17T22:04:14Z","snapshot_observed_at":"2026-08-16T15:10:59.708502Z","submitted_at":"2023-08-03T17:04:41Z","title":"ConceptLab: Creative Concept Generation using VLM-Guided Diffusion Prior Constraints","version":2},"cited_work":{"arxiv_id":"2308.02669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02669","snapshot_observed_at":"2026-08-06T10:47:01.092257Z","title":"ConceptLab: Creative Concept Generation using VLM-Guided Diffusion Prior Constraints","venue":"cs.CV","work_id":"142a0068-eb9f-469d-9d16-1873988bad52","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.686373Z"},"links":{"cited_paper":"/paper/2308.02669","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:755a44b0834587f93a51a86391863c099f67d042e70616100bb5a9ef056df20c","observation_id":"13ecdec0-3ffb-495c-99f8-0504733fb826","resolution":{"observed_at":"2026-08-06T10:47:01.098750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-06T10:47:00.691048Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.691048Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:4dbdffc78fa6f71f898488aee2ba771b8fe1b6db62641648d1cf9ad66c551862","observation_id":"b6356c3a-2c27-4333-8da4-7fa65de6a571","resolution":{"observed_at":"2026-08-06T10:47:00.691048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-15T21:30:31.645090Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-06T10:47:00.695807Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.695807Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3dfe0a63db3a78fad38de2aa499d79a4b0f08e65d7b8e0959e6850634ca13fb4","observation_id":"4d62dc61-9338-45a2-883d-7edcf1017cfe","resolution":{"observed_at":"2026-08-06T10:47:00.695807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.616914Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"2361ac2b-38c7-465a-95a8-afc827f00162","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.700353Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:785f60efd402023522fe23a312832644f16d7275559578ee50b08b0ac9c0da5f","observation_id":"c0f78d9a-a2e8-422b-8f13-af83bf97a927","resolution":{"observed_at":"2026-08-06T10:47:01.622221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.596210Z","title":"Instant- booth: Personalized text-to-image generation without test- time finetuning","venue":null,"work_id":"43234034-c3cb-4692-b0a3-5226e5f7ac7b","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.704766Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:ceee5d2163bb7ca773626d3af55cc48136fa15100b2edf2a2e0c6daef7b34b41","observation_id":"04d00cac-74fe-43b7-9df6-2dfc3d49f82c","resolution":{"observed_at":"2026-08-06T10:47:01.601868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07549","last_updated":"2023-12-06T12:16:23Z","snapshot_observed_at":"2026-08-16T14:37:11.086073Z","submitted_at":"2023-12-06T12:16:23Z","title":"Make-A-Storyboard: A General Framework for Storyboard with Disentangled and Merged Control","version":1},"cited_work":{"arxiv_id":"2312.07549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07549","snapshot_observed_at":"2026-08-06T10:47:01.031592Z","title":"Make-A-Storyboard: A General Framework for Storyboard with Disentangled and Merged Control","venue":"cs.CV","work_id":"cbe76ffe-e878-4e76-9cbc-c579be9836f4","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.709158Z"},"links":{"cited_paper":"/paper/2312.07549","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:663a987d68a48bcc4a1fcc098be54b374fe5c3233fd9fb2338d43b723456b7a9","observation_id":"963e731c-b1f4-4e35-b139-45dd52c818fe","resolution":{"observed_at":"2026-08-06T10:47:01.036647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03881","last_updated":"2023-12-06T17:58:25Z","snapshot_observed_at":"2026-08-18T10:49:04.404962Z","submitted_at":"2023-06-06T17:33:19Z","title":"Emergent Correspondence from Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03881","snapshot_observed_at":"2026-08-06T10:47:00.714088Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.714088Z"},"links":{"cited_paper":"/paper/2306.03881","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:d555f8dd6041f9c33f5bacf1de2b12b803b7568b5dc743f5978e859629b36caf","observation_id":"866eb49c-9464-4ecc-8513-26b1eb262209","resolution":{"observed_at":"2026-08-06T10:47:00.714088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07232","last_updated":"2024-11-12T07:49:39Z","snapshot_observed_at":"2026-08-19T08:16:25.352893Z","submitted_at":"2024-11-11T18:50:09Z","title":"Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07232","snapshot_observed_at":"2026-08-06T10:47:00.718928Z","title":"Add-it: Training-free object in- sertion in images with pretrained diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.718928Z"},"links":{"cited_paper":"/paper/2411.07232","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:fcea024924a599903cba26596b48efbca50d80fd7fbcd384e6e9289894f5c554","observation_id":"dd87f771-1aa3-43f6-be44-ec0f7206468c","resolution":{"observed_at":"2026-08-06T10:47:00.718928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:00.724877Z","title":"Training-free consis- tent text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.724877Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:0d3e6dd12fc8349f7abc5744776d2eec2d8fe4b283717f2e16fa0ec8dd97cef2","observation_id":"e5e32d00-8f2b-43c0-a51f-58dea7038eb0","resolution":{"observed_at":"2026-08-06T10:47:00.724877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10267","last_updated":"2024-10-28T03:05:40Z","snapshot_observed_at":"2026-08-17T21:48:35.609133Z","submitted_at":"2024-04-16T03:45:45Z","title":"OneActor: Consistent Character Generation via Cluster-Conditioned Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10267","snapshot_observed_at":"2026-08-06T10:47:00.729381Z","title":"Oneactor: Consistent character generation via cluster- conditioned guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.729381Z"},"links":{"cited_paper":"/paper/2404.10267","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:ec32974411ede3fc0c484b857cd8a34623b5b6f60e2c7c0c78a9294a5797da06","observation_id":"29a66fdf-c594-44a5-bebc-debb565025e9","resolution":{"observed_at":"2026-08-06T10:47:00.729381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04801","last_updated":"2024-09-07T11:52:48Z","snapshot_observed_at":"2026-08-16T13:20:33.640552Z","submitted_at":"2024-09-07T11:52:48Z","title":"SpotActor: Training-Free Layout-Controlled Consistent Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04801","snapshot_observed_at":"2026-08-06T10:47:00.733948Z","title":"Spotactor: Training-free layout- controlled consistent image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.733948Z"},"links":{"cited_paper":"/paper/2409.04801","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:3e421a00457bc3f2f8e6888bb3f988e8705614e120af01d88512fb1df0f1cfd5","observation_id":"3dfeb8c4-b9e4-43c9-ab35-240b706e871b","resolution":{"observed_at":"2026-08-06T10:47:00.733948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15677","last_updated":"2024-04-27T14:24:15Z","snapshot_observed_at":"2026-08-18T22:48:21.434266Z","submitted_at":"2024-04-24T06:15:31Z","title":"CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2404.15677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15677","snapshot_observed_at":"2026-08-06T10:47:00.931301Z","title":"CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models","venue":"cs.CV","work_id":"14e109da-5762-442e-8fb6-13cef06e035a","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.739136Z"},"links":{"cited_paper":"/paper/2404.15677","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:9672a6c8fea17e6082a36512b1e44cd5b52ba9f77b4ffd613b317726bcac4939","observation_id":"0ae00d22-5031-43d9-94e4-0f6e74db6597","resolution":{"observed_at":"2026-08-06T10:47:00.936339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.561064Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image gener- ation","venue":null,"work_id":"4085ef63-226b-4d0e-8196-e0e096b4a500","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.744144Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:0288fde8c610a1efcbe7ffb47fb030fdd9da447c51b43e0a59049635c75c03d3","observation_id":"f37fa062-1a6c-4f4c-88c0-2aab1af6fd86","resolution":{"observed_at":"2026-08-06T10:47:01.567203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:00.749222Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.749222Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:2aa0715d8001274d6d418195857d499ca30b87fdd325f7e110b2a05c85a299c1","observation_id":"bdeafe01-89f5-4e18-acd9-b30695a6cbd9","resolution":{"observed_at":"2026-08-06T10:47:00.749222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-21T20:42:58.713096Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-06T10:47:00.754074Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.754074Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:048775c5d86340f73dbefd692725ae66140c1e4c356f983f08ff19167d25ff57","observation_id":"f698b1de-2d72-4ff7-af37-a1589c6f4d32","resolution":{"observed_at":"2026-08-06T10:47:00.754074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T10:47:00.758937Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.758937Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:4efe02fe2d1bcfc21d7ccad231223534df58177177e3bba48c5957a028c89255","observation_id":"cd4285ba-af4d-4ae7-875e-5b3e471e9232","resolution":{"observed_at":"2026-08-06T10:47:00.758937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.525196Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"dc5ac753-c1e6-49dc-a5f1-a2d40605123f","year":2018},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.763414Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:455d0270ef1b36a3c0ac1b491681062d7fc4d531e196f6f9f4a9efeaddd3048d","observation_id":"8c04c3e6-40ab-41dc-9dc1-ebaf43e7b606","resolution":{"observed_at":"2026-08-06T10:47:01.534001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.505254Z","title":"Inversion-based Style Transfer with Diffusion Models","venue":null,"work_id":"ce2e3e02-92f5-4762-958e-19a99079a721","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.768283Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:8d75636e137cbccc16b74b63475d7e401c5aea86503aa89596016b1e8b7c910d","observation_id":"b7f0222d-27df-4943-8c72-d96e33326e93","resolution":{"observed_at":"2026-08-06T10:47:01.510829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09774","last_updated":"2025-02-24T14:02:08Z","snapshot_observed_at":"2026-08-23T12:27:24.398520Z","submitted_at":"2024-07-13T05:02:42Z","title":"ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09774","snapshot_observed_at":"2026-08-06T10:47:00.773062Z","title":"Contextualstory: Consistent visual storytelling with spatially-enhanced and storyline con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.773062Z"},"links":{"cited_paper":"/paper/2407.09774","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:428116d9046e1da8bf1f0897635b686f57f6ca62c3716d9d5d79de8fc3315743","observation_id":"a53f593e-5185-4b55-950f-900fe7ebcae4","resolution":{"observed_at":"2026-08-06T10:47:00.773062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:47:01.487973Z","title":"Storydiffusion: Consis- tent self-attention for long-range image and video genera- tion","venue":null,"work_id":"66c4da58-f2b1-41b0-94c5-5f752471d046","year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.777743Z"},"links":{"citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:9fe5dddb957de0c8d5759dbd9e88cbc3b4c33f6b2e6e70d31594cd7a7fba5545","observation_id":"4a11a7ff-9c4c-42d3-a04a-eb7f79ee8c6a","resolution":{"observed_at":"2026-08-06T10:47:01.492983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12576","last_updated":"2024-09-19T08:53:06Z","snapshot_observed_at":"2026-08-16T13:17:15.268174Z","submitted_at":"2024-09-19T08:53:06Z","title":"StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12576","snapshot_observed_at":"2026-08-06T10:47:00.781995Z","title":"Storymaker: Towards holistic consistent characters in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.781995Z"},"links":{"cited_paper":"/paper/2409.12576","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:1808a235ec874a094cd5248de38dd05a706e271d7b628d6d0925a6cd37b6922a","observation_id":"1b3a3a08-608c-4ac7-ab13-0da71aa48377","resolution":{"observed_at":"2026-08-06T10:47:00.781995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14153","last_updated":"2024-01-16T08:57:11Z","snapshot_observed_at":"2026-08-18T00:30:51.012623Z","submitted_at":"2023-06-25T07:40:39Z","title":"DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation using Limited Data","version":4},"cited_work":{"arxiv_id":"2306.14153","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.14153","snapshot_observed_at":"2026-08-06T10:47:00.830565Z","title":"DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation using Limited Data","venue":"cs.CV","work_id":"bb679a52-c903-4374-bf40-4196115a48a5","year":2023},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.786871Z"},"links":{"cited_paper":"/paper/2306.14153","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:5ed861edd5f469d697c99b735e5613b35c2e7b8a043cd6028282619ea5d42367","observation_id":"5a94c37b-7a28-40e7-816c-932cdd1478f0","resolution":{"observed_at":"2026-08-06T10:47:00.838402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:34:30.237318Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":6,"verified_fuzzy":20},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2508.03735."}