{"as_of":"2026-08-16T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b481c56ada17132a9d05ad3327139de0c96534e7f5552cb93e84111e7f1be2ac","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:07.941714Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:20:03.542467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T15:20:04.115181Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2501.03490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03490","snapshot_observed_at":"2026-08-10T15:20:04.115181Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","venue":"cs.CV","work_id":"e61761ce-efa0-4048-94b0-ffdc94620f57","year":2025},"citing_paper":{"arxiv_id":"2501.14316","last_updated":"2025-08-28T05:41:16Z","snapshot_observed_at":"2026-08-11T17:54:33.794441Z","submitted_at":"2025-01-24T08:21:35Z","title":"T-Stars-Poster: A Framework for Product-Centric Advertising Image Design","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:20:03.542467Z"},"links":{"cited_paper":"/paper/2501.03490","citing_paper":"/paper/2501.14316"},"observation_digest":"sha256:388480f8522b9b8e5da5c095419ae7b7c08aa70d9e37105bf48928ab2990faf7","observation_id":"a5415215-b39f-43aa-938a-8eaf33183f90","resolution":{"observed_at":"2026-08-10T15:20:04.119093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03490/citation-record","integrity":"/paper/2501.03490/integrity","json":"/paper/2501.03490/citation-record.json","paper":"/paper/2501.03490"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.633575Z","title":"Multi- concept customization of text-to-image diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.633575Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:69b4ad8f0d90db9865f401cf69e88d1c86cdf1bb7459371ab39ad55f2c594866","observation_id":"7de209d1-609b-4dea-8356-51dfb5a66030","resolution":{"observed_at":"2026-08-10T21:56:07.633575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.639905Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject- driven generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.639905Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9762d00f34ba7bacfae598683027f0e772ed8d18b261e97471cc2b319d602515","observation_id":"17f929f1-9a58-4e8c-919c-54d824721f9b","resolution":{"observed_at":"2026-08-10T21:56:07.639905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.829422Z","title":"Paint by example: Exemplar-based image editing with diffusion models,","venue":null,"work_id":"42e56929-87a2-4df4-8176-e686ccd0d8d1","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.647037Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:7b28e6f9d6edd64b9c5c729fad8fe8db1b7a32ac3b1bd94204a9365626c12e02","observation_id":"4387ae30-3531-4969-b106-557b6c313235","resolution":{"observed_at":"2026-08-10T21:56:08.834475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-10T21:56:07.653001Z","title":"An image is worth one word: Person- alizing text-to-image generation using textual inversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.653001Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:efa4f638a5b94990760776937867afd2a21fc4fe1216215e72cb3891e9c2c294","observation_id":"c24f6e30-f154-4fa9-815c-80f08f3ac860","resolution":{"observed_at":"2026-08-10T21:56:07.653001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.812953Z","title":"Blip-diffusion: Pre-trained subject representa- tion for controllable text-to-image generation and editing,","venue":null,"work_id":"d9b31faf-f15b-4163-866a-767c5102fd6a","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.659724Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a768c661498299f84a76f770b0a428e0fef3ec2b247d64c6eb263968b68069bb","observation_id":"b19cc6d9-f0fa-47b9-9a9b-8e490ee4cdcc","resolution":{"observed_at":"2026-08-10T21:56:08.818245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-13T10:53:07.664749Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T21:56:07.670882Z","title":"Anydoor: Zero-shot object-level image customization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.670882Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a297dde104cba1e7707e1fdc23689d41f765bb1868643047348c4859115e0c08","observation_id":"02e3a208-db6f-49db-b564-890f63a8da68","resolution":{"observed_at":"2026-08-10T21:56:07.670882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.797923Z","title":"Compositional gan: Learning image-conditional binary composition,","venue":null,"work_id":"c8464a5b-e509-4f2c-8b40-f303a93ddd28","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.676004Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:0e9c0c5176c66e6fff04f851e4867e74621eac2637b402987813005f1b641c32","observation_id":"507af8f7-d69f-4830-a34f-99ca62ea1037","resolution":{"observed_at":"2026-08-10T21:56:08.802754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.783029Z","title":"Painterly image har- monization using diffusion model,","venue":null,"work_id":"2d81bff7-0c45-4a0a-ac7a-9b6f488412b2","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.681275Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:36443db6fe32a3f6fcf7d36d6868717c49f6005763ccae5d8f4c958382116490","observation_id":"31f2056f-333a-4559-b1d9-94febbf47efc","resolution":{"observed_at":"2026-08-10T21:56:08.787864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.767569Z","title":"Learning object placement via dual-path graph completion,","venue":null,"work_id":"2eaa7d1e-73cd-41e3-873c-913a94353c16","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.686719Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:43d513e06b83b4df9e686e87f7e076de4c8d6ae9a74b1c700a6f8861958e5efd","observation_id":"e9c2d73b-59dc-447a-bd3a-e9a942e89f9f","resolution":{"observed_at":"2026-08-10T21:56:08.772525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.691768Z","title":"Bridging composite and real: towards end-to-end deep image matting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.691768Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:ed15d5c0f92dc491cfccbb060c7670cac229cf628abc26430e60d2ad78b25cd1","observation_id":"a716b768-b8b4-497f-b3b1-b66efba431bf","resolution":{"observed_at":"2026-08-10T21:56:07.691768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04499","last_updated":"2019-09-10T14:05:28Z","snapshot_observed_at":"2026-08-15T19:16:49.887888Z","submitted_at":"2019-09-10T14:05:28Z","title":"Countering Language Drift via Visual Grounding","version":1},"cited_work":{"arxiv_id":"1909.04499","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.04499","snapshot_observed_at":"2026-08-10T21:56:08.123335Z","title":"Countering Language Drift via Visual Grounding","venue":"cs.CL","work_id":"ab1e486a-9605-45f2-b3c1-28a3300c3526","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.696770Z"},"links":{"cited_paper":"/paper/1909.04499","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:80d7ea932e6e1400a2d41e611c3d1d2754e942a0a6481e68bb9f38c15cf9a1b9","observation_id":"14e339c8-fa07-4b9d-95c9-130deb36e274","resolution":{"observed_at":"2026-08-10T21:56:08.130646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.742111Z","title":"Countering language drift with seeded iterated learning,","venue":null,"work_id":"601cd473-306f-440b-8d7c-2034d72231d3","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.703288Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:344ca2421a97ed3ca96f0cb672d5fc7399b83e4d57629c283cfb12bb9611116b","observation_id":"6bbe005a-19ee-4fa3-b5cf-41c9e2f9ebca","resolution":{"observed_at":"2026-08-10T21:56:08.747215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.708296Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.708296Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:ce8949fecc31a15097a1b7734410cb22e8a1e2ee4a5da81893d5665a74078d4e","observation_id":"6b7ac6d6-1010-4df4-8417-42e1691559c8","resolution":{"observed_at":"2026-08-10T21:56:07.708296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.713063Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.713063Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:4db961013b00ef5126886efecf29dd658ce830f942eb390953cb387bb72cf9e8","observation_id":"49a87905-e020-45a4-95c1-eaaaeabf27af","resolution":{"observed_at":"2026-08-10T21:56:07.713063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.705989Z","title":"Mat: Mask- aware transformer for large hole image inpainting,","venue":null,"work_id":"76fb8588-b16e-4ef8-8ce9-bd541cbd84e3","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.717859Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:c58e3a44357bd08fe7d3b7af021bc7a9b5828a67821be22753e76249d7a1164a","observation_id":"524e131e-d475-4a08-9941-c64bb2cb9132","resolution":{"observed_at":"2026-08-10T21:56:08.711245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.722923Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.722923Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:16c521489142ec5ac7ceb6ad42a6d4c948dcddf776bd460897b42345d324b09d","observation_id":"6a5755f2-b5bb-480f-9df7-0db61c97e652","resolution":{"observed_at":"2026-08-10T21:56:07.722923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.679911Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided image inpainting,","venue":null,"work_id":"4a311f6a-8f5a-4a57-b398-1495cef8a5dd","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.728756Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:55104e356c4d7e249664a02835f0d14e1e0f491382599f6b0123aaab4926bb5f","observation_id":"23e6db53-1882-4dd0-8c6b-0ad0e9bc7514","resolution":{"observed_at":"2026-08-10T21:56:08.685209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.662993Z","title":"Layoutdm: Transformer-based diffusion model for layout generation,","venue":null,"work_id":"84b33be9-133a-4f9d-9461-093e7fc30392","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.733907Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:670a5081e292ef8fade3670723979abadb11043b4352a71ce98cc7c734b6bc29","observation_id":"fb86e0dd-974f-4589-b552-715c91a6dc6b","resolution":{"observed_at":"2026-08-10T21:56:08.668750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.738683Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.738683Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b4907a680d1437c42a14c29128c7435ae4888d9e6ead993c97c97b7cf991d488","observation_id":"471c75c9-50e5-4e5d-b815-fddb435862b1","resolution":{"observed_at":"2026-08-10T21:56:07.738683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.636762Z","title":"Gligen: Open-set grounded text-to-image generation,","venue":null,"work_id":"b1564f09-4344-4479-8a0c-a0d91526723d","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.743823Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:bb30394a7fd0d46f121646ba55b23448fa98bd918b1662f78f984d8c1f856939","observation_id":"d74b7532-9572-4ece-b580-a854ffbf74b2","resolution":{"observed_at":"2026-08-10T21:56:08.641753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.748652Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.748652Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:f70ae586dc3bda3a2c17d724943dd7cb7399b542d9b17405064f9edbb2a74e00","observation_id":"c8449c7b-b116-465d-aff1-a46eb26e1587","resolution":{"observed_at":"2026-08-10T21:56:07.748652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.610664Z","title":"Denoising diffusion probabilistic mod- els,","venue":null,"work_id":"0acfcb62-df22-468c-ac30-6b03b655eaff","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.753403Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:22c620f5b2ae1a9c028ae6a0b9404aba0122e537a709b683adc297e5ff5f25d2","observation_id":"905618ed-fd07-4b0f-9c79-11b8bae24e9b","resolution":{"observed_at":"2026-08-10T21:56:08.615458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.758124Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.758124Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9f7603b72684909658694ab344d1e1e4bb07f5599fb9b1a78e4eef2478aaad47","observation_id":"6a8f896d-01df-451a-9e26-ab41a15bb839","resolution":{"observed_at":"2026-08-10T21:56:07.758124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T21:56:07.762979Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.762979Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:88d3f26f8227a2e8912ccfc2d2a823cefaea40f9b196fcbe295e6a10f1fb2cdb","observation_id":"a737daf2-7c0a-48f6-80c9-01f69e097b18","resolution":{"observed_at":"2026-08-10T21:56:07.762979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.767836Z","title":"Improved denoising diffusion probabilis- tic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.767836Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:47eece22c498682a0f557e8e55c8af38fbabe5068c4c3a7fe8df919fbb4f4e79","observation_id":"20281740-7012-456b-8864-f5d92f1b7f75","resolution":{"observed_at":"2026-08-10T21:56:07.767836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.772378Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.772378Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9c4348aa7ec6e607fb599de948392a984e4f9a635972aaebaaff5815a7ae0bda","observation_id":"672f60f6-c064-46de-87e7-581021e4b8c0","resolution":{"observed_at":"2026-08-10T21:56:07.772378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.565153Z","title":"Fastdiff: A fast conditional diffusion model for high-quality speech synthesis,","venue":null,"work_id":"4dfaa6d2-406c-471d-9189-1236144342eb","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.777676Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:1d62c03e62695d903ef7b6197c4349f05cb0d9889dae9a406c97e61fe3a23905","observation_id":"f6e23de4-71ab-4a87-906f-b47e5a5a0789","resolution":{"observed_at":"2026-08-10T21:56:08.570135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03374","last_updated":"2024-02-27T02:45:34Z","snapshot_observed_at":"2026-08-13T11:48:46.737918Z","submitted_at":"2023-05-05T09:08:25Z","title":"DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03374","snapshot_observed_at":"2026-08-10T21:56:07.783337Z","title":"Disenbooth: Disentangled parameter-efficient tuning for subject-driven text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.783337Z"},"links":{"cited_paper":"/paper/2305.03374","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b485e5bc553fe2a6c12ac33e2620524b8ccd1529d61165272785198471ce96e5","observation_id":"db43b03c-ce0f-4eca-be57-513feed80894","resolution":{"observed_at":"2026-08-10T21:56:07.783337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-15T02:33:47.682205Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-10T21:56:07.788000Z","title":"Instantbooth: Personalized text-to-image generation without test-time finetuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.788000Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:3c4d3f61eaea0e70d00913ecdc532fc15e6f75bf94dda3b7ee11db74a2c3780b","observation_id":"41ca1734-141f-45b7-b44b-5363ace9288b","resolution":{"observed_at":"2026-08-10T21:56:07.788000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-14T13:38:46.864104Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-10T21:56:07.792817Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.792817Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b3101157e0a99b1520a124c319b5c35162086fa235386898f024519131e85f61","observation_id":"eb7becec-6434-4168-85d5-f61ee20bd04b","resolution":{"observed_at":"2026-08-10T21:56:07.792817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05125","last_updated":"2023-03-09T09:16:04Z","snapshot_observed_at":"2026-08-13T12:28:32.854815Z","submitted_at":"2023-03-09T09:16:04Z","title":"Cones: Concept Neurons in Diffusion Models for Customized Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05125","snapshot_observed_at":"2026-08-10T21:56:07.797790Z","title":"Cones: Concept neurons in diffusion models for customized generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.797790Z"},"links":{"cited_paper":"/paper/2303.05125","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b3462af0a494a482c24e2d5183b68baef7ac77f2f835aae91d7a5a8660dbb343","observation_id":"5a540e45-d1b3-413c-9718-35f3a44da445","resolution":{"observed_at":"2026-08-10T21:56:07.797790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-15T14:46:43.126675Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-08-10T21:56:07.802479Z","title":"p+: Ex- tended textual conditioning in text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.802479Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a8d930d5b61a1d72dde7cf8ce1ce581e6e6f096f6a7a9c4b0683eb4a98a8255a","observation_id":"a51f0e7c-536f-4ed4-a3a7-7291ad6b6244","resolution":{"observed_at":"2026-08-10T21:56:07.802479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.548984Z","title":"Subject-driven text-to-image generation via apprenticeship learning,","venue":null,"work_id":"4b31a275-2288-4434-84dd-2426ade0fb53","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.807275Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:1b512eaae7e28f5cfb369fc4c6fde76c10cd5957acc8f1985bac803684e0174d","observation_id":"1833d590-8ba1-46f7-92d1-83b871da6358","resolution":{"observed_at":"2026-08-10T21:56:08.554918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.533481Z","title":"A neural space- time representation for text-to-image personalization,","venue":null,"work_id":"4752ccd3-f157-4af7-af9a-4c280ed90be3","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.811927Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:13f43a8b673aae1f454760573dbb1490575c636f4515dec6d7042b9955021310","observation_id":"71147ebd-8197-4cb5-9d3e-b100c5583cb2","resolution":{"observed_at":"2026-08-10T21:56:08.538573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.517033Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text- to-image diffusion models,","venue":null,"work_id":"1cd1e9fe-ce8c-49c6-9c1c-995afa36306b","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.816846Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9b9cf9c6c937ae1cf9de6cbeba899c8475d18cb929c11e7f61e79c0bbb41ffe2","observation_id":"1e34b9bd-3109-4a0d-b227-425b753ac173","resolution":{"observed_at":"2026-08-10T21:56:08.522570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.501229Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"73d2ac1f-dae9-49f7-89a0-2fb2dabf5335","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.821350Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:537e470088210a1f15dddf2023dd692cb61151601aeee6b24a31b5e38cd9d2ea","observation_id":"dc75e2ed-f764-4084-ab1b-c571dc250eb8","resolution":{"observed_at":"2026-08-10T21:56:08.506195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.485517Z","title":"Layoutvae: Stochastic scene layout generation from a label set,","venue":null,"work_id":"77018a81-6e15-4cba-a922-44bbc3a3f67a","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.826603Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:89ac7e538d419df283109b465ed7ba4c24820a1af3fcd8041a1737d5da4f2073","observation_id":"d3029fa8-af2b-4838-8d09-dba17ef4600b","resolution":{"observed_at":"2026-08-10T21:56:08.491179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06767","last_updated":"2019-01-21T02:14:14Z","snapshot_observed_at":"2026-08-14T17:28:23.981389Z","submitted_at":"2019-01-21T02:14:14Z","title":"LayoutGAN: Generating Graphic Layouts with Wireframe Discriminators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06767","snapshot_observed_at":"2026-08-10T21:56:07.831159Z","title":"Layoutgan: Gen- erating graphic layouts with wireframe discriminators,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.831159Z"},"links":{"cited_paper":"/paper/1901.06767","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:09562badbccde54da818a4389a4434dd6a50aab5c8b2b783a7c0ac69e308cdb3","observation_id":"b636b276-a809-49de-976f-2b4c7705f923","resolution":{"observed_at":"2026-08-10T21:56:07.831159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.468167Z","title":"Attribute- conditioned layout gan for automatic graphic design,","venue":null,"work_id":"b5d03422-485d-4acb-91a5-8033fbbab722","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.836278Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:1b2352d9be90c43d483d5bf518de6a9dd377d22aee295996c367e678f075167d","observation_id":"620910f7-8767-4737-b0f4-79365c0e6527","resolution":{"observed_at":"2026-08-10T21:56:08.473776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.451874Z","title":"Variational transformer networks for layout generation,","venue":null,"work_id":"ea7b6416-1aa7-4f05-82c1-934f9199281c","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.840938Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:671e47e2cf02dc78b2e3b70839f6e70d804e1162a49f69b1cc71dcbd130b7fdd","observation_id":"d03f73e1-2851-4f39-b61c-994f95d1b94d","resolution":{"observed_at":"2026-08-10T21:56:08.456686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.436063Z","title":"Layouttransformer: Layout generation and completion with self-attention,","venue":null,"work_id":"e76fcf87-c237-43af-9d61-049193cb2810","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.845606Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:ad2972e129f703039e79b190cf5bb7545e6374746b8d787d27de1010eaa90fad","observation_id":"6a4d4e75-637d-4994-ab81-dd329740c68a","resolution":{"observed_at":"2026-08-10T21:56:08.440962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.420026Z","title":"Layout-bridging text-to-image synthesis,","venue":null,"work_id":"8c4e035f-740f-4b7b-9b58-04dc23c56c17","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.850454Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b3a8accb73d66ab24d9be643ef873fed99af6ab0e211c1dc4a4c7195e789b79c","observation_id":"165e288f-8e9b-4b86-a062-cb046cb86663","resolution":{"observed_at":"2026-08-10T21:56:08.424957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.403400Z","title":"Background layout generation and object knowledge transfer for text-to-image generation,","venue":null,"work_id":"0eab275a-dcac-44f5-a639-c5f81912346c","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.855108Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:ae43fe214e4f78946f996076e5e472ea1cc726dc1ce97f182e08baaf595cc258","observation_id":"d7401883-f39f-4c1e-8a5e-96734e564948","resolution":{"observed_at":"2026-08-10T21:56:08.409209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.387113Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation,","venue":null,"work_id":"df16056a-656a-4327-a2ac-83b6f94aa1dd","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.859843Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:b7bf06b75a53fa55deb4f9c84152d580bf45d6512ec033a52b453dd769e4c790","observation_id":"9931f9fa-61af-4d87-9f9f-0c0eb979fc16","resolution":{"observed_at":"2026-08-10T21:56:08.392739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-14T02:27:06.690299Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-10T21:56:07.864387Z","title":"Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.864387Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9d5fcd107dbc6159c28c03cba773747a7d19ed6ffa86bb07415dcfc5be63105c","observation_id":"7b6340ee-ecbf-40c5-b81c-4478cc4287a4","resolution":{"observed_at":"2026-08-10T21:56:07.864387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.869369Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.869369Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:171fbd6f411f02abf92275d286c562915da5d7d3e89efd10ca60b0e854bb5f5b","observation_id":"7d003791-b3c1-4253-8fc9-da2fe2edb2c4","resolution":{"observed_at":"2026-08-10T21:56:07.869369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.874882Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.874882Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:cab7c697810018cab5a85957de0cb98403688df237e479a2592ccfae1eb574bd","observation_id":"d207fd25-3c02-4a19-9887-ae07a066bc18","resolution":{"observed_at":"2026-08-10T21:56:07.874882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:56:07.879344Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.879344Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:545790161d10e79c4fdb84fea97acb13bd960e5d118114bb1071b21acbf6b804","observation_id":"4d82856c-e9c8-40d2-966f-a40923bc4b75","resolution":{"observed_at":"2026-08-10T21:56:07.879344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.349719Z","title":"On the spectral bias of neural networks,","venue":null,"work_id":"bc444745-d0ed-4006-9320-6ccef0c20622","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.884222Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:c665393102e3e7ec5c9636a3710246b314b5fb2edb447502ddd27df69bdd15a5","observation_id":"8dbcf914-8753-4682-a2b0-ce60a0760c9c","resolution":{"observed_at":"2026-08-10T21:56:08.355260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.888735Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.888735Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:59bb38435ccf8b036ae0090e25f5a6f033b5b8c2db05b79aa17ece320b81ee5e","observation_id":"9bdfc08e-75d4-4bc9-a085-296e04b46105","resolution":{"observed_at":"2026-08-10T21:56:07.888735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.893247Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.893247Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:d51de526617c94082ba52506e975540efbedd98a2fd36b94982c5e3d9df4720d","observation_id":"b87feada-dda5-4334-897c-874fa388a333","resolution":{"observed_at":"2026-08-10T21:56:07.893247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.314112Z","title":"Image synthesis from layout with locality-aware mask adaption,","venue":null,"work_id":"ab8f337b-eccd-4bac-bd33-ec3b6ed6f381","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.897901Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:dc78ffebdd35476940305971b94b959729cee3dbb797fa47f8ae8735c63176af","observation_id":"7f0254a8-e094-4942-9f6a-be9de7508741","resolution":{"observed_at":"2026-08-10T21:56:08.319659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.298638Z","title":"Constrained graphic layout generation via latent optimization,","venue":null,"work_id":"6ead44e1-ca23-406f-9afc-e10d6a998b46","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.902493Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:c54fccb3906d53bfe9eb2c6e103a1f114926ff143ad320b7ad7b5e1fdd6a9704","observation_id":"9882da85-2b29-4e33-9a35-433e3a9e9514","resolution":{"observed_at":"2026-08-10T21:56:08.303614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.907166Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.907166Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:5ba4f5b5dd834853914daf2af73e4f86685be55af973424b97ac6d6026260e82","observation_id":"78a56dc3-82e0-4f81-8ad1-d06fe206d62b","resolution":{"observed_at":"2026-08-10T21:56:07.907166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T21:56:07.911944Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.911944Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:0f29a59c1db40d60b3e0fc4f8b61d13660fc41279ef97feba388e9219b09104c","observation_id":"95fd7851-cac3-46ab-bf80-72079237903b","resolution":{"observed_at":"2026-08-10T21:56:07.911944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.270070Z","title":"Dataset diffusion: Diffusion-based synthetic data generation for pixel-level semantic seg- mentation,","venue":null,"work_id":"8c4c8c7b-00ca-43d0-83e1-71321766352d","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.917040Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a113cd4da44a7cef8d7f8ef4105c4b38d2ab1e2a56fe6ed7ae0cd702e2a6e529","observation_id":"42f614d4-7af6-476e-9d88-e9015524d7e0","resolution":{"observed_at":"2026-08-10T21:56:08.275701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.252792Z","title":"Image synthesis from reconfigurable layout and style,","venue":null,"work_id":"cb2d7e9c-3de3-4616-b51c-b231d5b74044","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.922661Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:4cffe26a777f3007e977aef275e56f18df28ac7b916192e0fd0919ba7cf27731","observation_id":"448d14bc-e049-4efd-a55e-890bde848c11","resolution":{"observed_at":"2026-08-10T21:56:08.258206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.236866Z","title":"Learning layout and style reconfigurable gans for controllable image synthesis,","venue":null,"work_id":"9408b9c2-2a49-41f9-80c3-6ced0ff660df","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.927361Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9e5cd9c742444b698fb24eb44800fb406e5e4377fd245dd92c9899ee5d418cd6","observation_id":"676c68f8-2e66-44e4-81ae-687cb1b368f7","resolution":{"observed_at":"2026-08-10T21:56:08.241887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.221281Z","title":"Object- centric image generation from layouts,","venue":null,"work_id":"e305e6fc-9649-4a4b-af7c-7c2f0b63815d","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.932105Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:7ff3b242483433b248530c2c6e1ec0706fe157764585905d43c3a5fc23d30c64","observation_id":"7c4f1469-648c-4298-9120-8c4cf455e1d9","resolution":{"observed_at":"2026-08-10T21:56:08.226246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.205504Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation,","venue":null,"work_id":"0a60e6d6-2e40-46f3-95fa-a2f1bc2f4e67","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.936977Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:7e6291c40893270c35e908161bdfa8781b7980227799f8c464dd359cb70a69d7","observation_id":"f93553b9-a59e-4f37-b703-6609b187936a","resolution":{"observed_at":"2026-08-10T21:56:08.210383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.190018Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold,","venue":null,"work_id":"85b5c393-5cb8-4116-a1e6-2b4df9037701","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.941714Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:34b08d83043ccfc82df049594278796acc4b9f2926bb97e6529351a496f9f25a","observation_id":"1e0a897d-406a-4e01-956f-840b489f5178","resolution":{"observed_at":"2026-08-10T21:56:08.195108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T07:38:21.068932Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2501.03490."}