{"as_of":"2026-08-08T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dc3ba233efb323aac00a8720fb8dd255f7836d3efb3378abb888708230fd55a","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:43.911455Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:16:15.417396Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24086","snapshot_observed_at":"2026-08-01T11:16:15.417396Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19947","last_updated":"2026-07-22T09:25:03Z","snapshot_observed_at":"2026-08-07T18:27:32.072726Z","submitted_at":"2026-07-22T09:25:03Z","title":"ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:15.417396Z"},"links":{"cited_paper":"/paper/2505.24086","citing_paper":"/paper/2607.19947"},"observation_digest":"sha256:f71a35092be85a7b9fd7446bff69f811b2790cca1a558fa5e19a5e0af6051b03","observation_id":"9d0ec3a6-6afb-46bf-b667-df7690f4e7f1","resolution":{"observed_at":"2026-08-01T11:16:15.417396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24086/citation-record","integrity":"/paper/2505.24086/integrity","json":"/paper/2505.24086/citation-record.json","paper":"/paper/2505.24086"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:55.230868Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":"1839eadc-bdf5-479c-9201-be166d7b7144","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:37.801554Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:96e55fa97ae3fbf8e87c9c11e2f06be45405bdd61cfe13f1dfcfadfa11979f0b","observation_id":"68034726-4471-4350-aad7-d7c6f1822622","resolution":{"observed_at":"2026-08-07T12:40:55.301072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:55.075070Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"255b4496-8e38-4710-b898-b1860e83aacc","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:37.869669Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:0f7a231195f34a7a2e30d532cb1065abbce25ff084a992d406b1886c05e2e597","observation_id":"d65f9b27-2103-4f6f-b3ba-06fa55ef3167","resolution":{"observed_at":"2026-08-07T12:40:55.139993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.941843Z","title":null,"venue":null,"work_id":"2570d095-fbc6-492d-9aa0-f3ab8af4bcd5","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.006453Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:714d3944bb454a5642eb347b2207b7e4bf4e0f7d0cc1eafdd1314c3a59165838","observation_id":"2fe8b983-02f5-4a09-97d5-7740bf2b1bd8","resolution":{"observed_at":"2026-08-07T12:40:54.988323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.822315Z","title":"Attend-and-excite: Attention- based semantic guidance for text-to-image diffusion models","venue":null,"work_id":"62407c22-cfcf-4bb1-b4a7-9db5d556eaf8","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.092173Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:8290a2ad36c0e25d00aaf170cb27186b18484d24d97cc906616387019994715b","observation_id":"9e0a6caa-924d-4a55-a9c8-cbc59e04f795","resolution":{"observed_at":"2026-08-07T12:40:54.866774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:40:38.168638Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.168638Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:4cbb977fad83c1b520df8e1ac06f89e092ad8948625a28258d59a511a1747fbb","observation_id":"82645f13-2595-4ba5-a36c-c94a66c9e467","resolution":{"observed_at":"2026-08-07T12:40:38.168638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-07T04:04:46.527670Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-07T12:40:38.255445Z","title":"Pixart-δ: Fast and controllable image generation with latent consistency models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.255445Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:9ef8ee8db74c6e5916db98bdb96ea907df23b0cfae7957e8ef724af5679b3610","observation_id":"e8d545d1-2154-4d08-9c91-575a54f48171","resolution":{"observed_at":"2026-08-07T12:40:38.255445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.706192Z","title":"Geodiffu- sion: Text-prompted geometric control for object detection data generation","venue":null,"work_id":"beb6daaa-e21f-4610-9362-b3c4a0a73b36","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.311344Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:18c43ccc3e3a94e7a36c93265401642a6c41c3f23623312d758a87c9fe9fcb45","observation_id":"d8a42d9a-d423-4b2b-b618-02fdcec5bcfd","resolution":{"observed_at":"2026-08-07T12:40:54.755805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.566845Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"bc6635fb-a10b-4f7f-9979-4136b51b297b","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.414953Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:63e4974741224ed5f009746f986014c86ac37756265249dbc6fb47d3f98b8b56","observation_id":"03e782f1-16fc-4cf4-b772-dd8bb9d97b77","resolution":{"observed_at":"2026-08-07T12:40:54.629326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.426492Z","title":"Zero- shot spatial layout conditioning for text-to-image diffusion models","venue":null,"work_id":"8d40bf38-b9dc-45a7-a2f7-1068111b77d9","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.533038Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:cf907216138acf09c0c44c2f96ace73a96b3f05af5521aa7676c5c2c21158e64","observation_id":"bb12308a-1d61-482d-a749-87f6c1db5053","resolution":{"observed_at":"2026-08-07T12:40:54.486001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.288189Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":"1272400b-c193-4b1b-b3a9-3de331a309c7","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.617567Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:fb1224a09ad55e8aade6a9efae124f5acac9db33698aca1df88cb83f1ce5fcc8","observation_id":"3524a5a9-7d50-48f3-838b-05cc82ebca69","resolution":{"observed_at":"2026-08-07T12:40:54.345123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.165702Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"8c2a97fe-2a07-4cdf-964a-df382766f2e9","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.686095Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:f4de74cdd170037ffc7d561a7c7d4ac7257c21db7648a20c73876a3f14b4d0e5","observation_id":"ae2da873-ff73-42d9-85e4-873a3369bb00","resolution":{"observed_at":"2026-08-07T12:40:54.217967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:54.039597Z","title":"Training-free structured diffusion guidance for composi- tional text-to-image synthesis","venue":null,"work_id":"984543e6-65be-485a-bfc6-175db45a0966","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.767766Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:ff4a9c93accaa4eec891b2f380e873062ae861ec3d7f30d390f50b8292bd1c7b","observation_id":"9ab53847-8850-439d-936c-d7cef9d70aef","resolution":{"observed_at":"2026-08-07T12:40:54.097333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.905801Z","title":"LayoutGPT: Compositional visual planning and generation with large language models","venue":null,"work_id":"4e8170e6-3535-49a7-8d05-ebe2597afc14","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.852740Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:2d36786a9f038d03251fa2720f7607fbf97da7c443d8f39b97dadf240adea495","observation_id":"c8810c1a-9ad1-49db-9238-692404325b30","resolution":{"observed_at":"2026-08-07T12:40:53.964857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.772287Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following","venue":null,"work_id":"5b756517-0a75-4344-85cf-d84e723f70f4","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:38.921080Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:739f476b2c0f7f720248bc1af4b84410c46f21b2d8b06da807ab592e6db35a2f","observation_id":"cfcf495c-18e3-4899-a27f-63be290a5669","resolution":{"observed_at":"2026-08-07T12:40:53.834924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.662816Z","title":"LLM blueprint: Enabling text-to-image generation with complex and detailed prompts","venue":null,"work_id":"d59bb61a-b0db-4ccb-9e06-c9e88bc7d05a","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.040929Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:7f4cb0f1c0c16eb882e7a23a2cb91464d642faf87b57d301b9dbe8c065cf9d86","observation_id":"5b6ee1ba-681d-4c96-ae36-5af591acf226","resolution":{"observed_at":"2026-08-07T12:40:53.693981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.629292Z","title":"Check locate rectify: A training-free layout calibration system for text-to-image generation","venue":null,"work_id":"e9705001-b8bd-4d83-ab45-0a6b31496ba4","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.117436Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:f41d87751bde298bf7f447a22215329befe7e1c1c52826f0c60c04295d0c5b12","observation_id":"8b04f8f2-ce58-445f-bafd-901fe0d963bb","resolution":{"observed_at":"2026-08-07T12:40:53.637076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.418362Z","title":"Initno: Boosting text-to- image diffusion models via initial noise optimization","venue":null,"work_id":"a4da3a3e-b0d4-499b-9c5e-f41941214579","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.222820Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:e3d15436635c5a3c84c9b5ff642250ebfdfa694f21b9992dd0d6bcef5fb57fad","observation_id":"073ef09a-ef2b-4c7c-9ece-839bd938d4d4","resolution":{"observed_at":"2026-08-07T12:40:53.514090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:53.206151Z","title":"Prompt-to- prompt image editing with cross-attention control","venue":null,"work_id":"6edcc9e2-267b-4e0a-bbf4-ee8631c2c7ee","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.348295Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:05b23db6c7eb6759df20ccdbfef115e8df90868750303a5b58d0a6dd3378545c","observation_id":"feeb7962-c199-4ec0-9d31-ebb3c5dda594","resolution":{"observed_at":"2026-08-07T12:40:53.301968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:52.979067Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":"3b7d776f-055b-4514-8faa-8c35f1d57e16","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.469217Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:960b389c69c790b942525b47f558527bb2b51b5b5412088eb00e68045eb04159","observation_id":"c0904039-b6e5-4394-8e7a-fcd9ec691359","resolution":{"observed_at":"2026-08-07T12:40:53.062615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:51.603034Z","title":"Scenecraft: An LLM agent for synthesizing 3D scenes as blender code","venue":null,"work_id":"6dc4f01c-a391-46bb-b882-99b2b22a10a1","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.656385Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:7e5995c584e8f7f304f4f406f1f04b17289b826b74b154e4972197ff085d4974","observation_id":"1cb87800-740d-4912-890c-a33e8bd08eec","resolution":{"observed_at":"2026-08-07T12:40:51.925212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:51.345583Z","title":"T2I-compBench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"467c6766-18c9-49ab-a10d-52cec4eb5d5b","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.797724Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:e0482b5a9668f5d521fdc2f8509ae80705a01e5f13c831bf0f2dde0ab1d07ea3","observation_id":"aeeaf5e4-eb27-45cc-b376-493722bce878","resolution":{"observed_at":"2026-08-07T12:40:51.414312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:51.169995Z","title":"Composite diffusion: whole >= sparts","venue":null,"work_id":"02b5f0b5-28df-4746-931a-5ddf88c61eae","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:39.928683Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:1e72fbc7cb2a97137067ca3164abc8ba4b99884c37da7e6160ac33952a685810","observation_id":"a55476c4-6ae5-4b06-9459-a1b86d00acf6","resolution":{"observed_at":"2026-08-07T12:40:51.269413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:51.010542Z","title":"Comat: Aligning text-to-image diffusion model with image-to-text concept matching","venue":null,"work_id":"4eef3dd8-feb8-448c-9b5b-86be0fbd75c3","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.097222Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:e1850620196810caf88df7de05b614c2551611d6608729c7b57f598d2a7c52a6","observation_id":"4b10b3e0-3272-4f8d-a446-7fe0b630b896","resolution":{"observed_at":"2026-08-07T12:40:51.070049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.860032Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"7e50d197-b988-4b77-8d0a-d65759997973","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.218722Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:aa19635d7f06f542cfaaa7410cc0c059beb061dd7b2d0ef93f0b105e69a38cee","observation_id":"fd1a662e-6a5f-47b7-b041-03df0f8bfaa2","resolution":{"observed_at":"2026-08-07T12:40:50.911265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.715984Z","title":"Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":"437150dd-8e91-4173-bc9d-fdda904d62df","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.350719Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:ebbe891ec011822c9c0dcecb383b908f872c9fba49bf50174267377725c45b6b","observation_id":"0f4e2416-22ac-4bbc-857c-6dabb588e666","resolution":{"observed_at":"2026-08-07T12:40:50.768601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.556728Z","title":"Grounded language- image pre-training","venue":null,"work_id":"f9ae214a-0b59-460e-b775-a4dfa78f705d","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.490585Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:b2bc9a663aea86112c90ae965813a0d910ccd58c9fca54172ea2e2e2353dc5cd","observation_id":"5dd47991-9fb0-4f94-901b-4cd2cdb0476f","resolution":{"observed_at":"2026-08-07T12:40:50.621728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.424571Z","title":"Con- trolnet ++: Improving conditional controls with efficient consistency feedback","venue":null,"work_id":"f5293185-7a56-481f-a568-395cd62e7b2b","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.596658Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:dd29bb660fb62e205379cc98a473fef45b15e869a5781082b5c98bc2eb63bb87","observation_id":"eb1259b7-ee4c-4208-8e00-4c0ca3320c11","resolution":{"observed_at":"2026-08-07T12:40:50.472757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12741","last_updated":"2024-05-24T15:56:58Z","snapshot_observed_at":"2026-07-06T17:32:40.646483Z","submitted_at":"2024-02-20T06:14:30Z","title":"MuLan: Multimodal-LLM Agent for Progressive and Interactive Multi-Object Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12741","snapshot_observed_at":"2026-08-07T12:40:40.732637Z","title":"Mulan: Multimodal-llm agent for progressive multi-object diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.732637Z"},"links":{"cited_paper":"/paper/2402.12741","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:e037d9ad6eb63815047a0fde4ecde80a8e3ec650428419c241af9ea3b31f1dcc","observation_id":"ec9a4110-170b-4211-8556-9f4143272d4d","resolution":{"observed_at":"2026-08-07T12:40:40.732637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.252295Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"e6751917-f83c-47f3-b3b6-fe3c8cc744c1","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.812200Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:40d420ac320ddd4aba4c530482ab648516b05b99656e9de812b41bcb9f7d35ec","observation_id":"090d0a2d-d84e-49fc-b931-5fe882b57807","resolution":{"observed_at":"2026-08-07T12:40:50.323841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.086481Z","title":"Divide & bind your attention for improved generative semantic nursing","venue":null,"work_id":"2c607b6b-c0d9-4de0-b122-2aafc141d6e8","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.891312Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:dd18672debbfb03e10d0b0d10617812b63b53ed871001be901559e57de33828b","observation_id":"91127520-46ee-4e50-8bae-810e866f3470","resolution":{"observed_at":"2026-08-07T12:40:50.166925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.883424Z","title":"LLM-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"9810ef62-85c5-4e8e-8c5c-121a0b76aaf2","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:40.984218Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:be51b6e18311ad83a6095d14a5ea23b45add8ec5a0eee08d28e8a8bcc21e76dc","observation_id":"4bcfab99-14c1-4f27-801b-f066b46fb840","resolution":{"observed_at":"2026-08-07T12:40:49.971259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.682940Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model","venue":null,"work_id":"36f131d2-60f8-4702-876a-7e55ae484299","year":2025},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.081311Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:24cf35bd8e8542a308f69e5f94ccec6d47b83e772911506765c4a5784163fd86","observation_id":"b3124cde-9f18-4e14-9323-af69588c0bfe","resolution":{"observed_at":"2026-08-07T12:40:49.762586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T12:40:41.167945Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.167945Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:189d579363a9cd97994c7f9b366798bcc1c2fc1a9e6e664481d4368106d6aa2c","observation_id":"cda6dede-d791-452b-acd4-6a87897e5872","resolution":{"observed_at":"2026-08-07T12:40:41.167945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.528956Z","title":"Tenenbaum","venue":null,"work_id":"c45cb3a6-3878-4bdd-ae23-77fba61c1ec8","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.213668Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:ea1253888ac13d6570a6417c3c29d49ef81e345a00a2d82082510f45f654b66f","observation_id":"4ae7f091-c2e0-4375-98bd-22b4d38eb5f2","resolution":{"observed_at":"2026-08-07T12:40:49.608495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-07T12:40:41.259858Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.259858Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:a64ea49a37277ddb04e9bf432d32049b8c0ae52205be1fd26004987dd28f1dae","observation_id":"5d873c44-0a0c-418d-9be5-3de11d1abd74","resolution":{"observed_at":"2026-08-07T12:40:41.259858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.382965Z","title":"Lewis, Thomas Leung, and W","venue":null,"work_id":"43ff3e34-94a9-48e2-8d65-0903d6f91ac3","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.312373Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:cad3ce506b4499e8a3e41373b4e58d5da4cf3b7c78f4f3386c517a54efcff5d8","observation_id":"54ee920c-4c19-4870-a971-6ff7ecdd67ca","resolution":{"observed_at":"2026-08-07T12:40:49.459542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.152083Z","title":"Guided image synthesis via initial image editing in diffusion model","venue":null,"work_id":"ec769bca-0f34-4f3c-b276-661979e36ece","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.418479Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:942ff42fa73ed9de2b8aae926c338866928935793d087c170f9351468fcd2ecb","observation_id":"f2ea001d-33a2-41c3-9c70-cb7d0220e42c","resolution":{"observed_at":"2026-08-07T12:40:49.245890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.941590Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":"0fbb9d2e-bede-4c05-a3bd-0778e5d42290","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.513574Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:7c3b22b41f9384ae98be8921aad06afac90b8abd294e444782c8198371184c88","observation_id":"fc9cffb3-16eb-413f-abba-34326dd0e712","resolution":{"observed_at":"2026-08-07T12:40:49.040833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.691844Z","title":"Conform: Contrast is all you need for high-fidelity text-to-image diffusion models","venue":null,"work_id":"34f81b48-276d-4589-a040-267fb52ee8cc","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.602652Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:887fec26e271f5e5b902be170f9f2cc3433738d30a8b5ae4e77f8d2ef84d89f2","observation_id":"b520383a-2eca-4b8e-b914-2f4979d48d7f","resolution":{"observed_at":"2026-08-07T12:40:48.825268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.389835Z","title":"T2i- adapter: learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"88182fe8-60a7-47d0-8961-e190b1336dab","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.659963Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:353422e2a73aafe54c2e637fd50150d747daafc9d27421440e9c4b1a4922617d","observation_id":"4b2a59a2-0603-4c06-a242-5f2440224df4","resolution":{"observed_at":"2026-08-07T12:40:48.504919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.117132Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":"39bb2d76-eac6-4936-ac52-bba610ac3a3f","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.749052Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:c4f9e48b378978a44086adfdf06520240080d486799d6d45ff1228ce4de29470","observation_id":"5346d8ee-738a-4304-a71a-7236b7ea0c2c","resolution":{"observed_at":"2026-08-07T12:40:48.228431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:47.800172Z","title":null,"venue":null,"work_id":"8d2ddfbe-6b38-4f1d-b17a-211caa04b726","year":2025},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.802344Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:a5fec783b5ac3e0ab8f0330e802ab70468936a817df93d53e38fca28311ea1f9","observation_id":"5e26fe21-89d2-4974-a2a0-4082312db42d","resolution":{"observed_at":"2026-08-07T12:40:47.957166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00637","last_updated":"2023-09-29T05:32:46Z","snapshot_observed_at":"2026-07-30T14:57:15.227452Z","submitted_at":"2023-06-01T13:00:53Z","title":"Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00637","snapshot_observed_at":"2026-08-07T12:40:41.897086Z","title":"Richter, Christopher J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.897086Z"},"links":{"cited_paper":"/paper/2306.00637","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:71d54bbdfefa04393e97ff5c562d37781f43c1ad8b7aa34efefdf5e3df8ae3ef","observation_id":"7694aea0-5f20-4b06-8e30-35e8c34c01b1","resolution":{"observed_at":"2026-08-07T12:40:41.897086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:47.530589Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":"e435c376-1496-4d52-a65d-dbea062453e0","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:41.942719Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:393b2eb48a14779fbbbda1e089bf93abb858b592290bfd7c570f1a02c5ff5cff","observation_id":"a3b029a5-a63a-4501-af56-afb9b898e22a","resolution":{"observed_at":"2026-08-07T12:40:47.649704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T12:40:42.047049Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.047049Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:4b214d709656b1c9dc6e4ed12c53740be7d792e185963a8f738351903bb6a316","observation_id":"9a0a080e-06e1-40fe-85dc-c1284452c161","resolution":{"observed_at":"2026-08-07T12:40:42.047049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:47.271837Z","title":"Linguistic binding in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"e290cba6-2ab5-47d4-83d5-d742643d5b68","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.116848Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:bec1af47d9a9489eee77356e6eac3e3d307de79f5e40d43f8e73ed9f2bb658eb","observation_id":"d24b75a6-9660-4d02-b172-94c5b5c60009","resolution":{"observed_at":"2026-08-07T12:40:47.378735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:47.007038Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"f769d0d1-28fa-4a49-b632-6cfa54235798","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.202578Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:e4e7fed67f6a1fc6107367f80386facb930cd7d7400bd60e260d034f5f05654d","observation_id":"15550932-8ce3-4d19-8d49-61e0c2fb4ff3","resolution":{"observed_at":"2026-08-07T12:40:47.132162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:42.277942Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.277942Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:c2f6ce1695d83f257d55c6f5ad1c7bdda10ae5b55d0783cd76535abbe10f017a","observation_id":"1508fafa-7444-46c0-9dea-4efdedfc431f","resolution":{"observed_at":"2026-08-07T12:40:42.277942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13766","last_updated":"2024-04-21T20:26:46Z","snapshot_observed_at":"2026-07-06T18:03:24.368197Z","submitted_at":"2024-04-21T20:26:46Z","title":"Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13766","snapshot_observed_at":"2026-08-07T12:40:42.368674Z","title":"Object-attribute binding in text-to-image generation: Evaluation and control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.368674Z"},"links":{"cited_paper":"/paper/2404.13766","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:f302ea668697b49004dfccebe5ac2b79f658d617c3c9e2a1c5a676fa0a848f5a","observation_id":"48a49361-eed4-41aa-a44f-78257cbe5173","resolution":{"observed_at":"2026-08-07T12:40:42.368674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.790175Z","title":"Plug-and-play diffusion features for text- driven image-to-image translation","venue":null,"work_id":"43d11a49-95ec-452c-8eb2-554115f6fbce","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.426137Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:8073b7df170e878a5c92d359537d6e045e50b9fb8f8b98b319dc6830ffe045e0","observation_id":"bbe460ca-581f-4b72-9e21-c97c5bcedc58","resolution":{"observed_at":"2026-08-07T12:40:46.871086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.606949Z","title":"Dynamic prompt learning: Addressing cross-attention leakage for text-based image editing","venue":null,"work_id":"be54ba7c-3de9-41ce-b267-077333882bbc","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.498501Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:a8c670f3d1aae688a511d9c23b106fcdec3c12415ad50a39dacd62371ebca2dc","observation_id":"e5526c10-5e3a-49af-8f5f-0d868ad041e6","resolution":{"observed_at":"2026-08-07T12:40:46.660889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.455759Z","title":"Instancediffusion: Instance-level control for image generation","venue":null,"work_id":"501d441a-270b-4d90-a940-0cdaaab9499d","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.580342Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:a69a10ab4b814066aa4df05396445869d2b3416634fc6878c56255a398bd3b5c","observation_id":"f1437715-5091-4ac5-b53a-a5d2a255be9f","resolution":{"observed_at":"2026-08-07T12:40:46.512652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.260367Z","title":"Tokencompose: Text-to-image diffusion with token-level supervision","venue":null,"work_id":"9a598b56-2e77-491d-a96e-6ef1e3858028","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.656050Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:9c9e742f643c11896ad0c9584b306e4589c2535edb1cf6f9cc790b4571d63728","observation_id":"9bf73694-fcb1-473d-8d23-a2231c0c542d","resolution":{"observed_at":"2026-08-07T12:40:46.345106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.087828Z","title":"Hyperseg: Towards universal visual segmentation with large language model, 2024","venue":null,"work_id":"797bf55f-d86a-4bee-9834-4a7a259b8d8b","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.745695Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:8f961d04fc12b2786c41e9e391957c50a05d4c68c290ace55d69dea4906f3455","observation_id":"95bb1b3f-68c5-4e46-98de-8d2086cdb67a","resolution":{"observed_at":"2026-08-07T12:40:46.169244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.906003Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"5987a4ef-5145-44ea-aeaa-8f88c34ae305","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.828176Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:2190929ac546444d8c621e5c3f05d033138324046275d0d85b723b85e869951c","observation_id":"eff1c02e-1391-4259-8801-1602411f0ff4","resolution":{"observed_at":"2026-08-07T12:40:45.987633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.730171Z","title":"Mastering text- to-image diffusion: Recaptioning, planning, and generating with multimodal LLMs","venue":null,"work_id":"5b2d00d4-f81b-4066-8edf-68b31d9571ba","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:42.913181Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:da5713d6f6b10f54ee41fc6e91f00ba42634e757b7aa4c1a67325fe11f3111ac","observation_id":"374eb3bb-b39a-457a-8b90-59c588d812ac","resolution":{"observed_at":"2026-08-07T12:40:45.814538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.525172Z","title":"Reco: Region-controlled text-to-image generation","venue":null,"work_id":"8235ad9b-0906-48d1-a2f9-e117572b4a7c","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.008111Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:f507f9641426050380dceec13cdbfd0487c5cbd9600e3087708a6c6819d42403","observation_id":"bd3743a4-2b16-476d-9a03-5e1bfb2180dd","resolution":{"observed_at":"2026-08-07T12:40:45.624952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-07-06T20:01:59.108032Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-08-07T12:40:43.078627Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.078627Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:d6f45d527b76c614594b9e2ca3f98e9b5d72df0d68c19180c74c840b9a3e21c9","observation_id":"089b1b99-3426-4303-bf25-1d647def6bff","resolution":{"observed_at":"2026-08-07T12:40:43.078627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:43.180221Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.180221Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:6664dd38f625be6b54471e3f7aa2a363d0f7ff8c02ab8995408ea5f0c4311066","observation_id":"97c859d1-4ae9-4a4a-8d04-666c22f844dd","resolution":{"observed_at":"2026-08-07T12:40:43.180221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.313076Z","title":"Realcompo: Balancing realism and compositionality improves text- to-image diffusion models","venue":null,"work_id":"2ffeabc1-4f55-4e10-a919-3603e4a5c0ca","year":2024},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.320114Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:82d738057c74a9d3071ad04f922c10216f3393826acbfa5bd9acc254345d63de","observation_id":"b2eeaa32-5763-4148-b041-41d873250f9b","resolution":{"observed_at":"2026-08-07T12:40:45.411207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08768","last_updated":"2024-08-22T06:27:48Z","snapshot_observed_at":"2026-08-03T10:31:11.518812Z","submitted_at":"2023-12-14T09:31:33Z","title":"Local Conditional Controlling for Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2312.08768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08768","snapshot_observed_at":"2026-08-07T12:40:44.102674Z","title":"Local Conditional Controlling for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"671a1e02-40d2-4321-9053-a1a1d50c0de7","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.483636Z"},"links":{"cited_paper":"/paper/2312.08768","citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:cfcdba24500e2d6611d41fbb3c306df0f1938bb4515d0ea3c88c0bf042a2a3f2","observation_id":"d867baac-bc1d-4e27-a2d7-b86e219854ba","resolution":{"observed_at":"2026-08-07T12:40:44.171990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.098639Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"e7a9c742-f016-48f8-8799-bee4f682f6d4","year":2023},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.635422Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:c277b8470c95ded24f8691c4ee0b44f605ac4b5da0a799fdd60ca73c2542a09e","observation_id":"e91162e9-cf7f-4726-a32a-aa1b5c773ab5","resolution":{"observed_at":"2026-08-07T12:40:45.189048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:44.904333Z","title":"= 3 𝑡!= 0.79 𝑁!","venue":null,"work_id":"1d404438-584d-4098-b6fd-74d933e3b44e","year":2022},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.782344Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:38f924fc84435ef3bdac53d752be2564a9e25870dc1aecbf1890505982a791b3","observation_id":"a07c59b3-44df-40fe-8f52-4bb13522d67f","resolution":{"observed_at":"2026-08-07T12:40:44.990025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:44.672890Z","title":"Objects:","venue":null,"work_id":"a1e603bb-66d9-4f49-8776-6b39093b0e46","year":null},"citing_paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:43.911455Z"},"links":{"citing_paper":"/paper/2505.24086"},"observation_digest":"sha256:2e85064688d00a1d11929cbc29eeee3353d7179248d934c60f33ad579ca1482b","observation_id":"679378dc-3b58-4263-8d02-6352eaf7678d","resolution":{"observed_at":"2026-08-07T12:40:44.794805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24086","last_updated":"2025-05-30T00:13:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:37:35.607733Z","submitted_at":"2025-05-30T00:13:36Z","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2505.24086."}