{"as_of":"2026-08-18T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a4b242eb52526a3e06636448b042ef287210c32c47e8a68c201852dd69a9f2e","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:32:37.842627Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01104/citation-record","integrity":"/paper/2505.01104/integrity","json":"/paper/2505.01104/citation-record.json","paper":"/paper/2505.01104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.237337Z","title":"A-star: Test-time attention segregation and retention for text- to-image synthesis","venue":null,"work_id":"dce266bb-bbfe-4e5f-9f8e-078683ae14d0","year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.706662Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:b4426d02fb6c20d58d4c693572ac9022c7e0730c00a62eba022ab1572ea2ed8f","observation_id":"8940cc4c-a0d3-4fdb-b82b-557647e0941a","resolution":{"observed_at":"2026-08-16T04:32:38.241280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.225258Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"de4e5ae3-595a-41a9-9d7f-1215ee7a2619","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.711004Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:a739a5b9c42dd222e0e1ae4f942c79f6940df49e97e2760c35f6707ba25f5e22","observation_id":"40f90421-1480-41d0-9504-1c7d6e5060ac","resolution":{"observed_at":"2026-08-16T04:32:38.229245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00238","last_updated":"2025-04-16T21:59:00Z","snapshot_observed_at":"2026-08-16T13:03:57.804900Z","submitted_at":"2024-10-31T22:24:47Z","title":"Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00238","snapshot_observed_at":"2026-08-16T04:32:37.714812Z","title":"Understanding the limits of vision language mod- els through the lens of the binding problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.714812Z"},"links":{"cited_paper":"/paper/2411.00238","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:21867899ce05e86e58bcdf4154febd8a1e1ced90afacaba327ccf1069db3c5ec","observation_id":"e0b7dfa2-60d5-4e53-a0ce-66d4141327e5","resolution":{"observed_at":"2026-08-16T04:32:37.714812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.214147Z","title":"Attend-and-excite: Attention-based semantic guid- ance for text-to-image diffusion models","venue":null,"work_id":"c7de665c-5acc-4c6e-994c-a976cb7bb0e0","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.719179Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:fde57797254e0d49ceba69bd18fa120de7d21fa2fe112592aa320632265f35cf","observation_id":"d832ea00-2b9a-40b3-bde5-3b59a0b73948","resolution":{"observed_at":"2026-08-16T04:32:38.218008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.203129Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":"a8882a8b-8afa-4e8f-8a47-fbfdb368fb30","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.722873Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:dcf1a1151b1d4258bbb15a12c3204db2e7e0b1c4e24b2431fa2c2a3dd6cfd0e1","observation_id":"e8d53753-aff8-4545-a0f2-ca88086d14b7","resolution":{"observed_at":"2026-08-16T04:32:38.207142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.191700Z","title":"Aspects of the Theory of Syntax","venue":null,"work_id":"83d50ca6-5ca2-454c-954a-7e1c6e846824","year":2014},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.726658Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:24c144d67d37e3016130936a96d134e722de7846fdebae1aa53652a6f4254bf8","observation_id":"483d8d9b-178f-4a4d-91b9-4447ffee0951","resolution":{"observed_at":"2026-08-16T04:32:38.195479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16990","last_updated":"2024-03-25T17:52:07Z","snapshot_observed_at":"2026-08-18T09:12:30.383828Z","submitted_at":"2024-03-25T17:52:07Z","title":"Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16990","snapshot_observed_at":"2026-08-16T04:32:37.730423Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.730423Z"},"links":{"cited_paper":"/paper/2403.16990","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:6e05936629926824b432aaff74b8c684927f16f9c6b405124273579016b819cb","observation_id":"c9bb5b28-0d28-45dc-97ee-b863c4ba3028","resolution":{"observed_at":"2026-08-16T04:32:37.730423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.179845Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"c7c5a3fa-89d8-4750-8f38-ecdc6cb42761","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.734752Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:a9b35385a69fec19d7c8ca3eaaf10d43614110f3e5a8bf52519c6db6c9fcf379","observation_id":"78d82129-7784-4850-8598-c8833d7669c2","resolution":{"observed_at":"2026-08-16T04:32:38.183999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-18T16:04:10.548936Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-16T04:32:37.738628Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.738628Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:b4a9a9471e9bdc9394b54e1dc7d69c89ae4f66c56b2189705ec444e35f85d880","observation_id":"ce26b3e5-917a-49be-9563-a3ed55ade6c9","resolution":{"observed_at":"2026-08-16T04:32:37.738628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.742553Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.742553Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:1f189237af5e365a2c4e3e30aaf29d5552ed53210dd3f20327df3ca439f9f094","observation_id":"fb3419f3-042e-46b5-88bb-7ed76213febd","resolution":{"observed_at":"2026-08-16T04:32:37.742553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-16T04:32:37.746049Z","title":"An image is worth one word: Personalizing text-to-image genera- tion using textual inversion.arXiv preprint arXiv:2208.01618,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.746049Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:549f619abb2afb9c28db923fe815a9eef24aa511625aee8f52d19ed5918aa1e5","observation_id":"2217b315-d14f-4d4e-9673-840da372ba0e","resolution":{"observed_at":"2026-08-16T04:32:37.746049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.160491Z","title":"Encoder-based domain tuning for fast personalization of text-to-image models","venue":null,"work_id":"27121cee-94da-4bec-ada5-54636def020f","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.750541Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:f95f15c614aba17c9a01426c318c6b30a715d144437a2e61622cd1f1784e2faa","observation_id":"e15fdd26-5ed9-4661-bea6-fd7ccb957a32","resolution":{"observed_at":"2026-08-16T04:32:38.164486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.754114Z","title":"T2i-compbench: A comprehensive benchmark for open- world compositional text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.754114Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:09d77c36670dc570cc925e129c69b18d337ded8888d8007eabc3028bcf2c0a61","observation_id":"0a187407-5d32-4ea9-af7e-70fbac53d3d0","resolution":{"observed_at":"2026-08-16T04:32:37.754114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.142006Z","title":"Openclip, 2021","venue":null,"work_id":"fd081331-bfe9-4cbe-8692-93a7221a6da6","year":2021},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.758118Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:850e594f365783c6b2c370a19167d3169450fef3efaf3d29a2dd54f6beeeb1a2","observation_id":"9fdf6f7e-e5d1-4629-a575-6631904d0fbc","resolution":{"observed_at":"2026-08-16T04:32:38.145998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01000","last_updated":"2023-03-02T06:33:33Z","snapshot_observed_at":"2026-08-16T15:51:30.138353Z","submitted_at":"2023-03-02T06:33:33Z","title":"X&Fuse: Fusing Visual Information in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2303.01000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.01000","snapshot_observed_at":"2026-08-16T04:32:37.917871Z","title":"X&Fuse: Fusing Visual Information in Text-to-Image Generation","venue":"cs.CV","work_id":"b479316e-7d82-4cb3-b5c6-c9f6286e4cc2","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.762395Z"},"links":{"cited_paper":"/paper/2303.01000","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:977ebf76c3bba131461f2c519c38c13e905666e055b9c4bd224dabf3f5126986","observation_id":"fc05b7c0-5f3c-47e6-a232-3c9c525e0c48","resolution":{"observed_at":"2026-08-16T04:32:37.924264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.766454Z","title":"Multi-concept customization of text- to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.766454Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:04eafbc94914dc5c1b8eaf4a01d56033ccd28fa294a3633fa5026ef91aa7cf66","observation_id":"475967bc-e754-42a9-b8cb-ec6b382ef0a8","resolution":{"observed_at":"2026-08-16T04:32:37.766454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-08-16T16:07:11.903489Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-16T04:32:37.770193Z","title":"Does clip bind concepts? probing compositionality in large image models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.770193Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:6db90830b3833cd9f0b5f3a9c86b87d7932a509fc605404bd357bc9f33285d2e","observation_id":"27cc0c02-f10f-4d5c-9aac-99aecd694353","resolution":{"observed_at":"2026-08-16T04:32:37.770193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.123293Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"3e282454-9101-4f35-b033-f11efa3effbb","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.774118Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:5a9f30623df639ab1ca5381e8f8df82a2482f399b09c7e8e2863aa8e049a7496","observation_id":"eba71ed0-9fec-446b-8835-8cfc7bbad605","resolution":{"observed_at":"2026-08-16T04:32:38.127426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.110892Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"a32e22c9-a1fa-4027-964a-f8f309b98d0c","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.777873Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:2a4e48098799ed75ea83b93d7af052dd6401d7d42b5875db206521c038926705","observation_id":"246ef3c6-f8aa-415c-95d5-4755765e9599","resolution":{"observed_at":"2026-08-16T04:32:38.115080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.781845Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.781845Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:da18c6c8fe4b6af7f5f625fc6d41ee62a047c754793fdff54375f3b7842fee89","observation_id":"3effc674-5468-43ba-b74a-f63f11fe3166","resolution":{"observed_at":"2026-08-16T04:32:37.781845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08246","last_updated":"2024-05-14T00:22:06Z","snapshot_observed_at":"2026-08-16T13:52:58.724164Z","submitted_at":"2024-05-14T00:22:06Z","title":"Compositional Text-to-Image Generation with Dense Blob Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08246","snapshot_observed_at":"2026-08-16T04:32:37.785519Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.785519Z"},"links":{"cited_paper":"/paper/2405.08246","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:2589ecc6e10ed744537b1f42751b5bfce4ed505dd2fa68811f4d083015b136ae","observation_id":"bfdfa16b-5383-4db0-8855-825f07bbc94d","resolution":{"observed_at":"2026-08-16T04:32:37.785519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.089635Z","title":"Compositional abilities emerge multiplicatively: Ex- ploring diffusion models on a synthetic task","venue":null,"work_id":"9be15e22-29be-49f8-8f6a-e4bf95215939","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.789348Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:0948e8778e28307c77390e66e2038e4370099dcf85d4528831e154020ab1249a","observation_id":"593e2bfe-744e-49ab-b89f-0c891c861d1c","resolution":{"observed_at":"2026-08-16T04:32:38.095525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.792906Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.792906Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:9ccae3f1c21d44d3dd1f838f08d2a274c669153ab1432804f44e07b63fb90d84","observation_id":"60bc3daf-34c9-453c-99e6-2b33424ecf8a","resolution":{"observed_at":"2026-08-16T04:32:37.792906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.071182Z","title":"Linguistic binding in dif- fusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"90f18e1f-361b-4f21-8c37-0ed5ceed6307","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.796732Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:f0add7bed4f22333af8c962fa93d9180fe00172672bb4c10ea312a21499d35c0","observation_id":"80927ef5-59b0-4991-8688-f531ccadf660","resolution":{"observed_at":"2026-08-16T04:32:38.074977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.060070Z","title":"High-resolution image 9 synthesis with latent diffusion models","venue":null,"work_id":"ac1ebb3d-4e36-41ac-90f1-c6f722d6e89d","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.800192Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:bcddcf9359299d5f4797756d4ba5052ba10f54e0e825a4ef8522c1a334fc48bb","observation_id":"b666c1f3-c711-4fda-aaa9-29d28451b183","resolution":{"observed_at":"2026-08-16T04:32:38.063720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.803812Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven gen- eration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.803812Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:a8f6bd14c53cdcc5c7c7d6dd5567872fa231891ef9cb9c2f2655c532d20df0f2","observation_id":"a3633a04-5f50-4a87-b22d-b3a43a6cff16","resolution":{"observed_at":"2026-08-16T04:32:37.803812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.042745Z","title":"Collage diffusion","venue":null,"work_id":"3aaf96e2-1a7e-4d03-b9dd-171d5f1d0bd2","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.807535Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:fb9b79513a9d5dfef11a0bf12e2cff951867b9ac7f29d8288f154e2a1e9f181e","observation_id":"2180b882-8dc7-4b3e-8605-5a8c3baf1bd8","resolution":{"observed_at":"2026-08-16T04:32:38.046303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.811840Z","title":"In- stantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.811840Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:9a9dcd1534058b6bed90ad194a9112e77cb2ae012ebe5a7403899313191b8606","observation_id":"9673ca5c-6ba6-4a31-9fc1-0a6269c44097","resolution":{"observed_at":"2026-08-16T04:32:37.811840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05846","last_updated":"2024-10-21T09:38:03Z","snapshot_observed_at":"2026-08-17T01:47:42.984618Z","submitted_at":"2024-03-09T09:11:49Z","title":"Diffusion Lens: Interpreting Text Encoders in Text-to-Image Pipelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05846","snapshot_observed_at":"2026-08-16T04:32:37.815468Z","title":"Diffusion lens: Interpreting text encoders in text-to-image pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.815468Z"},"links":{"cited_paper":"/paper/2403.05846","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:ff9ca2ef2c17a2fee9060e8905ccca2b5924ac9447a8de0d7e11ef0389ea0d50","observation_id":"25ae24a8-e593-4180-a8e5-ab39b7a7fa8c","resolution":{"observed_at":"2026-08-16T04:32:37.815468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.819233Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.819233Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:458226b72551d33ac193b9a4244a34e6afc2b6c773e93a12a9ff2cf14417fd6e","observation_id":"44ce8b81-3659-4245-bbe4-75c113bf497e","resolution":{"observed_at":"2026-08-16T04:32:37.819233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.017913Z","title":"A feature-integration theory of attention","venue":null,"work_id":"5c27cda9-1265-4d46-b019-d5c21bf134a2","year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.822804Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:d71893241d5125c7f4e178d7688e7b73a87837ecfb5a4f92663645cb0cbc7794","observation_id":"8a9d1631-6d7b-4ee4-8f20-e7560056296a","resolution":{"observed_at":"2026-08-16T04:32:38.021965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.006027Z","title":"Compositional text-to-image synthesis with attention map control of diffusion models","venue":null,"work_id":"83ebd12f-2ee3-4958-a491-ccc12899a2ca","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.826762Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:4eb616ea29a323bc67d33aab4802ab321b7af5e44ae7bc6ae87953d144186f7a","observation_id":"a69a5f3f-ef06-47e8-84a7-f895f0dfb716","resolution":{"observed_at":"2026-08-16T04:32:38.010243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.993136Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":"e65acd80-4c02-433e-8ffa-51cec99c7dd0","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.830414Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:7e1a65d0a71846e0468a10a16525758a179a0b70a175761c185481c93609fdf5","observation_id":"3a6d0582-4e8f-4dc2-af51-7b889b5ccbcb","resolution":{"observed_at":"2026-08-16T04:32:37.997285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.834554Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.834554Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:3e3bd94b98d0aaa3e1187799fcdfd7adff997622564663d4d22a32c2b8c76022","observation_id":"77391611-dd56-4e12-8280-20fc649ef992","resolution":{"observed_at":"2026-08-16T04:32:37.834554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07844","last_updated":"2025-03-24T21:33:14Z","snapshot_observed_at":"2026-08-16T13:43:56.351260Z","submitted_at":"2024-06-12T03:21:34Z","title":"Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07844","snapshot_observed_at":"2026-08-16T04:32:37.838448Z","title":"Understanding and mitigating compositional issues in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.838448Z"},"links":{"cited_paper":"/paper/2406.07844","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:61828a2e2ed507585bfe410766c1c512c5e726066e7af948ef5762ab26f827bb","observation_id":"bd17cd23-2685-4f28-83f3-2800da2cfaaa","resolution":{"observed_at":"2026-08-16T04:32:37.838448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.974627Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"24a98dd7-3aa8-4d1e-87ea-6fd19c4b7ec3","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.842627Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:d917694f9a65c93886e97342d5934203e364313c84881bd41e3f5153abf1f6fc","observation_id":"dcafdac5-7e56-46c7-beb9-7d52ccc63e47","resolution":{"observed_at":"2026-08-16T04:32:37.978537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T16:05:40.339392Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.01104."}