{"as_of":"2026-08-13T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:146e9bfa5435b9b0b508e78baa8197b36639f08b37f5de4b045bc567be3f769b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:51:15.596331Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:51:15.430935Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T14:51:15.757667Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11594","snapshot_observed_at":"2026-08-11T14:51:15.757667Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","venue":"cs.CV","work_id":"f91c2d64-8893-4be7-a488-a15d9a912954","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.430935Z"},"links":{"cited_paper":"/paper/2412.11594","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:14769a2d9c249e5e27d3c95153a03a4d8dccbffd5416555b55d7b446b5737aa1","observation_id":"30534c57-2710-40a2-833c-fcb1919e1463","resolution":{"observed_at":"2026-08-11T14:51:15.761702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11594/citation-record","integrity":"/paper/2412.11594/integrity","json":"/paper/2412.11594/citation-record.json","paper":"/paper/2412.11594"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.185582Z","title":"W.; Hakim, B.; Morwood, M","venue":null,"work_id":"41b8270c-fabb-49c0-9a1b-f63d27565f4e","year":2014},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.408588Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:864beac79520b7c62100da41b984c7f12975532bb8f861b6dc39b2af1e93c34e","observation_id":"6501c49a-e8d2-44c9-a570-82de5977c362","resolution":{"observed_at":"2026-08-11T14:51:16.190011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-11T14:51:15.412959Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.412959Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:4e5ea601ed94a2f3584742b4fbc8e4b30c2e06b5ddb00751e7906ddcc95f684d","observation_id":"af7e4f86-924d-4c33-ab3c-7f7d34766110","resolution":{"observed_at":"2026-08-11T14:51:15.412959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.175088Z","title":null,"venue":null,"work_id":"a8480947-ed60-4644-b0a4-41d20182cf90","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.416613Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7d7d2a905b6c35baa0b34089641aaf8939b84cb0fa4a49124d3e7a538e06799e","observation_id":"396dc7ab-56db-4331-a699-781d2449c190","resolution":{"observed_at":"2026-08-11T14:51:16.178615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-11T14:51:15.419679Z","title":"T.; Rubinstein, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.419679Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0778b58b444bb3f2a9ca19d29884f2592ef7acdcb948f48f61c8478f92a59db1","observation_id":"e9a7f0b1-1c11-4b09-abcf-3b8193cec460","resolution":{"observed_at":"2026-08-11T14:51:15.419679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.164526Z","title":null,"venue":null,"work_id":"e4438475-6cb4-4c76-8e26-3f0a1e1df7d3","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.423472Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d1fa5d098fa2dc21fdc39ecd57376d85fa373f0f821353558d23e9501b33e77a","observation_id":"515b6406-57d4-4936-80f3-191486f6aa71","resolution":{"observed_at":"2026-08-11T14:51:16.168178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.153588Z","title":null,"venue":null,"work_id":"f45412e0-6333-4252-87a7-fa0a375c50de","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.427025Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:671aefb3aa7fdc336b762f30af91ccc39ea94a338219d11531a76349aea72f3b","observation_id":"fbdff1aa-ca22-4956-9d6b-c4a227d3dc06","resolution":{"observed_at":"2026-08-11T14:51:16.157285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11594","snapshot_observed_at":"2026-08-11T14:51:15.757667Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","venue":"cs.CV","work_id":"f91c2d64-8893-4be7-a488-a15d9a912954","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.430935Z"},"links":{"cited_paper":"/paper/2412.11594","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:14769a2d9c249e5e27d3c95153a03a4d8dccbffd5416555b55d7b446b5737aa1","observation_id":"30534c57-2710-40a2-833c-fcb1919e1463","resolution":{"observed_at":"2026-08-11T14:51:15.761702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.142282Z","title":null,"venue":null,"work_id":"18b105e3-026d-49fe-9dfd-1c8f0377fd09","year":2012},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.434454Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:89b04bcbcfbe26bcd7df86302fc1e578547a565bd5e733e1edfe86c38591ec22","observation_id":"284774e5-4acb-4407-87be-c75c806dc11f","resolution":{"observed_at":"2026-08-11T14:51:16.146204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-13T13:24:31.977894Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-11T14:51:15.438184Z","title":"E.; and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.438184Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:b53e097910d6214b5aff559a2bcd0a13c7c62165e0b5dc687443fc6dfefd6875","observation_id":"c41a8b0c-3a71-45f9-b24f-a06cb4353d31","resolution":{"observed_at":"2026-08-11T14:51:15.438184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.130646Z","title":null,"venue":null,"work_id":"1a81e595-2f66-41b9-a041-250ee75550cc","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.442361Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:5d4b612bbeb07c3c9d44a7b1c82d10f4265c8b328d2745f97438454f972f2822","observation_id":"aa1c793e-6fa1-41da-9e5d-43744b3bb72c","resolution":{"observed_at":"2026-08-11T14:51:16.134428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T14:51:15.445886Z","title":"H.; Chechik, G.; and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.445886Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:68e97190570d3ee009fa4ecb3f75200db9b049ed82824c9f9a5ad9b36bb33691","observation_id":"836f7ce0-c202-4bef-b046-8502661d586c","resolution":{"observed_at":"2026-08-11T14:51:15.445886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-08-13T05:48:12.806673Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-11T14:51:15.449573Z","title":"F.; Naseer, M.; Khan, S.; and Wonka, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.449573Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:f1091527bdf6c4843c3f8e4e19c1a3ce60ab50a3c97449273ccbe97e4d6f2b93","observation_id":"d96854fd-8f9c-43d7-9f1b-d4ff701966ba","resolution":{"observed_at":"2026-08-11T14:51:15.449573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.118845Z","title":null,"venue":null,"work_id":"2c10b892-b967-495b-aab8-99f27cc69261","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.453280Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:b0a2fc662bc9d6e9379f9a60bd343daf21ec1ddbb13551f27ea33be5e43d3635","observation_id":"6d427f27-9e70-41b6-83c8-d1f71e383d35","resolution":{"observed_at":"2026-08-11T14:51:16.122353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.108080Z","title":"H.; and Gombrich, E","venue":null,"work_id":"14d1024f-6707-42a1-997a-47f64753d64d","year":1995},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.456425Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:748b56d61019a866b26793a219bb7c0ea8942bc8cd84c217efdc474477edc3e1","observation_id":"217d6475-a6bf-4a20-ac40-689ccd694bf6","resolution":{"observed_at":"2026-08-11T14:51:16.111630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15773","last_updated":"2024-03-25T17:41:23Z","snapshot_observed_at":"2026-08-13T05:17:07.533272Z","submitted_at":"2023-11-27T12:48:33Z","title":"Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2311.15773","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15773","snapshot_observed_at":"2026-08-11T14:51:15.710293Z","title":"Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","venue":"cs.CV","work_id":"1e3e562a-fe9e-480e-9026-e32389076f2e","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.459790Z"},"links":{"cited_paper":"/paper/2311.15773","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:27677a5cea107154705a74c973c6d18c69b16aa045811236061925c22ff9e65e","observation_id":"8f458957-432f-4b41-b4d2-c7d09e67e2da","resolution":{"observed_at":"2026-08-11T14:51:15.715429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.096906Z","title":null,"venue":null,"work_id":"24e48c2e-0e6b-46f8-b355-69ad492695c0","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.463382Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d9534755a9eea52787eaf9b71c8d7b6fff89bd3049aaa2b19ded6a04245d16ea","observation_id":"5d8e46ac-b2be-412a-a182-fbd292c0e6b6","resolution":{"observed_at":"2026-08-11T14:51:16.100687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.087160Z","title":null,"venue":null,"work_id":"68d98fc0-f25f-4b95-8704-f64162e2e1ea","year":2017},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.466801Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:55e9e39285a4c4cccff58ca8db3927180b9d1fe415f47d1276001c82eba53d78","observation_id":"936a19d8-b1be-4c2f-92c7-ca2b932149dd","resolution":{"observed_at":"2026-08-11T14:51:16.090348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.077292Z","title":"L.; Standish, C","venue":null,"work_id":"ccd0194f-d83e-4ffe-8a35-3f2ea78f1f28","year":2018},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.470277Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:e9cd183050e485e8604c3c55792ac312abd208614e5658e3c40518456245ffb8","observation_id":"c0c1916a-6973-4825-b65c-08311308a6f4","resolution":{"observed_at":"2026-08-11T14:51:16.080483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.473618Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.473618Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:3e93f36148bdae485072405ac25863edd6207e53d77aec6297cb045f64baf312","observation_id":"3dc2271e-cc5e-4a82-acc9-a9b3e6090a22","resolution":{"observed_at":"2026-08-11T14:51:15.473618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.060014Z","title":null,"venue":null,"work_id":"02d01f28-14e3-4919-9e6c-918e9747437e","year":2017},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.477054Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0268650ab408aaf80562866f6c620abaf977164a54c9a1fc8646959b9a215c74","observation_id":"e05a6004-9ae4-4a51-ad97-ebaf4b4410ff","resolution":{"observed_at":"2026-08-11T14:51:16.063640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.048856Z","title":null,"venue":null,"work_id":"75eaf5a0-b284-4570-99ed-e31883902a86","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.480471Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:eb800f52d2cbf0ca251833060564282daf16e7a23daeff4e7bc5c78295798853","observation_id":"baeee8bf-8a56-46ab-8172-c54a82ef96f3","resolution":{"observed_at":"2026-08-11T14:51:16.052614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.037356Z","title":null,"venue":null,"work_id":"10b844ad-8186-465f-a3c1-b1544cb2903e","year":1990},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.484047Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0900f82332e5bb7560e3754219b307e83c7d3bfcbe6ea4ba2fd5cf6fda62b13a","observation_id":"bf942c76-7e44-40eb-a82d-173cb5e01d38","resolution":{"observed_at":"2026-08-11T14:51:16.041182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.024948Z","title":null,"venue":null,"work_id":"d3228af9-d538-4bb7-b344-509abd8ca965","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.487455Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:52cec43d60895c7c58003bf5ccea35c3155797dca1326a203f62c5ad7384d8c7","observation_id":"83179605-8352-42b8-a5d8-96fe4c68e378","resolution":{"observed_at":"2026-08-11T14:51:16.028880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.010397Z","title":"C.; Lo, W.-Y.; et al","venue":null,"work_id":"951a4d2c-aec4-4869-aa8f-008e99a63273","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.490931Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:2ba0bfee0fd5f50847ab5e72e637028ee01afb80e421f78a757aa06d267a0832","observation_id":"1364bf83-059e-43bc-a338-58d3edb8eb19","resolution":{"observed_at":"2026-08-11T14:51:16.016928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-11T14:51:15.494215Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.494215Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:5870b983c3d91976bac7df3d5b07b23ea1c64ef5963d678d8e52e950340845f7","observation_id":"03851f7f-1225-4769-be3c-622ad30f4e7b","resolution":{"observed_at":"2026-08-11T14:51:15.494215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.497761Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.497761Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0e9283756ef7789e9b4b41076ca0eefb86bb17ccf134af7ccd77b9e3d069c404","observation_id":"4802dfcf-a476-4f8d-9fd5-7b8e0546a748","resolution":{"observed_at":"2026-08-11T14:51:15.497761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10864","last_updated":"2024-07-14T16:20:19Z","snapshot_observed_at":"2026-08-13T10:51:51.092702Z","submitted_at":"2023-07-20T13:33:28Z","title":"Divide & Bind Your Attention for Improved Generative Semantic Nursing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10864","snapshot_observed_at":"2026-08-11T14:51:15.500721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.500721Z"},"links":{"cited_paper":"/paper/2307.10864","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:2e5345d3111ea4c1c048d5cf869ab17e14239939f42f982e036631b582f2daaf","observation_id":"a9b04699-272e-49d7-9c45-3cede000b4db","resolution":{"observed_at":"2026-08-11T14:51:15.500721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.993050Z","title":null,"venue":null,"work_id":"75db64cf-4a70-4026-8ae8-3cd7eaee6f88","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.503790Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7ea33e17e2e864d45794133569089701101697874e06a5df447c6af66a647824","observation_id":"d1b38f52-99ca-4d0c-a7d5-94fdbc5ff421","resolution":{"observed_at":"2026-08-11T14:51:15.996733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.506737Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.506737Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:4ca427b3f352cf772bbc5ddc1a9725990a70889255b0410d24ed5dc77c34a5dd","observation_id":"00af3b40-bd33-43ec-9f8f-cce5878973bb","resolution":{"observed_at":"2026-08-11T14:51:15.506737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T14:51:15.509727Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.509727Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:eaddb8f1ff5b5e7b4bb629e1c4ffbaa0ddba34100b55f5b994a884835970ddb3","observation_id":"3b20889e-79f7-4332-a2d6-c18ce369ece5","resolution":{"observed_at":"2026-08-11T14:51:15.509727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.975673Z","title":null,"venue":null,"work_id":"70e83e8e-8a32-4e78-a6b7-8d653cbc426d","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.513056Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c8be149c53a361f831608456deafcc09423dc17bea7c29b32c20e418d81582e3","observation_id":"35fe23fe-8bfc-4043-961d-5e19385ffa06","resolution":{"observed_at":"2026-08-11T14:51:15.979371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.516184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.516184Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:5bdca9094dc852b5b09277ae66c0f6b796f8fe890fc6434e99ec02d3b1c07e0f","observation_id":"46b083b9-e0da-489f-ad05-e1f016c1aeb4","resolution":{"observed_at":"2026-08-11T14:51:15.516184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11410","last_updated":"2024-05-19T01:40:39Z","snapshot_observed_at":"2026-08-13T10:50:38.428912Z","submitted_at":"2023-07-21T08:09:47Z","title":"Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11410","snapshot_observed_at":"2026-08-11T14:51:15.519454Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.519454Z"},"links":{"cited_paper":"/paper/2307.11410","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ba8100830f04b3f7bb04e45a81503d73aac14f4d7cac37f17eb4b5a352ec8cdd","observation_id":"c8aa5d54-9945-4a17-bfdf-34937f4ff3e5","resolution":{"observed_at":"2026-08-11T14:51:15.519454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13807","last_updated":"2022-05-02T19:35:26Z","snapshot_observed_at":"2026-08-13T15:55:42.019361Z","submitted_at":"2022-04-25T18:54:39Z","title":"A very preliminary analysis of DALL-E 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.13807","snapshot_observed_at":"2026-08-11T14:51:15.522995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.522995Z"},"links":{"cited_paper":"/paper/2204.13807","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:bbbaf7a469bb4857660e90704fd7bcab25ef5287845e35205d0a6bffb1e6dc48","observation_id":"a9cb248e-d201-489c-b0fa-0a47c53f5caa","resolution":{"observed_at":"2026-08-11T14:51:15.522995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.956947Z","title":null,"venue":null,"work_id":"9b2ef79e-b223-4ef4-99f7-80bf29dd7108","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.526751Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:6d223b21dc027827064c6a0ea51f08af49212b486a1c518374b6d4941361f255","observation_id":"828ffa88-b5fd-4107-adba-03b8a1e2c2c9","resolution":{"observed_at":"2026-08-11T14:51:15.960594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T14:51:15.530136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.530136Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7e35a221a7248428c65c0d91f38d6fdd0163e1881b1e7814eda7da97de949de0","observation_id":"7b2aa5dd-5eb2-4961-abb6-b859f40fed6e","resolution":{"observed_at":"2026-08-11T14:51:15.530136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.946023Z","title":null,"venue":null,"work_id":"776a4ac2-83fb-4db0-9f0c-e3465f0fa305","year":1975},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.533557Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c9273cfb7a86e242ac0dd8708b9f1ecba096146acf22f7727dbcc2d06932d4f6","observation_id":"dee63f72-95d9-4b18-80ad-e38b08b54d68","resolution":{"observed_at":"2026-08-11T14:51:15.949779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.934988Z","title":null,"venue":null,"work_id":"4358f0dd-8b59-4d11-b03f-b2b6308c551d","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.537005Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:db37e6761bd60b7a71fceba15f1d912983c2eda8ddc5ef00a08fd904c0d2a041","observation_id":"f973ac3d-be34-485a-8d42-76d45d9b16f2","resolution":{"observed_at":"2026-08-11T14:51:15.938841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.923257Z","title":null,"venue":null,"work_id":"e8cbeb25-410d-4f63-81fe-b9eec69ee7e9","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.540495Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ae299049b506700d0b9f126d7ee7e514545a93500b943bc786475f681476ed9e","observation_id":"4584c432-e774-4c11-ae47-0ce2b2f90b9d","resolution":{"observed_at":"2026-08-11T14:51:15.927534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.911922Z","title":"C.; Xiong, C.; Savarese, S.; et al","venue":null,"work_id":"4da1655e-5f3f-43ec-83cc-14b5ce97628b","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.543912Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:f56f4b341f462e8942c089a32b88774eb74c668e956e47e23d45b2b8e26b494f","observation_id":"d208749b-864e-46ac-ae2a-7888dd8d757c","resolution":{"observed_at":"2026-08-11T14:51:15.915637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.547610Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.547610Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d6727dcf5c8fad1e1809e8ceebcde833616872d80fc16298911c09ecd1d80fd9","observation_id":"3cd2e581-d604-4eb8-ac5e-44df9591eda3","resolution":{"observed_at":"2026-08-11T14:51:15.547610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.551256Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.551256Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:9db906040b7fc7870ac48d53992b121b1cb900162d7a8289d5f154ec363ae3e4","observation_id":"ad49562b-4847-4065-85a0-516092d6190a","resolution":{"observed_at":"2026-08-11T14:51:15.551256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.886949Z","title":null,"venue":null,"work_id":"31e3c12a-4777-4b50-a5e1-8ed0574bedf8","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.555106Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7178dfb9830e6be0fed3c7744da4a49e4360d7b384a22ccb727493b2c3bcc9eb","observation_id":"d73691ad-713f-4692-8266-135043bd887f","resolution":{"observed_at":"2026-08-11T14:51:15.890772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.558513Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.558513Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:fce39dab7c84801066bf92b25ed45e627adf3f69cb354b287ed7993a247c8f5f","observation_id":"3ee3948e-4c24-496b-8ebd-721efa1d2433","resolution":{"observed_at":"2026-08-11T14:51:15.558513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.868972Z","title":"L.; Ghasemipour, K.; Gontijo Lopes, R.; Karagol Ayan, B.; Salimans, T.; et al","venue":null,"work_id":"a5a5bd01-a8ca-4940-aa18-57bdbad0d30f","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.561914Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:9d04ab62070243b33c62dcd0740b0b3a64d4c42592415931b728a1a9f385ba3d","observation_id":"81d2677a-c2f0-4c9b-b454-e1facb036b15","resolution":{"observed_at":"2026-08-11T14:51:15.873085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.857639Z","title":null,"venue":null,"work_id":"784f1059-90ed-40eb-88a4-a113a6b30a80","year":2016},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.565367Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:dcfb0f989c7711a08e40f25fdb39ff6bfcd74a00a773e561142698d2c4a8707a","observation_id":"3a893d18-e972-4840-adbb-56a37e1c83ed","resolution":{"observed_at":"2026-08-11T14:51:15.861681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.846591Z","title":"S.; Girdhar, R.; and Misra, I","venue":null,"work_id":"4329eb9a-45b6-4d75-9733-66541f8679ab","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.568629Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:8e1ba4dfcc87a9a93d54db86da04d77bcdf389df831b117c19531afdfc1168bf","observation_id":"18d7bbd1-9c03-4206-929b-01cd35f6bca2","resolution":{"observed_at":"2026-08-11T14:51:15.850150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03626","last_updated":"2024-06-23T23:50:59Z","snapshot_observed_at":"2026-08-13T05:08:36.070418Z","submitted_at":"2023-12-06T17:13:15Z","title":"TokenCompose: Text-to-Image Diffusion with Token-level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03626","snapshot_observed_at":"2026-08-11T14:51:15.571912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.571912Z"},"links":{"cited_paper":"/paper/2312.03626","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c7a33989c42e794acce55662c92c57e3795b5f5b5266c80ad441f3afe01fc6e6","observation_id":"ce9dcb89-5ff2-4b11-a31e-8bf65f0de5a0","resolution":{"observed_at":"2026-08-11T14:51:15.571912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-13T13:55:48.903163Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-11T14:51:15.575356Z","title":"J.; Montoya, E.; Munechika, D.; Yang, H.; Hoover, B.; and Chau, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.575356Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:88ca15895e40dc4f088c25ab3fdb1caa226fe13c56ad52d25bd2e66ae6a2ea58","observation_id":"735e1a98-4700-4eb6-be95-53ac064bf1d8","resolution":{"observed_at":"2026-08-11T14:51:15.575356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.835422Z","title":null,"venue":null,"work_id":"92a2e0ce-cacb-4106-855b-ea563c130624","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.579045Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c0b7ef353b0896f23217a1e56a98e9a00a8b434c64fd55fc021f28b3d2e05911","observation_id":"4ae22e46-f35e-485c-a3ca-740a7e743da4","resolution":{"observed_at":"2026-08-11T14:51:15.839271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.824333Z","title":null,"venue":null,"work_id":"6523211e-cc24-450a-b5ae-1005ca31b9b4","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.582291Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0dd6879b82ba17795417209663700cecf441572d81391a26711eb85b2ba9650d","observation_id":"f7cd7d8e-8f67-49fd-b415-7ba19d65f64d","resolution":{"observed_at":"2026-08-11T14:51:15.827907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.813637Z","title":null,"venue":null,"work_id":"8f8eff07-23c5-4641-8a13-5c16a7a0d588","year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.585775Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d62988462016bf4b9f0d222317ca5c9c42e59d35e0baf03304e963e465529308","observation_id":"98e79a70-7899-41de-a084-d26d8a456090","resolution":{"observed_at":"2026-08-11T14:51:15.817356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.802632Z","title":null,"venue":null,"work_id":"dc26b34a-8ae5-40dc-a035-589438747021","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.589307Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:17e0fc0c080f5e3e0124a639973b6f8d42db9f62e5e52ece5e48cba0c67942e4","observation_id":"59381152-cc03-4550-9470-364efd62e213","resolution":{"observed_at":"2026-08-11T14:51:15.806629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.592595Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.592595Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:a11eb47e04b65b000d0970dfc79fc0833e16e90f9f47a86830ac30bd7d00cc33","observation_id":"63470f95-b156-4131-a34b-3843557e95a7","resolution":{"observed_at":"2026-08-11T14:51:15.592595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.596331Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.596331Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:24409ad77b04534c2a6cfa1ab98682423bdbe8dcb9bdb501499572506ebfd274","observation_id":"4982370e-a596-425a-9e08-f15996809b40","resolution":{"observed_at":"2026-08-11T14:51:15.596331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:59:31.356426Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2412.11594."}