{"as_of":"2026-08-07T12:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fbf95b45eb4bbd7b8173ed99eb263e649302e9240d70ed3818f4722dfb58038","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:58:05.169969Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:52:01.768852Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19939","snapshot_observed_at":"2026-08-02T09:52:01.768852Z","title":"Llmcontrol: Grounded control of text-to-image diffusion-based synthesis with multimodal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22655","last_updated":"2026-06-26T17:29:32Z","snapshot_observed_at":"2026-08-07T03:00:52.298676Z","submitted_at":"2026-06-26T17:29:32Z","title":"EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:01.768852Z"},"links":{"cited_paper":"/paper/2507.19939","citing_paper":"/paper/2607.22655"},"observation_digest":"sha256:603d669bb578ffcc2969125a0476b960ce36ea9dfd17b1bcebe81584a52c3b7e","observation_id":"136e6b49-1b99-449a-b459-2878b5d978c5","resolution":{"observed_at":"2026-08-02T09:52:01.768852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.19939/citation-record","integrity":"/paper/2507.19939/integrity","json":"/paper/2507.19939/citation-record.json","paper":"/paper/2507.19939"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.334339Z","title":"Diffit: Diffusion vision transformers for im- age generation","venue":null,"work_id":"f2d84235-d663-4b33-aa25-adb70aa2e565","year":2025},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.946931Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:8874dd005160ffa759f247586357cf055685c9a850b2fae13f30099a38a956e2","observation_id":"07e9ae56-ddf1-447f-bc70-bf34fe543b0c","resolution":{"observed_at":"2026-08-06T13:58:06.338680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.321759Z","title":"Sketch-guided text-to-image diffusion models","venue":null,"work_id":"318c3ce3-07aa-440d-8d38-5d351390f49e","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.951193Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:637dfba4afbd78a84ea5afc35b151cc5a799807042f9046a97553d3d4dcf4b97","observation_id":"ba332586-5090-4171-81ed-75404db30ac2","resolution":{"observed_at":"2026-08-06T13:58:06.325945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T13:58:04.955410Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.955410Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:37716c57aa82036e176a8953fd41cfabfe67c1cb379e3ec623dea0e874e45084","observation_id":"c4ee3e43-266a-467d-95fb-8239ef05321d","resolution":{"observed_at":"2026-08-06T13:58:04.955410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-06T13:58:04.959610Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.959610Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:c3f3f5af3f68adf13536f3e6bb0c5dabe45e98e2b9b44b06fb9428cf8900a9d5","observation_id":"b7146fd2-fcec-4aa8-aa49-eb21f363e065","resolution":{"observed_at":"2026-08-06T13:58:04.959610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:58:04.964121Z","title":"Llama: open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.964121Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:4f20acb7abc453be081705cc184142ba340f5739e30c83a8e06a472b6101e9dc","observation_id":"117e6c31-1f2c-4410-bbcc-8af04532b50f","resolution":{"observed_at":"2026-08-06T13:58:04.964121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-06T13:58:04.968184Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.968184Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:1b97fe1c0a9eaadadd41291d0b6ce69b34fe31370184dc7370863eb7f88f6bcc","observation_id":"084b781f-ebe9-42a4-8549-550deea7ee0c","resolution":{"observed_at":"2026-08-06T13:58:04.968184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T13:58:04.972222Z","title":"Unicontrol: A uni- fied diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.972222Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:a984d63c4f053788106da5de593264011bd25bddfbe9f789adba325c9f148de3","observation_id":"e7c8796a-5a87-450c-9b6f-9242b661bb1f","resolution":{"observed_at":"2026-08-06T13:58:04.972222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.308891Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"a8ddeea3-d5ee-4b2a-abd7-f73d7c60912b","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.976692Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:d282c178d6a01593c0f3e96ed2658eceb24780f75687920a9d4ebaf06bfc789c","observation_id":"171efb84-11c5-48a5-b5d8-9d20abe572af","resolution":{"observed_at":"2026-08-06T13:58:06.313044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.294375Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis","venue":null,"work_id":"736ad204-1faf-4da4-94a7-ddd1e4f90a62","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.980592Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:5dcbf58485ee99ee266e2a165fc3fd4c201ba6f205d5863b595a5ed9852dbd96","observation_id":"bcd86d95-aa16-4441-ae02-c68103fd6549","resolution":{"observed_at":"2026-08-06T13:58:06.299741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.281147Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"665b4eac-589e-4263-af99-cf5114d5603b","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.984214Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:7c7e79683bbc839f01f31542d8e80cdeb99b74d1668ecdbede7c54d75b068e74","observation_id":"52a95384-79c8-48c5-9f2d-ef7c6610dcd7","resolution":{"observed_at":"2026-08-06T13:58:06.285704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.268600Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"4552c57b-9aa9-464f-8168-f29cb530f210","year":2021},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.987777Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:7d008f8e111bbf3b7d2d73132bc1258fa60947e934deeb4ddeedd01296d33667","observation_id":"6eaf496b-d8b5-457e-bbea-6eca8fcde988","resolution":{"observed_at":"2026-08-06T13:58:06.272597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T13:58:04.991565Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.991565Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:05d4f611472157c515f030a3b9cb1cab1c55bfec776e77e68b8019b2743144af","observation_id":"6900dd29-b12c-4755-a336-471b5f0335be","resolution":{"observed_at":"2026-08-06T13:58:04.991565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.255367Z","title":"Freeman, Fr ´edo Durand, and Song Han","venue":null,"work_id":"1105917f-49ef-46ae-83cb-b191643bb656","year":2020},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.995851Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:aea3cc60e584dba26018458ac6aa9a0f0a43fdee82fb05dab8e80c1ab3ab054d","observation_id":"13a8f93a-9671-44cd-9f4c-7d768096f52f","resolution":{"observed_at":"2026-08-06T13:58:06.259576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.241086Z","title":"Freeman, Fr ´edo Durand, and Song Han","venue":null,"work_id":"ceae6554-ac39-41ce-9cd2-ed19c0734365","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:04.999510Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:17b547395bb6715df76fd3e9b4e151d054788c6e241194257ba0765e026b3744","observation_id":"e372bee8-fdf3-427a-a54e-9430c798aad7","resolution":{"observed_at":"2026-08-06T13:58:06.245961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.227525Z","title":"Cross-modal contrastive learning for text-to- image generation","venue":null,"work_id":"3558454d-5f99-4eb2-a951-00d312882cc3","year":2021},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.003315Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:4d393b5b7981227017d1a8812c383f2c2100577abd6a131303cf8117576f7dc5","observation_id":"a026925c-8916-426c-af89-1f7a18dfca60","resolution":{"observed_at":"2026-08-06T13:58:06.231757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T13:58:05.006991Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.006991Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:7baf8273642362b94677c2fd3f9318e4258e4ccb856334f90946d2284301798d","observation_id":"d7ddf754-1a80-441a-9475-41b3333b530c","resolution":{"observed_at":"2026-08-06T13:58:05.006991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2301.0070","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.757932Z","title":null,"venue":null,"work_id":"5029b80d-960b-48d2-98d2-63f5eb907ee5","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.011442Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:59cf4e85e74170099a0778b56aa88b2d6f3805f2d66fe6dd0eab771fb78558f8","observation_id":"c672f31d-3987-41dd-ac11-5cb1fdbadc9d","resolution":{"observed_at":"2026-08-06T13:58:05.764736Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.015533Z","title":"Scaling autoregressive models for content-rich text-to-image genera- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.015533Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:af61d7d66075a5e7142f54738626fda8f6f31524a90c0ec6b55a702022a3a109","observation_id":"f49346e4-5003-42e9-b883-139052201eca","resolution":{"observed_at":"2026-08-06T13:58:05.015533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T13:58:05.019334Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.019334Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:1ed42a4efd4d4e3baaadb643c266b78da6a2eb96d58b94b8ce93bbf3e0322baf","observation_id":"49cc29f7-ae85-47f5-9d8d-d0354b7ef22d","resolution":{"observed_at":"2026-08-06T13:58:05.019334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.214507Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"bf98d601-c355-464c-9c22-d6a15dc02b49","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.023001Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:905906600041b9e2762ca536511fd4c06aa5800d4e63a4a16563ae3910a99b5b","observation_id":"387a71a9-9a1e-4380-965d-b4a3df88279d","resolution":{"observed_at":"2026-08-06T13:58:06.218527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T13:58:05.026909Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.026909Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:2084aab014b37b7f2fb1f262670da0acb3a699ce2af96aaf0d21476ca6e5a4ee","observation_id":"bb990f3b-b75d-4482-b143-6cdd2f770cd2","resolution":{"observed_at":"2026-08-06T13:58:05.026909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.201879Z","title":"Perception priori- tized training of diffusion models","venue":null,"work_id":"b12f99a5-1012-42d0-82f2-d87270d4ab63","year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.030582Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:68347ee121957ab4312362a7808c367dae5a5b456278ba8da53035123852d10e","observation_id":"045cb68c-5a5e-4c06-8745-e09cd8738412","resolution":{"observed_at":"2026-08-06T13:58:06.205937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T13:58:05.034238Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.034238Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:32dca58687769b648baf2b60b85744381c47140fd03b0c6e588522f278b269d0","observation_id":"01ca8309-71cb-4dc4-9625-b066f51b68a3","resolution":{"observed_at":"2026-08-06T13:58:05.034238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:58:05.038403Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.038403Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:dcbea364816b9c8ec11ae6e711f852bb46e34bfbe3c44c30a9ccdf492bf0f9ab","observation_id":"ba033c7d-4d55-45e4-9218-fd745383be60","resolution":{"observed_at":"2026-08-06T13:58:05.038403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.188799Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"dfb9a5e6-7698-4988-bfe1-f44d1d4325c6","year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.042052Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:cf9ffa747afd2b4172a3ba878caed60c6ce0fb65a47b38dde2bb87cbe6a78dcc","observation_id":"96d40ce9-fc3e-47cc-8936-c5206b6cfb6e","resolution":{"observed_at":"2026-08-06T13:58:06.193167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.174756Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"4920e92b-e079-4c8e-a389-c4aea2050ae9","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.045817Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:04eee80fa166e19b5d163ccd3078db40b23e814183ea569328eb28e8b18adbfa","observation_id":"dec473ca-5274-436a-8276-a27034d4da20","resolution":{"observed_at":"2026-08-06T13:58:06.179252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-06T13:58:05.049275Z","title":"Composer: Creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.049275Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:61449abbb9ea1f4522b8a85595fc98cfaa8c92909b64dff1b372195b7c997640","observation_id":"aedc824d-b6f6-442a-a7bd-ae989798ff91","resolution":{"observed_at":"2026-08-06T13:58:05.049275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-07T08:09:13.605920Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-06T13:58:05.053158Z","title":"”llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.053158Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:4b071f12d15da08ddb759b325c68ec297dfe6ee42985d3cb8ab603c88574085c","observation_id":"0a970c1c-d1f8-4434-9689-93710fb5c2ff","resolution":{"observed_at":"2026-08-06T13:58:05.053158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.161159Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"77cb07e1-c9e3-4c91-afd8-f317bd83a5a4","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.057314Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:d3d80b60a202cf28778d375394b49511fd50e13004350223993bbbdcd7afe57b","observation_id":"fd0473fa-31b1-4309-9aeb-72ca7fb8cc91","resolution":{"observed_at":"2026-08-06T13:58:06.165248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.148191Z","title":"Fourier features let networks learn high frequency functions in low dimen- sional domains","venue":null,"work_id":"c9268e9b-8f5f-4fe5-9c46-29de163cca7b","year":2020},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.061006Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:43a50a26d90b3ff1ff165deddfe8bb86ee5cb011694a4c8f85c2ec9a4904eab0","observation_id":"d0195274-c817-4e8b-a3ba-0f901497dd7d","resolution":{"observed_at":"2026-08-06T13:58:06.152391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.135382Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"7fa39a3b-080b-4277-955e-cc02cb8bf50b","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.064778Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:7e96be92916db4b757c487027cdcf525489ab693b892fc6995a5effbf748fac8","observation_id":"9d934d97-73ad-40df-b623-a83d283a0493","resolution":{"observed_at":"2026-08-06T13:58:06.139406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.123020Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to-image models","venue":null,"work_id":"278143c1-1321-46b3-81e5-21232f2a9840","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.068589Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:df9a4b28c53563b6687197359f7d1870820bf4f2f64d523fad6ecafd210c115d","observation_id":"5dd8cdb2-bf75-499e-b609-e59e05b3f2c8","resolution":{"observed_at":"2026-08-06T13:58:06.127185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.109810Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"828773cf-0b85-4db6-9acb-d8759857408e","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.072153Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:ae918aafd942ac8e3de8a40320570e3e830e8354d646ff6319ff8f653f6ecaa3","observation_id":"d3c4b848-ad70-490f-9bbc-fdcc948ddf11","resolution":{"observed_at":"2026-08-06T13:58:06.114259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T13:58:05.075777Z","title":"Scaling rectified flow transformers for high-resolution image synthe- sis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.075777Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:70d3a77b8d51b86082918bf0d2a8cc496465c389fd057089e0222704fd000f7d","observation_id":"f00b8a3d-e113-493b-ae07-9bb2c96cdf12","resolution":{"observed_at":"2026-08-06T13:58:05.075777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.097506Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"93eecd65-1ae5-4d3a-9f1a-d24d7868b0d2","year":2021},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.080272Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:b8fbc8ca5218386aae9104f7b8633a8ccaebf5c1c23bdf9d7e0bc68d2aed8408","observation_id":"5f9b0f5c-a565-44a1-91c0-e3870f289e9c","resolution":{"observed_at":"2026-08-06T13:58:06.101424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T13:58:05.084309Z","title":"Bermano, Gal Chechik, and Daniel Cohen- Or","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.084309Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:08d523110e41c745c4b63ea968f76ae4d5ba540c3808d31400dccad2114bb054","observation_id":"a820c14e-3831-45c8-b988-edf429f9c255","resolution":{"observed_at":"2026-08-06T13:58:05.084309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.085167Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"955170e6-6dc1-469d-8791-389828fa1f8c","year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.088465Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:6c8ddcbde802dd933278613698f38df319cf71a73bad21bb5fb4f7bdc72d2f68","observation_id":"e18275d2-9c57-48f6-a3e7-aca56999271f","resolution":{"observed_at":"2026-08-06T13:58:06.089138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.072461Z","title":"Generative ad- versarial text to image synthesis","venue":null,"work_id":"0fdaa6d1-d9a3-4ea6-ae89-2912fc90ef74","year":2016},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.091929Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:b0301be7802324d39a4825ca577f118c0500a2e32d8e5760e5e16192fc2c7e54","observation_id":"1590a588-bddb-4a99-9aa1-282788ff9afe","resolution":{"observed_at":"2026-08-06T13:58:06.076676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.059152Z","title":"Younes Mirinezhad","venue":null,"work_id":"8926ba87-df3a-453a-8006-40e06fb60ca8","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.095580Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:6996967fc2221cfb6b74f2f646fe933726d3f19d195c3d3147da28b04d988525","observation_id":"2882007e-6483-443f-b211-b9d621daf465","resolution":{"observed_at":"2026-08-06T13:58:06.063281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.046471Z","title":null,"venue":null,"work_id":"a8abae0b-f4e3-40fa-823e-5b445c0bcc22","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.099809Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:9475aabf981fb54afcf20e54f37341aa1c34761cb35fe1eb36a58bffef45deec","observation_id":"aa69289a-f977-41b8-8bce-40f4f1818b70","resolution":{"observed_at":"2026-08-06T13:58:06.050460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T13:58:05.103489Z","title":"Grounding dino: Mar- rying dino with grounded pre-training for open-set object de- tection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.103489Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:9ede8f97c769e1c23b79f9de0d981ab0b3b4e850d3882d4dc7e4d7eaf6888265","observation_id":"8b607d78-345b-402f-9019-477285db138b","resolution":{"observed_at":"2026-08-06T13:58:05.103489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.032503Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"b2519779-7429-44c3-9429-e47c32048f1c","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.107430Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:32e6b802df3b686b6ca49cf1d2f99b1436c21e77e16199364ffe2aa7c42160b4","observation_id":"dff75b55-9d13-4164-81f5-79445e019411","resolution":{"observed_at":"2026-08-06T13:58:06.037096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.020262Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"4257887a-92df-4737-b573-8f1fb55688ed","year":2015},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.111372Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:33cc2d613bfb0411cff8fd7a0e37eda342aaae8e988154c286715b1623da4680","observation_id":"9f202afb-5277-4256-9229-d79520cce8a1","resolution":{"observed_at":"2026-08-06T13:58:06.024283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:06.007117Z","title":"Score-based 9 generative modeling through stochastic differential equa- tions","venue":null,"work_id":"ece47730-41cb-4642-9907-0f43b324f06d","year":2021},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.115135Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:471de74114a9fa7988bb6f1fb880ce6854cd08a9dcf078b4f19493408eea0837","observation_id":"365b3635-be53-442c-bcc9-5976687a29ed","resolution":{"observed_at":"2026-08-06T13:58:06.011333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.993079Z","title":"It’s all about your sketch: Democratising sketch control in diffusion models","venue":null,"work_id":"930d43d8-c0af-473f-8709-f1f481390a50","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.119314Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:910767350d85eb8478c6475f8c052888aca25b756b9dfd108983d5c6136cfb47","observation_id":"f4a4d41f-fe1c-4a7e-9c56-368377856526","resolution":{"observed_at":"2026-08-06T13:58:05.997752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.980166Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"83960df0-5210-4bf9-ba78-ba0deda71dfa","year":2018},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.123447Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:ad9890347e4ec9c9191729f03912629adc08fe9144511d89056449ea4a3d0b43","observation_id":"ad81617a-d9db-4dc4-867e-6a734b62bd54","resolution":{"observed_at":"2026-08-06T13:58:05.984472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.965826Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"f3cff141-ef6b-4de4-bfb0-544c91eab519","year":1921},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.127180Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:7cde7651871153aca8f503de33ea70c860f32515fcc93708f98482ddd152ded3","observation_id":"042213c5-e384-4891-81bd-13bd131496f3","resolution":{"observed_at":"2026-08-06T13:58:05.971428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08246","last_updated":"2024-05-14T00:22:06Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T00:22:06Z","title":"Compositional Text-to-Image Generation with Dense Blob Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08246","snapshot_observed_at":"2026-08-06T13:58:05.130972Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.130972Z"},"links":{"cited_paper":"/paper/2405.08246","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:0cb74229aa8e317fb55aea9c4e9b0202c6e05d54ce7798855fc9bd1d5d236616","observation_id":"40174456-e7e8-4dc2-aaae-aec564f43fd0","resolution":{"observed_at":"2026-08-06T13:58:05.130972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.953129Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"bb819081-a333-4c70-9587-2b4c3bb98772","year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.135424Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:d9fcfca6ebd8a9cbd826e926391d1c06a49ef37661fbfc357f4785405207852c","observation_id":"85990893-f0a0-45e3-b0ac-bfd9e6f7ab99","resolution":{"observed_at":"2026-08-06T13:58:05.957221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T13:58:05.138991Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.138991Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:f12c0a8701c2d2f8ac5ffa6fe86ae33802a7f351d29cffe07fbed1c0627ee36b","observation_id":"6625bbde-6465-4073-9aa9-78dc70909b7a","resolution":{"observed_at":"2026-08-06T13:58:05.138991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.939058Z","title":"Humansd: A native skeleton-guided diffusion model for human image generation","venue":null,"work_id":"52a38590-08c2-424b-af82-ad7cd3beb5af","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.142871Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:870dd51955883289a745c81e0f654aef80d7abe9ba2da5592920bb507dbd41b5","observation_id":"dac461c6-ad6a-48a2-86ce-d515f6dd62ed","resolution":{"observed_at":"2026-08-06T13:58:05.943248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T13:58:05.146539Z","title":"ediff- i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.146539Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:9685223bddc1c5fec9d9e05c115531bb7e808ddf67d283abf2604327377586bf","observation_id":"2be2634a-9867-456f-97c1-6ceb237ba7e2","resolution":{"observed_at":"2026-08-06T13:58:05.146539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14124","last_updated":"2022-10-25T16:22:23Z","snapshot_observed_at":"2026-07-06T14:10:16.603292Z","submitted_at":"2022-10-25T16:22:23Z","title":"Lafite2: Few-shot Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2210.14124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14124","snapshot_observed_at":"2026-08-06T13:58:05.205456Z","title":"Lafite2: Few-shot Text-to-Image Generation","venue":"cs.CV","work_id":"e67c3e6d-c7fc-4dc2-b84c-5ba87111134b","year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.150622Z"},"links":{"cited_paper":"/paper/2210.14124","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:3a14a8459e02425a6d02f90148e6eaa0f98393e6574fadc823b0cb1aac608a05","observation_id":"8b6efc69-2ffd-4ae7-bccb-0251a4f3104e","resolution":{"observed_at":"2026-08-06T13:58:05.211626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.925193Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"cdd946a5-5968-4952-a6a1-bf908cdfbb67","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.154643Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:1dd2eeb168e347c5bc8eba6abb984428131edecc43f0862041086c50ae44352c","observation_id":"b1d736c3-2c9e-4aed-b529-7dc8e21c151e","resolution":{"observed_at":"2026-08-06T13:58:05.929027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.911636Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following","venue":null,"work_id":"8e014dfe-4834-4432-9a2d-46e45ee8517e","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.158515Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:8bc5939c1d4b2bccd1b7025bcd884a017f91e5b0d7de9f2d89656092fc9f719c","observation_id":"64e4b6a5-2c47-43dc-998c-bf7fb7cd7e00","resolution":{"observed_at":"2026-08-06T13:58:05.915734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.897746Z","title":"Smartedit: Ex- ploring complex instruction-based image editing with multi- modal large language models","venue":null,"work_id":"3e5f7c79-be24-47a7-8aad-2da63e87d935","year":null},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.162408Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:f4cc3dbc1c3e8530bb6d556da344e519d0c424e943b887b5384bdb7b1e2a8b3c","observation_id":"c05889d0-fa51-4631-a53c-603f36e5e8fb","resolution":{"observed_at":"2026-08-06T13:58:05.902359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.883436Z","title":"Layoutdiffusion: Controllable diffu- sion model for layout-to-image generation","venue":null,"work_id":"b19a17a6-fa28-45e6-8837-14ce47cc3cc4","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.166417Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:9c896a5292b7b8b8c8e6a57e62176c2257c138c6cd86a4b260ed3c8c9715506c","observation_id":"0fbbccd9-48a4-463e-90e8-709a42ec2a94","resolution":{"observed_at":"2026-08-06T13:58:05.888090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:58:05.870969Z","title":"Reco: Region- controlled text-to-image generation","venue":null,"work_id":"f11e8185-10ad-4c79-ab0d-f94a8414df45","year":2023},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.169969Z"},"links":{"citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:b7d65f2e00210d6bce96b8cce38b6b2daa45e14aa12a811d39abad3dd090b86c","observation_id":"aa617503-f3f4-4e57-a2f1-b75cbf59137a","resolution":{"observed_at":"2026-08-06T13:58:05.875093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2507.19939."}