{"as_of":"2026-08-17T19:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc4e7b131ac438aa28d900e6764b2372237d2653445f8e1e7c38feb4533584cc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:49:40.533898Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02648/citation-record","integrity":"/paper/2505.02648/integrity","json":"/paper/2505.02648/citation-record.json","paper":"/paper/2505.02648"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T00:49:40.156099Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.156099Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:2b369712cae7e270529044a244d1356118423e8c6286914d22fdb25c2a7a937b","observation_id":"536e04f2-4d07-4849-81c4-4445beb33081","resolution":{"observed_at":"2026-08-16T00:49:40.156099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.671583Z","title":"window”: “large, fills the room, offers a view of the peaceful outdoors","venue":null,"work_id":"dc3c0b8f-5df9-4398-a132-32cdcaf31cd1","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.166363Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:c8709228adaa79ea5f4f11e7faeced6fe9b068a82ed509a37fdb923bd8b4517f","observation_id":"8a1d20ff-6dbe-4616-a128-6e5522673e6b","resolution":{"observed_at":"2026-08-16T00:49:41.679853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.645729Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"4a4bdfba-40ae-4327-b4f2-6a33c51d9529","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.173707Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:fec8e879a673114931b7f8a742736ac656757ba076d1544031c26ad789d5d29a","observation_id":"312f4eda-8400-4aa4-92e0-801e42f7d179","resolution":{"observed_at":"2026-08-16T00:49:41.654238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-16T00:49:40.181104Z","title":"Pixart- alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.181104Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:e9416cc822d2a36c49f648ba1480de063953cd0690a03cfe99e0e337437bfecf","observation_id":"41cbec74-e3cb-49ad-b1e2-4a0cfbf72cb3","resolution":{"observed_at":"2026-08-16T00:49:40.181104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-16T00:49:40.189040Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.189040Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:58f9d19c43849215a93810d40b9ed9b1e6957a57cb46c33b8baea9c7edc3aac1","observation_id":"5297fe55-ba3d-404c-868d-b4dcd4b96b06","resolution":{"observed_at":"2026-08-16T00:49:40.189040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.196948Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.196948Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:8be7b27b098f802eefc488facb90b8726ab2e9ce4c4a1f74014441a89a78e419","observation_id":"12ef18b1-f046-4e0b-b384-f7ba4614f147","resolution":{"observed_at":"2026-08-16T00:49:40.196948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.203284Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.203284Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:5af642b66562f3c00483d20e33b40a3b3638b791b997f1b0e61623e559379caa","observation_id":"5fce98c3-d814-45ef-bd38-54b3e5ec8307","resolution":{"observed_at":"2026-08-16T00:49:40.203284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.579966Z","title":"A woman in a pink shirt and jeans holds a white umbrella in the rain","venue":null,"work_id":"3ba2d627-f034-42c1-82f1-9bb29e56374d","year":2021},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.210341Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:57d03ccc26858478849a58a442fdb6c5c2b2ba84ea2c8158e89c1dbcacd3e003","observation_id":"5f1c0bd0-25c4-4617-877a-4bff346be8af","resolution":{"observed_at":"2026-08-16T00:49:41.588895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19599","last_updated":"2024-10-24T03:14:22Z","snapshot_observed_at":"2026-08-17T15:15:23.993164Z","submitted_at":"2023-05-31T06:59:21Z","title":"RealignDiff: Boosting Text-to-Image Diffusion Model with Coarse-to-fine Semantic Re-alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19599","snapshot_observed_at":"2026-08-16T00:49:40.218386Z","title":"Boosting text-to-image diffusion models with fine-grained semantic rewards","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.218386Z"},"links":{"cited_paper":"/paper/2305.19599","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:f5d92cdd38ab1e227d22bc921a82ab5730382e83aa7eec27a1ed3399b75463a8","observation_id":"b3ecd4d9-9ff9-4581-aaf1-57909a8356af","resolution":{"observed_at":"2026-08-16T00:49:40.218386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-16T16:09:43.175330Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-16T00:49:40.226216Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.226216Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:f7f404065c1bbda35cf222d4e768293201f20ccf0c68ac84f7faef7b24114b13","observation_id":"0ef5c32b-cf50-45d1-b220-a6111a2c4a68","resolution":{"observed_at":"2026-08-16T00:49:40.226216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.234783Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.234783Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:d77bc0a5b2cb7cb5ae7168e410774aa06e9575899ba89fd8dde2a28fc60382a2","observation_id":"b6748258-551f-4f87-a8f0-59fc8d51ff61","resolution":{"observed_at":"2026-08-16T00:49:40.234783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-08-16T14:51:40.096499Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-16T00:49:40.241163Z","title":"Llm blueprint: Enabling 14 text-to-image generation with complex and detailed prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.241163Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:a76587c401a908b8a39ba9c0c7848f73df0740f338631d5e8a9f5cc726ca058c","observation_id":"d59b63e1-8eaa-4bb1-9602-da9882228fb6","resolution":{"observed_at":"2026-08-16T00:49:40.241163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.250265Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.250265Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:3e5ab012ab9305285c742004f47733e9bf6a1fc5a3930cf48baee211bcabf2a3","observation_id":"94682f17-b4f8-48bd-a178-93b8163395ba","resolution":{"observed_at":"2026-08-16T00:49:40.250265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-16T00:49:40.258273Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.258273Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:eda0097d3841d6b3729622d2519d4489651c21af16b7595ada6f22a3211182c2","observation_id":"cf6e5e12-6603-4d3e-b659-d2b72840d812","resolution":{"observed_at":"2026-08-16T00:49:40.258273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.516340Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"c3477682-2e6e-4f4e-99d5-011088808143","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.267440Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:25d57eaffe3c1863b7cad6ef369e86dd1b7b4857202fe69cce4cf301ea91362e","observation_id":"2ee3d702-a412-4570-a509-135a876bd871","resolution":{"observed_at":"2026-08-16T00:49:41.524056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-16T00:49:40.275309Z","title":"Aligning text- to-image models using human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.275309Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:e2613f1fa7fd2770ad3a53d0d0a265c2646f862c5c79f2703b1c816f9654e759","observation_id":"dc7308be-f579-4325-a0fe-c5eb67449f22","resolution":{"observed_at":"2026-08-16T00:49:40.275309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.483181Z","title":"Parrot: Pareto-optimal multi-reward reinforce- ment learning framework for text-to-image generation","venue":null,"work_id":"adec24f7-554e-40cd-b18c-0c8705a9e305","year":2025},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.287068Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:f881344fe8334619dc0bafcfa219a3a0066bead26f00174497a1a33cee354e74","observation_id":"972a67c2-e7cd-48b4-a700-b98a4a35fad6","resolution":{"observed_at":"2026-08-16T00:49:41.497889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.296688Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.296688Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:86a605e594c01a0821f9ff0b2bfac1cb1d9e794d573e719f67b4170c531a62d6","observation_id":"600d663c-b53e-41ce-91fe-72f4fc8ece24","resolution":{"observed_at":"2026-08-16T00:49:40.296688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.305777Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.305777Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:16311bd1c2899edb5c755031a452142773107de95e0e55d7cb4be9fad68372d2","observation_id":"2d32d33e-c1aa-45cd-bc46-66fa06848293","resolution":{"observed_at":"2026-08-16T00:49:40.305777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-16T15:30:49.729694Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-16T00:49:40.316575Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.316575Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:ac0b31661c155f73ab02d4c4e5173cfd3420aab2d6e1bd9c24f2cf31ad114daa","observation_id":"1112b31f-e2a4-4a0a-815d-1dc42d069ae5","resolution":{"observed_at":"2026-08-16T00:49:40.316575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.412593Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9a272ba7-2236-4b1b-b266-d31dd8b22b8d","year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.323469Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:ca98e31fbb827dd1cfee77a99e9cd914cd830b2465d754b43f52f63f422baa44","observation_id":"e00e4295-3931-40eb-a8ec-36a5c8e342b7","resolution":{"observed_at":"2026-08-16T00:49:41.422788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00737","last_updated":"2024-08-27T08:33:31Z","snapshot_observed_at":"2026-08-16T13:38:22.914699Z","submitted_at":"2024-06-30T15:50:32Z","title":"LLM4GEN: Leveraging Semantic Representation of LLMs for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00737","snapshot_observed_at":"2026-08-16T00:49:40.329434Z","title":"Llm4gen: Leveraging semantic representation of llms for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.329434Z"},"links":{"cited_paper":"/paper/2407.00737","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:d83690ab722be1d44374ce38d1522cb2b60e9a355a9b5f3c20fb3bf9a23019f9","observation_id":"e65ed4c8-ee80-4bc8-bc02-196c4f23ff6a","resolution":{"observed_at":"2026-08-16T00:49:40.329434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.388008Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"131f70d7-1d1c-41df-8a56-a43656d35fde","year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.335711Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:ec63dde2f3decaf585196312df903bc30efec883e558f575a6b7a3b74ef5285d","observation_id":"03ca9635-eb25-4c0e-ba71-74e9d49dd97e","resolution":{"observed_at":"2026-08-16T00:49:41.396730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.346005Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.346005Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:8de1970625324daece3d9ca7fe191b28f9605010106e815852060d29d1027245","observation_id":"22e247bb-7bcd-4c31-84e5-273852d87b81","resolution":{"observed_at":"2026-08-16T00:49:40.346005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-16T00:49:40.354813Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.354813Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:9ae24d4eb5f1bbfe9c418833decd21cc172f8b4e538ecf81f8ffc0bd5a00a3f6","observation_id":"70060076-583c-4692-a10f-c66982826750","resolution":{"observed_at":"2026-08-16T00:49:40.354813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-16T00:49:40.362068Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.362068Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:93a872584c31b53dd6ae63f0b51d26e8713c9c47121ac77ea84bc2e0992628aa","observation_id":"11ec256e-6359-400a-9f67-6537797f4ead","resolution":{"observed_at":"2026-08-16T00:49:40.362068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.343750Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation","venue":null,"work_id":"96df0d04-aaf8-4849-a168-edcf5f320b29","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.368810Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:023636b04fc3a7fce3374ee7ec2d09898b05e1e32d2437eba89681d274837400","observation_id":"3ffed5f7-4e5b-4983-a154-80e706675b85","resolution":{"observed_at":"2026-08-16T00:49:41.350338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.381467Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.381467Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:c43bc650b4f06a39dc08e31ecbd748b29c66a09e3f37fdc67bab50bd3321fe32","observation_id":"4dc398ec-97f0-4a39-b23d-9bf5e4c134f7","resolution":{"observed_at":"2026-08-16T00:49:40.381467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-16T00:49:40.390117Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.390117Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:5b563cd2ead13864db6f89aac5852a058dc91215260c722df57940e7de55a6e2","observation_id":"c8a30bf5-ae97-48b4-97e9-57743876e3bf","resolution":{"observed_at":"2026-08-16T00:49:40.390117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.292829Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a20cbc4d-0d36-42db-8538-66ebe4e9cf61","year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.404680Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:41994c94c68f1a17c5e202a621c6e55685ba18d336bdf32e25528e2c59931f6a","observation_id":"e2eb31fe-efcf-4c8b-a07c-9f831ebbba8a","resolution":{"observed_at":"2026-08-16T00:49:41.301543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.417473Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.417473Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:15ffb028a807291aeeefcc0ef922706e356becd786a0566637849d6468c03f30","observation_id":"4b5a6001-dccd-4828-a4ff-9d475dffadc9","resolution":{"observed_at":"2026-08-16T00:49:40.417473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.426876Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.426876Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:603f5f2d2bb2b9b71181eac195da90d97f4e32bfd090619ad2e924452f804f13","observation_id":"9b239947-c635-4f4d-82c6-aad15d775abd","resolution":{"observed_at":"2026-08-16T00:49:40.426876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.228986Z","title":"Dreamsync: Aligning text- to-image generation with image understanding feedback","venue":null,"work_id":"04acac90-e6a0-4241-8ce8-41806633f294","year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.432154Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:44cca73f85d34733b9f3854e408c121a25b1031f6a6667cdbff6cfe748dd5791","observation_id":"8c5594ee-a889-4531-93f2-f698442c5d14","resolution":{"observed_at":"2026-08-16T00:49:41.244023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-16T00:49:40.440341Z","title":"Galactica: A large language model for science","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.440341Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:b2912718acd8d18f417df511e6d85e0f50e22eb92e7d27f26566310f23313fcd","observation_id":"28e3a8ce-3b64-428c-a284-ed8f5c1c6493","resolution":{"observed_at":"2026-08-16T00:49:40.440341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.203548Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"b25eb4f0-1747-44eb-95f3-36d934d64188","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.448329Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:1fe6aa5bcf1a7991c29bf9ce10738bca473dcdc23f500d449d74461cfc492e94","observation_id":"4aa0b6b4-3413-4b8e-bcef-94c9d4a08885","resolution":{"observed_at":"2026-08-16T00:49:41.210063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.457557Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.457557Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:4b60f777bbce41f8c3207a9c44b1d0ca5296f04658ca4a8ab3193264ad068b84","observation_id":"fe034dd2-80b6-4e10-be96-68f0743b4d54","resolution":{"observed_at":"2026-08-16T00:49:40.457557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-16T00:49:40.468540Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.468540Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:5296c10dd91af6ee1335efa40fddbc807c0393961b6ebf9797faf515cceb812c","observation_id":"665dd3d9-d71d-4ad6-866c-36f6c1232703","resolution":{"observed_at":"2026-08-16T00:49:40.468540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.477240Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.477240Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:4fbec884ff56eef12726a513f985a30c0e5ced52f2f4e1338d09e485b0406a65","observation_id":"16c462ad-0b0d-4ccf-baa4-9a043736144a","resolution":{"observed_at":"2026-08-16T00:49:40.477240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.144203Z","title":"Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"3a4a7d9e-e0d2-4193-9910-42e3dcb01060","year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.483763Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:7859f8042fdb2272c35a14c41cda1bc74001c78fd9fd5dd5655e01856429de1b","observation_id":"078a6c36-fc47-49ba-b11b-3a5b546d0555","resolution":{"observed_at":"2026-08-16T00:49:41.150419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.112774Z","title":"Cross-modal con- textualized diffusion models for text-guided visual genera- tion and editing","venue":null,"work_id":"e6eaf201-1180-4fdc-bed8-aa413b1f24ff","year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.490051Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:49bfdad41eb9629466a41929a9f66b461db8c15ca290eca9154c1c224119468f","observation_id":"93f4bd02-342e-44e7-a7e8-19c0219156be","resolution":{"observed_at":"2026-08-16T00:49:41.120523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.499062Z","title":"Reco: Region-controlled text-to-image genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.499062Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:d24b0eaaa934e3c826ea9cafc12820ea841b31a761a9d0ee9122f8199ed9848d","observation_id":"ebcc0686-331d-4e5e-b081-8c386acf71f3","resolution":{"observed_at":"2026-08-16T00:49:40.499062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:40.507176Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.507176Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:405abeb431f3d1759d506acb2e9bc778e9ebd7f44faaad936d50cac78f648ec6","observation_id":"22bdfded-832b-4164-9ca8-aceb6aff4c1e","resolution":{"observed_at":"2026-08-16T00:49:40.507176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12908","last_updated":"2024-10-14T07:27:37Z","snapshot_observed_at":"2026-08-16T14:16:59.854006Z","submitted_at":"2024-02-20T10:56:52Z","title":"RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12908","snapshot_observed_at":"2026-08-16T00:49:40.513664Z","title":"Realcompo: Dynamic equilibrium between realism and compositionality improves text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.513664Z"},"links":{"cited_paper":"/paper/2402.12908","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:6f80eefb1bff7de7d66bbaccb133a25374dcefa9fdd7369720ab0ac9eabd74fa","observation_id":"fb7dbd99-3aaf-4743-97d9-5177824e8429","resolution":{"observed_at":"2026-08-16T00:49:40.513664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:49:41.040866Z","title":"Sur-adapter: Enhancing text-to-image pre-trained diffusion models with large language models","venue":null,"work_id":"e5b6959a-9e89-4c40-a2b4-7e98a875b5e7","year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.526787Z"},"links":{"citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:3f7d00bdc3de89afeded1450af2023fb6ce64884819eb364aa4e4f9a2b6da83f","observation_id":"8f2a4c29-0255-4fc8-b08e-5dff52218725","resolution":{"observed_at":"2026-08-16T00:49:41.050394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T00:49:40.533898Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.533898Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:2e9c7b94c2858b2d2d7be9ed243d4e39672d492eee48f07fa78b9e8d25061df9","observation_id":"c416b4cd-95eb-477a-a420-d26ac6984cc8","resolution":{"observed_at":"2026-08-16T00:49:40.533898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.02648."}