{"as_of":"2026-08-06T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b4966ec1992d509cc450fc7d471b220fed4ce8901b795647ea58d9e89c675c9","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:15:24.299457Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28615/citation-record","integrity":"/paper/2605.28615/integrity","json":"/paper/2605.28615/citation-record.json","paper":"/paper/2605.28615"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.16772","last_updated":"2025-01-22T17:42:29Z","snapshot_observed_at":"2026-08-04T10:48:23.715738Z","submitted_at":"2024-07-23T18:10:43Z","title":"VisMin: Visual Minimal-Change Understanding","version":2},"cited_work":{"arxiv_id":"2407.16772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16772","snapshot_observed_at":"2026-06-29T13:23:28.313219Z","title":"Vismin: Visual minimal-change understanding","venue":null,"work_id":"d4b6e5a1-5f9c-4bd3-82ed-e3ce9cb2eb9a","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2407.16772","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:a09caa83d3cf94b9d76d3ed2a8e755d456d196ae90c77a6e8d5ef05936635c9a","observation_id":"da92fc0e-3dc2-424e-acd0-5398b05fc4f4","resolution":{"observed_at":"2026-06-29T13:23:28.314661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:cc0a214cc9ae3377ecc493a0faf4864eb65a5c0d878335cfae48412c8b9bd175","observation_id":"4b9540b2-3eca-41bf-8f96-0a404812eb55","resolution":{"observed_at":"2026-06-29T13:23:28.317010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:6ed2ffd46fb18eec4f7ddf22c370ac09b9bb9c740f9244741b8d326ba7d4f4ef","observation_id":"397f5500-d34d-4245-a4b8-d14e052a5854","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models.ACMTransactionson Graphics(TOG), 42:1 – 10, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:c31c38546f488179afe0fc199f0f3e906607d168a43d2494c996ebf9b3fc08e1","observation_id":"9cf8ec4d-9e15-4ce6-bd25-9519ae47445a","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:fe781f42edc3dfee2114f4f720bfa47886bbb76c5eb4c8702b94df322be94bba","observation_id":"c43429ae-55f5-43cb-84d4-0878a77fe81a","resolution":{"observed_at":"2026-06-29T13:23:28.312079Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Gentron: Diffusion transformers for image and video generation.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 6441–6451, 2023","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:2dbd3c1640317868989dc81eb8b3701572671d1ec2ca7be489774b9d6a7d76d0","observation_id":"884d61e2-7a99-4f7f-9b5c-98446b851b3a","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:1633f2fc83e67514858618584fb37df5c1bc92a861a55a132d4fe1f41d64f0f3","observation_id":"c9e9757a-3d36-4281-a70d-0ee0cee81a3d","resolution":{"observed_at":"2026-06-29T13:23:28.329419Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:94d1ac63561cdc706c031ae4c56d1de18ec73b17e923cb14a0885c89bd8e102a","observation_id":"22c8f37c-3e86-4cd3-80a9-568ce0c8f71b","resolution":{"observed_at":"2026-06-29T13:23:28.327103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:58f3936e1d9ea0b31c9e63e22c07e6e603b1268a3ce70b24b02c797ff10e783e","observation_id":"12e5ab3d-ad4a-4ba9-bcf9-e0935418d10a","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01159","last_updated":"2024-06-03T09:51:59Z","snapshot_observed_at":"2026-08-04T06:10:04.041264Z","submitted_at":"2024-06-03T09:51:59Z","title":"Dimba: Transformer-Mamba Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.01159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01159","snapshot_observed_at":"2026-06-29T13:23:28.308286Z","title":"Dimba: Transformer-mamba diffusion models.arXiv preprint arXiv:2406.01159","venue":null,"work_id":"04f9ca78-eaf8-48e6-80b4-5e0b6a4d4dfc","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2406.01159","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:885e447686906c6a9cc96c1ab622b38ba5aba828f7334180678dbf10631920ee","observation_id":"7939cb22-7437-47a6-b7e2-853ff16cc20d","resolution":{"observed_at":"2026-06-29T13:23:28.309648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following.2024IEEE/CVFConferenceonComputerVisionandPatternRecognition(CVPR), pages 4744–4753, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:1d1f3fe7455f4bd19ae6e29ce13a83dd8e46102ec747df1ff7eb454a70a91632","observation_id":"9bd29546-d6fa-46d9-9c78-ce15dbaf8ea9","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:0b52f48acf144e985b99e10f11676659a1bcf640f92f1f5e739b80d9b196fa37","observation_id":"4ce23e08-8cb8-4e1b-a379-7d7e40aea350","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Contrafusion: Contrastively improving compositional understanding in diffusion models via fine-grained negative images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:bfbcc33904b563cd4b62e54f03736aea06dbd03797f69376017334c0c369b71c","observation_id":"d0502b47-7384-41c1-8920-aca5d3635f82","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07614","last_updated":"2024-07-11T11:05:53Z","snapshot_observed_at":"2026-08-06T02:29:21.167648Z","submitted_at":"2024-07-10T12:52:49Z","title":"MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis","version":2},"cited_work":{"arxiv_id":"2407.07614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07614","snapshot_observed_at":"2026-07-02T21:27:24.441164Z","title":"Mars: Mixture of auto-regressive models for fine-grained text-to-image synthesis","venue":null,"work_id":"50822597-546e-4083-9ced-932e5e1ba3e7","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2407.07614","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:a66a3cb4e7f3ce5c11b50ff9b5c07f0b5ab89d6fe53025c8b1d04a5298413e5e","observation_id":"df9c6714-1456-44b4-a6fd-4d87ef5e18a3","resolution":{"observed_at":"2026-06-29T13:23:28.310544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.06424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T12:44:40.118048Z","title":"arXiv preprint arXiv:2406.06424 , year=","venue":null,"work_id":"6c83f88e-d832-44f6-a2e7-f663e4b9a1bd","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:d5bb62c45ff044978485464dce6100bbb11d7143cf218c88f2e7e6eac3ead796","observation_id":"c882f8b3-e18b-4f3f-8146-05a01988d4fb","resolution":{"observed_at":"2026-06-29T13:23:28.307268Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:0135c76c9a4654ccac303f26fd955b200d6586e65c69c4d8040f18c1398d9107","observation_id":"bcab43c5-1ad2-4ddd-8ff2-61ce94027cd1","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:034cba4eaff0db1f5a2cdde3e7e4098c9c271cd57206ed01f40d19388f430e3a","observation_id":"adbcec71-95ac-4dc7-a516-b0955fcb410e","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:300bade30dff8efc20ca1d1363a157a473168d2aca4c0850b8ca2fbbe4bb6c62","observation_id":"27dbad8e-e2ed-40b6-a4f2-e71b802a6e31","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:8e292812f09b48b9fd99d4f2d30cdde1632c28da71a5da283b11c1fd968235f2","observation_id":"284535c7-d273-4ca5-a1f0-286ab423d777","resolution":{"observed_at":"2026-06-29T13:23:28.308162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:57.989864Z","title":"yes\" or","venue":null,"work_id":"6816f785-b304-4b2f-9fcc-cb6f8f1ac10c","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:e8c1afb4e8190f407d8a0283c9e546ed6b792dc8747c4a1c7fca2ef43fe462b8","observation_id":"6e1111f1-bca1-4c11-bf02-1835c8669516","resolution":{"observed_at":"2026-06-29T13:23:28.324392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18013","last_updated":"2024-10-30T13:40:01Z","snapshot_observed_at":"2026-08-04T13:32:37.040278Z","submitted_at":"2024-10-23T16:42:56Z","title":"Scalable Ranked Preference Optimization for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2410.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18013","snapshot_observed_at":"2026-06-29T13:23:28.318320Z","title":"Scalable ranked preference optimization for text- to-image generation.arXiv preprint arXiv:2410.18013","venue":null,"work_id":"3b323e47-36d9-438f-a1a9-b8a2748ee0f7","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2410.18013","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:d7ba2154d10bcd62e3bf1abbd8ae15e18ada29df5c2689137751cfeed83f6429","observation_id":"9e90e67f-754f-46fc-97ec-e4e09aa3de87","resolution":{"observed_at":"2026-06-29T13:23:28.319598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:98c2060c8897aca28b7746f13ff1cd18ad34b3d43e663685df38cf246d57b606","observation_id":"510e5633-8fae-46cd-bcb5-89b3225bd7c7","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":"2302.12192","doi":"10.48550/arxiv.2302.12192","metadata_source":"pith","pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Text-to-Image Models using Human Feedback","venue":"cs.LG","work_id":"39a08cdc-3986-4994-baf0-91e8ddf1b855","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:ccdf38e70acf77a717fda05c9c610aa7c6dbae5f98ba29184fe35d282cb7c9a7","observation_id":"303f0d4d-bc8c-4e45-ae45-e447a04a7648","resolution":{"observed_at":"2026-06-29T13:23:28.296582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:d34e4c0d559b4a29d0ee5356dac5360ea5f8bebeeaad27f4ac7c0a7142007a9b","observation_id":"cc80049c-57e2-42fb-8447-4cb2862d5099","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Calibrated multi-preference optimization for aligning diffusion models.2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 18465–18475, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:492d0d6f711f5a0c7f6cbf787c7b6b2f920ce65a3bc175cb9b822889b393f0ad","observation_id":"46780f46-8b9d-45b9-9b28-593598929161","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Playground v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:b8245d34db7dc90b489623b7366f95554d6740f7c7b7335f6397b1571ff674fe","observation_id":"acdb1d11-57c8-4ee4-982e-01fd1f432468","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:0de99fc69aaae72a47dc634f4537200e8c6a66070742ffbf928870fb97d3f064","observation_id":"cb6d2f2b-4f5b-423e-9a6a-40575aedd698","resolution":{"observed_at":"2026-06-29T13:23:28.281901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:4ac58dfd398b46a392ef18c173e85b4e4cf953cfd53be5d93b0381e091162f05","observation_id":"6f97e364-a2f8-43ea-bb8e-2bd33348ce8d","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08580","last_updated":"2024-12-13T03:13:47Z","snapshot_observed_at":"2026-07-06T20:05:23.685854Z","submitted_at":"2024-12-11T17:57:10Z","title":"LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations","version":2},"cited_work":{"arxiv_id":"2412.08580","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08580","snapshot_observed_at":"2026-06-29T13:23:28.275291Z","title":"Available: https://arxiv.org/abs/2412.08580","venue":null,"work_id":"4c404b6a-4320-4c88-8e83-7d6f1f5c00b3","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2412.08580","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:941f1615a2911710eb3d7884daaf8ea76b4f5b15981f2832574a5c3545467637","observation_id":"557264fc-ffe9-48f0-ab1f-15a838f98369","resolution":{"observed_at":"2026-06-29T13:23:28.277687Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models.Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:12233b0fba58c03b84f7c69abf4f96e2bfad5f1762e6384a704e2c1cb3dd7358","observation_id":"d7917592-7b31-47fe-b35f-64250911c9eb","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-01T21:33:07.884113Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.13655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-07-04T16:39:58.233736Z","title":"LLM-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"5c6b2f10-7c7a-4f99-9895-3524faeea08d","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:660b742cd940b07e0c17799581775a32496a80373baa2b231d77dc9217b72311","observation_id":"91ef9bd6-f350-468b-94b6-76255911bfef","resolution":{"observed_at":"2026-06-29T13:23:28.288224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Aesthetic post-training diffusion models from generic preferences with step-by-step preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:e9b02eca688d5ca2a2050002a1eda48913f28c465e0aacf4aca0468705e12557","observation_id":"42e4fffa-f157-4e67-88d8-e82c8036d534","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:d4fef231ed03baa7daa5a3c5f68d387950eb28f3bdbf19045e041df55b6525f4","observation_id":"c6e39825-1d71-4628-8429-6cbf1de93d74","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Eclipse: A resource-efficient text-to-imagepriorforimagegenerations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:f9bdc5aecf5f504bebe1dadf1183b055e5d1dc104e1ead96892fed508addac41","observation_id":"582ff4b1-4d6c-49fb-a319-2788ecc4919d","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Enhancing image layout control with loss-guided diffusion models.2025IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pages 3916–3924, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:f8f23222541c0b757d1686bc5026d9859380a923d6e0eb3e9bb71246d8495151","observation_id":"183dc7a8-7d43-4fb5-b305-1a7a1f153a78","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:1c3c1d6cc248065d0bde98f3ddee022ef16d8dcf0031517f38effd27e724232f","observation_id":"1326b9df-2b21-4376-84c5-177c51a1bb88","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:b6c88ab12f30f9c6d9cb420a6448682130afb1499d8be291a7a97a33032b7cc4","observation_id":"6ad8a84f-e736-4331-ad3c-f7c5c9d1954b","resolution":{"observed_at":"2026-06-29T13:23:28.317518Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:02f6495e62458e02369b5b9ac32cf748dd10ee50a71b6a09c52266f6dd038871","observation_id":"4ac09c30-23ee-4d5c-ad04-cf8e721d43b0","resolution":{"observed_at":"2026-06-29T13:23:28.321794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:670a91a98420f7942c8f35908ca622fb53067941e62693a9a316a1243f6b0ef2","observation_id":"6ad5b72b-5caa-46ff-96a8-145544cd971b","resolution":{"observed_at":"2026-06-29T13:23:28.271295Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:8b22d5b88e4ddbdbb5a9e34362bd63a77a8318dff9be01003e4fb2120ab820b0","observation_id":"0dfba7f4-d6ed-44cc-9586-697314419e31","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Joty, and Nikhil Naik","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:7c8b3e9d239b4f5e5d01fffbee7db5e45747bada727c5b8c48ed44d05febe9ec","observation_id":"ec046f94-920a-4af2-a4d9-2e965bf65b65","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:16c14239e9961eb5b9024f05636c07af427f7034ea80c567ef99c97be59e38e4","observation_id":"4a0f52fc-1ad2-4af7-9ed1-3e5559e29059","resolution":{"observed_at":"2026-06-29T13:23:28.268975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Instancediffusion: Instance- level control for image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:89c1b186a769db5f81f4373cb3a92123e0abb09dd4c141e2790098bd3c193c39","observation_id":"835069a5-55c0-4959-9602-71d237bbe30c","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Tokencompose: Text-to-image diffusion with token-level supervision.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 8553–8564, 2023","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:50b1ad87d496959911a23ed1746d74b54c113b62814ffffbd4c9aa3df1237601","observation_id":"db404a6b-ccc1-43c2-aba7-98f5806b4c31","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:f9bf9b1fe933c32de7978d99aa5dac0347ea15d72da02551bd27b9011d5ad6e9","observation_id":"effb093e-0bbe-441b-9d17-e9717133fcc0","resolution":{"observed_at":"2026-06-29T13:23:28.264372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2306.09341","doi":"10.48550/arxiv.2306.09341","metadata_source":"pith","pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","venue":"cs.CV","work_id":"40702548-f094-4c67-a5db-a62f426f852e","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:d1de35f671e6bb2e779059e776b3b2ebf2f2e727b186207395a2d9589d0e59d6","observation_id":"449a95db-e5f9-44f2-89da-6a4985fa6fe7","resolution":{"observed_at":"2026-06-29T13:23:28.266858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:3cc01b624f9cc216e81d3fb05b05ae5a5bc44017bf95c211e9d930936ba49c61","observation_id":"e4c0aaf3-2f4d-46d8-92d2-4d07a2b27c62","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion.2023IEEE/CVFInternational Conferenceon ComputerVision(ICCV), pages 7418–7427, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:213b8bffc24811bd5d1276a0366ff10a58e473f9179eae0c7a6d7b6da73e956b","observation_id":"984973a1-1b85-409a-85f0-f32006326c4d","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:e1a68566ea1b57b497c7df81b6f41cc09f3e3c121c18f09890bb514f6136ac27","observation_id":"d25c841a-26d7-402b-88e4-7de930f84fb1","resolution":{"observed_at":"2026-06-29T13:23:28.262113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-07-06T15:14:55.628493Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2304.05977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-07-04T08:59:43.031755Z","title":"(page 13)","venue":null,"work_id":"578102d7-413d-4e1e-b8a7-a532ef75f1a6","year":2023},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:bf92cb78890258b56849b8fa3cb54d93d7843ce67a19b2265cd05cc1d070edf7","observation_id":"e5da4431-8128-489a-8fe0-2c0fdf5f475a","resolution":{"observed_at":"2026-06-29T13:23:28.301718Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-04T20:05:00.947056Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2401.11708","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-06-29T13:23:28.257830Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":"bd988759-4f55-4079-8131-1162ced8f017","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:075bde4d7139083b409455092988a62545392f1968bd178b2f94a0a0977e5dd8","observation_id":"276680a2-f601-4dcf-bb86-2f6e84230380","resolution":{"observed_at":"2026-06-29T13:23:28.259292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-07-06T20:01:59.108032Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2412.03859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03859","snapshot_observed_at":"2026-07-02T08:26:47.756395Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":"466097fd-703b-42fc-9c6f-b5cfcca0df46","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2412.03859","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:1567e1e082934e21ed4cb1262af4478307cce5415fd1ea2422d7cc93e43b25d6","observation_id":"b2376fc3-d09e-491b-ab3d-ff9d59f8ace6","resolution":{"observed_at":"2026-06-29T13:23:28.291397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.01051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:29.412308Z","title":"Diffusionmodelasanoise-aware latent reward model for step-level preference optimization","venue":null,"work_id":"81bfafbe-2fb4-45d3-813d-2793c44de76b","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:005c10870582b4a9a4b3e06faa2528cbd8a1a67d57b9d881ab29f615385f93f8","observation_id":"469978e9-f216-421d-9a3b-551371990134","resolution":{"observed_at":"2026-06-29T13:23:28.274092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:bb830f2d1502723e74eb2daf128a9abf5290b0b6f14c20e6052a8ebf3a5742c2","observation_id":"14a3fe6d-9416-4690-b1b3-fd2691a4c0ad","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":"Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:da28bd21afc14b6348a73baefc2d75382f8a3eb72ec7f9b0e05ce47a0c40c2b3","observation_id":"4b283f70-325c-4771-9399-2aeb653f65b2","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"cited_work":{"arxiv_id":"2505.24875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24875","snapshot_observed_at":"2026-07-04T16:39:58.166311Z","title":"Reasongen-r1: Cot for autoregressive image generation models through sft and rl","venue":null,"work_id":"1b96e53e-4a55-4eac-af91-d650ecc68e28","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2505.24875","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:7d6224747bf38041b3426aa41831b8ff39c0f714fb265905868f4c9dbef26875","observation_id":"7a0a4529-8acb-4d06-9d30-ebdc5e3679fe","resolution":{"observed_at":"2026-06-29T13:23:28.285430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:15:24.299457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:87064a57534f24202c1e0cf54788f220f084b97806d90f74cd8e0445b3da1f4e","observation_id":"c74e5544-ffba-43da-b3d8-8d7efb67f563","resolution":{"observed_at":"2026-06-29T13:15:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-04T05:04:30.923686Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":"2406.18583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-07-08T00:04:22.362322Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":"cs.CV","work_id":"a86301ea-f268-4427-89ff-5d7599f00938","year":2024},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:3703c9d9b6bf42267ec10db26d81b55b97d0782004237b1d26051e027519dd7a","observation_id":"fee82bc0-6dc0-45e1-8278-a456b7da04f0","resolution":{"observed_at":"2026-06-29T13:23:28.299117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:04:02.464901Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":30,"verified_exact":19,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2605.28615."}