{"as_of":"2026-08-07T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfea56e82272511891ee294a570fc00ce6df9852f77dbe1b014af20e2f2d4361","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:48:57.591417Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23418/citation-record","integrity":"/paper/2506.23418/integrity","json":"/paper/2506.23418/citation-record.json","paper":"/paper/2506.23418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:50.808315Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.808315Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:250e8c699a08d7e5544549cef09b5fd957935440b43ac33582041b6970bb00d0","observation_id":"1b45c9dc-5db5-4982-9ef1-e50edfe83359","resolution":{"observed_at":"2026-08-06T21:48:50.808315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:50.867916Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.867916Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:98ca19474d1e1600e2ed023107005654bebcf49b25f23996fa3a06308c3bf82c","observation_id":"3f71b3e6-8ec6-463b-bbec-afd2add3b53b","resolution":{"observed_at":"2026-08-06T21:48:50.867916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03511","last_updated":"2024-06-28T11:23:11Z","snapshot_observed_at":"2026-08-02T11:16:43.728226Z","submitted_at":"2023-12-06T14:13:38Z","title":"Kandinsky 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03511","snapshot_observed_at":"2026-08-06T21:48:50.976891Z","title":"Kandinsky 3.0 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.976891Z"},"links":{"cited_paper":"/paper/2312.03511","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:5f4803d8bcdde58bb4d4a5ee053b2668c06460c33b6c5fa465298346c802c051","observation_id":"07799072-ad50-41b4-b658-3d6ceaf1db9d","resolution":{"observed_at":"2026-08-06T21:48:50.976891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.033654Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.033654Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9a2a94ba00c2a40f6d967bf049880f82be8b4674b2ad0a5806e7de7480fb24b5","observation_id":"f2a69bfd-0dca-4dd9-8e21-23820b2719b6","resolution":{"observed_at":"2026-08-06T21:48:51.033654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.080754Z","title":"Spatext: Spatio-textual representation for controllable image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.080754Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:880de5d4a68005348477b915554a0740197668c83934f54d525017c9f388861f","observation_id":"6a8c774a-95af-48c2-849f-65c0d9e7309f","resolution":{"observed_at":"2026-08-06T21:48:51.080754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.127391Z","title":"Cc3d: Layout-conditioned generation of compositional 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.127391Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d858e80f0b76926f9b99d0e496ffc8fd5f391dfe94e4d6264fb9652e25837e6f","observation_id":"4b624120-e17e-4a45-9d74-32299bfb1238","resolution":{"observed_at":"2026-08-06T21:48:51.127391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.167595Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.167595Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:010629ec7f7456ca41ca5d3e2d2a3e248bb72fef50161c30a7fa63abbacabaff","observation_id":"2e40a2e8-8777-44e5-873e-7d0bd3629d80","resolution":{"observed_at":"2026-08-06T21:48:51.167595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08113","last_updated":"2023-02-16T06:28:29Z","snapshot_observed_at":"2026-08-07T03:49:49.341219Z","submitted_at":"2023-02-16T06:28:29Z","title":"MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08113","snapshot_observed_at":"2026-08-06T21:48:51.252650Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.252650Z"},"links":{"cited_paper":"/paper/2302.08113","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b8f621a7131c9bd489de8ac414684af05b9bdd651995aa24a25ed471fc094642","observation_id":"c3b64dc5-5646-4eef-900f-5df72f601870","resolution":{"observed_at":"2026-08-06T21:48:51.252650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.298620Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.298620Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:337cb78ddd7c18dccc54b4094d024e4bf17f2ee9f153d99422520325f784ff6f","observation_id":"41a8f068-b396-4a9b-b4e4-133192444c86","resolution":{"observed_at":"2026-08-06T21:48:51.298620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10210","last_updated":"2024-06-14T17:46:08Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:46:08Z","title":"Make It Count: Text-to-Image Generation with an Accurate Number of Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10210","snapshot_observed_at":"2026-08-06T21:48:51.348576Z","title":"Make it count: Text-to-image generation with an accurate number of objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.348576Z"},"links":{"cited_paper":"/paper/2406.10210","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:dd56c9e8859de98ed52a6458b2affd2682b583901193250684e2facc86b5cf95","observation_id":"4fd1b3e2-497d-4ced-ae61-9af9773af035","resolution":{"observed_at":"2026-08-06T21:48:51.348576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.795290Z","title":"Conceptual 12M : Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"23f38074-73aa-47ce-a422-fc82bb47a203","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.432547Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d21eeda870d6510773d8b1d1701514a60cdcfcec1b76521484e2180c8b8c8171","observation_id":"26a059a3-eb12-4ace-b2ed-612a9e13c0e9","resolution":{"observed_at":"2026-08-06T21:49:03.878208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01197","last_updated":"2024-08-06T17:58:00Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T15:55:25Z","title":"Getting it Right: Improving Spatial Consistency in Text-to-Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01197","snapshot_observed_at":"2026-08-06T21:48:51.518955Z","title":"Getting it right: Improving spatial consistency in text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.518955Z"},"links":{"cited_paper":"/paper/2404.01197","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:647edc2f8eef871071353ddc29123e2680dbf911e1099336f649e6cfbda6d194","observation_id":"b3a0d950-88b9-4ea0-9329-aa5f0ab4ffb8","resolution":{"observed_at":"2026-08-06T21:48:51.518955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.652271Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models","venue":null,"work_id":"5ec7aa62-c7ab-41e3-94cc-e6e17b57746d","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.601008Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:64369ba40b6785d6b6ff48a9ceb17137ebf9a2e4e93ddaae9b8a1faf8ca2a58d","observation_id":"4bfb679c-f849-4704-bf91-e714a875ec45","resolution":{"observed_at":"2026-08-06T21:49:03.719627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T21:48:51.657856Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.657856Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:0f310b8fa99cacec49b000ab1283ad9d82caa215465b3a5ef8a0b73cf9b81ad3","observation_id":"e1d998d1-f294-4f63-905f-d4b06ff9f1f6","resolution":{"observed_at":"2026-08-06T21:48:51.657856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T21:48:51.736340Z","title":"Pixart- : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.736340Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a35e2d2e73e74a0bee2c0cedd4614fdad729956e2300d5c1f64dd6695b7d5724","observation_id":"aaae8dd0-4517-47b7-bf31-a63a6426e88d","resolution":{"observed_at":"2026-08-06T21:48:51.736340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.494650Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"f48af46f-07d9-48df-b88c-b8b0d773be52","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.783311Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:027578e96918651dbf91e67e55c8e7576382eeec14ed6dbe0fec77101b5ff1c4","observation_id":"307c10fb-40cd-45ef-8cf9-05c055f67e7e","resolution":{"observed_at":"2026-08-06T21:49:03.564234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08908","last_updated":"2023-02-16T14:20:25Z","snapshot_observed_at":"2026-08-03T22:48:00.893342Z","submitted_at":"2023-02-16T14:20:25Z","title":"LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08908","snapshot_observed_at":"2026-08-06T21:48:51.832817Z","title":"Layoutdiffuse: Adapting foundational diffusion models for layout-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.832817Z"},"links":{"cited_paper":"/paper/2302.08908","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2c965216533627a351c7a9bdd25ea2fbb7de2879e58a9746173770177590f887","observation_id":"f60b0b08-79b3-4092-81a7-67085a3a6130","resolution":{"observed_at":"2026-08-06T21:48:51.832817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.296883Z","title":"Dall·e mini, 7 2021","venue":null,"work_id":"197a20bc-20bd-4e74-8960-da98f957d24a","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.883431Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:44405f2ed0a49a194c61a85a3c2b5457a4f3f383a430e0a42c09eaaa3d0792b0","observation_id":"4a510a3f-4052-400d-b187-98e87f161fd8","resolution":{"observed_at":"2026-08-06T21:49:03.406246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14217","last_updated":"2022-05-27T14:40:07Z","snapshot_observed_at":"2026-08-04T19:09:10.486489Z","submitted_at":"2022-04-28T15:51:11Z","title":"CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14217","snapshot_observed_at":"2026-08-06T21:48:51.971405Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.971405Z"},"links":{"cited_paper":"/paper/2204.14217","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e5c89359c63836d9effb676d0d17b7d790febab4edd42125b145b49e373684f9","observation_id":"9765d374-7cba-47c7-84b2-6d72e643d53c","resolution":{"observed_at":"2026-08-06T21:48:51.971405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.104131Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":"9e5cde13-94e8-4816-9577-1c02b351a6a4","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.059608Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2f5d48d023211b6fe63377433060f6b1b3906c888ef82442867cddae2ed7f1be","observation_id":"c7458bd6-c8d0-4088-bc99-df1b62ad21c2","resolution":{"observed_at":"2026-08-06T21:49:03.187547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-06T21:48:52.182184Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.182184Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:c1419eebe991508fe4e233695eb558a83ae49b0c7c355e938839c0c4159af17c","observation_id":"6e88afe7-aa0c-466e-b77f-134e9213febc","resolution":{"observed_at":"2026-08-06T21:48:52.182184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-06T21:48:52.298002Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.298002Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:45c2c81cf7211cb563ddc571e8524c39ce826a3cf4304656a3b191655da66f2a","observation_id":"f2b3f176-fa36-40c8-99f9-e08ba899c89e","resolution":{"observed_at":"2026-08-06T21:48:52.298002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T21:48:52.391265Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.391265Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:60e5b07c9fa3bc4696a1721091e09be291d8d89273e7374303120f71d56c9097","observation_id":"54e5f73d-cf88-4460-bc27-fa90af3275fe","resolution":{"observed_at":"2026-08-06T21:48:52.391265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14743","last_updated":"2024-10-15T19:37:51Z","snapshot_observed_at":"2026-08-04T04:06:24.551238Z","submitted_at":"2024-04-23T04:51:02Z","title":"Gradient Guidance for Diffusion Models: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14743","snapshot_observed_at":"2026-08-06T21:48:52.464757Z","title":"Gradient guidance for diffusion models: An optimization perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.464757Z"},"links":{"cited_paper":"/paper/2404.14743","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7ddf1108aaecca21c356511d96a34a0850b19d79e2578883d7f91b176c278a40","observation_id":"a97cb007-cd59-49c9-8682-85279d24b011","resolution":{"observed_at":"2026-08-06T21:48:52.464757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T21:48:52.605567Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.605567Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b520fe4aeab0d67eb76e9eeadea0c2950403fa103f028d1e69c6801d654ea9df","observation_id":"56e3b960-01db-4269-88bc-a7be5e2209ab","resolution":{"observed_at":"2026-08-06T21:48:52.605567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-07-06T05:48:30.254634Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-06T21:48:52.737177Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.737177Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:86b0764bc4521103bf84f5faab013de30612c909af2d5348d940a514ed0a8e32","observation_id":"a5d12599-6650-44dc-a625-5dbe2c18cc58","resolution":{"observed_at":"2026-08-06T21:48:52.737177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:52.842219Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.842219Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:77a5f36de86ad60b7606456084ce7d45b4ea450560bdaf7451b4a6474158ed11","observation_id":"a7b727f7-47fc-4c9b-83c7-40f10f905237","resolution":{"observed_at":"2026-08-06T21:48:52.842219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:52.928167Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.928167Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:5d92ab59ee388705aa1d8cbafd88a73d9ab44b6881a1cf4887a85359bbf86088","observation_id":"b6111a05-8052-4a32-8d30-9ecd28e2c8e2","resolution":{"observed_at":"2026-08-06T21:48:52.928167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.909670Z","title":"Token merging for training-free semantic binding in text-to-image synthesis","venue":null,"work_id":"18a3e4f3-efd8-4e49-b781-b09be602404f","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.000087Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b44f6ab2af12e8614cd2b7799aaf98b4205634d36c18591c96d3db0344a5d1f3","observation_id":"f00c05be-3b62-4de4-a843-a95554a680d8","resolution":{"observed_at":"2026-08-06T21:49:03.036753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07451","last_updated":"2025-03-11T10:55:52Z","snapshot_observed_at":"2026-08-01T16:20:25.400373Z","submitted_at":"2024-06-11T16:57:48Z","title":"A Multi-Armed Bandit Approach to Online Selection and Evaluation of Generative Models","version":3},"cited_work":{"arxiv_id":"2406.07451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07451","snapshot_observed_at":"2026-08-06T21:48:58.698551Z","title":"A Multi-Armed Bandit Approach to Online Selection and Evaluation of Generative Models","venue":"cs.LG","work_id":"88ec47f4-4a60-4e8c-979d-c005dc415c70","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.058729Z"},"links":{"cited_paper":"/paper/2406.07451","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7635528625aee23b23caf5319e4be8f5b4050e4c03fb130d73b1cf5f0a488853","observation_id":"79b60aa4-8021-40ee-a135-487356241c7b","resolution":{"observed_at":"2026-08-06T21:48:58.751381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.739811Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"c4c2071c-37ca-4a87-9e88-8531f61fc028","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.116358Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7fe1d97217c86fd8002faca7f8b94c772ce1fee3c98f9212ee84cf3a0ed05838","observation_id":"68e853c2-b619-4f9d-95ab-a9eda965bb51","resolution":{"observed_at":"2026-08-06T21:49:02.829715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.577989Z","title":"An information-theoretic evaluation of generative models in learning multi-modal distributions","venue":null,"work_id":"b47daf3d-7f60-4e13-ba1a-b512172ad94d","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.228368Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3d33699f86e01541f9f75e8831aba8f00653ee83082d0a4a1d9e639d37b3f940","observation_id":"8206daf3-8e7a-48dc-9aa8-fead9a8a5ba7","resolution":{"observed_at":"2026-08-06T21:49:02.654824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09603","last_updated":"2024-01-25T22:22:14Z","snapshot_observed_at":"2026-08-06T02:07:59.883449Z","submitted_at":"2023-11-30T19:11:01Z","title":"Rethinking FID: Towards a Better Evaluation Metric for Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09603","snapshot_observed_at":"2026-08-06T21:48:53.316391Z","title":"Rethinking fid: Towards a better evaluation metric for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.316391Z"},"links":{"cited_paper":"/paper/2401.09603","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:4d2ab8e43773d7efda3f56fad4ef43d307b497fb9cd707800ae36340e320fd24","observation_id":"07d48034-0798-4fe7-9a7d-d13cc77c49dc","resolution":{"observed_at":"2026-08-06T21:48:53.316391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.423488Z","title":"What's ``up'' with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":"4aafd750-a0d7-47ce-9760-ba7bffcc7cbe","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.352085Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:fea4fa8365cb6d705c435dce46ac7be8e9b6222f87359768a9ea5fb8e2b1525a","observation_id":"f2b20c63-ef67-4c6f-8e17-fdad4f6363f6","resolution":{"observed_at":"2026-08-06T21:49:02.501071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13308","last_updated":"2023-05-22T17:59:41Z","snapshot_observed_at":"2026-08-03T21:40:54.274621Z","submitted_at":"2023-05-22T17:59:41Z","title":"If at First You Don't Succeed, Try, Try Again: Faithful Diffusion-based Text-to-Image Generation by Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13308","snapshot_observed_at":"2026-08-06T21:48:53.437835Z","title":"If at first you don't succeed, try, try again: Faithful diffusion-based text-to-image generation by selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.437835Z"},"links":{"cited_paper":"/paper/2305.13308","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ce67e900ad3ca58fbbaefd8cb8c268f50928591bfd98124de08f91fa80edd179","observation_id":"568f43b0-6aeb-4c70-a4c0-43df7e04bb1f","resolution":{"observed_at":"2026-08-06T21:48:53.437835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04544","last_updated":"2024-04-06T07:53:49Z","snapshot_observed_at":"2026-07-06T17:56:27.818353Z","submitted_at":"2024-04-06T07:53:49Z","title":"BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion","version":1},"cited_work":{"arxiv_id":"2404.04544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04544","snapshot_observed_at":"2026-08-06T21:48:58.549114Z","title":"BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion","venue":"cs.CV","work_id":"5527ca7c-a52d-44dc-b165-6d95a5167f08","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.533737Z"},"links":{"cited_paper":"/paper/2404.04544","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b5e55904e0120ce3ce8fa00f63433034d0be1721f6cb9fde67be888b1bdc94d4","observation_id":"71edc826-1f08-423d-bc26-8dfe123c5cfb","resolution":{"observed_at":"2026-08-06T21:48:58.598720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.245273Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"5ae5f660-396f-4ba3-ace0-c0beaf82d912","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.586132Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d38294a1ccc296376100fd0798f5f45862e169627d6ef648e2a147b6adf3dc2f","observation_id":"65b24792-db47-47ac-a5cb-977279bd3622","resolution":{"observed_at":"2026-08-06T21:49:02.338882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:48:53.722447Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.722447Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:c3d3b294f0fcf6e363c4296ba506b69c87d76f3ac54aee8740c17775d321a904","observation_id":"60788508-c8c4-4c60-b0e9-270c434757eb","resolution":{"observed_at":"2026-08-06T21:48:53.722447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06991","last_updated":"2019-10-30T12:33:29Z","snapshot_observed_at":"2026-07-06T07:46:06.039145Z","submitted_at":"2019-04-15T12:20:32Z","title":"Improved Precision and Recall Metric for Assessing Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06991","snapshot_observed_at":"2026-08-06T21:48:53.852853Z","title":"Improved precision and recall metric for assessing generative models, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.852853Z"},"links":{"cited_paper":"/paper/1904.06991","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:56f7343113487383f1d737124dacbce03fe2b50feb984bc1eba7735f1e1b3fcf","observation_id":"632e5ff8-76bb-4f4e-89de-f5cc318033e6","resolution":{"observed_at":"2026-08-06T21:48:53.852853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.041799Z","title":"Laion-coco 600m","venue":null,"work_id":"fc42a689-d21f-482d-abc8-037041cd3b11","year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.993200Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b661c7482542e10b1909a03e1e47221866add79c5f9c0fcd28b993b399047077","observation_id":"938ff7f5-8e90-47a5-b9f5-08632237ec65","resolution":{"observed_at":"2026-08-06T21:49:02.158280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20474","last_updated":"2024-11-01T04:33:52Z","snapshot_observed_at":"2026-08-03T04:16:49.590276Z","submitted_at":"2024-10-27T15:30:45Z","title":"GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation","version":2},"cited_work":{"arxiv_id":"2410.20474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20474","snapshot_observed_at":"2026-08-06T21:48:58.424627Z","title":"GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation","venue":"cs.CV","work_id":"b2a8f0f6-c96a-45db-b71e-ddffd199cf3f","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.063558Z"},"links":{"cited_paper":"/paper/2410.20474","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b29ff209ab4c1e984fedd79d443ab0f8642c2e3a3303ba51f2ab153d137fac66","observation_id":"cc4b0226-9d4c-407a-8619-11b898df9d86","resolution":{"observed_at":"2026-08-06T21:48:58.472999Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07093","last_updated":"2023-04-17T01:54:37Z","snapshot_observed_at":"2026-08-05T03:57:55.413826Z","submitted_at":"2023-01-17T18:58:58Z","title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.07093","snapshot_observed_at":"2026-08-06T21:48:54.226577Z","title":"Gligen: Open-set grounded text-to-image generation, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.226577Z"},"links":{"cited_paper":"/paper/2301.07093","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ec35c8fb36b9b02fc1c6a709a7bfb482e48ccdf61072b7c5b1b8ee0d2601f82a","observation_id":"83dd898d-37de-4d8f-b1b2-ea746ca26f09","resolution":{"observed_at":"2026-08-06T21:48:54.226577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.869540Z","title":"Divide & bind your attention for improved generative semantic nursing","venue":null,"work_id":"448d7a1b-865a-4f63-94a5-1c894eec89a9","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.383202Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2a5da985e0ef912c798dcfeab0ae549cfcfcff6d4f19141eeafa58eba6dcf22c","observation_id":"0981c3cf-42c0-4f5a-ad88-a0fa44bdb9bb","resolution":{"observed_at":"2026-08-06T21:49:01.947376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-07T08:09:13.605920Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-06T21:48:54.541171Z","title":"Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.541171Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:5fd63e28c6728136bdea031b26dcc5c163c421b1b3e037ccba2820506a62b368","observation_id":"163ad252-7a8e-46fe-966d-63458b240b4e","resolution":{"observed_at":"2026-08-06T21:48:54.541171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-06T21:48:54.670059Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.670059Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d22c8c52bcae0774a4d930db6a27006384940cbce1b875a53019a7562b987a07","observation_id":"1b6393a3-ac2e-4b9f-b839-c7024428db99","resolution":{"observed_at":"2026-08-06T21:48:54.670059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-06T21:48:54.778142Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.778142Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e5f3aafd24b6dd4be57735b969bf4ccd5921970108f65a2762842c43054a399b","observation_id":"babd993d-63a6-4fb9-89a9-c3b2f7b3f4cd","resolution":{"observed_at":"2026-08-06T21:48:54.778142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-02T04:13:10.260957Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-06T21:48:54.880447Z","title":"Tenenbaum","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.880447Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ab804f9fabe0b46f1c8ba9795fe1088d892c67f13b7e11abbb21fe8c5b269f2b","observation_id":"0c9d4880-0781-4eaa-a364-e680ac9a6c13","resolution":{"observed_at":"2026-08-06T21:48:54.880447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.698019Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"117320d4-4c31-49df-9c5c-d7f2a19b2638","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.923631Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3cfeae47054199f84301be1682c132db2f7e9d5a7344da96adb7509df0f40abb","observation_id":"ced64cf3-11ee-4234-afc1-7abfb9ed26c6","resolution":{"observed_at":"2026-08-06T21:49:01.783156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.489107Z","title":"Correcting diffusion generation through resampling","venue":null,"work_id":"70b422c6-9401-427b-b819-45d1d74cae58","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.042044Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ff35e64afc47ec706cb9e40aa2b0cc239313a424beccd3aac06eb5228a0e574b","observation_id":"9fd69e75-d069-47bf-9d8d-e0c8a10bb6cf","resolution":{"observed_at":"2026-08-06T21:49:01.584642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T21:48:55.131271Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.131271Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9312e4c9da6d61977b9dd56c105a6741a7925d56b1e1093fde90b51a5be960f4","observation_id":"9090d239-61cb-4e85-98b5-3771c792f67e","resolution":{"observed_at":"2026-08-06T21:48:55.131271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22775","last_updated":"2025-03-21T10:45:28Z","snapshot_observed_at":"2026-07-06T19:42:03.739016Z","submitted_at":"2024-10-30T07:43:29Z","title":"Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2410.22775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22775","snapshot_observed_at":"2026-08-06T21:48:58.268190Z","title":"Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models","venue":"cs.CV","work_id":"1fe5e2a0-6aaf-4ee9-97aa-27dee8fa6ae9","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.186979Z"},"links":{"cited_paper":"/paper/2410.22775","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b2a8bcef510986b09e154d58f35b7eeeb482572e118e7ea4fd3936f80dddf56a","observation_id":"1a67cb10-e9b4-462b-8869-d8d9ce9ea2b3","resolution":{"observed_at":"2026-08-06T21:48:58.305767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.290943Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"71786183-5e8b-4ce6-a318-8d826c851869","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.224103Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7a049ca63b7547a6500708d8efe19258ed7904255d139134eae8017256aeb34d","observation_id":"b8d16741-9771-454f-b974-e8b3bc0b739c","resolution":{"observed_at":"2026-08-06T21:49:01.393772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06230","last_updated":"2022-07-20T12:24:25Z","snapshot_observed_at":"2026-07-06T13:09:25.356940Z","submitted_at":"2022-05-12T17:20:36Z","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06230","snapshot_observed_at":"2026-08-06T21:48:55.316835Z","title":"Simple open-vocabulary object detection with vision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.316835Z"},"links":{"cited_paper":"/paper/2205.06230","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2c31506deb703e3ed79b6d0fc95756e9f2426372e26e690f1ef28798522b77fe","observation_id":"9970ec12-3997-4701-9dba-82053fae0d7e","resolution":{"observed_at":"2026-08-06T21:48:55.316835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T21:48:55.441530Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.441530Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:1b7832c9fa2ba6f8dae842ab4fb9d4db940011f774180d81cc03508bdda1238c","observation_id":"a378cbee-6979-48cf-a0c9-9d1ed0c2c8aa","resolution":{"observed_at":"2026-08-06T21:48:55.441530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:48:55.619085Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.619085Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d86524e8b38df9f48291bd4cd8828ba550c45edaede45661129efff226aa54da","observation_id":"35e4c707-9e52-4348-b0d1-5155491146cf","resolution":{"observed_at":"2026-08-06T21:48:55.619085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:48:55.723845Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.723845Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e4648b119f66ce096d409b4f49357c1f13fe6868a52d21fe7bd268a10b755bad","observation_id":"84c356ae-bf5c-4a8f-b989-9ee6242478a9","resolution":{"observed_at":"2026-08-06T21:48:55.723845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05427","last_updated":"2023-12-02T02:02:54Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:59Z","title":"Grounded Text-to-Image Synthesis with Attention Refocusing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05427","snapshot_observed_at":"2026-08-06T21:48:55.795064Z","title":"Grounded text-to-image synthesis with attention refocusing, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.795064Z"},"links":{"cited_paper":"/paper/2306.05427","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:90c182e0dc16b3d1eb5508427bd9a585f290fb251a7385264dd40b2ff69d156c","observation_id":"676cee09-5884-4021-9fad-a5e72b17e219","resolution":{"observed_at":"2026-08-06T21:48:55.795064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T21:48:55.869024Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.869024Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:05a8d0bedcd32ef4a2ea15d2fbe7c738e21493820e1322929e4dc92e0c8387fd","observation_id":"721246fa-07dd-4586-a22c-97860a7034c4","resolution":{"observed_at":"2026-08-06T21:48:55.869024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.031625Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"fadc01f2-7fbd-4460-901e-67b880c1057a","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.965615Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:8a6182491a4da44c023b9a41b4ea0d109227cbc2c210b47f49ab5ae89ebd9bfc","observation_id":"3a181d03-2143-46e2-898a-5e4a2f6f696a","resolution":{"observed_at":"2026-08-06T21:49:01.192900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.834549Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"198f845d-f4cf-47cb-b6e4-1d7b20139655","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.023411Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:acc3f5e2c953f7e026ad06f80054e4bbad87c44b4cc8cb74054ea8ab3f09be48","observation_id":"e6aace94-dd9d-4064-93eb-a33d6b4d5ae1","resolution":{"observed_at":"2026-08-06T21:49:00.928478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:48:56.058839Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.058839Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9f66097932aaa75a3cbe6521ef3a6c55376ef8bf0bf35b58ed87ecfccd455b42","observation_id":"26b51eb6-89dd-43c0-83c6-b8ba3c63a021","resolution":{"observed_at":"2026-08-06T21:48:56.058839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.645697Z","title":"Linguistic binding in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"b698f472-4cb7-4f34-ada2-e8d3fdb47017","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.114052Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:39e644469296a3d0cf9daafb9351df5a8acfd92aac8d8cd4f73fe4d06306aa4a","observation_id":"f2edd81a-8cec-4252-a975-0b63c4d33ac0","resolution":{"observed_at":"2026-08-06T21:49:00.717211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.423508Z","title":"Arkhipkin, Igor Pavlov, Ilya Ryabov, Angelina Kuts, Alexander Panchenko, Andrey Kuznetsov, and Denis Dimitrov","venue":null,"work_id":"dd8760fc-15b8-46d9-adf5-6cb6c1ec4326","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.170409Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d048e0d630ed84021fd7ff536bbe60f877fff958a68f74d04d559d215097162e","observation_id":"367c2b0b-cd2b-4eb0-9ee8-07b77b7c9b72","resolution":{"observed_at":"2026-08-06T21:49:00.511252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T21:48:56.243827Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.243827Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2cc0737b57ab2533289c04fc621235bf457547037fe51e99dc2a1fd896b637bd","observation_id":"112b0fc5-524c-4449-a5eb-e9e146ef55fd","resolution":{"observed_at":"2026-08-06T21:48:56.243827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.281095Z","title":"Be more diverse than the most diverse: Optimal mixtures of generative models via mixture- UCB bandit algorithms","venue":null,"work_id":"9973ad59-93cb-4e51-af39-028ea6c3ddf1","year":2025},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.338961Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a63e39a70734e60f95e48b936d75fbd214a2515f41fbc617ade03ac4589b397d","observation_id":"9bf64bec-9478-44dd-9edb-b24615ee4229","resolution":{"observed_at":"2026-08-06T21:49:00.335950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:56.381683Z","title":"Some aspects of the sequential design of experiments","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.381683Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ff10bb35e4363854fd4524f0ea2f0200b856ca49960e76e88a23d0b8f9aeee2b","observation_id":"dc1a2e9c-df3d-4cad-9d28-43c19116b4c3","resolution":{"observed_at":"2026-08-06T21:48:56.381683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:56.449019Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.449019Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:17dfcb4dfadc87c8293302f072c9344895a944fa4d7d9364cc21ebc75ecd7864","observation_id":"dce2eed6-d5f8-4927-b29d-0b19ead8005f","resolution":{"observed_at":"2026-08-06T21:48:56.449019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.077948Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"1023d62a-01cf-4f15-a689-60ca1d1f785b","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.503848Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:4c30f02f28293bc9231dc2ca1860fa90c456bc170845ea8054beb5300e3f47e1","observation_id":"e97464c5-dbec-4752-bd3f-816cbb486125","resolution":{"observed_at":"2026-08-06T21:49:00.178187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.881072Z","title":"Predicated diffusion: Predicate logic-based attention guidance for text-to-image diffusion models","venue":null,"work_id":"4e1f2e3a-d2a5-47e3-b2c2-25feb1c50a6c","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.540544Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:60f84d6c91ea8b3400cacc1adca86f9f417f8f2db45aa0552f8a7d5b7960b0f3","observation_id":"1878b31b-1707-4e95-b649-8c5be5da182b","resolution":{"observed_at":"2026-08-06T21:48:59.979688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03290","last_updated":"2024-02-05T18:49:17Z","snapshot_observed_at":"2026-08-06T08:11:36.010824Z","submitted_at":"2024-02-05T18:49:17Z","title":"InstanceDiffusion: Instance-level Control for Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03290","snapshot_observed_at":"2026-08-06T21:48:56.611116Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.611116Z"},"links":{"cited_paper":"/paper/2402.03290","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:0fabaf8d1c85c1b5fc6c020ea9c9a61e8a4045f1e24fd82536bac4874066e77d","observation_id":"e6c76451-9de6-4185-a098-92aa33429390","resolution":{"observed_at":"2026-08-06T21:48:56.611116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2682922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:58.070610Z","title":"Wolfe and Robert V","venue":null,"work_id":"afe2ec31-b57a-49b0-8c3c-b29be6c24bfc","year":1971},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.663174Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:168daf72c0668aa9ef544bee521fb06bbbafeefb949ce7b3fbf4593e0dd50033","observation_id":"6eea2c92-3000-4d91-a3bb-cca1487973e0","resolution":{"observed_at":"2026-08-06T21:48:58.107706Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08872","last_updated":"2023-11-27T08:42:07Z","snapshot_observed_at":"2026-08-06T14:13:21.470520Z","submitted_at":"2023-10-13T05:48:42Z","title":"R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08872","snapshot_observed_at":"2026-08-06T21:48:56.745122Z","title":"R&b: Region and boundary aware zero-shot grounded text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.745122Z"},"links":{"cited_paper":"/paper/2310.08872","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2dafda60ab6d9d5972e59eb861d0fd6d64630065ff826c56177f681a234d3898","observation_id":"aa2d77d7-1af9-455d-87fa-796a078c9105","resolution":{"observed_at":"2026-08-06T21:48:56.745122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10816","last_updated":"2023-08-21T13:07:10Z","snapshot_observed_at":"2026-08-03T06:20:53.986415Z","submitted_at":"2023-07-20T12:25:06Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","version":4},"cited_work":{"arxiv_id":"2307.10816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.10816","snapshot_observed_at":"2026-08-06T21:48:57.854470Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","venue":"cs.CV","work_id":"043c9925-59e2-4269-906e-d1bbfff8b77a","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.816954Z"},"links":{"cited_paper":"/paper/2307.10816","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:61bf2ba665ea1c9c7ab85269cca92545abdb47a17a3c4bcaf5160b8dc31ccc0e","observation_id":"1d63d2f5-54b2-4226-bed7-c60f7208a5cd","resolution":{"observed_at":"2026-08-06T21:48:57.931564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.766133Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"977a3812-e2c9-4f86-ad3d-15a0e858dfa6","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.852398Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:21503ddf975eb15f4cf2d4e869a7c2393ed0d7f8877b6fc9b2168b6003778700","observation_id":"8ba51f86-cc4a-4f76-a2b8-a0ccd79790fb","resolution":{"observed_at":"2026-08-06T21:48:59.834159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-06T07:45:20.379717Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-06T21:48:56.923723Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.923723Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:4d31bace29b0349c9182f61dfffc82c7c99948e50f8e4d6617aa740c7efcf822","observation_id":"ff379478-dc49-45a9-9c2d-0c34e5ca44a1","resolution":{"observed_at":"2026-08-06T21:48:56.923723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.632114Z","title":"Reco: Region-controlled text-to-image generation","venue":null,"work_id":"734da814-2e9d-4c7f-9b13-a8c412dc986f","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.998259Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9e6ab1cb476f314eff2901be770663e988743e628d0f08e22388aaffeedf49d9","observation_id":"855cada1-bf5a-43e5-8e87-dbdad5b0b6fc","resolution":{"observed_at":"2026-08-06T21:48:59.681822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11721","last_updated":"2025-06-05T15:25:55Z","snapshot_observed_at":"2026-08-06T13:21:53.371899Z","submitted_at":"2024-08-21T15:51:46Z","title":"Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11721","snapshot_observed_at":"2026-08-06T21:48:57.035500Z","title":"Iterative object count optimization for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.035500Z"},"links":{"cited_paper":"/paper/2408.11721","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d3069b491479feb28a6059e844633bdbb934c0b1327254446a1d7ddfed0169da","observation_id":"3c0c1880-0a35-4d0d-a0ed-89c56d17e0ef","resolution":{"observed_at":"2026-08-06T21:48:57.035500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07844","last_updated":"2025-03-24T21:33:14Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T03:21:34Z","title":"Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07844","snapshot_observed_at":"2026-08-06T21:48:57.092979Z","title":"Understanding and mitigating compositional issues in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.092979Z"},"links":{"cited_paper":"/paper/2406.07844","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e4361d1e6d3fbe02ad4bcf7865b419b7f31505668ac01407f34340b7ae91a9af","observation_id":"0ecde0f2-5b63-4da1-a25c-e919df18b343","resolution":{"observed_at":"2026-08-06T21:48:57.092979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.481731Z","title":"Multi-grained vision language pre-training: Aligning texts with visual concepts","venue":null,"work_id":"007de748-bbdf-4402-b023-b8e2979350b3","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.225701Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:51ab601eff5e0b45a0b82c63bb7c3f7f7f296934828f103e2ec60e07572e775f","observation_id":"6c6e4dad-b9be-4ec0-9c4e-a2e4a8147b8d","resolution":{"observed_at":"2026-08-06T21:48:59.553613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-06T21:48:57.313620Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.313620Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:991dd039cee8b880a112545502a7856767aeef028e09c797b601cabb8a74fbe9","observation_id":"dbe8a91e-ea7b-491b-89ed-248bec555a13","resolution":{"observed_at":"2026-08-06T21:48:57.313620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.348538Z","title":"Realcompo: Balancing realism and compositionality improves text-to-image diffusion models","venue":null,"work_id":"8d31666c-cbba-42a4-b2e9-65acfc459100","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.350636Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d47aca7bc140b227e725d0f854339771746ca782995a4a336e5ee4c5be24bd0f","observation_id":"2075568a-7757-4427-bc8b-f412c48e1914","resolution":{"observed_at":"2026-08-06T21:48:59.423169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06381","last_updated":"2024-03-11T02:18:27Z","snapshot_observed_at":"2026-08-05T07:58:24.491379Z","submitted_at":"2024-03-11T02:18:27Z","title":"Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06381","snapshot_observed_at":"2026-08-06T21:48:57.426716Z","title":"Enhancing semantic fidelity in text-to-image synthesis: Attention regulation in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.426716Z"},"links":{"cited_paper":"/paper/2403.06381","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3d9fb782f4cf5ed72d2778e7a19a860b6a2996e52a00d7219c5050f4af8003c1","observation_id":"640cee54-8bbc-4849-9c19-455d032b15ab","resolution":{"observed_at":"2026-08-06T21:48:57.426716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17189","last_updated":"2024-03-12T13:15:24Z","snapshot_observed_at":"2026-08-04T23:51:21.430350Z","submitted_at":"2023-03-30T06:56:12Z","title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","version":2},"cited_work":{"arxiv_id":"2303.17189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17189","snapshot_observed_at":"2026-08-06T21:48:57.719480Z","title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","venue":"cs.CV","work_id":"8768fdd6-3105-4046-acc9-f99838973f5a","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.484646Z"},"links":{"cited_paper":"/paper/2303.17189","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:6c9fe33b531f8bb10c4c587e0aed2425d9ab1220d46fa4961b3a464c95325ea9","observation_id":"ac7f8dd9-14e8-4c32-a600-b96082be45b4","resolution":{"observed_at":"2026-08-06T21:48:57.770163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.184218Z","title":"a henb \\","venue":null,"work_id":"7d150c67-b88c-4850-9b90-082802a2c741","year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.523921Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2dc1a2497c496dc337134203edf7cb5b7ba47fac3a8b14c4fc224f21b98bd092","observation_id":"7924c320-10cd-4992-9f9a-459d6d3807d2","resolution":{"observed_at":"2026-08-06T21:48:59.258838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:57.591417Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.591417Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9a2d04abd53d5cc9e21656154b83ddbc7c9f6a10c9ff0e71554ee97a1946a632","observation_id":"092761a5-b219-4d41-b024-75209b95bd11","resolution":{"observed_at":"2026-08-06T21:48:57.591417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":51,"verified_exact":6,"verified_fuzzy":27},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2506.23418."}