{"as_of":"2026-08-07T22:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcbae46c33cbf7023f896c28dd75a1b3e44076c6046706ebdcb167ed003ab325","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:21:27.112050Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:10:09.300722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.420268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-07-06T23:07:03.254122Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:50144935dd7aabe52e61bae6276830eb5cbc36a871789153c242059e81e511a7","observation_id":"74f31468-8f91-4b76-b3e6-4ac6cdbab895","resolution":{"observed_at":"2026-05-10T00:49:48.814426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:bb46f5146523c06efe1091d5026de96d29c42cfa548f39262916dbdaef8e132b","observation_id":"e353140e-f05d-46e4-90d7-b64f3dd3f317","resolution":{"observed_at":"2026-05-12T08:46:26.895339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2606.26738","last_updated":"2026-07-15T11:15:44Z","snapshot_observed_at":"2026-08-02T10:10:07.945306Z","submitted_at":"2026-06-25T08:20:34Z","title":"Do Image Editing Models Understand Lighting?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:42.024146Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2606.26738"},"observation_digest":"sha256:00826705f78592154d8b1ed748786163a0e51913dd9b476cde0d208aa52b05f0","observation_id":"027d0472-c21d-4c93-b7db-da8451aa30b8","resolution":{"observed_at":"2026-07-04T13:09:50.422178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-08-02T10:10:09.300722Z","title":"Genspace: Benchmarking spatially-aware image generation.arXiv preprint arXiv:2505.24870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26738","last_updated":"2026-07-15T11:15:44Z","snapshot_observed_at":"2026-08-02T10:10:07.945306Z","submitted_at":"2026-06-25T08:20:34Z","title":"Do Image Editing Models Understand Lighting?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T10:10:09.300722Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2606.26738"},"observation_digest":"sha256:988ab09ddbfed88e8962e770c2e307e29f4fffeae85dcdc77db164a32c40aebb","observation_id":"0c9af7a1-ec47-4037-8f84-421a4a828f92","resolution":{"observed_at":"2026-08-02T10:10:09.300722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24870/citation-record","integrity":"/paper/2505.24870/integrity","json":"/paper/2505.24870/citation-record.json","paper":"/paper/2505.24870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.139959Z","title":"Univ of California Press, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.139959Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5bf902428a696d95777c7171595501105fa7d6097353bf7d74f6b036ddd14f24","observation_id":"b46af2fd-fbb0-42e1-92d6-c575cc83a5d9","resolution":{"observed_at":"2026-08-07T12:21:20.139959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.733343Z","title":"artificialanalysis, 2025","venue":null,"work_id":"5933340b-9991-4763-bd10-99ef40f6ac17","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.280978Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:232c41d04ea916c28a90ef105ba029a96bef2e5fbe55bbfa5300fe99b2fa8c64","observation_id":"cfdd0717-c7bf-4037-ba62-4d21abcb9792","resolution":{"observed_at":"2026-08-07T12:21:31.805827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:21:20.380572Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.380572Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:b83975845a3755326b2ffad5c5638f9127310d44f6fd13d6b850a80459e894e4","observation_id":"6f9e14a5-2366-4fab-88a5-30bdeb56c20a","resolution":{"observed_at":"2026-08-07T12:21:20.380572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.539173Z","title":"The state of the art of spatial interfaces for 3d visualization","venue":null,"work_id":"35d3dd58-8c9c-4259-9dc7-fe45aef4936a","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.471921Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:021e25f6dd237f47f2f4594a022b7633558d5cbc6175463f02765012f8b762bf","observation_id":"1f4a59bd-d0cb-48a8-a937-81c74179908a","resolution":{"observed_at":"2026-08-07T12:21:31.624662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.559724Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.559724Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:834b827d1238be985b6c60cf726b328911521106777687feaae9f413095114e1","observation_id":"16533d03-3ea7-4269-a335-7bd48ca13f95","resolution":{"observed_at":"2026-08-07T12:21:20.559724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.690901Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.690901Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:fe7efe3628b629642da9557850cd4fa2e360f703ee3fafbdc3e9c25174f4483a","observation_id":"98caf435-875f-4f05-be14-bb37cb081ff7","resolution":{"observed_at":"2026-08-07T12:21:20.690901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.776296Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.776296Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2ed9bdfb26b7caf1bf8f4cdab3e073f708bd6dd972183b2b6abf22362ef81e56","observation_id":"448e6dee-853a-4972-b6fc-0995678be19c","resolution":{"observed_at":"2026-08-07T12:21:20.776296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T12:21:20.914495Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models.arXiv preprint arXiv:2406.01584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.914495Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:b8f01bd0ee007beef02904ded701b7d40b03981002827059bac64872e7e2f14b","observation_id":"eaf3a9d2-5463-4376-a6bc-5326c43abcfe","resolution":{"observed_at":"2026-08-07T12:21:20.914495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T12:21:21.025185Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.025185Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:45eb1e6af4d507c2ebd46a326f719eeb4344707de81ac49a79c571bf0ff9a96f","observation_id":"9c6e516c-9dcf-4d19-a551-e38fe52cd7e7","resolution":{"observed_at":"2026-08-07T12:21:21.025185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:21.163530Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.163530Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:05b340b2f84604c2609fc006ae4dfa204eea5d6e30da7f0dedfe457c0c773c08","observation_id":"7d18ac92-a9f6-4c43-873b-89900e87456a","resolution":{"observed_at":"2026-08-07T12:21:21.163530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.355776Z","title":"Routledge, 2017","venue":null,"work_id":"2495d56b-4374-43b7-97a6-11df1974a2e2","year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.321145Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:cb3464ce872a96547aaa23f02eca2d17c598eee3010f5b9f62e3531cdae93f90","observation_id":"75df68fc-7fed-43f7-b2bb-caf9d7928da4","resolution":{"observed_at":"2026-08-07T12:21:31.437732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T12:21:21.501770Z","title":"Commonsense-t2i challenge: Can text-to-image generation models understand commonsense?arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.501770Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:381281e232512833e16bfb04556aa6d7d5f3209115f46c157c3187327afaafe3","observation_id":"5042c595-d8b2-4957-8d6e-e989a06c2c7b","resolution":{"observed_at":"2026-08-07T12:21:21.501770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-07T12:21:21.642710Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.642710Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:40d724c4c5f5236493eff8624f88f7bb66c56a62372af4208e109aabca659961","observation_id":"8e498051-2301-4bdb-b254-b046d6132a46","resolution":{"observed_at":"2026-08-07T12:21:21.642710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.172215Z","title":"Interaction strategies for effective augmented reality geo-visualization: Insights from spatial cognition.Human–Computer Interaction, 36(2): 107–149, 2021","venue":null,"work_id":"edad27bf-13f6-4510-90dc-8119cd1f76dd","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.761934Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2fdf4a6c422f7419a251d22ba43f9f35525f03a75a4f148f146b98adf09ef99e","observation_id":"c5fe5d6f-44f1-43fe-9589-ab1349030bfd","resolution":{"observed_at":"2026-08-07T12:21:31.281855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:21.902276Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.902276Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:7703dac6612a5bbbce9683c8de884d8971635f1712a8e77f42d2660e95c3d6cd","observation_id":"54641fec-4982-4259-992d-f56ea187a7a7","resolution":{"observed_at":"2026-08-07T12:21:21.902276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.941955Z","title":"Gemini-2.0-flash, 2025","venue":null,"work_id":"567ffcb2-1509-4f49-9860-91f8bb38ef8a","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.040641Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:660e5d7117c79dae0ad4a76f9ae2fb85b3ee930d704238ed429c0f60b693c7cf","observation_id":"200400af-27cf-4f8a-a99f-cb20d10f8f09","resolution":{"observed_at":"2026-08-07T12:21:31.051201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.838964Z","title":"Gemini-2.5-pro, 2025.https://deepmind.google/technologies/gemini/pro/","venue":null,"work_id":"98fb9599-485b-4792-b8a8-d7053e6b013c","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.151813Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:23835421a7f709bc0bdc9e80208916579b50dc2d96b627684bce4b87a78d54b9","observation_id":"b99dd7ac-c942-44bb-b8cf-35172382d5a4","resolution":{"observed_at":"2026-08-07T12:21:30.870218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T12:21:22.261946Z","title":"Prompt-to- prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.261946Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:df3e0fdef9e8e63bdafbee11b2023333d18a17eeb404352104ba9726fa3c0123","observation_id":"c03f88bd-a509-44cc-9470-9b040d18bf9d","resolution":{"observed_at":"2026-08-07T12:21:22.261946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.355100Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.355100Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:9e118e9ddc9ecf6c9f7a3d7faa867f7c5bba32b081ba9ef23fe2682fc284ef17","observation_id":"6bdeaf89-f347-41ab-9c82-7d19a165efa7","resolution":{"observed_at":"2026-08-07T12:21:22.355100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.439109Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.439109Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d9a8daf7c03aa1886d61416afdebdaa04956012250fc386c3c68d26ba3920bc9","observation_id":"efda6c62-e141-41bb-9935-f449b285812a","resolution":{"observed_at":"2026-08-07T12:21:22.439109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.621789Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":"776e5f95-dab7-4f16-877b-3600cfd98b5b","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.579998Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2016654d52e7294305c81dcb40c64f66390fc75c58bbddf5bf39cb5bcac3a738","observation_id":"39b547ff-6312-48e7-a7e4-d2e7910423f7","resolution":{"observed_at":"2026-08-07T12:21:30.690958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-07T12:21:22.689695Z","title":"Composer: Creative and controllable image synthesis with composable conditions.arXiv preprint arXiv:2302.09778, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.689695Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:37e2230cf94116548f0d58764044a7ec621afa0088aa6c44682c0f51e1c07283","observation_id":"29bd3261-7207-4e99-acb3-46205719e5cf","resolution":{"observed_at":"2026-08-07T12:21:22.689695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.447205Z","title":"Perspective fields for single image camera calibration","venue":null,"work_id":"81df18f6-ddc6-4d84-80e4-6f625ebbe86c","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.790244Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:56555cccf05f55547fada50afe185a5d85c0afba570c383f2cf5626e4706760e","observation_id":"be4a7820-a7d8-41e3-8cde-fc27da6bb05d","resolution":{"observed_at":"2026-08-07T12:21:30.510813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.902732Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.902732Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:004fed2d5711bbd6ca960e05a2c7eee701533cf81350d49a1fb03af2f22c6d5b","observation_id":"c846080e-c2a4-4324-87e1-1924d2fbd59b","resolution":{"observed_at":"2026-08-07T12:21:22.902732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.002591Z","title":"Pick-a- pic: An open dataset of user preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:36652–36663, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.002591Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:615f9b3ded129740a6f241f9e9b6777d7b059ea4ea3a87bedaec197dcee310e6","observation_id":"f9390b6f-1d6e-4fe7-ad0f-8c14b5529d29","resolution":{"observed_at":"2026-08-07T12:21:23.002591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.095767Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.095767Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:704d0a9cde553b561cd967e7c211b66a902edb4968cba82d158d97d028e6fe2d","observation_id":"810b3a23-5e6f-49ab-9835-2a12b4fd7227","resolution":{"observed_at":"2026-08-07T12:21:23.095767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:21:23.182573Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.182573Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:4001781c1d4efe84dd26797d2c569f68c2465a9ca62bc866a1949850bab110a8","observation_id":"0ba3e372-9816-449e-8acf-d4a831eb2ab6","resolution":{"observed_at":"2026-08-07T12:21:23.182573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.301179Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":"5d8c5d33-418d-432d-893c-76b5cf743880","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.279789Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2a411bc7c0d691f663f72bd31c081f0770021cbbcc72411c54e8032587ba4709","observation_id":"75e43270-0f7d-43fe-b33c-56179ae1806c","resolution":{"observed_at":"2026-08-07T12:21:30.331628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T12:21:23.379583Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.379583Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:ddd5c71600d50e6b78b1a2385d3cd672f8c2d2c44d3a8d9975fb801cb5b062da","observation_id":"eafc1697-b812-446d-afac-e42599339342","resolution":{"observed_at":"2026-08-07T12:21:23.379583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.430712Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.430712Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:465ef9666f46f5127a283b6e23c6339965eb9428f4e56ce4a2a17b1df4e1c563","observation_id":"73cc255d-0bb3-46b4-8804-2be266a7ceba","resolution":{"observed_at":"2026-08-07T12:21:23.430712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11817","last_updated":"2025-03-02T07:05:19Z","snapshot_observed_at":"2026-08-04T04:52:39.088264Z","submitted_at":"2024-10-15T17:46:31Z","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2410.11817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11817","snapshot_observed_at":"2026-08-07T12:21:27.598172Z","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"3aa5051b-6010-4c3f-b365-ba2e9cf64081","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.564403Z"},"links":{"cited_paper":"/paper/2410.11817","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:e15e7bc4f34c2ce4fcf230fce7b8716861442b1573d756a0ce55abf49a1522f1","observation_id":"ba8a2a71-5919-499c-b7fd-d1cef9bbb745","resolution":{"observed_at":"2026-08-07T12:21:27.679632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.656105Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.656105Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:9236bf2a30475780d97a6ba13dc3b74cf976d823457099a6dee44062eabe68e7","observation_id":"e8eec2dc-570e-4570-98ed-b82966dfe8b8","resolution":{"observed_at":"2026-08-07T12:21:23.656105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T12:21:23.733768Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.733768Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:df54ffa4e631c36b70e793b2b5617507ba7079ee039eaef0d23da4992997db82","observation_id":"2b7cc815-f909-4904-80e2-ef49e217350d","resolution":{"observed_at":"2026-08-07T12:21:23.733768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.836081Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.836081Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:3f40b42d8379ac27c402c29e1902b6222ce3807abb68dc9ac070870df5c171bb","observation_id":"216c5aed-8743-40a1-989c-89e5ed6623a3","resolution":{"observed_at":"2026-08-07T12:21:23.836081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-07T12:21:23.919192Z","title":"Phybench: A physical commonsense benchmark for evaluating text-to-image models.arXiv preprint arXiv:2406.11802, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.919192Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:c867ddd725744bc61d4a3df45fc428d98ef2ffd671413bea909b2317b0a233f1","observation_id":"c316e543-6c85-4442-af8e-b75ae5e6ae74","resolution":{"observed_at":"2026-08-07T12:21:23.919192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.034736Z","title":"Hands-free interaction in immersive virtual reality: A systematic review.IEEE Transactions on Visualization and Computer Graphics, 27(5):2702–2713, 2021","venue":null,"work_id":"104cdecd-643d-4d6f-afad-d1fe1ab4dc23","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.041361Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:fc49cb999dcd1444a882b1436a43a320343df9c40f92c0059141b108fa504923","observation_id":"8cae6b39-964e-4e48-96cb-52b1f01eabe8","resolution":{"observed_at":"2026-08-07T12:21:30.152161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:21:24.138663Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.138663Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:07090c037034d0fef23d70ef68258c3e56205301b1021ca9ffd9d43aaa060869","observation_id":"3d441313-ed6c-4758-abb1-3e117e947a75","resolution":{"observed_at":"2026-08-07T12:21:24.138663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.796457Z","title":"Gpt-4o, 2025.https://openai.com/index/introducing-4o-image-generation/","venue":null,"work_id":"50c0237c-f587-43c3-b8d2-d4df99a2f215","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.226161Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:0b59cb2d86dcd259b7517b201501f8ffdd6b536cca1fdef95deb553e3156764a","observation_id":"e5009608-ba5a-40b2-ab86-8a59f8085f66","resolution":{"observed_at":"2026-08-07T12:21:29.931517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.545429Z","title":"Gpt-o3, 2025.https://openai.com/index/introducing-o3-and-o4-mini/","venue":null,"work_id":"4f814c66-dbeb-4304-b280-5a4c0da7b88c","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.339565Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:45d84d54052437e6cc4d57bcad46ce8f42d8ed9a74839c1c9487628fc0f1f747","observation_id":"93bd714e-7be7-4162-bd35-8465ea7ce1d4","resolution":{"observed_at":"2026-08-07T12:21:29.688950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.263041Z","title":"Diffusion handles enabling 3d edits for diffusion models by lifting activations to 3d","venue":null,"work_id":"0dc85c24-d550-41f4-a70d-c77096db9101","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.436992Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:347d8643896cbb56acdf63972eee75e28ab141df033178a16bddaf303221e39c","observation_id":"1fa1556f-c724-4629-84c4-fd42fad2479a","resolution":{"observed_at":"2026-08-07T12:21:29.367092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:24.513458Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.513458Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:07a3c5cf5362f97c0c8a0bb9a32d53818bf453df6285df52753a004f8b09724c","observation_id":"5138a52d-a751-4369-839f-59018ebc1c6f","resolution":{"observed_at":"2026-08-07T12:21:24.513458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T12:21:24.611747Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.611747Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5393b7e69a92e98d3303324414cdc7722a97eb35d84b84cb4a50522a91819c97","observation_id":"724df505-a9df-475f-a883-23efe1c4a75f","resolution":{"observed_at":"2026-08-07T12:21:24.611747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:24.710721Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.710721Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:64dcc03f2f2a7f0dc93d053f1e9db17ab73bfec5d8ec9f5ee3bb994ce29e9e02","observation_id":"975044c5-66b2-478a-b910-2082cae1b4fe","resolution":{"observed_at":"2026-08-07T12:21:24.710721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-08-06T15:03:15.947501Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-08-07T12:21:24.796187Z","title":"Does spatial cognition emerge in frontier models?arXiv preprint arXiv:2410.06468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.796187Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1706fc4e3a0e4567317e86f914bec92cdc1f61797aadf052256f723c5f4800e0","observation_id":"89639ab5-5079-4828-a8dc-149077824f5a","resolution":{"observed_at":"2026-08-07T12:21:24.796187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:21:24.876288Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.876288Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:821127b676b892cc80907b653f46ec1dc9ab91097020dcef4494df3d4c7e9941","observation_id":"65164d93-b13b-4d21-b6ce-9e5328f38f08","resolution":{"observed_at":"2026-08-07T12:21:24.876288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T12:21:24.946005Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.946005Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:7075a1dcb5c40d43d6c22d8cb86ec881c35a278444878c3aa87393cb3d5b0a14","observation_id":"f15429ec-5438-4ae4-a8f4-c415be0e5e19","resolution":{"observed_at":"2026-08-07T12:21:24.946005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.017477Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.017477Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:6e27806be2d2438a3083ac74edc6cda3fa87d650abf7b41a8a380cfd1cf9ef95","observation_id":"3982acb9-1a81-41dd-a817-ec747de379eb","resolution":{"observed_at":"2026-08-07T12:21:25.017477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.090599Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.090599Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:f275235f8c290e4a6563121c45ab7b3b5556cc46b45ba83635909ea691350c88","observation_id":"7198bf91-2ed5-4f49-805e-485685938b60","resolution":{"observed_at":"2026-08-07T12:21:25.090599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.158919Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.158919Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:c342d3f7e3e63b27919f991f96cca1d4602b647aeadf2b966406c2b0526358fe","observation_id":"5179dcb2-693c-498c-938e-c587b1f80307","resolution":{"observed_at":"2026-08-07T12:21:25.158919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06686","last_updated":"2024-11-11T03:06:26Z","snapshot_observed_at":"2026-07-06T19:48:15.021550Z","submitted_at":"2024-11-11T03:06:26Z","title":"SeedEdit: Align Image Re-Generation to Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06686","snapshot_observed_at":"2026-08-07T12:21:25.265534Z","title":"Seededit: Align image re-generation to image editing.arXiv preprint arXiv:2411.06686, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.265534Z"},"links":{"cited_paper":"/paper/2411.06686","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d9e576238180ba5552122b5ad15d416b3a921b7a02ae87c6ef1f923c0dc13eb9","observation_id":"55761e5b-7922-4a03-bc9e-c880f61dcb1f","resolution":{"observed_at":"2026-08-07T12:21:25.265534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07664","last_updated":"2024-11-12T09:30:02Z","snapshot_observed_at":"2026-07-06T19:48:58.392175Z","submitted_at":"2024-11-12T09:30:02Z","title":"Evaluating the Generation of Spatial Relations in Text and Image Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07664","snapshot_observed_at":"2026-08-07T12:21:25.344505Z","title":"Evaluating the generation of spatial relations in text and image generative models.arXiv preprint arXiv:2411.07664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.344505Z"},"links":{"cited_paper":"/paper/2411.07664","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d371b2d3dfd33654d1f176d021a72adaa662d66cc41eef56acbcf66d3802701d","observation_id":"f4f0165d-14c5-4572-8790-18a320b70af9","resolution":{"observed_at":"2026-08-07T12:21:25.344505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T12:21:25.420657Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.420657Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:b246823fc442da03f55db4d065b699711db15eaac9159fa769f52389a705031a","observation_id":"de0bf15a-4c2d-45d6-aca8-764a6e7b4537","resolution":{"observed_at":"2026-08-07T12:21:25.420657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.552279Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.552279Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:437c4aa01b56c551aac3a31c1d9c0f0654fa164f5f4609a1e1aefeca1785adfd","observation_id":"8c96555e-8b81-48d2-b1b5-3dc956516e39","resolution":{"observed_at":"2026-08-07T12:21:25.552279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.629620Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.629620Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:05185520f089916ba86aa00be33bf9bae2cae6f215c3f7a1c0e3f98206a5cbc4","observation_id":"3c311cfb-3a95-48e4-9241-86dd0325874b","resolution":{"observed_at":"2026-08-07T12:21:25.629620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.943179Z","title":"Diffusion models are geometry critics: Single image 3d editing using pre-trained diffusion priors","venue":null,"work_id":"7a7b2ed1-749f-494a-b905-9c467921ba46","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.729981Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:24fde8eaeff06a11fa07ffa178d9aa9f015635ed833cb4d2a89288a5e939f18f","observation_id":"f78d723d-8c76-496b-9ed4-ef1477c2fc1b","resolution":{"observed_at":"2026-08-07T12:21:29.062674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18605","snapshot_observed_at":"2026-08-07T12:21:25.818565Z","title":"Orient anything: Learning robust object orientation estimation from rendering 3d models.arXiv preprint arXiv:2412.18605, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.818565Z"},"links":{"cited_paper":"/paper/2412.18605","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d8fe7f867abd843ee37308bc812a2c921f7ad4ad80f1f8e8a4a4942304c06f6b","observation_id":"73cc1680-f8ff-4b61-b0d8-581ff98c6902","resolution":{"observed_at":"2026-08-07T12:21:25.818565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.920486Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.920486Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:c46488a0196e6ca91b24d486953ec29144f8fd934064617d61ff1f7e4f05fbd3","observation_id":"eb0590c9-a39a-46d2-b4c8-a14535c1d4f7","resolution":{"observed_at":"2026-08-07T12:21:25.920486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:21:26.035619Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.035619Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:7c14b7ab028b71f1b9f848bad350184a33407eb7e72495edf68e23b88e4f3ab0","observation_id":"139c664c-12f5-400f-8446-4918c0e8a111","resolution":{"observed_at":"2026-08-07T12:21:26.035619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.120883Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.120883Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:41be24b496a5e3713d8de005a45164577d000f4e978fb082785fa93426d5a312","observation_id":"90ca739e-6ff8-4f25-bc48-c6b6614ffa2c","resolution":{"observed_at":"2026-08-07T12:21:26.120883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.230334Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.230334Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:97f91a5af61e160309b9a609c3a704be4d3e1d7e5b4d3d32381e05fd772b7dbe","observation_id":"16264a7c-cc30-41f8-8fbe-8fbe5cc7a133","resolution":{"observed_at":"2026-08-07T12:21:26.230334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.758803Z","title":"Image sculpting: Precise object editing with 3d geometry control","venue":null,"work_id":"6e4bc929-4c71-46ca-9c13-dc29e303d978","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.342807Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:e0cf70346bc69036f894622c2b36a54face8ca60e041a6d2d71f3d36eb0c6faa","observation_id":"e12b5993-4dd5-49c4-b548-f8c04ee4552d","resolution":{"observed_at":"2026-08-07T12:21:28.844374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.558835Z","title":"Gaze-supported 3d object manipulation in virtual reality","venue":null,"work_id":"a79b37e3-b465-42ca-98bf-0c07aa40ed37","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.422478Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:c5841ff46a32182da7b775f9889d2e685de8e7f9fc2ee2290589a68a2e5f420b","observation_id":"f125b5bf-1a08-411e-a9e2-35acbe2bc18f","resolution":{"observed_at":"2026-08-07T12:21:28.626925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.340554Z","title":"Routledge, 2017","venue":null,"work_id":"d43c0dd4-8a3a-4df2-8002-5b50c28a3f76","year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.528288Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:ff18b295f115f1ff0776709237ae6b77db8dd7eaf03eceb86f6ac0db95fc3c44","observation_id":"1653a25b-9850-4c88-b2cc-c46cabde786a","resolution":{"observed_at":"2026-08-07T12:21:28.425306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.629052Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.629052Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:08f2e87f2f24f009fe3bc4238a69b5173abe7f46fc5dd924dfb95ddcf68d4e5e","observation_id":"f7db2829-6c3e-4c87-a8c0-f72f42a5f8d1","resolution":{"observed_at":"2026-08-07T12:21:26.629052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.701661Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.701661Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:664bacf3ab096e3f77718070799f04e0ab8a8c019f84072a1428e6f49e0668db","observation_id":"3278abbd-039d-437a-818e-e14884c12d94","resolution":{"observed_at":"2026-08-07T12:21:26.701661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-07T12:21:26.808950Z","title":"In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.808950Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:58292e4033ef2d6de5eb94f851da7fe424f1234e22669c865f312e40801ddb59","observation_id":"5316e9aa-aa2a-4422-bea9-b113b018d047","resolution":{"observed_at":"2026-08-07T12:21:26.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17385","last_updated":"2025-04-17T17:59:27Z","snapshot_observed_at":"2026-07-06T19:38:04.948333Z","submitted_at":"2024-10-22T19:39:15Z","title":"Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17385","snapshot_observed_at":"2026-08-07T12:21:26.903958Z","title":"Do vision-language models represent space and how? evaluating spatial frame of reference under ambiguities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.903958Z"},"links":{"cited_paper":"/paper/2410.17385","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:adc08d27eac2661942dd3ad3017ef74f32977a2d8642a90198182b9f57fb7311","observation_id":"c809b1ae-52e3-4d17-9928-ba1826c2861f","resolution":{"observed_at":"2026-08-07T12:21:26.903958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.148522Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:11127–11150, 2023","venue":null,"work_id":"64535767-6ba4-424a-b94f-82bb03d6dba4","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:27.002761Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:726793c758da11e7e647d8440d349117c8713ea2152057caf72c860aaa0052ed","observation_id":"cbf2cd02-1ca4-42bb-a8d5-e0b534a76426","resolution":{"observed_at":"2026-08-07T12:21:28.238220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:27.921786Z","title":"right/left view","venue":null,"work_id":"cd8704ad-68e9-4f74-ae2c-d44f02a00743","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:27.112050Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:8716864c9b07e251bd2ba2c3a8dacc1b65ef3315e98a3825761f40318563d142","observation_id":"4b7e23dd-b953-451e-b06c-050557bf65be","resolution":{"observed_at":"2026-08-07T12:21:28.034247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:10:22.188975Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 4 inbound Pith citation observations for arXiv:2505.24870."}