{"as_of":"2026-08-08T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:846be90149bf9e552bd5824a39ec051087e99d11afe1c7cbcca8ce7630bc9352","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:14.923026Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:29.849367Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T14:29:14.923026Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.923026Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:75e93e849937b0b73ca5d0f0b115d1483dbb6f770c87a37913af0eebd8b33d2c","observation_id":"c9468441-2afa-4be0-b5c9-cf182aa22214","resolution":{"observed_at":"2026-08-07T14:29:14.923026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T05:14:41.429534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.429534Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:2520b37f0d929f86503dd223e58e0e5ff4c5449ef3746a48d217594ad3785fb9","observation_id":"fbaee488-b011-4168-9d0d-9bf5f8ac655b","resolution":{"observed_at":"2026-08-07T05:14:41.429534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T10:17:46.511922Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-07T20:45:05.929732Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.511922Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:7b1abc09ae2b8fe1ded16f0a3cfad7af28d28fda5e743119b27955a46038a011","observation_id":"d00ac191-626e-49e9-bd97-7f9e6761377d","resolution":{"observed_at":"2026-08-07T10:17:46.511922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T21:48:52.391265Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.391265Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e6fe1da18395dbe39ef3f453126a2cf348ada11d7141b8a9b46c70e818818d05","observation_id":"54e5f73d-cf88-4460-bc27-fa90af3275fe","resolution":{"observed_at":"2026-08-06T21:48:52.391265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T18:50:42.353509Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-06T23:13:48.925047Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:42.353509Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:45420029a7c6e837e099b72e69d8cdb054ebe39df7950864c47320dfb103c883","observation_id":"8dda9b9c-2267-4826-8203-8d08ffa3620f","resolution":{"observed_at":"2026-08-06T18:50:42.353509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-05T22:23:09.608412Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07135","last_updated":"2025-08-10T01:15:37Z","snapshot_observed_at":"2026-08-05T22:23:08.270280Z","submitted_at":"2025-08-10T01:15:37Z","title":"Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:23:09.608412Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2508.07135"},"observation_digest":"sha256:07d9902191f4a61df02814471a717f01f543e6306e7b5aca1f10821a260d8c1d","observation_id":"9d0e6edc-0bf6-4db3-bc1a-0f0fca961dd1","resolution":{"observed_at":"2026-08-05T22:23:09.608412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-05T10:59:25.229741Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03385","last_updated":"2025-09-03T15:02:40Z","snapshot_observed_at":"2026-08-05T10:59:22.778037Z","submitted_at":"2025-09-03T15:02:40Z","title":"Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:25.229741Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2509.03385"},"observation_digest":"sha256:65e4788e6aa1e889e1509a3ddf785ee1aa874b70ea30d3b6acf6d54005125e29","observation_id":"a5df3ae9-484b-47a3-9946-033742454da1","resolution":{"observed_at":"2026-08-05T10:59:25.229741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2509.17458","last_updated":"2026-04-11T12:35:18Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T07:51:28Z","title":"CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:25:39.116881Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2509.17458"},"observation_digest":"sha256:8d7aeee5233c5649ff209b81ad4ada7b2bfd4d512145dfc6346d164066535018","observation_id":"4cba0c9c-9294-49d7-96a7-d81c09a42921","resolution":{"observed_at":"2026-05-18T15:26:33.618048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-03T09:35:27.378827Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17037","last_updated":"2026-06-23T18:08:52Z","snapshot_observed_at":"2026-08-03T09:35:21.823477Z","submitted_at":"2026-01-20T00:06:58Z","title":"AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T09:35:27.378827Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2601.17037"},"observation_digest":"sha256:1bfeeaf68c5359b440e32663ec99f0db83a198cdbea0b2b9590961da63e7f8d0","observation_id":"4fbf225c-09f3-4334-a9f3-ca043d6b7fa5","resolution":{"observed_at":"2026-08-03T09:35:27.378827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2603.00166","last_updated":"2026-05-11T07:16:33Z","snapshot_observed_at":"2026-08-07T10:45:22.942441Z","submitted_at":"2026-02-26T08:11:09Z","title":"Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T19:15:11.575505Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2603.00166"},"observation_digest":"sha256:58ad1d26603ba068f0e6635c2078d663f796eb0b23f933843ef5b7e6058a3c03","observation_id":"da2973fe-c940-41b8-a44c-8499cff71122","resolution":{"observed_at":"2026-05-15T19:16:31.387201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:24b73978953e188d47c43bb43d57c82f2fe51d34a3207ea06853065e59b32db6","observation_id":"63def0fd-170a-45bf-a37f-3b9949a7e061","resolution":{"observed_at":"2026-05-10T06:56:47.397746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2212.10015 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:bd61749283d2c057ccc07c1d844855997515c87c2e76dd52268210135613ef90","observation_id":"9a3cbfd8-8b21-4830-ad48-68a08784bdde","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2605.11722","last_updated":"2026-05-12T08:08:09Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:08:09Z","title":"EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:10:52.567634Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2605.11722"},"observation_digest":"sha256:0e6369777610768ab322388cceaf8c6aaf5edb8e8d4c855a762ef4d0621e2ec8","observation_id":"c5b2d4fb-eb60-40ee-838d-538e2cb0d628","resolution":{"observed_at":"2026-05-13T06:12:22.668531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2605.19532","last_updated":"2026-05-19T08:33:10Z","snapshot_observed_at":"2026-08-02T22:16:23.062173Z","submitted_at":"2026-05-19T08:33:10Z","title":"Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T06:25:32.694239Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2605.19532"},"observation_digest":"sha256:d786a0d748269f117d401b2b03f2bb1cb30eede41cd08628cace188fc70ec2d9","observation_id":"300a6ef3-f683-48d3-a286-9aa5671031eb","resolution":{"observed_at":"2026-05-20T06:28:05.540179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.07568","last_updated":"2026-05-26T02:19:47Z","snapshot_observed_at":"2026-07-06T23:47:10.030985Z","submitted_at":"2026-05-26T02:19:47Z","title":"A Systematic Study of Behavioral Cloning for Scientific Data Annotation","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-29T16:23:08.402194Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.07568"},"observation_digest":"sha256:fa36430e7caa1b2bbe21114f3687baba01fd9d37b33b5120e11b578be36f0707","observation_id":"db924f41-522a-4d10-aa6d-5074d461b1f2","resolution":{"observed_at":"2026-06-29T16:23:39.188094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.19941","last_updated":"2026-06-18T08:39:07Z","snapshot_observed_at":"2026-08-03T00:29:25.767611Z","submitted_at":"2026-06-18T08:39:07Z","title":"Compositionality Emerges in a Narrow Depth-Connectivity Regime: Architecture Constraints and Solution Manifolds","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:56.676469Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.19941"},"observation_digest":"sha256:03ff2677a5a14a6e5aaf584ec6d94f0ab0472eff4178a595cfc4671e64817cda","observation_id":"b3361d10-8a55-4354-b500-ec4d341334e8","resolution":{"observed_at":"2026-07-04T03:09:29.854512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.20924","last_updated":"2026-06-18T20:33:20Z","snapshot_observed_at":"2026-08-06T15:05:17.630734Z","submitted_at":"2026-06-18T20:33:20Z","title":"ELDiff: When Evidential Learning Meets Text-to-Image Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T17:40:14.587143Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.20924"},"observation_digest":"sha256:9a5c68e0695e8072c32da5150e308b116a3d9747b47eeef433dc893e8cfe8777","observation_id":"3e74535b-719e-49d1-a2a2-c3d88c0dfca8","resolution":{"observed_at":"2026-07-04T03:49:29.850942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2212.10015 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:1da77fea7c11c7d125be7e5e7241c089dbeb215446646fba5bc2e7e1cdbd1c4a","observation_id":"36b8fd0f-250a-427f-9c62-25dba55a608d","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-01T08:39:37.518805Z","title":"Benchmarking spatial relationships in text-to-image generation.arXiv preprint arXiv:2212.10015 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.518805Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:430a7c7032b73f4189823d5f62dbb8b2569af20a8ce7bca00ce924bd44cff342","observation_id":"d397bc5e-c954-44b6-a872-c5f290657a1a","resolution":{"observed_at":"2026-08-01T08:39:37.518805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.10015/citation-record","integrity":"/paper/2212.10015/integrity","json":"/paper/2212.10015/citation-record.json","paper":"/paper/2212.10015"},"outbound":[],"paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2212.10015."}