{"as_of":"2026-08-07T14:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:656ea2d3582ba6d734a746fd1639eedbaf64be5cabe2465a79c4397870829838","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:03.913503Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:57:03.724733Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:6cad74783ad34bb69bcd3dc5f715d2adcf4c55849ad373dd3dde9a30e2bc8bae","observation_id":"3f602b83-fa9b-418a-b4af-a5f683562da0","resolution":{"observed_at":"2026-05-12T08:27:53.656561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:3230e73168e25229899ec0822811a5118187ae6f5de017a5425264ae686abdb1","observation_id":"c825cdfc-b5a3-4949-84de-ee6e671f6738","resolution":{"observed_at":"2026-05-18T02:48:45.006556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T13:08:03.913503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.913503Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:67cd8be2270294094425d49aa75a53d0470ca8b98154ac0d05c6e30ae3c047ff","observation_id":"ab514049-398b-44d1-9f7b-4630afa36023","resolution":{"observed_at":"2026-08-07T13:08:03.913503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T05:25:43.869061Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07986","last_updated":"2025-07-23T03:45:11Z","snapshot_observed_at":"2026-08-07T05:18:42.229297Z","submitted_at":"2025-06-09T17:54:04Z","title":"Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:43.869061Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2506.07986"},"observation_digest":"sha256:54df6ba6ca7a25b1984baee2a48e3cc2fcc8b4d5bc17b5bda244572f6fcbecfe","observation_id":"9e5b577d-fd2d-40e7-b874-1a187add373d","resolution":{"observed_at":"2026-08-07T05:25:43.869061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T05:14:41.673571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-07T05:07:24.053682Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.673571Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:43963f4675e8576f99dcc5b1458e0b5107679fd7e3ae61703b8c2bb232f86b49","observation_id":"1240962d-56f1-466e-9851-e69f16a28d70","resolution":{"observed_at":"2026-08-07T05:14:41.673571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T19:18:50.365029Z","title":"T2I-CompBench++: An enhanced and compre- hensive benchmark for compositional text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06033","last_updated":"2025-07-08T14:35:02Z","snapshot_observed_at":"2026-08-06T19:10:14.583563Z","submitted_at":"2025-07-08T14:35:02Z","title":"TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:50.365029Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2507.06033"},"observation_digest":"sha256:8e8b21518a2915f96c6f4185bdf9c8bae4f7fafc230f2d6ff18114868ffb410c","observation_id":"c2a97c68-a4ae-43ad-b5d8-45f9c83ae372","resolution":{"observed_at":"2026-08-06T19:18:50.365029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T18:50:42.784210Z","title":"T2I-CompBench: A Comprehensive Benchmark for Open-world Compositional Text-to- image Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-06T23:13:48.925047Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:42.784210Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:acdb5996a472b320c06516782ee3ce4d01823f30cd81e16420d8cde0e79b7fa6","observation_id":"f2d2c8f5-04bc-4a5e-9d42-b0b4da157f9b","resolution":{"observed_at":"2026-08-06T18:50:42.784210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T20:44:12.680706Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.680706Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:dbd96eb95bed0c91c048f0267fd20c928c3967b38dc76a8835a3d1d0f0baf9c2","observation_id":"536242bd-79f5-4edf-b5cc-89f572b67e5e","resolution":{"observed_at":"2026-08-05T20:44:12.680706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T17:56:52.482995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-07T04:50:21.719268Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:52.482995Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:8429c6b67febfdc424965c3b26e5be346f272dc71fe07fbf8e737c6fa1189053","observation_id":"39496e77-780b-4891-a077-0e698c61f2ef","resolution":{"observed_at":"2026-08-05T17:56:52.482995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T18:47:45.271784Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.271784Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:e9b8e9c4f5775951ef319f22170fc9cf5022fb623ef6fa678753f892908a4edd","observation_id":"5f74645b-dff7-4ee7-b7a7-8e27c88559e4","resolution":{"observed_at":"2026-08-05T18:47:45.271784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2604.25072","last_updated":"2026-04-27T23:57:29Z","snapshot_observed_at":"2026-08-05T02:34:39.806032Z","submitted_at":"2026-04-27T23:57:29Z","title":"Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:08:41.452018Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2604.25072"},"observation_digest":"sha256:a5326ce3c1a42b0fbadf3ea9e66a0ccb96cc7bd46589caed14c210e337fc2f8f","observation_id":"2656f209-dea0-49ef-b843-3e4e825cc669","resolution":{"observed_at":"2026-05-11T21:51:18.468344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:aaffff0d73aa44979821e25cc15dba15bc8de9bd8721f280f19bf5b530a12c8c","observation_id":"1e361967-1b4b-4b51-8f21-44866183bc66","resolution":{"observed_at":"2026-05-19T16:37:39.744583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2607.00402","last_updated":"2026-07-01T04:00:27Z","snapshot_observed_at":"2026-08-07T02:31:41.165567Z","submitted_at":"2026-07-01T04:00:27Z","title":"The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T14:56:40.860766Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.00402"},"observation_digest":"sha256:0dafef931f29def40223a54fc331e13f7495fe760b71415b2111436767639366","observation_id":"42f0a070-55d3-4d62-8bcf-99dd84e4ebf3","resolution":{"observed_at":"2026-07-02T14:57:03.726486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-01T21:07:58.733061Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16409","last_updated":"2026-07-17T18:02:44Z","snapshot_observed_at":"2026-08-03T15:52:50.380548Z","submitted_at":"2026-07-17T18:02:44Z","title":"Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:58.733061Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.16409"},"observation_digest":"sha256:02f504f6fcbba6b5531140587170a059e279196018966794401c9bf14084520a","observation_id":"d92e1202-1a7d-4e3f-a27d-2abe02fc04db","resolution":{"observed_at":"2026-08-01T21:07:58.733061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-01T14:24:46.083996Z","title":"T2I-CompBench: A comprehensive benchmark for open-world compositional text-to-image generation.arXiv preprint arXiv:2307.06350,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-03T00:36:19.592702Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.083996Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:225bd00d29adb40efe9121d66b76253b88ee10300df39beae4feb3b9f04963d2","observation_id":"73280caa-25ab-44dd-b35d-df6f459a6509","resolution":{"observed_at":"2026-08-01T14:24:46.083996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T01:00:04.805025Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.arXiv preprint arXiv:2307.06350, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00440","last_updated":"2026-08-01T04:39:59Z","snapshot_observed_at":"2026-08-06T23:14:19.940382Z","submitted_at":"2026-08-01T04:39:59Z","title":"Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T01:00:04.805025Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.00440"},"observation_digest":"sha256:1d8d8606a4e484ed70e5a2f1dbe39fa7b947cb6195b7019537c368bcfbb3b8af","observation_id":"b58957d5-4016-4ffb-8860-bffa5b8c3866","resolution":{"observed_at":"2026-08-05T01:00:04.805025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T14:23:58.328521Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03708","last_updated":"2026-08-04T14:13:18Z","snapshot_observed_at":"2026-08-07T13:10:51.465574Z","submitted_at":"2026-08-04T14:13:18Z","title":"MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:58.328521Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.03708"},"observation_digest":"sha256:677ec69f01a4b4851be744b8c9757209b1c49d6f59df71f6a711064a434aabd3","observation_id":"25e91c2f-579f-4e29-8be2-02b1c64c458f","resolution":{"observed_at":"2026-08-05T14:23:58.328521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T17:31:34.759041Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04750","last_updated":"2026-08-05T12:18:28Z","snapshot_observed_at":"2026-08-07T11:51:43.445160Z","submitted_at":"2026-08-05T12:18:28Z","title":"Simile Understanding in Text-to-Image Models: An Evaluation Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:31:34.759041Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.04750"},"observation_digest":"sha256:2b246fb8a31f71b2b3f4edd9094a23565d1320914864a8fe91445e25efda75c6","observation_id":"9663b61d-8c42-451b-b1a5-acbf264ea2d5","resolution":{"observed_at":"2026-08-06T17:31:34.759041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.06350/citation-record","integrity":"/paper/2307.06350/integrity","json":"/paper/2307.06350/citation-record.json","paper":"/paper/2307.06350"},"outbound":[],"paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2307.06350."}