{"as_of":"2026-08-07T22:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a2257ddd344fc00aca3086c41f3e546d9ceb5c80d67d567c78832c1f9c4e677","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:56.713041Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:48:22.594002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.749687Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:15.034196Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:9c97ecb94b9392adb0058f502617015ce961a9caa47eaa63dc3bbd1044cef0fd","observation_id":"46fadfc8-672a-4492-bd62-df72663c45b5","resolution":{"observed_at":"2026-05-17T20:50:15.265088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T07:17:26.381232Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:2fddeb1f0b107e21f3ae237c61f629504cfd712aeff16367e33dd6b397ea0ea3","observation_id":"59c12a06-209e-4f77-b97a-d26040fdf814","resolution":{"observed_at":"2026-05-25T07:20:28.749989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:abfb795c44d3b71b78e7383f912eb1d9110abeff8ec314965b5e6ce2dbc03e71","observation_id":"4d3fa62b-0fe2-424e-893c-4a4515adfa78","resolution":{"observed_at":"2026-06-30T06:54:20.751242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23493/citation-record","integrity":"/paper/2505.23493/integrity","json":"/paper/2505.23493/citation-record.json","paper":"/paper/2505.23493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:00.030771Z","title":null,"venue":null,"work_id":"84d791c0-4271-4be7-a46f-e3d4ddd1cca5","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.746943Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:0e62976218a616185356f7201e9c3d4b6379813875669dea20b05ed47fe17b84","observation_id":"d15d36c5-e011-4bda-8d2a-cfd185456321","resolution":{"observed_at":"2026-08-07T12:49:00.159374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T12:48:49.843304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.843304Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:35e3337aaf32663c82b40f7680914dd31a5ea9713ee72aa4b9f2fbbf37ec059a","observation_id":"010d06db-4492-4aa0-adc9-773aab591966","resolution":{"observed_at":"2026-08-07T12:48:49.843304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17283","last_updated":"2023-07-03T09:12:49Z","snapshot_observed_at":"2026-08-07T20:36:47.393700Z","submitted_at":"2022-10-31T13:04:07Z","title":"CausalBench: A Large-scale Benchmark for Network Inference from Single-cell Perturbation Data","version":2},"cited_work":{"arxiv_id":"2210.17283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.17283","snapshot_observed_at":"2026-08-07T12:48:58.502381Z","title":"CausalBench: A Large-scale Benchmark for Network Inference from Single-cell Perturbation Data","venue":"cs.LG","work_id":"648bc1ae-f68e-4eff-956c-185f5e66075a","year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.005107Z"},"links":{"cited_paper":"/paper/2210.17283","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:05f21998cbe06bfe3c768b64584f575613c73c5ccfdd8c972892627f47db1e58","observation_id":"fef839bb-e848-40d5-a172-edfede8c32f1","resolution":{"observed_at":"2026-08-07T12:48:58.625556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-07-06T16:39:32.455002Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T12:48:50.146992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.146992Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5c45b2970c19a1269a76a29eb80bd1fb1529c06100067ceae0ff1bd2afae3f4e","observation_id":"7302757c-64c6-463a-891b-5be4aba836af","resolution":{"observed_at":"2026-08-07T12:48:50.146992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14324","last_updated":"2023-10-17T16:33:33Z","snapshot_observed_at":"2026-08-07T09:19:18.826470Z","submitted_at":"2023-05-23T17:54:57Z","title":"Ties Matter: Meta-Evaluating Modern Metrics with Pairwise Accuracy and Tie Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14324","snapshot_observed_at":"2026-08-07T12:48:50.308918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.308918Z"},"links":{"cited_paper":"/paper/2305.14324","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:4acebc61cf689be6f3e5f44357957777173999318aa4cd809b3eb37177fb67c9","observation_id":"bc722c93-31a9-456c-80b2-35d3d5367dfd","resolution":{"observed_at":"2026-08-07T12:48:50.308918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.687517Z","title":null,"venue":null,"work_id":"44098103-0109-49a2-99b8-26023eaae5d4","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.460119Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:787a5a4c5a6be440b4173b3cbd23e193a05cbd0d808c277121a90fe2102da807","observation_id":"86f70d88-4b49-4d1f-b0ac-de7c90dfb821","resolution":{"observed_at":"2026-08-07T12:48:59.888400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T12:48:50.601657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.601657Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:21c58e2a37d45bf17bd68721f02dd74ba295de640a3cdce583390accad558f06","observation_id":"a7e5a7b6-088a-45e7-a1b8-ac1e9abb352a","resolution":{"observed_at":"2026-08-07T12:48:50.601657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T12:48:50.711956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.711956Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:de09f7c278ba52e0e390830fa452d740e7e8c6e4a7dbf1997fcd073959fbdd1d","observation_id":"2a1e1bb1-ba1a-4820-90c6-e681d26cbd59","resolution":{"observed_at":"2026-08-07T12:48:50.711956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T12:48:50.794369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.794369Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:f146aa9cc436a7ea1822bf66b2cb9076fd4b02950d05d2f941536d970ceb8d3a","observation_id":"369b99fb-2f79-4006-ae23-413dac14c3a7","resolution":{"observed_at":"2026-08-07T12:48:50.794369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.918448Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.918448Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d65f88059968ed537b3d84542b14197af5c9b6991cd4832c022d3698bdfb67e5","observation_id":"52f2d23d-c8a4-459b-a650-5772f282b9d7","resolution":{"observed_at":"2026-08-07T12:48:50.918448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:48:51.044539Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.044539Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5a45a16ad4bf3731e33d648a480f55b6488324e1a255da2fe8d73154fcb8e82a","observation_id":"c30ed327-5349-46e7-b27a-bb7d9de92dad","resolution":{"observed_at":"2026-08-07T12:48:51.044539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T12:48:51.198464Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.198464Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:70bf8821840b3bd06dee72129cedd4bdcb77e527786730608cbef189a84e029d","observation_id":"cca02173-e221-4070-b608-b43bb1183361","resolution":{"observed_at":"2026-08-07T12:48:51.198464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T12:48:51.465446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.465446Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:b7c864a934581584c59e4007f1ed3f8f24ea3c77f88a66657446a6942ce3fd01","observation_id":"45a045a7-98f8-420f-98c9-3d0e66a55142","resolution":{"observed_at":"2026-08-07T12:48:51.465446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:48:51.628628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.628628Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:87c7006bc260c55b73c4ba68755f1a4bc7b75b94f3be9fada0df60ddc9370674","observation_id":"2231ea07-0147-4d7b-8f59-c4722310452a","resolution":{"observed_at":"2026-08-07T12:48:51.628628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03725","last_updated":"2019-12-08T17:47:25Z","snapshot_observed_at":"2026-07-06T08:42:55.569794Z","submitted_at":"2019-12-08T17:47:25Z","title":"Kendall's Tau for Functional Data Analysis","version":1},"cited_work":{"arxiv_id":"1912.03725","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03725","snapshot_observed_at":"2026-08-07T12:48:58.195839Z","title":"Kendall's Tau for Functional Data Analysis","venue":"stat.ME","work_id":"5d5c4d0d-24b7-4c6f-a198-8c10179bdf97","year":2019},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.794555Z"},"links":{"cited_paper":"/paper/1912.03725","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:adc98150ae1add79bb5a7e958cd61aaf619e09ad87bd49e795b17ab3e2f583e7","observation_id":"f62b6d8b-f62f-43d4-a2e3-82943ec1678e","resolution":{"observed_at":"2026-08-07T12:48:58.308666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T12:48:51.964061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.964061Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:a01da2aa189ec692c03ace3b509a85db3b9accc45802893f22cd554ef30cabca","observation_id":"804ffdb4-d090-4c42-9dc0-ddf05b948e29","resolution":{"observed_at":"2026-08-07T12:48:51.964061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.492381Z","title":null,"venue":null,"work_id":"66f44775-472a-425d-9eb4-a2b869b3aabe","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.147488Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:3d6c82820347075d136b01a4453e8262107a065caffcdbaa143094edd5b7a27c","observation_id":"db0e28d8-1cfa-40fa-a469-aa79a0625070","resolution":{"observed_at":"2026-08-07T12:48:59.602562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-07T12:48:52.532034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.532034Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:a1a2edc9d52dcb5ae2d7da3cbb4ccea4ab8b18547b3681f14c6636a2751cd7d4","observation_id":"ad65a177-2452-4707-8dac-e53ac9c1a002","resolution":{"observed_at":"2026-08-07T12:48:52.532034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.267649Z","title":null,"venue":null,"work_id":"8e7aaf02-a708-49d4-a442-acd2f0388190","year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.666804Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:c3898b68f10929855549c02d22a3a977dd5a80aa6bcc25ecf6390d07a8709184","observation_id":"b14e1c6f-fc45-420c-b189-7e1c833fb11e","resolution":{"observed_at":"2026-08-07T12:48:59.339026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2501.13920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13920","snapshot_observed_at":"2026-08-07T12:48:57.874105Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","venue":"cs.CV","work_id":"d13fed39-aac8-48de-92b1-abf882b49a09","year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.817656Z"},"links":{"cited_paper":"/paper/2501.13920","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5762dccdc08420b8db9d22c7346889bac7ad6e2f86eb259261607596a90334b0","observation_id":"43c04451-4193-4182-b1fc-579930d9d841","resolution":{"observed_at":"2026-08-07T12:48:57.976466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T12:48:52.975148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.975148Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:df0da24a5c8f40b68799e034f67b04bfaf7f81bb85bd76ce417843eb10142905","observation_id":"836d8399-db45-4cb3-84f0-0bbc4b029464","resolution":{"observed_at":"2026-08-07T12:48:52.975148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19312","last_updated":"2025-03-25T03:18:46Z","snapshot_observed_at":"2026-08-07T16:39:29.551106Z","submitted_at":"2025-03-25T03:18:46Z","title":"ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19312","snapshot_observed_at":"2026-08-07T12:48:53.157072Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.157072Z"},"links":{"cited_paper":"/paper/2503.19312","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:a344be60d59aca2efe20758f62851ed62e0cdc79b4743f96584a6093e5f3de63","observation_id":"723ce008-02c0-4df6-8f68-b18827866cb5","resolution":{"observed_at":"2026-08-07T12:48:53.157072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16056","last_updated":"2022-10-28T11:07:48Z","snapshot_observed_at":"2026-07-06T14:11:40.158683Z","submitted_at":"2022-10-28T11:07:48Z","title":"MagicMix: Semantic Mixing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16056","snapshot_observed_at":"2026-08-07T12:48:53.295857Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.295857Z"},"links":{"cited_paper":"/paper/2210.16056","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5cdbe47c5c51609030c9182a6a02ac6072312de10b5fdb73ff63f2339b026bc9","observation_id":"33189b65-b17b-43ee-a9e5-0152e6f44c30","resolution":{"observed_at":"2026-08-07T12:48:53.295857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.425939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.425939Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:801e7243ecf18e98f54175861e4a0453c41025d408249fe0d25dd35aa51c74cb","observation_id":"5b8a8ef9-cba3-48d6-b038-4acffd83eaa5","resolution":{"observed_at":"2026-08-07T12:48:53.425939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T12:48:53.577654Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.577654Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:bf37aa7eb58ad4c2eab35d840cf5dbd0222414c28971b7108421f2ec5fe17cd0","observation_id":"b30cb2e3-9dc7-4397-ad67-4a745b572ff1","resolution":{"observed_at":"2026-08-07T12:48:53.577654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.747961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.747961Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:4958a9ceb8c4b8e24f3b7e6559ff908cceabf8084f6fbb88a4463fa32437a2f6","observation_id":"e55c5242-413a-43ce-b7fa-cf86eb48aed6","resolution":{"observed_at":"2026-08-07T12:48:53.747961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.070704Z","title":null,"venue":null,"work_id":"9db856cb-92f0-4bb1-9168-c0e8ccff1814","year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.921825Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5dfc9d6066e082da7ec57706e8e369d8af591bf3d8145da23db2348e94439334","observation_id":"adda8c30-b5c0-439a-a532-f3d0e4ca0885","resolution":{"observed_at":"2026-08-07T12:48:59.129969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07767","last_updated":"2025-03-23T08:10:56Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:59:31Z","title":"Learning Visual Generative Priors without Text","version":3},"cited_work":{"arxiv_id":"2412.07767","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07767","snapshot_observed_at":"2026-08-07T12:48:57.600976Z","title":"Learning Visual Generative Priors without Text","venue":"cs.CV","work_id":"3ff58f49-86f3-4556-8a56-03117c0f0644","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.032525Z"},"links":{"cited_paper":"/paper/2412.07767","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:bf40b2e5d9068b59db79eb47926c418544bfe74add6b4c6208d578e459cb36f9","observation_id":"05868bab-5a3c-4920-9e7d-12d77b8175ba","resolution":{"observed_at":"2026-08-07T12:48:57.707197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.106454Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.106454Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:bb3445682c9bfb046f7ca86683d9db625bc4f7b26bbccda68716ecae6b3af994","observation_id":"da3143c8-41f6-45b9-bec3-a3a40a0ef15f","resolution":{"observed_at":"2026-08-07T12:48:54.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:48:54.317434Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.317434Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:7ff5a3f74a6d4fdaf54a3fdecaab8932e2fe47766d6e153002961549d7d887b5","observation_id":"40408198-a49f-43fc-85d5-d6426c2ed649","resolution":{"observed_at":"2026-08-07T12:48:54.317434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-07T16:59:27.482089Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-07T12:48:54.580086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.580086Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:9a44a3be4efdb469819800e72fbb998ebc0610cb61d0b39a27cd25a567fc82b1","observation_id":"cf20f87c-f19c-496c-a84b-2ac9f43a21e6","resolution":{"observed_at":"2026-08-07T12:48:54.580086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:58.904163Z","title":null,"venue":null,"work_id":"e47d94ec-f774-4553-80ac-d6291b1a92a5","year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.692540Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:b881d0f8a04c1038ba9bc2479c9a6a9f67c5aacbc9cef7247ea76178be3331f3","observation_id":"17673e44-7f71-446b-bef4-7adb5565277b","resolution":{"observed_at":"2026-08-07T12:48:58.969246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T12:48:54.855706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.855706Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:22580cb8ab4baecbfb0bfade4ee0c98c9f7cd4f849e8e7f7e1bf76cb523dd871","observation_id":"37859dc6-6fc7-41fa-a920-6b90ec0d4b14","resolution":{"observed_at":"2026-08-07T12:48:54.855706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T12:48:55.005689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.005689Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d53e0897cba28e1a005ac45e447f2e4d9d833b421ced8b0709c1a880488ef899","observation_id":"c2c0e2d7-3117-4f63-9400-0e3e1d0fe880","resolution":{"observed_at":"2026-08-07T12:48:55.005689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T12:48:55.111828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.111828Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:6813b8d1478a6dcb01dde30dc4035b217de76db3433a22620db7f54d49a68682","observation_id":"15fe29a9-c656-48bc-91ee-f800647ce3f3","resolution":{"observed_at":"2026-08-07T12:48:55.111828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:55.192746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.192746Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:31e245341c8806815520126eb0794812c6970ecfd3304610e60f5a818f2bc5f8","observation_id":"03b63b66-149e-47b7-98ee-befe15c591cd","resolution":{"observed_at":"2026-08-07T12:48:55.192746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:48:55.384624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.384624Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:c1ab31538519888700346a541c728ba70277f93b5f260b7d6bdb9b03a55ddddb","observation_id":"e33e3d93-ec1e-49a8-9ef6-5bc9596101ba","resolution":{"observed_at":"2026-08-07T12:48:55.384624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:58.730268Z","title":null,"venue":null,"work_id":"b0638794-0521-48a6-9e2c-9fa71f89d963","year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.514454Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:a9de23ca3028d3d5a5af72c3750f02c8785dc2d298552107b9fed1a4721c9944","observation_id":"fdb135d6-f843-4d5f-ae9b-5688fdadfc0c","resolution":{"observed_at":"2026-08-07T12:48:58.803715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:48:55.567187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.567187Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d0f78d68dd2b068faf0b90b3143eaa9c48a1d1bfdb9596a26c53d86107f6cd1f","observation_id":"d961166e-2c35-4e17-a820-a5fe76732e65","resolution":{"observed_at":"2026-08-07T12:48:55.567187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-06T09:18:54.806043Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T12:48:55.570907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.570907Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:35269c91dd188b6147ac343dfecf474d8899056f4c25d4e55cc2705334f72fb2","observation_id":"9a7f49e9-8af9-4f8d-afc6-7bba26078876","resolution":{"observed_at":"2026-08-07T12:48:55.570907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-07T12:48:55.618522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.618522Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:126153347445e26072df6a0b072e90b03eda30cefe93eb6d6c059ca52f4df80a","observation_id":"2bee3ea4-59db-4fb9-9590-684383f90c07","resolution":{"observed_at":"2026-08-07T12:48:55.618522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T12:48:55.829535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.829535Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5cd2088002bfb171742b56507e485921235163484811b43b7b23eb3117a47349","observation_id":"2898c4ff-0a6a-4f53-acae-e0166b00442a","resolution":{"observed_at":"2026-08-07T12:48:55.829535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:48:55.954212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.954212Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:54d82c292dc1db1729f26baf2e4b5f917403c6fa61926209870c382fa0c11d71","observation_id":"2bd8c5a0-ceba-4d35-8cd3-c01cec3ba9e4","resolution":{"observed_at":"2026-08-07T12:48:55.954212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02015","last_updated":"2024-01-04T01:10:56Z","snapshot_observed_at":"2026-07-06T17:11:25.753590Z","submitted_at":"2024-01-04T01:10:56Z","title":"Improving Diffusion-Based Image Synthesis with Context Prediction","version":1},"cited_work":{"arxiv_id":"2401.02015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02015","snapshot_observed_at":"2026-08-07T12:48:57.219105Z","title":"Improving Diffusion-Based Image Synthesis with Context Prediction","venue":"cs.CV","work_id":"7a8be654-1536-409e-949a-2538abe940fb","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.036754Z"},"links":{"cited_paper":"/paper/2401.02015","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5dc4090f65114a0c23d3623b87597229e7ceab393aca88909cce35187d60c7db","observation_id":"c40b6fc4-a2da-4dcb-8750-19d86b2d9706","resolution":{"observed_at":"2026-08-07T12:48:57.320478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01181","last_updated":"2024-08-02T11:03:22Z","snapshot_observed_at":"2026-08-06T13:04:34.380567Z","submitted_at":"2024-08-02T11:03:22Z","title":"VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01181","snapshot_observed_at":"2026-08-07T12:48:56.108385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.108385Z"},"links":{"cited_paper":"/paper/2408.01181","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ac2918f5cdf8d1c0ccda088454c32d81c47091af122f0209ab9a61dacf539a9d","observation_id":"9f2adca5-024e-4b9b-bbc3-bf397071ab34","resolution":{"observed_at":"2026-08-07T12:48:56.108385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-07T22:15:46.080591Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-08-07T12:48:56.234527Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.234527Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:0ea096eccac2b0ccd6cf2c23ed094695da1dca744b8857b152c41d9af512e47d","observation_id":"7d178482-6428-4976-96ef-9290457b12da","resolution":{"observed_at":"2026-08-07T12:48:56.234527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T12:48:56.360167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.360167Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:87ac21dbd9b5b8cefd5f7b8c9d9b5bdd765d8d2aa9bfe0be1ff3d2408bf5a810","observation_id":"eee34671-3498-47ed-bd10-555b3b04761a","resolution":{"observed_at":"2026-08-07T12:48:56.360167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10291","last_updated":"2025-04-17T08:31:14Z","snapshot_observed_at":"2026-07-06T19:32:56.002390Z","submitted_at":"2024-10-14T08:45:35Z","title":"Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective","version":4},"cited_work":{"arxiv_id":"2410.10291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10291","snapshot_observed_at":"2026-08-07T12:48:56.882097Z","title":"Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective","venue":"cs.CL","work_id":"cf9ad812-b334-4d36-b0b1-d3d34770a02f","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.454870Z"},"links":{"cited_paper":"/paper/2410.10291","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:09796cdbe4c697464e376a7ecbfa7d4e65590ef09ae7fefa2b5166504e192636","observation_id":"c8d31cea-5951-4100-ab35-8c0f3b4a3ad4","resolution":{"observed_at":"2026-08-07T12:48:57.030869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.601294Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.601294Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:98dcbf6332493f958de9b3a063c27b2a0e48569fa2eb9645032ef296de3218d5","observation_id":"b556ee5a-ae57-4893-8b1e-1f03754f9921","resolution":{"observed_at":"2026-08-07T12:48:56.601294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.713041Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.713041Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:f754a31dd91c03e0f7aab7c936aabae445934e11c8ac5cf265d7cccdde1a080f","observation_id":"c5e8baea-0cc1-4bb7-b1a2-1d462c9be9bf","resolution":{"observed_at":"2026-08-07T12:48:56.713041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2505.23493."}