{"as_of":"2026-08-09T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b95e8678b06860c803f2cd9ca297ec05d977376f0305f48d50808f2de9325a6","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:14:43.033978Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:41:10.852265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:25:46.015089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2506.08480","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08480","snapshot_observed_at":"2026-07-01T14:25:46.015089Z","title":"Re-thinking the automatic evaluation of image-text alignment in text-to-image models.arXiv preprint arXiv:2506.08480, 2025","venue":null,"work_id":"f3d7e5b1-d4b8-42cb-a988-0aed94f707a6","year":2025},"citing_paper":{"arxiv_id":"2605.14842","last_updated":"2026-05-14T13:46:24Z","snapshot_observed_at":"2026-08-06T21:38:07.402815Z","submitted_at":"2026-05-14T13:46:24Z","title":"Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T21:41:10.852265Z"},"links":{"cited_paper":"/paper/2506.08480","citing_paper":"/paper/2605.14842"},"observation_digest":"sha256:5269b309cdf9d710dba9f28c88be782cf0aa13e8e537785a1abfb11db37dfa05","observation_id":"c3748a19-91d3-4940-a10f-6e09799c29a7","resolution":{"observed_at":"2026-07-01T14:25:46.016575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08480/citation-record","integrity":"/paper/2506.08480/integrity","json":"/paper/2506.08480/citation-record.json","paper":"/paper/2506.08480"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:40.534295Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.534295Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:e85181cb99b0f022c1b8dce8114e04cfbdae42110f778f595909c69c6348f351","observation_id":"d04e99d2-52be-42c6-94ac-a5110609acfc","resolution":{"observed_at":"2026-08-07T05:14:40.534295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:40.623732Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.623732Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:b5e95f0d04013c26436507b96eb51ef252c53fe553b94104225aac2fd9676b6f","observation_id":"343fa16a-e992-48e1-a8e0-44f6ae564951","resolution":{"observed_at":"2026-08-07T05:14:40.623732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.532725Z","title":null,"venue":null,"work_id":"d8e24a83-ecaf-4d1e-aa3d-a8cb272964ca","year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.739452Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:832be3a24e9d5bf9ba94c8c51e7f5b04d02ffd5172183e4e645cec7c73713145","observation_id":"722e85eb-e0e0-49f8-8272-117a6434adc6","resolution":{"observed_at":"2026-08-07T05:14:44.606532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T05:14:40.852888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.852888Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:b72c217722dbaed85715fb5a10cf924bc4d5b5c1f7166491bc18f801646f5e56","observation_id":"00f7d635-966c-4406-b3de-4ab59a097c14","resolution":{"observed_at":"2026-08-07T05:14:40.852888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03190","last_updated":"2024-05-27T11:52:56Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T16:56:11Z","title":"Unified Hallucination Detection for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03190","snapshot_observed_at":"2026-08-07T05:14:40.971289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.971289Z"},"links":{"cited_paper":"/paper/2402.03190","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:396a48b164884a74a6cea129c95f1718ae5cfbb24ff44ea32940e5e501616e64","observation_id":"1eaedb72-0415-4070-ab85-23d82c30fe60","resolution":{"observed_at":"2026-08-07T05:14:40.971289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-07-06T16:39:32.455002Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T05:14:41.111755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.111755Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:9a6ee843db3c5426a763c70e9193e0039289ff18bb4b674141d8f9c51eaccf16","observation_id":"f3a1352f-1c68-49c4-9b6d-c80204ad3006","resolution":{"observed_at":"2026-08-07T05:14:41.111755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.377617Z","title":null,"venue":null,"work_id":"392424e7-f469-49f2-8b6b-ec347c9d0116","year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.224534Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:ca1a86ce8b8fbc6a7ab1dbff10baf1551631cd78164d76c511528b72dc9948e4","observation_id":"d1163b47-90fd-4dce-bc08-9f769c0caa6c","resolution":{"observed_at":"2026-08-07T05:14:44.449158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.201669Z","title":null,"venue":null,"work_id":"81782dad-f87a-450e-88e6-6624c6d9eb65","year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.339032Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:231f3529a0617eff46ac447fac419ab0a35fcb8af1ac1381ace4c25dc2c4ae9c","observation_id":"8c0c5ef2-2649-4650-bc27-89785d034008","resolution":{"observed_at":"2026-08-07T05:14:44.286273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T05:14:41.429534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.429534Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:2520b37f0d929f86503dd223e58e0e5ff4c5449ef3746a48d217594ad3785fb9","observation_id":"fbaee488-b011-4168-9d0d-9bf5f8ac655b","resolution":{"observed_at":"2026-08-07T05:14:41.429534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.032681Z","title":null,"venue":null,"work_id":"29ebd34c-2a99-4f7a-aa3e-2d1cdb408191","year":2021},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.491640Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:ebe1bb11ed957018789131dcd68fa67fa079183b3f1397055fbf86370020ede4","observation_id":"8300ec3c-da9d-49ed-8dee-fbd00f8a1a0d","resolution":{"observed_at":"2026-08-07T05:14:44.114397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.857882Z","title":null,"venue":null,"work_id":"e18ecdff-a404-4ee5-804f-7423bafe5af8","year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.603219Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:462e9a0c054fb5432cd0aab13e4f77f97515c039af3b9409b0cbcd4d7b61e27a","observation_id":"c6ee1981-6af1-4362-a710-44f1bc5f232b","resolution":{"observed_at":"2026-08-07T05:14:43.921102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T05:14:41.673571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.673571Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:cc8777b8d121ed3b2b1935661108d362c0367ca54feb7b7da7a462abf6e13483","observation_id":"1240962d-56f1-466e-9851-e69f16a28d70","resolution":{"observed_at":"2026-08-07T05:14:41.673571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.731417Z","title":null,"venue":null,"work_id":"fb6e44a2-64ff-4b37-810a-3f2169fb9e53","year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.769405Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:1a483bf35e1554b5882de89a9411d60ad86a350f28dac4a66d07595c036e2996","observation_id":"a232d6a6-d3c5-4df7-b19f-ef5a65166b19","resolution":{"observed_at":"2026-08-07T05:14:43.769144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:41.914104Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.914104Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:233cf872199b3e432ee31590f56f63ee62392ccc399931b1ba0bb4c993260b73","observation_id":"e9c4f316-7fac-4712-857c-a97cf24242ca","resolution":{"observed_at":"2026-08-07T05:14:41.914104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.025600Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.025600Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:ba7c6369212d8a186240e276506cb04b8ea23013d89fd0759f6cf642225bc9a4","observation_id":"65141a82-4e53-4557-8949-302640b40b8b","resolution":{"observed_at":"2026-08-07T05:14:42.025600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-07T05:14:42.136106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.136106Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:9c5ffe5f38ca9bab56451db6e27b860e6f6a0938f47b854b274c97feb2bd4a00","observation_id":"703f16e1-cf9f-40a6-b78c-b678b5ea79e7","resolution":{"observed_at":"2026-08-07T05:14:42.136106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.211336Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.211336Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:d3dfc2c147a9931a9a530e802809a4dd41ddfebd3999d8f4ca5edfdc608c7c8a","observation_id":"d594fff6-ce5a-4e96-a3a5-c3439ade17c1","resolution":{"observed_at":"2026-08-07T05:14:42.211336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04695","last_updated":"2024-02-22T19:11:46Z","snapshot_observed_at":"2026-07-06T15:39:56.892976Z","submitted_at":"2023-06-07T18:00:38Z","title":"ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2306.04695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.04695","snapshot_observed_at":"2026-08-07T05:14:43.214572Z","title":"ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"414e3f3d-05fc-4f87-8ddd-e243c80d870b","year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.297692Z"},"links":{"cited_paper":"/paper/2306.04695","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:2e904d33b5c3fe98f64c234b759fa77bf9544eac9ce19ea719cc498e07a591e3","observation_id":"0c16d08f-ed4d-4751-909a-13ebc3bd7053","resolution":{"observed_at":"2026-08-07T05:14:43.248885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:14:42.399345Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.399345Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:37cfdad8aec0e0735421a1d14fcadd386494509df71a497afc2fc2570ab378df","observation_id":"29200d13-37c8-4cb1-ab83-e358a11f303b","resolution":{"observed_at":"2026-08-07T05:14:42.399345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.569117Z","title":null,"venue":null,"work_id":"6dde430e-5829-48f9-b68f-c2bd6fe6f968","year":2021},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.514345Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:aeea2a524e3f6aa17feea96e81756803728aa75d26b6ab9cdbf4c31169df2b96","observation_id":"e8109674-c308-4a2f-8541-44336b9f7ace","resolution":{"observed_at":"2026-08-07T05:14:43.624612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.598591Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.598591Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:982fb40ec5d24f84a8e26fb311d9534ee3858db5279566700e4c13b904921458","observation_id":"76a2795c-931c-498f-8ff0-7b2d9ac01e45","resolution":{"observed_at":"2026-08-07T05:14:42.598591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T05:14:42.724690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.724690Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:98a6c9673b59191e26811bf793117c5be33867eb0c28759b9c151a0597460f67","observation_id":"36fb1309-36bf-4877-aa34-1faa11774360","resolution":{"observed_at":"2026-08-07T05:14:42.724690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-06T09:18:54.806043Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T05:14:42.807933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.807933Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:87a08ecfb9a3dce429c7aaa70ce8bb9bda0aa9e35a101d86dd0944ebd131d2d1","observation_id":"3e61048c-bee1-4d80-a03a-b7b088b2dfe9","resolution":{"observed_at":"2026-08-07T05:14:42.807933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.422825Z","title":null,"venue":null,"work_id":"72c5b548-c322-4a63-9523-50931320e566","year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.939120Z"},"links":{"citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:438dc87e2e647909120be13e37a765f139f165613b8dc3f9ae2d1f511b778f6d","observation_id":"147871f9-ef9e-4b52-9c68-930433ea2c6d","resolution":{"observed_at":"2026-08-07T05:14:43.490295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T05:14:43.033978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.033978Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:0b0fabab668a25bde1811be13af5f6442bdc2e1ba957e0ef2dcb1d1a85fe2b53","observation_id":"740ac670-3217-4895-b2a1-23c8ae371472","resolution":{"observed_at":"2026-08-07T05:14:43.033978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2506.08480."}