{"as_of":"2026-08-19T03:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88eb429ca4665ac0c15a5a82662f8f7a11c84881218cf13f23446d223e1fdfee","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:02:21.265519Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:26.460713Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T09:04:45.978885Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":"2412.18150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18150 (2024)","venue":null,"work_id":"cd1f23a0-e710-421d-9056-6ea91222a985","year":2024},"citing_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-08-17T22:15:08.630152Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T00:44:30.558048Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2503.05236"},"observation_digest":"sha256:b78a151223339f31f6cdf44cef0a49c3dd86abc4ad9965976d4df0f3941fd16f","observation_id":"332d43b9-40a9-4b4d-9326-6a9fb54f5748","resolution":{"observed_at":"2026-05-14T00:44:30.874520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":"2412.18150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18150 (2024)","venue":null,"work_id":"cd1f23a0-e710-421d-9056-6ea91222a985","year":2024},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-08-18T21:46:17.317047Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:c888a5ff80991499b50e87920d9c14073d89df7a503e822ab10469b8eaa0ad08","observation_id":"875f6439-a1f1-4702-ac45-987eb212db60","resolution":{"observed_at":"2026-05-17T08:27:36.292569Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":"2412.18150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18150 (2024)","venue":null,"work_id":"cd1f23a0-e710-421d-9056-6ea91222a985","year":2024},"citing_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-08-16T15:39:15.923412Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:55:38.690569Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2504.11346"},"observation_digest":"sha256:b2594d8d391065a7fdad8dbbd1c0958efc51d95df483ca3e13a5439999acb808","observation_id":"24604afa-ef4f-44c1-9f38-99a20c6f70e7","resolution":{"observed_at":"2026-05-13T07:55:38.744353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-16T12:40:26.460713Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text- to-image generation model evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12018","last_updated":"2025-04-16T12:21:49Z","snapshot_observed_at":"2026-08-18T10:41:09.205775Z","submitted_at":"2025-04-16T12:21:49Z","title":"Instruction-augmented Multimodal Alignment for Image-Text and Element Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:26.460713Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2504.12018"},"observation_digest":"sha256:a597284074d94eb6b96c816b1f1d9caa39515b5899c30fd12bfae6c0c92d8056","observation_id":"73ddecb0-e4a0-4d62-b9b0-dec03dc27092","resolution":{"observed_at":"2026-08-16T12:40:26.460713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-15T23:37:38.074067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04670","last_updated":"2025-06-04T12:57:19Z","snapshot_observed_at":"2026-08-18T12:03:33.562507Z","submitted_at":"2025-05-07T08:26:54Z","title":"LLM Code Customization with Visual Results: A Benchmark on TikZ","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:37:38.074067Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2505.04670"},"observation_digest":"sha256:7501bd771516bb862549d52dc77bad5e27bda86dd48c176c510dc6fda3c8aec8","observation_id":"0717342c-df3f-486f-b6ef-76aa03d125a6","resolution":{"observed_at":"2026-08-15T23:37:38.074067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-15T20:46:46.138692Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12098","last_updated":"2025-05-17T17:49:26Z","snapshot_observed_at":"2026-08-17T17:30:06.121487Z","submitted_at":"2025-05-17T17:49:26Z","title":"LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:46.138692Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2505.12098"},"observation_digest":"sha256:f0b26c7a40856ee15d1c4cce7fe336f29134c6cea28dc47f3a070b8ff4caefbc","observation_id":"6c5980de-0401-4a87-bc22-9002791225ac","resolution":{"observed_at":"2026-08-15T20:46:46.138692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-07T14:17:33.225548Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evalua- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.225548Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:27e737d21c1aa3776523a201cdfd70ae0db6d4ddf22317fec43bd85a1c51407a","observation_id":"20e1c83d-9c5e-4fbe-8e3d-fccc0850c1db","resolution":{"observed_at":"2026-08-07T14:17:33.225548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-15T17:27:52.889724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12605","last_updated":"2025-08-18T04:02:58Z","snapshot_observed_at":"2026-08-16T01:10:18.407898Z","submitted_at":"2025-08-18T04:02:58Z","title":"ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:27:52.889724Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2508.12605"},"observation_digest":"sha256:f0bba395f3682967115387ffb2a5aea7ec80b3a030bfdc0b7288100fe823dc03","observation_id":"0a48ac7b-7546-4399-aed5-fbcb6dd31e9c","resolution":{"observed_at":"2026-08-15T17:27:52.889724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-04T18:48:03.692481Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evaluation.arXiv preprint arXiv:2412.18150, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-15T13:22:53.250412Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.692481Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:96ea2ec303008e397a487c2dadfb86730be73da0c515d14a5a46713fc4ae8d05","observation_id":"f050f52b-e189-4d85-9826-0aa32acfc810","resolution":{"observed_at":"2026-08-04T18:48:03.692481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":"2412.18150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18150 (2024)","venue":null,"work_id":"cd1f23a0-e710-421d-9056-6ea91222a985","year":2024},"citing_paper":{"arxiv_id":"2605.21728","last_updated":"2026-05-20T20:43:38Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T20:43:38Z","title":"BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:01:24.453821Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2605.21728"},"observation_digest":"sha256:1a9bd2a31a5f77621ce1ca9314c62fb8099b6c771169b4df16ca681e5d86410d","observation_id":"de3d8133-aed9-47b5-abd9-3b631ea87206","resolution":{"observed_at":"2026-05-22T09:04:45.982530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18150/citation-record","integrity":"/paper/2412.18150/integrity","json":"/paper/2412.18150/citation-record.json","paper":"/paper/2412.18150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T05:02:20.851688Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.851688Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:df7cec04cfa6a132c5de84c516ab52edf7b98f90a415ba2b09d619146fba5a10","observation_id":"307de585-4f03-4f32-96f1-07fbf6d6be76","resolution":{"observed_at":"2026-08-11T05:02:20.851688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03511","last_updated":"2024-06-28T11:23:11Z","snapshot_observed_at":"2026-08-16T14:37:09.655792Z","submitted_at":"2023-12-06T14:13:38Z","title":"Kandinsky 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03511","snapshot_observed_at":"2026-08-11T05:02:20.857101Z","title":"Kandinsky 3.0 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.857101Z"},"links":{"cited_paper":"/paper/2312.03511","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:05efdb6057e05422fb60cb2763393022e77f935d45fbe99890ce0b017c8570a5","observation_id":"ad95ae33-07e9-4e5f-90e2-3a866e39fc66","resolution":{"observed_at":"2026-08-11T05:02:20.857101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.739000Z","title":null,"venue":null,"work_id":"05906d05-4aa5-424c-b437-ebd62113eae4","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.862210Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:4b059c3bf49f50c1c391a9e741881b8db290d44758abb61ad26451ab4e051ac6","observation_id":"fbda3c3d-9c86-458f-90b2-542372b9899f","resolution":{"observed_at":"2026-08-11T05:02:22.745634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-16T14:11:52.899972Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-11T05:02:20.871423Z","title":"Pixart- σ: Weak-to-strong training of dif- fusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.871423Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:c7bd91ea196e3a7c3b067db375850720297f32683a9f9f615803033fb6692f9d","observation_id":"76909cde-a0cb-4a6f-ba78-e441b7868eff","resolution":{"observed_at":"2026-08-11T05:02:20.871423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-16T14:28:28.987831Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-11T05:02:20.879214Z","title":"Pixart- δ: Fast and controllable image generation with latent consistency mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.879214Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:9565ceb5f92cb4b93ef8c82b1060e3b5fc8b34144fe0d40b822b35a99519e82e","observation_id":"7b580605-deab-43ad-8b41-8a96588eb7a5","resolution":{"observed_at":"2026-08-11T05:02:20.879214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.710944Z","title":"Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis","venue":null,"work_id":"6b5b95d1-43b2-4f7f-ab12-1c85f5f434ec","year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.886875Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:eb52f6757e6cdcf552b79039d503eddb780a908b9876cf16e8959d66e3382960","observation_id":"cb1c4a1b-9fee-49e9-9f1c-cffd3c41a872","resolution":{"observed_at":"2026-08-11T05:02:22.718503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.687626Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to- image generation models","venue":null,"work_id":"92de9322-d4a0-4e02-a9e1-ad2fe14fe1e1","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.894200Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:fe124d9f6caa5178aa2a7385cd1d6d3b2fead41c314a325da25e174659e5521b","observation_id":"feea6f55-9308-4406-b65d-a3da77087c31","resolution":{"observed_at":"2026-08-11T05:02:22.694638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.669035Z","title":"If-i-xl-v1.0","venue":null,"work_id":"882d6c6d-1b14-4aff-a704-ec7fed24d231","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.904653Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:fbfa1320876bb5679efac5ef27b6bf7867d6c77323cdc0428573ce74c64640a9","observation_id":"c4652b9c-b24b-40c6-b5a5-2ff49340a79d","resolution":{"observed_at":"2026-08-11T05:02:22.675019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.651492Z","title":"Dreamina","venue":null,"work_id":"3a5f88c4-506a-4060-ba32-17500398d4b9","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.912278Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:8ea590dc01ee3322b6f2aa450c06e9eacb368cf90afeed0883ed1051ffcb5557","observation_id":"8602313f-eb29-4ee1-9494-e29fc6325577","resolution":{"observed_at":"2026-08-11T05:02:22.657134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.627752Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"fbe2e4af-6fd1-4034-930c-a9d90df992bd","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.918953Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:bc7431985a583caaf6feffe6f627649a180d1696ef718e49f65bfed4a67746e9","observation_id":"8c2fe1ef-eeb8-4120-a6e2-afbf475a170a","resolution":{"observed_at":"2026-08-11T05:02:22.637201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02677","last_updated":"2024-01-05T07:21:46Z","snapshot_observed_at":"2026-08-16T14:29:41.094909Z","submitted_at":"2024-01-05T07:21:46Z","title":"Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02677","snapshot_observed_at":"2026-08-11T05:02:20.925998Z","title":"Progressive knowledge dis- tillation of stable diffusion xl using layer level loss","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.925998Z"},"links":{"cited_paper":"/paper/2401.02677","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:12130ed440ea64086a29fbbf83f5ed2098ab5fd62b995328adfa94211cbc5db9","observation_id":"3da1b9f5-41a1-4ca2-9ce8-4e57d21880be","resolution":{"observed_at":"2026-08-11T05:02:20.925998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T05:02:20.937773Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.937773Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:effe3c518c06fa80cf6388912689cfa38d5463195a27e95d79a74908439d40db","observation_id":"3e78fa1f-f29e-411d-8a9e-907b01b74f5f","resolution":{"observed_at":"2026-08-11T05:02:20.937773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.600303Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"cd224f29-03ab-472e-be8d-d34c037966cb","year":2017},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.948276Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:032beb07c5ba18ea90975d005ccba8a23ba2b1b6bd8acb41d26c8942f2faece7","observation_id":"455001f5-1923-493b-adae-2ab67bd2dda2","resolution":{"observed_at":"2026-08-11T05:02:22.607738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.579347Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"8b9abceb-8198-4581-882a-72dd838c25c3","year":2020},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.959363Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:49580dee5000c5dfaeba1c100cb02e4b14695b5b49cbba20a1a3fe89678ce71b","observation_id":"55b022e9-6f76-4d76-a03b-436436feaf0e","resolution":{"observed_at":"2026-08-11T05:02:22.588710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.557999Z","title":"Midjourney","venue":null,"work_id":"14d6ca61-e7bb-4f0d-9b6b-1c8fc6337142","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.965988Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:e2a99db87bb8b8d3e7f0cd369a05d4c6b8e280a4f1b8d0ae009669592a58f13e","observation_id":"2523502c-afa7-4a2d-91c2-7d540c0db447","resolution":{"observed_at":"2026-08-11T05:02:22.564578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.532258Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"8819533c-96e2-42bc-87d8-bffa5582fe5f","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.972653Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:b16858cba044a99d1f7af83a01d25cbfb50f4a2aa5e7980e4897d4576893e9d0","observation_id":"7037f01e-36fa-4e62-b6b6-918a8050cb37","resolution":{"observed_at":"2026-08-11T05:02:22.538887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.485149Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"d0afa0d4-1f6d-4754-8732-f5ec66664d6a","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.978469Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:622228c48d46c4ad8fcc3b1e78e64b7cfb515a4cea9e0b253600030b06781e47","observation_id":"a98bdefe-d7df-4fb8-9920-c50cde40387a","resolution":{"observed_at":"2026-08-11T05:02:22.497299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.455852Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"27b5360b-3d08-48db-a431-d21917e354f3","year":2019},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.986792Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:ff738d7d3147f2ed84e1287062cb9022e7c0db3985b439f82eeaaadde560f09f","observation_id":"2600e025-9e03-4bb4-bc86-c62ce442f7d9","resolution":{"observed_at":"2026-08-11T05:02:22.463105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.420745Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"35244ed0-87f0-41b3-bb13-308fb5f1d1b4","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.992411Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:ccfab2292b6b344510ebc1968655f7e373c29d9f6a25b3ac4a584b1bd2a2ebb3","observation_id":"23a18070-6271-4b03-87ec-cd4747603d55","resolution":{"observed_at":"2026-08-11T05:02:22.437220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-18T03:21:35.557463Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-11T05:02:20.998785Z","title":"Genai-bench: Evaluating and improv- ing compositional text-to-visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.998785Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:3f547715cd0810eb34e2918b7917172ada2b00940b616c4e8397b7df3bc80f2e","observation_id":"cb6b0374-f776-4503-8711-0803822a4cb4","resolution":{"observed_at":"2026-08-11T05:02:20.998785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.393230Z","title":"Evaluating and improving composi- tional text-to-visual generation","venue":null,"work_id":"7821e0fb-d13b-4dad-a9fe-e08c637b7fc7","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.005276Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:36cb0d2023b97d5aa81d60acb6dfb0104a7e096bb732930adc4c25f53490e242","observation_id":"be980eac-6c0c-4333-92a6-fdd6b999f4bc","resolution":{"observed_at":"2026-08-11T05:02:22.401777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-11T05:02:21.012013Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.012013Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:90a19e4a91d8fb9d8aaf2bef136c9d9a174f2b9d46552f90b981084cfc78de08","observation_id":"f89b545d-0bd5-4bf8-ac60-28d90d10c2d7","resolution":{"observed_at":"2026-08-11T05:02:21.012013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.021586Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.021586Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:7fe739097a90f9507ca01c314f7586f1f522136bab4bfc9c11c44e8d52d979b5","observation_id":"4d610c48-2b54-43ab-8d34-229cab943032","resolution":{"observed_at":"2026-08-11T05:02:21.021586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T05:02:21.029310Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.029310Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:3b89330cca663f294001fff7b0b2be3289844a59290b6ee6a95fb65043964069","observation_id":"6decca13-abc0-427c-a26b-d644163b295b","resolution":{"observed_at":"2026-08-11T05:02:21.029310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.350238Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":"63f2c444-2fc4-4f03-a518-f2877f9fb38a","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.036558Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:01e84a92645e102865e2afbc2e4163485a4cd8f1cec1d4d5b92655cb39ef913c","observation_id":"5cb528c2-36a5-4668-866e-1f1b969f270d","resolution":{"observed_at":"2026-08-11T05:02:22.356693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-08-12T13:08:43.602176Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-08-11T05:02:21.042923Z","title":"Sdxl- lightning: Progressive adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.042923Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:3b80e2e379a9de3bafd5555c06bc7ab5ff734d17c29f3f4f4c7d24e69eb127e7","observation_id":"47dd1d66-3a5d-4564-83eb-8f86b908a486","resolution":{"observed_at":"2026-08-11T05:02:21.042923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.051255Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.051255Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:dd829b860f7d6c28be2bde5aaa5989d32ce1505f21d07f940362a5eed3a34158","observation_id":"93f56d51-6c78-40f0-a08f-3f7866d4b12b","resolution":{"observed_at":"2026-08-11T05:02:21.051255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.303100Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"aeba4736-d7e4-4901-92c3-879a1cee2f5e","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.059585Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:26713a768fe304db4295ab0224c25c85adc62d4f052006b155a3c827eb7af2d7","observation_id":"fe456f20-c1d2-4ce5-9daa-aacb5dbf0b22","resolution":{"observed_at":"2026-08-11T05:02:22.311721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-11T05:02:21.071349Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.071349Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:ddb2025ba7e4ec82d441e55906b8ef7903716730affdc040404c1e315e515f73","observation_id":"bbf407be-a7e0-4ae2-a39d-3e819f06ae8e","resolution":{"observed_at":"2026-08-11T05:02:21.071349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.271412Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"53f78b90-0556-44a6-b9f7-d72dca915d17","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.079970Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:898d5c8609f1072faf3319586cdda9a6a6bc6b83220a94fb810b5bd0d1e7b92f","observation_id":"cc432f8e-9bcb-4ad5-8dc5-06bbb44ffefd","resolution":{"observed_at":"2026-08-11T05:02:22.280148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.239227Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"f3700401-7855-4055-97d3-9815ba40150e","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.089847Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:44a111b095bf8d4c526637a3873f5352bb5cc2344affe2f5f8dbfb91076be320","observation_id":"594a4e38-b197-4553-95b2-511c39c83f54","resolution":{"observed_at":"2026-08-11T05:02:22.249478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T05:02:21.097690Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.097690Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:677645885b90c334560d7908b53eacc4bfe1270f6b9c36c3116159418ea4cb33","observation_id":"8eedc475-0ccb-406e-8f84-98bbc525c32a","resolution":{"observed_at":"2026-08-11T05:02:21.097690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.207555Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"4c4d9a02-2b30-4eb9-ac4c-a0c58b36e522","year":2022},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.103787Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:cb1ee5686fa2ca8ba0bdb7d41941b79f860949a6af897155ef3c337ebfb84afa","observation_id":"1e5849c8-95e4-48d9-bdec-b36e2f2386d4","resolution":{"observed_at":"2026-08-11T05:02:22.221393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.175379Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"060f17d7-bccb-4e69-b568-849c62407399","year":2022},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.111622Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:275f9fffd31c102f9866b5545fc61e1a7e09e2841bad46c5f7e86dd323778c25","observation_id":"7f5035af-9229-42c9-b7b7-3e740d5f785c","resolution":{"observed_at":"2026-08-11T05:02:22.188309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.150734Z","title":"Improved techniques for training gans","venue":null,"work_id":"2074c0b4-4d1b-48de-a242-5147ff9abd67","year":2016},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.117927Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:37b30855e4f45b5c05074ea338ea2243d167373b45ed8e7e04031efe9b483e39","observation_id":"d49c2c9b-c03a-409a-910a-1e5532028457","resolution":{"observed_at":"2026-08-11T05:02:22.157587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.118833Z","title":"Adversarial diffusion distillation","venue":null,"work_id":"369b25e3-fc75-4a60-be7c-601fd58e81be","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.126537Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:84cd903aaf675801e307afc5900cfd7bea14ee7b84f00d6d04c29d41d3e72c99","observation_id":"dcd8729b-d21b-4149-8598-4bab0acc0422","resolution":{"observed_at":"2026-08-11T05:02:22.125556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16562","last_updated":"2024-10-10T14:04:07Z","snapshot_observed_at":"2026-08-16T13:40:10.520877Z","submitted_at":"2024-06-24T11:56:15Z","title":"EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16562","snapshot_observed_at":"2026-08-11T05:02:21.134390Z","title":"Evalalign: Evaluating text- to-image models through precision alignment of multimodal large models with supervised fine-tuning to human annota- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.134390Z"},"links":{"cited_paper":"/paper/2406.16562","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:9940fa742faf168e28d52b5ed6548369d19d3b3a4c2e0c44cef48db3ccd78b2e","observation_id":"2e0a4791-8562-48ad-8c09-f65c5e542251","resolution":{"observed_at":"2026-08-11T05:02:21.134390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.146494Z","title":"Kolors: Effective training of diffusion model for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.146494Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:a9a2d40ad46c1b4ca5bbe9095cc3cb014bfb5508a1fba46a591a234b31750a8f","observation_id":"ec67be34-20d5-4d73-8b90-7687ac6dd39c","resolution":{"observed_at":"2026-08-11T05:02:21.146494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.081410Z","title":"Shaping datasets: Optimal data selection for spe- cific target distributions across dimensions","venue":null,"work_id":"85e653a3-da60-47a7-ab13-00b2fad3d91c","year":2016},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.155621Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:ccaea02b8364ee26171a786b1bf6ea5e024e94d96bbc75a2f27b00849325d005","observation_id":"5611f23b-ea4e-4db1-b371-7ab0b513843e","resolution":{"observed_at":"2026-08-11T05:02:22.090609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T05:02:21.167608Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.167608Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:229b11983f14c3b85a164ebfeb5a74113ad640b42c3b61c64b55daecd351ad12","observation_id":"d903efde-b1a8-4d39-83ca-20655a7eb158","resolution":{"observed_at":"2026-08-11T05:02:21.167608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:22.046589Z","title":"Diffu- siondb: A large-scale prompt gallery dataset for text-to- image generative models","venue":null,"work_id":"144ba80d-be0e-46cb-a1f5-adce8095f69c","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.177037Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:44d1d707de52b21729d5aee958ef1d9cb2aa2d1e32a0d40c40a7c666b40f24f0","observation_id":"824b497c-b825-43cc-8ecd-15fad71e2ded","resolution":{"observed_at":"2026-08-11T05:02:22.056488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-08-18T10:40:40.051476Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-11T05:02:21.183802Z","title":"Revisiting text-to-image evaluation with gecko: On met- rics, prompts, and human ratings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.183802Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:0603bb088bfda0caba5d9d5887a8810aefd173a42bc081b3cb77bc3855a36929","observation_id":"8b36e445-d6cc-49f1-9bc1-a2fdc6827740","resolution":{"observed_at":"2026-08-11T05:02:21.183802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-11T05:02:21.191344Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.191344Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:54625982ba86a4fe3ba101e24da0ab899963c1b150355ad791dffb72d2ca359a","observation_id":"e73ef5b9-5d03-40f0-9ce5-f3d0c7663fa5","resolution":{"observed_at":"2026-08-11T05:02:21.191344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.985695Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"88f62fea-5017-48c3-a39c-932c2fff27ff","year":2023},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.197982Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:d728a145bc2df749be453176e1ffadd588a20d2b228f942262d5331af8f0ce78","observation_id":"fce54b42-52b2-4ef2-a7f1-a8f8d5e8fc25","resolution":{"observed_at":"2026-08-11T05:02:22.003846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.960725Z","title":"What you see is what you read? improving text- image alignment evaluation","venue":null,"work_id":"f7bf421b-6cd1-462b-9386-78206bb740f7","year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.206424Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:d4894c7aafc511167855831ff3eca44e9f92bdab1295f503e17130066d64ee7f","observation_id":"0668094b-562a-4122-8821-04ba1d075eac","resolution":{"observed_at":"2026-08-11T05:02:21.970675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-11T05:02:21.213390Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.213390Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:9751ff5bfe967f5c08e3939b202083a3f3ddfaa8fddf65676b09395b1616ee94","observation_id":"b767f916-d5ab-4753-b078-ea09397f85ca","resolution":{"observed_at":"2026-08-11T05:02:21.213390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.940123Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"67e4af40-1b9c-40c9-904a-85ff8e1a0264","year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.230479Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:c8c5caf5f10411be9028dd43cd1a77063ed8e223147725515a61161fcf869964","observation_id":"15f99ce7-d24c-4a56-b0cb-d1f90b984ea8","resolution":{"observed_at":"2026-08-11T05:02:21.947283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.912556Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"fc845c1b-afaa-4758-b710-3d30877ed493","year":2018},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.237859Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:baf74f7c9208059f5edc35bd6d780794eba0c161b76e32cb6143aba61226034a","observation_id":"080476d3-f4b0-4183-bb0f-b3ee56730743","resolution":{"observed_at":"2026-08-11T05:02:21.921018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.885963Z","title":"In data collection details, we de- tail the classification and sampling of real user prompts in Sections 8.1 and 8.2, ensuring diversity and balance among the real prompts","venue":null,"work_id":"626a9b95-5eca-4a2b-b8d8-f50422f7d306","year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.243077Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:b43975a6d492b431c5fa49179546d6748aa400e92e1e9ca443ce761b12afd17e","observation_id":"d590b938-a58a-41b9-bf4c-abc96f605fdb","resolution":{"observed_at":"2026-08-11T05:02:21.894425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.856775Z","title":"1 cat and some dogs","venue":null,"work_id":"05cacedd-7b80-494b-bfb2-a1409d37f909","year":2009},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.251563Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:9ce8433ac94aaf0f1c03d7f03c21753fa8f5879a43a6336b51387fd0ef2848de","observation_id":"5eb7cd80-4821-41c8-bbe2-19b2ca55d1fa","resolution":{"observed_at":"2026-08-11T05:02:21.865554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.836350Z","title":"Yes.” and “No","venue":null,"work_id":"19057e8f-c3b8-496d-acd6-2aef6eddb696","year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.258732Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:641524d4f0a35673930f9c27282d0b39cb68d6ccbdc7e47148d45027da567857","observation_id":"7a7ddfa5-7fda-4b6e-b168-15ffacdffd25","resolution":{"observed_at":"2026-08-11T05:02:21.841468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:02:21.808010Z","title":"Evaluation of image-text alignment across different T2I models","venue":null,"work_id":"45aec59d-b667-441b-8e1e-b1434540c6d4","year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.265519Z"},"links":{"citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:7612414105e7f51e4ab2c8519570daae62f1c357afc08f82dfbb67606e6a2b60","observation_id":"f9334116-0c08-4333-94c8-1cfcc72905b6","resolution":{"observed_at":"2026-08-11T05:02:21.821794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:26:48.098712Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 10 inbound Pith citation observations for arXiv:2412.18150."}