{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37d434cd80cdb61c95810a26551d00a3949633705bb7e8d328af25666649fbd4","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:35.910075Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T06:20:23.251121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18775","snapshot_observed_at":"2026-07-14T06:20:23.251121Z","title":"arXiv preprint arXiv:2505.18775 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11199","last_updated":"2026-07-13T07:50:54Z","snapshot_observed_at":"2026-07-16T23:19:15.382857Z","submitted_at":"2026-07-13T07:50:54Z","title":"DynEval: Holistic Evaluations of T2I Generative Models in the Wild","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T06:20:23.251121Z"},"links":{"cited_paper":"/paper/2505.18775","citing_paper":"/paper/2607.11199"},"observation_digest":"sha256:0b96de59e5f889a2a6313ecb649561feb22dd6bcd931920f84d9ce802af63c88","observation_id":"48b59986-b7a8-4efd-af13-d8dadcaa1d7f","resolution":{"observed_at":"2026-07-14T06:20:23.251121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18775/citation-record","integrity":"/paper/2505.18775/integrity","json":"/paper/2505.18775/citation-record.json","paper":"/paper/2505.18775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:28:29.295573Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.295573Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:bc64921ee5fcb0dfc8d165ff4b55b1c5d88b66db582ac41c8e11fd57fd197def","observation_id":"2512fa8f-a2f6-4ea6-9f2b-6a2892fe035a","resolution":{"observed_at":"2026-08-07T14:28:29.295573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.379140Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.379140Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:2f825c5f898765fe88cd53783b404b424cf66508530ba6bd840872ae37b1093d","observation_id":"f6e0813d-039e-4e7f-80fd-c2c6b2173c73","resolution":{"observed_at":"2026-08-07T14:28:29.379140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.499025Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.499025Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a87420abded34df36b1932ffb4d11f9b6f4a4dee9ea9aa181c86a9294093edb5","observation_id":"179116bc-2e1c-49ee-8131-792ea8f7e260","resolution":{"observed_at":"2026-08-07T14:28:29.499025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.813801Z","title":"Flux1.1 [pro]: Advanced text-to-image generation","venue":null,"work_id":"e5e6d296-ea4b-41aa-aeec-76d6d590bbbe","year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.643316Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:d0067f1c958cd032fa07cdd7c7985fd5e7469bc3f2965e9e54aedb8fa202dc16","observation_id":"88bd8380-9655-4ca7-97f3-5f7781a19c9e","resolution":{"observed_at":"2026-08-07T14:28:39.968176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-07T22:17:44.862677Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-07T14:28:29.775775Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks.arXiv preprint arXiv:2410.10563, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.775775Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:6dde61366941c10fc4c5ca48f0bfdbb992b46c22d5ea66dbc85fd57835c3ce52","observation_id":"eb001b3c-1e32-447c-aac6-58d4f013fa70","resolution":{"observed_at":"2026-08-07T14:28:29.775775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.862479Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.862479Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:995782e0f930233e22e18841ca9127c6565439cf56d753ea173a83ec594cdff9","observation_id":"712b1f7f-f1af-46df-a7a3-38490e1ffeb1","resolution":{"observed_at":"2026-08-07T14:28:29.862479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.966648Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.966648Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:1571f6a513a7c8e78bfaaf89611af06c77bd386cfbf92e1dc8892dabfacfa981","observation_id":"bebc4b12-ae47-43ae-9f1b-29ab110dd5eb","resolution":{"observed_at":"2026-08-07T14:28:29.966648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:28:30.097899Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.097899Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:b2a0be4a052d40a7e3c86b3bf581dbacc77a920bb4ede7eba691cb627033a2a4","observation_id":"63187bfa-1fb6-4de9-b6ee-a004f532a42e","resolution":{"observed_at":"2026-08-07T14:28:30.097899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.247323Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.247323Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:568110b3dbcc30ec42e243a83eb4e7e369af35d694a413fa41126a55fcee56b1","observation_id":"9abc236d-b12e-4359-a185-fc11a3faec6b","resolution":{"observed_at":"2026-08-07T14:28:30.247323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.340524Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.340524Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e937e43847f8f807d5f08a4a7656759a612cfe76c01cc74c45106bfbce0c59f2","observation_id":"6c01f326-1404-4e65-922d-d127e347067b","resolution":{"observed_at":"2026-08-07T14:28:30.340524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-07T22:15:46.490983Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-07T14:28:30.474655Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens.arXiv preprint arXiv:2410.13863, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.474655Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:23d5deecef072d3d464d995214f59221f67183d238f6bba7aa15f2831c5eb323","observation_id":"d9d632a7-038c-4a2c-a2be-6af5687e0ddf","resolution":{"observed_at":"2026-08-07T14:28:30.474655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-07T14:28:30.598466Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.598466Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a3770dc72e682b5d4218e9be28f6787f09ca9fe9a91f9e4bb13211e585491676","observation_id":"e3f06447-395a-44e2-a55a-601fe674da0a","resolution":{"observed_at":"2026-08-07T14:28:30.598466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.714121Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.714121Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:0ff136a20c7b9c9cf8c1f56ac58dcdfa88e0e202011da81f40fdac0b2caa5e58","observation_id":"24305e3b-7bc9-4c0f-9cf8-15318303a931","resolution":{"observed_at":"2026-08-07T14:28:30.714121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-07T14:28:30.836749Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model.arXiv preprint arXiv:2503.07703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.836749Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:6444dd665bf3226ce2104afe3c51e42e5686fae8669400bc9cacbbd77820a77a","observation_id":"1e6a4cd8-c0b9-4963-aa02-5f61e9f6963b","resolution":{"observed_at":"2026-08-07T14:28:30.836749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T14:28:30.975516Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.975516Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:86793bb1270c5a7295c87faece56ad8e48b816e34f2e891bdd5cbd5aa51a4d4e","observation_id":"05ffd836-af89-4d16-8e44-e5d21617f6f4","resolution":{"observed_at":"2026-08-07T14:28:30.975516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-07T20:34:58.400387Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-07T14:28:31.134652Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.134652Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:2d8782b817732ff0e30657750b8b69b4c5317d738869dcb0e13e473ae16e9888","observation_id":"fc6ded08-f408-4eef-8c1f-0c5c1d5208bd","resolution":{"observed_at":"2026-08-07T14:28:31.134652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.273550Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.273550Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:b40cc2c86ac3d5da4d47ced5fc740e68abb85dae6a378ee6d26ec9c8c76638cf","observation_id":"70ed4d08-6ea5-4948-9ce0-6d53d9451b3e","resolution":{"observed_at":"2026-08-07T14:28:31.273550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T14:28:31.438907Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.438907Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:416120b9e85bed8562f18a91782bb2433a6a8af544c3e6eb422532fe42159602","observation_id":"6d3fe910-e3b0-401a-bd17-e17bd1c3a99a","resolution":{"observed_at":"2026-08-07T14:28:31.438907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.562874Z","title":"T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.562874Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a6a79355cc9973f1000e68e79bd3ce89a80aadabbc5a13ec33d675ce0846d769","observation_id":"a2854d20-f825-4e38-bc92-45ea16fa310f","resolution":{"observed_at":"2026-08-07T14:28:31.562874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.688400Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.688400Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:38cb98c9e3ef845a81932bfb00b955b55401d748671f4b60ffe11d31d0e51ec2","observation_id":"daf5c128-881e-4efd-9b69-77e9116fa03a","resolution":{"observed_at":"2026-08-07T14:28:31.688400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.826848Z","title":"Smartedit: Exploring complex instruction- based image editing with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.826848Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:440616cb5f7b2500fbf00d0f1798f19aef4e37674b083ae23ff8f376488106af","observation_id":"b6a52180-e130-484d-94d7-9b39f21ac75a","resolution":{"observed_at":"2026-08-07T14:28:31.826848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:28:31.979482Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.979482Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:5cde5391dd688e9311a6b2410654320d5b7906c02de9dfaca2f825249a3a0aea","observation_id":"94ac27b8-8da2-4c73-a953-55a3758adeb6","resolution":{"observed_at":"2026-08-07T14:28:31.979482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07304","last_updated":"2024-05-28T12:32:31Z","snapshot_observed_at":"2026-08-07T22:15:49.747620Z","submitted_at":"2024-03-12T04:13:45Z","title":"Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07304","snapshot_observed_at":"2026-08-07T14:28:32.109779Z","title":"Lumen: Unleashing versatile vision-centric capabilities of large multimodal models.arXiv preprint arXiv:2403.07304, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.109779Z"},"links":{"cited_paper":"/paper/2403.07304","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:58390ce80ac11adb51a858dcbbd67ce081e6cd73b5172ea94f45f24187a99907","observation_id":"80f0a40a-cea9-4987-898d-36caa0d6a161","resolution":{"observed_at":"2026-08-07T14:28:32.109779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-07T16:08:15.150652Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-07T14:28:32.219643Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified visual encoding.arXiv preprint arXiv:2504.04423, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.219643Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a0ffd27b359466b4f59ee9bf924dd7286f6da6057badb365f09f184cffefea86","observation_id":"1ed1e2e4-6fd9-447c-89d2-e5d3ad74bb88","resolution":{"observed_at":"2026-08-07T14:28:32.219643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-07T22:18:33.579780Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:28:32.362554Z","title":"Dual diffusion for unified image generation and understanding.arXiv preprint arXiv:2501.00289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.362554Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c4526a0feb2f9c634be7f87820ffb019af26dd92314780935975a380b3953098","observation_id":"ed0f780d-9212-47a9-96ab-f8b587539ce6","resolution":{"observed_at":"2026-08-07T14:28:32.362554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:32.471522Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.471522Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:545fa2eea271e5440789e4afce3291e74c17b1947ea962a79fa9ed95318f4283","observation_id":"bce7c79f-86a0-48a6-8648-9ad7572829c4","resolution":{"observed_at":"2026-08-07T14:28:32.471522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T14:28:32.610635Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.610635Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:4b293dac32dbd1cee3cc14b4bddd8f4b95ebfe0ce305655631d34e5e114cfdca","observation_id":"93558a59-6c40-4f89-af10-36509eedaf50","resolution":{"observed_at":"2026-08-07T14:28:32.610635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T14:28:32.759400Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.759400Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3bbf2e04a7cb58858becd5e22512144051ab4c9e05aa78dd202ff7999431427d","observation_id":"667db9b1-f805-456d-aa65-246b61de0ce7","resolution":{"observed_at":"2026-08-07T14:28:32.759400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T14:28:32.849110Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.849110Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:0746155ad24aed4c671e85a55ce4f90c65153d413baee4fe592f8774febbf1e9","observation_id":"06f51c28-4492-43fe-9042-a032154cb4fd","resolution":{"observed_at":"2026-08-07T14:28:32.849110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-07T14:28:32.994290Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation.arXiv preprint arXiv:2406.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.994290Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c6bbb2cb5b8d1bbcf1ae45d71f6a6d77e98f959ec964dc4b19d17c7131f15a10","observation_id":"baf26363-2df5-4671-90d6-3c95ed69a624","resolution":{"observed_at":"2026-08-07T14:28:32.994290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:28:33.100754Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.100754Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:8d577d7822b0c1e7434eca199223e8d7b90568ee3dce9a00dc860159beacf965","observation_id":"8aa4a257-6577-433d-8c6f-dd02bf34176c","resolution":{"observed_at":"2026-08-07T14:28:33.100754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:28:33.219203Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.219203Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:80d499cccbf457836ea9ea8acff0c94f84b56e65c7001e3704ab499f2dc48357","observation_id":"b4ae9d06-9360-4d33-9bac-db1ffda71c76","resolution":{"observed_at":"2026-08-07T14:28:33.219203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.330159Z","title":"Vision transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.330159Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:1fac24667e7aa2e7f03fa9a34d013adfa1d2363c00bfb205eb07c5ef9161e995","observation_id":"397e652e-4ba8-4f4a-af64-7e0d7ecd08e5","resolution":{"observed_at":"2026-08-07T14:28:33.330159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.455366Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.455366Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:8e9959a7679ccca2cde7e41ab7bdd0dcbfc5947a34dbd7ac998b18681fac8fcb","observation_id":"401de1fb-3ba7-4581-8f08-5d5685eac118","resolution":{"observed_at":"2026-08-07T14:28:33.455366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.607650Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.607650Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:0ea89efe5fd65c6bf25bda4b0e9527d43b501f8b3c9e07c8958965ba23baf041","observation_id":"d492a396-8d58-4e14-b5af-9dae847c1e83","resolution":{"observed_at":"2026-08-07T14:28:33.607650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:28:33.734038Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.734038Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:98d6c793c6959a31bd98a0ce9b277ad78e97588e2d47dec9860099ad81c53f37","observation_id":"11ba40ed-a0f1-4214-9cc5-1ad67dd44a15","resolution":{"observed_at":"2026-08-07T14:28:33.734038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:28:33.846760Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.846760Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:9cf579a332fa20d025ec963a215767da13ee517550ba9d25fdcc11c37bd360e7","observation_id":"f1d56689-5926-4aaa-8edb-b141979cd266","resolution":{"observed_at":"2026-08-07T14:28:33.846760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:28:33.967796Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.967796Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:91b5c6ef99b294d988521ef5f8d73bb18e601bd3e50f214a5690a8abdb9d0d61","observation_id":"f21b04f6-5b96-4314-8a25-8a21085d8016","resolution":{"observed_at":"2026-08-07T14:28:33.967796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:34.088359Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.088359Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3a0fc38a947edd362b7759b73e1c5e32e400eaf8848acdd69df0f497ed4713f3","observation_id":"2dd0c276-3f5e-4b66-b540-53865d3e78f8","resolution":{"observed_at":"2026-08-07T14:28:34.088359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.361056Z","title":"Evolving storytelling: benchmarks and methods for new character customization with diffusion models","venue":null,"work_id":"63229846-2abe-4b34-ab27-8fa2b9723287","year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.237115Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:f30d8e91491a6dc80f1f71ac0c631271b3fffc6ccb3605e95065bb0c7d8081d2","observation_id":"456f8880-6752-4e00-b4f6-19c803b0f578","resolution":{"observed_at":"2026-08-07T14:28:39.510080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-06T09:18:54.806043Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T14:28:34.389019Z","title":"Conceptmix: A compositional image generation benchmark with controllable difficulty.arXiv preprint arXiv:2408.14339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.389019Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:94593d891b1aa5e4cc03f35b97f8662f58513b387d5ee7af80ce57ca3c982df3","observation_id":"6e6be51f-7718-48d4-a1bd-af3ae90e0e0d","resolution":{"observed_at":"2026-08-07T14:28:34.389019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:28:34.510211Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.510211Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c5171077556fb9089d1a59d5366f1e60a81d73994a6e9b19623f3b5f8ebd0869","observation_id":"a3cc4fbb-c669-4e01-9bb8-015dd4de32ac","resolution":{"observed_at":"2026-08-07T14:28:34.510211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-07T22:15:46.080591Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-08-07T14:28:34.643778Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing.arXiv preprint arXiv:2504.02826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.643778Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:bd51bfc86055d9b8e19cd1ef724c4a7cbab8e93c7bda4eb4385165fd991c8161","observation_id":"ac53e407-5d32-476e-be06-8d9d59866187","resolution":{"observed_at":"2026-08-07T14:28:34.643778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T14:28:34.753090Z","title":"Not applicable","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.753090Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:02deba2e316f3a7f11a3453e2db9274c909f3229e364dc76e8cbab3cf810f0ef","observation_id":"654d0a23-4d51-4dd1-af7c-b6e468722408","resolution":{"observed_at":"2026-08-07T14:28:34.753090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.053252Z","title":null,"venue":null,"work_id":"0882cfbf-ade9-43c4-a49e-d7bfbb9fb977","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.852853Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:40d27d94b26bab59b2c94c307ad986b1f808bca7e81f2cd04515b96c0bf0dedf","observation_id":"c6373c3c-90d4-4ec1-974d-989a8e8216cc","resolution":{"observed_at":"2026-08-07T14:28:39.227501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.804979Z","title":null,"venue":null,"work_id":"d0416992-d8b4-46e1-b05b-e18f00f5d629","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.990939Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:37e23be62f53a22e0119afd7a8d69afb8b96be2ef8919f2ed10a17f05060cab7","observation_id":"6866b88d-7c9b-4b7a-8f11-26dc576d2760","resolution":{"observed_at":"2026-08-07T14:28:38.939411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.528714Z","title":null,"venue":null,"work_id":"16b93f3b-20aa-4a45-a63a-a2f389cecc38","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.120612Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:4f5bd23252faf19e584ac520206c68724b1bdd87f56138387f2fdf03e102eaef","observation_id":"995dda9f-06a7-4ec4-86bb-3003227a9ab5","resolution":{"observed_at":"2026-08-07T14:28:38.651186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.261335Z","title":"Identify and highlight the inflection points of the function shown in the image","venue":null,"work_id":"9deee88d-e982-43c1-bf3b-e60d55d6e3a1","year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.228438Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c380169d78b54b608df9d530bc95f5d32e2f45fe00a5b8201dccf3996061f659","observation_id":"7eb7d2d1-4e50-4cee-b487-844a53544732","resolution":{"observed_at":"2026-08-07T14:28:38.384268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.045601Z","title":null,"venue":null,"work_id":"fb5f05a6-36ef-4fa6-aebb-25627016da77","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.282745Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:b828b0123ca984627f27a2628e5fed0dc5c052ac36718657ca68407fe68bac4e","observation_id":"19f2abe5-92fd-482d-8826-5cea8d6283fc","resolution":{"observed_at":"2026-08-07T14:28:38.181329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.808357Z","title":null,"venue":null,"work_id":"ed8268f7-a46c-4038-9f5a-b9b0df728a63","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.328745Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a637a938b0c585b8c30de7b551161f6ceecbe08b9b27fbd6d3bd014e27915587","observation_id":"b2f7de11-125a-4e38-befb-34fe66d5be4f","resolution":{"observed_at":"2026-08-07T14:28:37.924467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.588310Z","title":null,"venue":null,"work_id":"f067e0fc-e9d4-4714-8bcd-346a88131d37","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.407601Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:4463678e428e839d8155c3d388e32b167691b04acfda3f38759e4d7c2f76e967","observation_id":"5c05967e-cc88-4f73-9e13-05459d9e11f2","resolution":{"observed_at":"2026-08-07T14:28:37.684805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.381165Z","title":null,"venue":null,"work_id":"ce3b0089-e7d6-4510-bca0-e36ac12badce","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.539559Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:be8515c1573d7ad70ea2f831ff0b091ccd06f6175748016c609ee2f8a017af16","observation_id":"5796b532-7688-4fc3-9891-78018bf62abf","resolution":{"observed_at":"2026-08-07T14:28:37.476868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.161526Z","title":null,"venue":null,"work_id":"d704cda9-c1c1-4ad0-a690-7f06dce39818","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.597984Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:9c50400be48f4a5068131e8af87118cf8cb188e6cb55df9bbe42d76f04899253","observation_id":"863525e2-b1ab-4df1-86d5-2213272e20db","resolution":{"observed_at":"2026-08-07T14:28:37.265280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.000971Z","title":null,"venue":null,"work_id":"983aeeae-0f55-43ad-af34-b1e3e8b00bfd","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.670058Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:ec723fb86b09e4b5e69016ec09008a0b9eb789db1444a54f08f6337627e8c671","observation_id":"256de426-fe25-4cd9-90ff-4ba675c46303","resolution":{"observed_at":"2026-08-07T14:28:37.071301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.849347Z","title":null,"venue":null,"work_id":"6cd8244a-8d75-43ad-9db2-aebbb8c62868","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.741444Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:d241fb56cd9abcc1579f80b55843b95f3a9f2e7dd1fea4a45c3f4d60cd97a926","observation_id":"78e3e01b-0a59-4d3a-ad4d-e1326fb76637","resolution":{"observed_at":"2026-08-07T14:28:36.886405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.654461Z","title":null,"venue":null,"work_id":"46779a04-6543-4a4d-81ad-167e27a7f0d6","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.805925Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:f5d4da6c6ec26fd0974ae1a9516bb3f7af9572e024866ebc576e3a689448cfcf","observation_id":"3376522a-1709-41b7-80e5-6fd3d9ec49d3","resolution":{"observed_at":"2026-08-07T14:28:36.744968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.532661Z","title":"To Do Today","venue":null,"work_id":"e405cebf-71e3-4125-b668-646791c65f3f","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.910075Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:2b84ca02835c3bd4a4d4ed2ac2711078f4e6d98a02c80528a047a898af9c43b0","observation_id":"2b8b1568-7216-45b2-9073-2cffad60ef0b","resolution":{"observed_at":"2026-08-07T14:28:36.588956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:35:26.877187Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2505.18775."}