{"as_of":"2026-08-23T12:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ed757157e114f60bd61626b1f33116d38f55c13c56f63099982d10cc86b1a19","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:40.539908Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:16:44.681599Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2603.27064","last_updated":"2026-04-14T20:08:27Z","snapshot_observed_at":"2026-08-18T14:08:51.713230Z","submitted_at":"2026-03-28T00:45:05Z","title":"ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T22:39:06.113655Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2603.27064"},"observation_digest":"sha256:69599b3b64565ddee3f2e5d4adf268e33c77f3f170dd1ba51138f0a5d310a07a","observation_id":"5d2f1016-d7b9-4996-bbf9-ccf4cb5a9a2d","resolution":{"observed_at":"2026-05-14T22:39:32.913108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2605.13223","last_updated":"2026-05-13T09:14:31Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:14:31Z","title":"Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T20:13:21.750639Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2605.13223"},"observation_digest":"sha256:b357b453f1ff8aec7f2e5bc78a0c462945e588a696bd70ca6c7ebace6f1a90da","observation_id":"d0fbf8be-567f-4290-890c-45d1d41a5c17","resolution":{"observed_at":"2026-05-14T20:19:28.535511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2605.18652","last_updated":"2026-05-18T16:57:36Z","snapshot_observed_at":"2026-08-15T10:44:58.228182Z","submitted_at":"2026-05-18T16:57:36Z","title":"MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:36.734758Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2605.18652"},"observation_digest":"sha256:bb86f43820abc6dd5db0a40d0039929d6733020a961cbe7ab7a6e7986cb51f1a","observation_id":"79e960fa-1a9a-4a6d-ae8d-e8d73862762e","resolution":{"observed_at":"2026-05-20T11:58:15.046298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2606.01414","last_updated":"2026-05-31T19:22:43Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T19:22:43Z","title":"Agent Skills Should Go Beyond Text: The Case for Visual Skills","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:11:37.457810Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.01414"},"observation_digest":"sha256:c79350ed8f29cf0c3e4c78da47032b970b2c1f29369eb34d63d9f9e7c8338ba1","observation_id":"dfe5db5b-ba7d-4510-b033-d47557dce56a","resolution":{"observed_at":"2026-06-28T17:12:23.921117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T02:03:45.564122Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:399ca4520e6cdbcc0711818d15bb1d4a99b1087c628ade01bf8e0c464e3d5ccc","observation_id":"6702f4e2-7b6d-4114-840b-f92783a07124","resolution":{"observed_at":"2026-07-01T18:25:57.796713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:58.872140Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:59ce5a0ba0cb396bffccb73a254d0ce6c1eec4522f39e5f76da16f1dbeb32279","observation_id":"540ad50b-fbea-492e-9c25-5def5ee16eb6","resolution":{"observed_at":"2026-07-01T09:35:40.637749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:28.444524Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:651ee43f4f67814bd97356326f00dce838fe5dc18534088e4c1f8141879ae4b5","observation_id":"9da87cec-30ae-4453-8d54-b06e830de4b7","resolution":{"observed_at":"2026-07-02T20:57:22.796523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":"2505.19415","doi":"10.48550/arxiv.2505.19415","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aliaga, Wei Xiong, and Jiebo Luo","venue":"ArXiv.org","work_id":"e0b01afd-c12a-42eb-857c-aaec4ff005fa","year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T22:44:16.272541Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:3eddf532f7b84a87a8517e248338a6c1752ed9ab036bf0824def84754ed901a6","observation_id":"cb39151b-0dc9-4e56-a9ef-4390812c75ec","resolution":{"observed_at":"2026-07-03T22:49:00.966399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-07-14T17:14:19.770867Z","title":"arXiv preprint arXiv:2505.19415 (2025) 8","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:19.770867Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:faea68fda7a443ca9b67d3eb1f528b05edb622778aa03e24a767fb4b5c9561c3","observation_id":"a2758f89-69d3-4344-b147-f6a0645cd615","resolution":{"observed_at":"2026-07-14T17:14:19.770867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-02T10:00:10.910569Z","title":"arXiv preprint arXiv:2505.19415 (2025) 8","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:10.910569Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:5ac2ed35d380c4e453607bed5d8dc6d5d7d6bc8986f766ccac8be9ce45c0d812","observation_id":"a397dfef-885e-4bdc-ab6d-621ecb59b936","resolution":{"observed_at":"2026-08-02T10:00:10.910569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19415","snapshot_observed_at":"2026-08-08T12:16:44.681599Z","title":"Mmigbench: Towards comprehensive and explainable evaluation of multi-modal image generation models.arXiv preprint arXiv:2505.19415, 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05485","last_updated":"2026-08-06T00:28:38Z","snapshot_observed_at":"2026-08-19T17:53:06.511050Z","submitted_at":"2026-08-06T00:28:38Z","title":"VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:16:44.681599Z"},"links":{"cited_paper":"/paper/2505.19415","citing_paper":"/paper/2608.05485"},"observation_digest":"sha256:52f215c2ce6ee6ac50b9ce6ea48e423a1136eca7a6e8c42b025c8e80562e9416","observation_id":"f88a1b98-a342-4fd0-93d6-3d990ade54d9","resolution":{"observed_at":"2026-08-08T12:16:44.681599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19415/citation-record","integrity":"/paper/2505.19415/integrity","json":"/paper/2505.19415/citation-record.json","paper":"/paper/2505.19415"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:17:32.198193Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.198193Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:e24c03d298d02b707065a50344b1a2fdfaaaa31fc9e1fe2163cda2966a7360f1","observation_id":"ebc1c556-8043-4c91-9050-e5814de20360","resolution":{"observed_at":"2026-08-07T14:17:32.198193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:32.253961Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.253961Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:e39a9d562a5f046917e75565bae1d62e20f70ba329f9931142a959e003e2dca3","observation_id":"1f03809d-4cb9-41d9-a07d-ce2184c25094","resolution":{"observed_at":"2026-08-07T14:17:32.253961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-21T20:37:42.923128Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:17:32.455904Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.455904Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:91cf66bce725f5b188dcf2693fce7e5f5e90955d4ed02c7b593b15dd6c0b0741","observation_id":"956a145d-9daa-47d9-af78-c6027cfcaf70","resolution":{"observed_at":"2026-08-07T14:17:32.455904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-08-18T10:40:40.596551Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T14:17:32.547410Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.547410Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:386d73a5bbe2867cf21ace3c1eb030a7f06e35416a5571c860320cf928fdc9ba","observation_id":"319cba81-a631-4770-95e8-e365b887cfe8","resolution":{"observed_at":"2026-08-07T14:17:32.547410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:32.623206Z","title":"Dreambench, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.623206Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:a532c9ce6edf0be57ff143b40fb2f6c333342a0890dea88875fa2dca6a6f2a6a","observation_id":"6278fd2d-b2e0-4c2b-8581-0dbde1d2c4c3","resolution":{"observed_at":"2026-08-07T14:17:32.623206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T14:17:32.692807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.692807Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:9e63de6dc777633e8db0869bf3104eb46ce1fe9a1308f5f530d3408a11a4be00","observation_id":"8ea65807-b9b2-4183-ae09-469ba6671eac","resolution":{"observed_at":"2026-08-07T14:17:32.692807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12590","last_updated":"2025-03-16T17:51:16Z","snapshot_observed_at":"2026-08-21T20:44:40.850115Z","submitted_at":"2025-03-16T17:51:16Z","title":"Personalize Anything for Free with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12590","snapshot_observed_at":"2026-08-07T14:17:32.762978Z","title":"Personalize anything for free with diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.762978Z"},"links":{"cited_paper":"/paper/2503.12590","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:05d8025c89673af9d98343ea4a12935219069ee1f13c0126b3a8878508331db0","observation_id":"1fc9f34c-9f78-4159-8240-ee816df5ed74","resolution":{"observed_at":"2026-08-07T14:17:32.762978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-08-21T22:35:43.071280Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T14:17:32.854514Z","title":"Commonsense-t2i challenge: Can text-to-image generation models understand commonsense? arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.854514Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:7376965c3aa8271a555812b29d986c9cc55a5abb7de8effb42687f7aef2e571c","observation_id":"9b784e3f-2441-487a-a237-cf01ea15bdca","resolution":{"observed_at":"2026-08-07T14:17:32.854514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-20T10:39:03.872570Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T14:17:32.973359Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.973359Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:9ed5bb6ab28fc84bf3a350b5fe0af91b436f02216c4527f2d3df03ecb1be6c25","observation_id":"53f7d114-3ea6-4ae5-91c3-d463759d2edc","resolution":{"observed_at":"2026-08-07T14:17:32.973359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.046998Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.046998Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:aab17cd952d50aacb09b7eb1318fb266b1ce7a905db2864f5ddc2b9e062c8390","observation_id":"826c7544-3676-4543-8fe7-c1950397d96c","resolution":{"observed_at":"2026-08-07T14:17:33.046998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.128761Z","title":"Gemini 2.0 flash, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.128761Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:26b079619a54787c0d6a1c17eebe0a602d087cff7619164423607bd70a785d78","observation_id":"8710b60f-8f99-42ca-9c35-fd726c61decc","resolution":{"observed_at":"2026-08-07T14:17:33.128761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-19T18:58:04.469177Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-07T14:17:33.225548Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evalua- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.225548Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:6879413e3fe4c0fafb7a215373a29fcc5f9179e7d3e84d2ca4bcb54d93eb30a5","observation_id":"20e1c83d-9c5e-4fbe-8e3d-fccc0850c1db","resolution":{"observed_at":"2026-08-07T14:17:33.225548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T14:17:33.298586Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.298586Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:29d4f1560f59669551208325737606c53c9089d58f38afa6e3ee8cb5dfe2aef9","observation_id":"f6659ad7-bccc-4c04-be4e-03e0bfc88c44","resolution":{"observed_at":"2026-08-07T14:17:33.298586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-19T17:14:28.711585Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-07T14:17:33.369845Z","title":"Promptcap: Prompt-guided task-aware image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.369845Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:314db7038b4e7bf6de7b725abc44ab9ffbd3190b7606bd24e7680b894979c302","observation_id":"d55fa72d-bf2f-4a12-959e-5e0f50f827f7","resolution":{"observed_at":"2026-08-07T14:17:33.369845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.476722Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.476722Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:7fdd2dbcacde0e1c26d0f57ca08b1268dd7d8fc8fc13ae5397ad93fd93b747b0","observation_id":"1df7e5ed-c53e-4a36-a83d-fcd0d8c2804e","resolution":{"observed_at":"2026-08-07T14:17:33.476722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.566324Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.566324Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:af2cf8383faec93c3c62f043b5ff9bd90bd51dddf08ec2570940d1df8ce8c933","observation_id":"c75cbd43-9ac1-4832-8609-29b20633391c","resolution":{"observed_at":"2026-08-07T14:17:33.566324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.636999Z","title":"Finematch: Aspect-based fine-grained image and text mismatch detection and correction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.636999Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:705257769effb13f154672f83c0d9afe0f1d09ec8b11c0f56dbb74efb9bce3c9","observation_id":"102a8bb1-d20b-4a86-bbb4-b1cecbb5e0f6","resolution":{"observed_at":"2026-08-07T14:17:33.636999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-21T19:13:25.220980Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-08-07T14:17:33.709860Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.709860Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:8776876a409b0434f35e92a7d078fefd2d5d02f0a7f81548e90b36c74a1abdfb","observation_id":"a27e9937-2230-4ba7-bf44-1d7987b2a080","resolution":{"observed_at":"2026-08-07T14:17:33.709860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.783607Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.783607Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:138f0edfdbe4035a060563d2346e72747411bf6bce97124ca409a46c8f9a959a","observation_id":"5f8d031a-0586-43c7-9b1c-814c32fe0561","resolution":{"observed_at":"2026-08-07T14:17:33.783607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04300","last_updated":"2025-06-04T03:29:18Z","snapshot_observed_at":"2026-08-15T01:57:23.693588Z","submitted_at":"2024-12-05T16:21:01Z","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04300","snapshot_observed_at":"2026-08-07T14:17:33.979030Z","title":"T2i-factualbench: Benchmarking the factuality of text-to-image models with knowledge-intensive concepts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.979030Z"},"links":{"cited_paper":"/paper/2412.04300","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:22cb3ab8a7acb7a5320a41f8b1efba0a18a2b73301fb54085e260bf46e16f97e","observation_id":"8f14445d-b9a3-4d2a-88dd-81f43faf8828","resolution":{"observed_at":"2026-08-07T14:17:33.979030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:48.005166Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"ea103bc3-72bb-489a-b31d-1f737948402c","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.067778Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:91c6e3ba360f317656726df900e955b128d1497d6b21aa079acf41979a6b58d6","observation_id":"facc9f8d-5068-4fa6-a19c-23d5ed5e58a7","resolution":{"observed_at":"2026-08-07T14:17:48.094741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.06537","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:41.898166Z","title":"Profashion: Prototype-guided fashion video generation with multiple reference images","venue":null,"work_id":"37ee3630-34f1-40a8-b579-67264f023ef5","year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.166191Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:eaa5d73d3b142f8a97f90db5838e63cabba91771e68fb05f95b1577ebab75282","observation_id":"1be814f8-41b5-4078-a06f-8ecc2696b562","resolution":{"observed_at":"2026-08-07T14:17:42.018740Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00750","last_updated":"2023-11-01T18:00:03Z","snapshot_observed_at":"2026-08-16T14:46:46.824013Z","submitted_at":"2023-11-01T18:00:03Z","title":"Are These the Same Apple? Comparing Images Based on Object Intrinsics","version":1},"cited_work":{"arxiv_id":"2311.00750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00750","snapshot_observed_at":"2026-08-07T14:17:41.533949Z","title":"Are These the Same Apple? Comparing Images Based on Object Intrinsics","venue":"cs.CV","work_id":"3144aa8c-5791-4cac-8ae4-086c83a74511","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.260701Z"},"links":{"cited_paper":"/paper/2311.00750","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:112965af1bf0748878b016788c9b1f02f461dfa337a3204b6194dc9cf06192bf","observation_id":"f793b838-9fb8-4b72-99f4-f778726fc54a","resolution":{"observed_at":"2026-08-07T14:17:41.674371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:47.803883Z","title":"Multi- concept customization of text-to-image diffusion","venue":null,"work_id":"62b0a032-f946-46f8-b194-85eea23480f6","year":1931},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.334393Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:132d2d45fa8c9830870eb5af607fb55e4f66b4ebf4b5bec930fbe0eeca7f70ef","observation_id":"c53286f2-f14c-4b16-946f-37d1001fc762","resolution":{"observed_at":"2026-08-07T14:17:47.918627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:47.609413Z","title":"Flux.1, 2024","venue":null,"work_id":"4f8a2e30-0f1b-49d3-a76b-dac59251b1ab","year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.415113Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:33d7328905778425857e997cb272cccf16b492dcd0168c5d78e4c00aa61c9f9e","observation_id":"4a731ae5-bc4e-427a-8a05-85dbd9c687fb","resolution":{"observed_at":"2026-08-07T14:17:47.702937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:34.494533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.494533Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:2802871a73b21a5f525736277b757cd47315d17d9855c46e17d7b099894b06cf","observation_id":"18bb1ba9-1589-4f9b-bc54-7448ac5064d0","resolution":{"observed_at":"2026-08-07T14:17:34.494533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:47.449755Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"86dab3a7-451f-4a49-a665-8b3e4313a195","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.588651Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:7d658752af80249f15c16dbf3b7140c62fcb23a642821243955cbc9b3e1fafa1","observation_id":"9453b890-c1fc-457f-aff5-3b4d4ecc2bb0","resolution":{"observed_at":"2026-08-07T14:17:47.511934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-18T03:21:35.557463Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T14:17:34.670156Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.670156Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:89eeb1dce489510db2915895b8f563821902cf8622d169432f5d416d429a6bc4","observation_id":"a6d82efc-93f1-4e0a-9be3-468e66cde8ea","resolution":{"observed_at":"2026-08-07T14:17:34.670156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:34.761980Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.761980Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:584d1ece4085b50f163f5658762e937e4a42f493a305c910c39d3b173b5b0108","observation_id":"23844377-395b-457c-90d4-a8abc9cd86da","resolution":{"observed_at":"2026-08-07T14:17:34.761980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13388","last_updated":"2024-06-06T13:25:09Z","snapshot_observed_at":"2026-08-16T14:24:55.715271Z","submitted_at":"2024-01-24T11:36:44Z","title":"UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13388","snapshot_observed_at":"2026-08-07T14:17:34.850238Z","title":"Unimo-g: Unified image generation through multimodal conditional diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.850238Z"},"links":{"cited_paper":"/paper/2401.13388","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:3299a6bc5899936b0bb55432009c51951fa43db60c0cd95a25b48e1d7c47b711","observation_id":"cd72b125-1a48-4f03-a3b9-fd888d5f8ff6","resolution":{"observed_at":"2026-08-07T14:17:34.850238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:17:34.926538Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.926538Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:fb5ca85f77688c75276d98042574f7f8dfebca0862b2d092feb53c96aeb1ba91","observation_id":"7464fcef-16b5-4120-bebc-5a2d6fff5501","resolution":{"observed_at":"2026-08-07T14:17:34.926538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:35.004844Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.004844Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:b6ceb758c721d69ab86599b93962cde2e9bee33ba0dcefc4586ecf897733191f","observation_id":"bf9c1b92-59a5-4e20-a3a0-2fb338cd9c6a","resolution":{"observed_at":"2026-08-07T14:17:35.004844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-19T14:16:58.804962Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-07T14:17:35.084460Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.084460Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:f9f976a930315c8d37b8608b1b8bdb99eb3e298e6cb34bf452f07fd88e9211a1","observation_id":"4b4d0343-7423-42f1-a3a3-b60338de0636","resolution":{"observed_at":"2026-08-07T14:17:35.084460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:35.188045Z","title":"Dreamo: A unified framework for image customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.188045Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:74b613651619c62c9db368e2eb247cd8b72bbc0d8b90af9fd0586505466a1b71","observation_id":"5a465f76-35ec-4672-9868-ce9356b68a4d","resolution":{"observed_at":"2026-08-07T14:17:35.188045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:17:35.272677Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.272677Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:673897e8c6399bb5f698fc4cbd212dda426dce739b6d2b0d750bf20087b78742","observation_id":"167f5396-337a-49bb-8910-86bba60b3567","resolution":{"observed_at":"2026-08-07T14:17:35.272677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T14:17:35.348998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.348998Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:fbfc3c2a1693c25b15eb5a99a4499def5acb97394b23fba45bac52763c449bfb","observation_id":"e6805a9a-285d-490d-aeb1-ddcb2fc189cb","resolution":{"observed_at":"2026-08-07T14:17:35.348998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-08-16T14:55:02.836558Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:17:35.431664Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.431664Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:91cf24791f32a5028b9033e4f0325b7e813dabde8272a30766720fbe651fe629","observation_id":"f90bcb09-fe16-46c2-b5b9-42cba39f935c","resolution":{"observed_at":"2026-08-07T14:17:35.431664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-18T10:59:53.317746Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-07T14:17:35.573979Z","title":"Dreambench++: A human-aligned bench- mark for personalized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.573979Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:b69992992710c5376cdf1a41f87dc9deb8daa4ee0330a1fe37f5c7788ba59c13","observation_id":"b107bfca-6bd5-4d03-bca3-0983d68e75d2","resolution":{"observed_at":"2026-08-07T14:17:35.573979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:47.062762Z","title":"Pexels, 2014","venue":null,"work_id":"af601d3b-5910-4586-b7bb-7a5499acff51","year":2014},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.642706Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:4fd8445b42e80d2c72fc0a5f9cf6c702e911f88f045df229317dc66dbfc42287","observation_id":"69fc506b-bb5b-4d22-a343-267aaf41f310","resolution":{"observed_at":"2026-08-07T14:17:47.157579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:47.280634Z","title":null,"venue":null,"work_id":"62269278-d93f-4eda-9590-767f0d842065","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.505841Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:d30c14b23cd512cbe8c67bf23b1cb5ab29453f15a274b29dc8e9cd9b9a7136de","observation_id":"8217eeda-c442-454c-be1e-0e4a8dd56b7e","resolution":{"observed_at":"2026-08-07T14:17:47.356538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:17:35.788931Z","title":"Blattmann, Tim Dockhorn, Jonas Muller, Joe Penna, and Robin Rombach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.788931Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:abb201ed7c3e3aca30b593b8e72c618a40675630732a35bf2f67b78a982f1b67","observation_id":"f83cb8f0-3318-47aa-9d71-55c18f2ecb40","resolution":{"observed_at":"2026-08-07T14:17:35.788931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-20T13:06:49.900114Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-07T14:17:35.875375Z","title":"Lumina-image 2.0: A unified and efficient image generative framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.875375Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:bf3177b5b0f15fdeb3c5332e6b8c7196cd990171ba5735c880aac80ef25ad008","observation_id":"c3b6b41e-ba0c-419d-a92b-f756d57ba2b1","resolution":{"observed_at":"2026-08-07T14:17:35.875375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.919941Z","title":"Photon-v1","venue":null,"work_id":"09eee774-d12f-4887-b3d8-162d07588752","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.710792Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:d5d5efb91e131e3aee8f91a17e3a5245d07ac15b454d1fe974935c357087a0f5","observation_id":"0ff6849a-201c-4bbc-b620-e72f5cf7cd6c","resolution":{"observed_at":"2026-08-07T14:17:46.988130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:36.061706Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.061706Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:bdaa9477788a8501616d384d55e1a5117aed229ba0e51189271e4313c9c55289","observation_id":"468fbcd0-f144-4b3b-8730-38fc84468f23","resolution":{"observed_at":"2026-08-07T14:17:36.061706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:36.141458Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.141458Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:064330bf9cc78065c9455178200bfefc0055ffc3171e24ca14efc42efd016413","observation_id":"dc3dfb22-7bf2-43c9-8ec9-8455237536e5","resolution":{"observed_at":"2026-08-07T14:17:36.141458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.809995Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"e012fd97-4c7c-4ebd-a2ba-a72f7c3af7bb","year":2021},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.997395Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:e52a9ca9172e0346e46fb29a768b072af56d61e42eff3c9fd85cb377f1ed7a24","observation_id":"6c3cbda5-e4ef-4687-b65c-36fb8587355a","resolution":{"observed_at":"2026-08-07T14:17:46.853853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.671013Z","title":"Instantbooth: Personalized text-to- image generation without test-time finetuning","venue":null,"work_id":"ac7ae43a-a146-411e-9e33-8cf43858eef1","year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.285110Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:6ceb25274cf867d3c4ae7ca18542e5b2cdb810343093ba505098da9f617115bb","observation_id":"05756949-a24e-49d3-88a4-2009cb79e1fd","resolution":{"observed_at":"2026-08-07T14:17:46.719733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:36.405666Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.405666Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:aa13d28eb717ed901154c4f30287241c5085011b0717e65c84be4d99b62bebea","observation_id":"8b1da1ca-b31c-4b14-9176-dcd357f87f5f","resolution":{"observed_at":"2026-08-07T14:17:36.405666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:36.211649Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to-image models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.211649Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:bf8306fb103bad4db5cc1f132d73f6c09b1ce6e778f1bcaff68aabb4b8d05616","observation_id":"69cf6613-43d6-4a08-9c2e-3fa75499fcf5","resolution":{"observed_at":"2026-08-07T14:17:36.211649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.556441Z","title":"Hidream-i1: A 17b parameter open chinese text-to-image generation model","venue":null,"work_id":"a62a5616-4318-4383-8bb9-9de00bbb9aa2","year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.556940Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:80e293ced9a3a11c219761f7221bfa8785edafbc0d5b7ebca7eb00526fb084c6","observation_id":"7ec74167-9983-4116-852e-cf64f108f876","resolution":{"observed_at":"2026-08-07T14:17:46.602631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.439205Z","title":"Lmm4lmm: Benchmarking and evaluating large-multimodal image generation with lmms","venue":null,"work_id":"f0ca1325-9089-41d2-a1ad-6b863b603e1f","year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.625308Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:4cc77040a3be00381ffe295b06ad28a231f955522c19db97f242542e4bdf16b0","observation_id":"7a151e95-6de1-45ee-be06-a50e0ac452d1","resolution":{"observed_at":"2026-08-07T14:17:46.491274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.10979","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:41.090897Z","title":"Vidcomposition: Can mllms analyze compositions in compiled videos? arXiv preprint arXiv:2411.10979, 2024","venue":null,"work_id":"3e1e9886-2077-4c65-80d6-0384c805285c","year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.490359Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:25fc12c2b3e4615a074ac931d233e675d65eb027f242b895f0a06bedbde3918d","observation_id":"0502b1cb-59d9-4cd7-9c72-05f7b681da84","resolution":{"observed_at":"2026-08-07T14:17:41.178957Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-16T06:18:35.139211Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-07T14:17:36.766473Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.766473Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:b79641965198e5316322e7c69c12d557744e0eb88eb7ae6482094f4c91d7b179","observation_id":"5402eb20-67f8-40bb-8f0f-1af7c66d91a3","resolution":{"observed_at":"2026-08-07T14:17:36.766473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07209","last_updated":"2025-03-04T06:21:26Z","snapshot_observed_at":"2026-08-16T13:44:12.244281Z","submitted_at":"2024-06-11T12:32:53Z","title":"MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07209","snapshot_observed_at":"2026-08-07T14:17:36.838755Z","title":"Ms-diffusion: Multi- subject zero-shot image personalization with layout guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.838755Z"},"links":{"cited_paper":"/paper/2406.07209","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:6c085015e512ff5aa8302882616b99671d40281ba9a7dacf2ede86fe3d3ac26a","observation_id":"3d81d521-1b15-49d3-a362-31d62bcf6695","resolution":{"observed_at":"2026-08-07T14:17:36.838755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12024","last_updated":"2023-11-23T17:59:42Z","snapshot_observed_at":"2026-08-16T14:41:45.064723Z","submitted_at":"2023-11-20T18:57:55Z","title":"PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12024","snapshot_observed_at":"2026-08-07T14:17:36.698633Z","title":"Pf-lrm: Pose-free large reconstruction model for joint pose and shape prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.698633Z"},"links":{"cited_paper":"/paper/2311.12024","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:0257a3d54341a7340c98e475f4c4c384d11ad1f43cc727529a17527f1d3382c9","observation_id":"71ddb135-76bf-4ce2-a798-d99731f022ae","resolution":{"observed_at":"2026-08-07T14:17:36.698633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13081","last_updated":"2025-02-18T17:34:04Z","snapshot_observed_at":"2026-08-16T12:57:14.309060Z","submitted_at":"2025-02-18T17:34:04Z","title":"Personalized Image Generation with Deep Generative Models: A Decade Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13081","snapshot_observed_at":"2026-08-07T14:17:37.020233Z","title":"Personalized image generation with deep generative models: A decade survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.020233Z"},"links":{"cited_paper":"/paper/2502.13081","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:d31ae48d2d5263983b9b4072b4146f5f465c91a3f82202882521f04864fba155","observation_id":"20a05d4f-385e-4ad3-841c-da2f9ff8e0e6","resolution":{"observed_at":"2026-08-07T14:17:37.020233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-08-19T18:46:51.035768Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T14:17:37.111721Z","title":"Revisiting text-to-image evaluation with gecko: On metrics, prompts, and human ratings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.111721Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:ee936bea6a3a7e6d5b76525faa53f410880faff42a58ca15fa33d1ae7e4cb330","observation_id":"58ad5f0f-98bf-4095-99ed-04eb8fb06ffb","resolution":{"observed_at":"2026-08-07T14:17:37.111721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T14:17:36.950135Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:36.950135Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:8c4189e79c7df03124150478d09268e0ba92e93e62dd00d5920286bfa0e114ec","observation_id":"641edb97-7833-4ee0-8720-1cf388511536","resolution":{"observed_at":"2026-08-07T14:17:36.950135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10400","last_updated":"2023-12-26T15:58:24Z","snapshot_observed_at":"2026-08-19T15:29:50.076448Z","submitted_at":"2023-05-17T17:43:38Z","title":"What You See is What You Read? Improving Text-Image Alignment Evaluation","version":4},"cited_work":{"arxiv_id":"2305.10400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10400","snapshot_observed_at":"2026-08-07T14:17:40.722842Z","title":"What You See is What You Read? Improving Text-Image Alignment Evaluation","venue":"cs.CL","work_id":"14a69ccb-a503-4e11-8d05-4b8c8686a597","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.320626Z"},"links":{"cited_paper":"/paper/2305.10400","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:156ff0b2a17ca2926e84948106953a3eb1d43507e5a46428070804a634a0d410","observation_id":"84b0be7e-5a20-4e90-bef7-5d873ddbddf3","resolution":{"observed_at":"2026-08-07T14:17:40.822374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T14:17:37.464479Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.464479Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:8ae96d71e2a2dde4379f9927664a91ddc04cae3d2dfdb690bee15b62ea0a4297","observation_id":"7560ce16-f122-4c6f-a068-4fd984d2c536","resolution":{"observed_at":"2026-08-07T14:17:37.464479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08520","last_updated":"2025-03-16T04:31:33Z","snapshot_observed_at":"2026-08-17T19:10:45.612856Z","submitted_at":"2024-09-13T03:40:58Z","title":"GroundingBooth: Grounding Text-to-Image Customization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08520","snapshot_observed_at":"2026-08-07T14:17:37.221759Z","title":"Grounding- booth: Grounding text-to-image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.221759Z"},"links":{"cited_paper":"/paper/2409.08520","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:07bd422d79e243474156183867885ddcf81be3526ed0df454a80fb5d6f05cc32","observation_id":"98efdf5c-162b-436f-a7ae-e9d13498de4a","resolution":{"observed_at":"2026-08-07T14:17:37.221759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.208223Z","title":"Perceptual artifacts localization for image synthesis tasks","venue":null,"work_id":"64087c79-9207-4483-ae7c-1e9a7d0aa64e","year":2023},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.679832Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:4f7309c0cc1036dfbead2ed5478845a70652234444a86ada592f144a6ac6bbc0","observation_id":"6d14cf9a-04ef-479f-978f-2ca49404fe8e","resolution":{"observed_at":"2026-08-07T14:17:46.295760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02357","last_updated":"2025-06-15T14:09:58Z","snapshot_observed_at":"2026-08-19T04:18:08.147741Z","submitted_at":"2025-03-04T07:28:45Z","title":"Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02357","snapshot_observed_at":"2026-08-07T14:17:37.730771Z","title":"Q-eval-100k: Evaluating visual quality and alignment level for text-to-vision content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.730771Z"},"links":{"cited_paper":"/paper/2503.02357","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:c8a5b3649fef651ff86170902ff16a2aae36e9ec880d8a7d12a9a3b4b0345ddc","observation_id":"b0149de3-cf12-4115-9dc5-5f713a901145","resolution":{"observed_at":"2026-08-07T14:17:37.730771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.308066Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"50357253-b516-4de5-ba8d-870fef64d47c","year":2022},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.566774Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:ec3ee10edad2977bd7e43afa02da1f57c1f6c7394e305453cdb3c6567090e94e","observation_id":"00ddbd14-d2c0-43e8-82e2-bc26f12bed67","resolution":{"observed_at":"2026-08-07T14:17:46.364786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-13T01:30:47.696305Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09618","snapshot_observed_at":"2026-08-07T14:17:38.004401Z","title":"Objects” dominate with 38.3%, while “Attributes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.004401Z"},"links":{"cited_paper":"/paper/2412.09618","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:6b604043d6b984dca41c9d52c1e9040b03d9a632e095fd431faf9617f307309f","observation_id":"d96c673d-0991-499b-b77a-10501cf48a12","resolution":{"observed_at":"2026-08-07T14:17:38.004401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05121","last_updated":"2024-03-08T07:32:50Z","snapshot_observed_at":"2026-08-16T14:11:42.486634Z","submitted_at":"2024-03-08T07:32:50Z","title":"CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05121","snapshot_observed_at":"2026-08-07T14:17:37.891666Z","title":"Cogview3: Finer and faster text-to-image generation via relay diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.891666Z"},"links":{"cited_paper":"/paper/2403.05121","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:9a2b5962620646ea5329700cbd37bb8031322aa448cd6b6da634e8455fa63695","observation_id":"1dd032ed-7d5e-43ad-9f67-9266eec42b7f","resolution":{"observed_at":"2026-08-07T14:17:37.891666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.843511Z","title":"entity\" should be common objects; e.g., chair, dog, car, lamp, etc","venue":null,"work_id":"be70cb48-303f-4635-b2a6-4cdbad32c61d","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.111737Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:28f5f71182b5d391185656325829762247dc758618319abb50c9e00923a14b83","observation_id":"a6bc888e-597b-4db3-887d-187f3a74ca97","resolution":{"observed_at":"2026-08-07T14:17:45.929187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.526671Z","title":"interaction","venue":null,"work_id":"e46e8920-c85b-4fc4-894b-5cb2e2b708cb","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.349730Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:76c5a085d68329e20cef2c64e07b87fcac9b52f54df85640ee438ef3e9a4ee55","observation_id":"0fcde27d-f7e5-404b-9e57-2b7ad9ba2367","resolution":{"observed_at":"2026-08-07T14:17:45.586397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.128597Z","title":"scene description","venue":null,"work_id":"ade80834-d8e0-43db-9f2c-8bb58d6aaf3a","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.630873Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:ba67158f5bd97ff7fda88873953643c37203cbb7bd5d07ed3f0ad7043def403c","observation_id":"e8a75886-d99c-4e0f-8e5a-05466eb33169","resolution":{"observed_at":"2026-08-07T14:17:45.181082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.817096Z","title":"A robot and a dolphin dancing under the ocean, surrounded by swirling schools of fish","venue":null,"work_id":"f4698dfd-e2f9-4fb6-be79-d4d0204490da","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.875063Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:6e6807dbdaf1d0f84fc0b8b38672f3fa218146ed33a03ab497292c99791aa809","observation_id":"5be5e40a-857a-46a3-a811-208eacc51a2b","resolution":{"observed_at":"2026-08-07T14:17:44.886420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.675670Z","title":"minimalism meets hygge vibes / editorial photoshoot style / baroque detail / etc","venue":null,"work_id":"b79905bd-bf3c-4e10-a9c9-c4200b07f74a","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:38.960242Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:f5a31117f2fbe090cbcd667622e7dada0132bf6fd793e4ea783705c3d457914b","observation_id":"735d8e0d-beb4-449d-a6b1-f560dbc19cb0","resolution":{"observed_at":"2026-08-07T14:17:44.743428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.525194Z","title":"negation","venue":null,"work_id":"a59dfd6d-7e4d-4238-bf29-366000afc068","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.173467Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:22098206fb6e8b0df194f708df5f36d04c779e3cb99c05428622d015259d1cf9","observation_id":"5cc877b0-2182-4f37-8d98-e93c45ffa3c1","resolution":{"observed_at":"2026-08-07T14:17:44.580482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.962023Z","title":null,"venue":null,"work_id":"97e6ee13-8120-4720-8649-51a6c2508219","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.228478Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:c98b8f80b4fa81a2db0d86ecf039d923a1d2ea9cb942f1f55db8d4a25f990f4a","observation_id":"66a896e8-1995-400f-b294-dcd635eff30e","resolution":{"observed_at":"2026-08-07T14:17:45.033190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.397686Z","title":"comparison","venue":null,"work_id":"863faab0-8948-4972-b081-e7ddc02277f8","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.326589Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:dc77a286ba84b54c49b2e69b1bf6b842e2dce3ab7e28a9ec44ea05144ce26713","observation_id":"f5cff7ec-054c-4c11-8c73-0cf056664659","resolution":{"observed_at":"2026-08-07T14:17:44.446713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.297824Z","title":null,"venue":null,"work_id":"e3951c14-0cb9-4ae7-997e-546da9f8d762","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.437725Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:a8c02afa0b3df1039b765035704abc4e637b92efdcd1e14ac6f2d8cdb41fe356","observation_id":"9737e77f-fa97-42e5-a886-d1312f516c8c","resolution":{"observed_at":"2026-08-07T14:17:44.340233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.252364Z","title":null,"venue":null,"work_id":"851ec091-5276-4733-afd8-134e1444dc2f","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.529673Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:aaaa6f0e711a4c2aae8e8ac4648ec0aee3b1ea5ab20ff2a41a52d431c65455d2","observation_id":"6655b434-904b-4727-83dd-986640f3082a","resolution":{"observed_at":"2026-08-07T14:17:44.286726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.092789Z","title":null,"venue":null,"work_id":"82e3c5d8-7b7d-4896-b42d-1bbabfcf3ba7","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.623980Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:fa96d0350e735753bd9c436517d0a23ea229bcf4cf7c98b49294631f1435976a","observation_id":"5cb1be73-2647-4c9c-a686-99b7f8ed8684","resolution":{"observed_at":"2026-08-07T14:17:44.159110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:43.927075Z","title":null,"venue":null,"work_id":"5ef013c9-9ea2-4131-9038-3659c04d76e2","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.748781Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:e7459f3cfe518d392416129529c86d25b82e95e0dc977a394d47735d02d71420","observation_id":"877d5ceb-73bf-4f1e-8be8-e009a76cccc9","resolution":{"observed_at":"2026-08-07T14:17:44.006604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:43.786933Z","title":null,"venue":null,"work_id":"27af9d67-9ff6-4a82-881c-6804da977176","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.870642Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:4e1b85c4eed5a825d0671264d0026c7bb19e44ef67a929f2df6c92bd8f947c66","observation_id":"f600f510-0200-4e99-bcbc-6637f29b999a","resolution":{"observed_at":"2026-08-07T14:17:43.852269Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:43.637594Z","title":"[scene description (op- tional)] + [number][attribute][entity1] + [interaction (spatial or action)] + [number (optional)][attribute][entity2]","venue":null,"work_id":"2b03db9b-92fd-4191-8a81-8e6722146355","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:39.933217Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:e75d78257b62734b3950731e6bae8a1ab7a91c93dc82db8146c766b4bfc10ba6","observation_id":"da5dab7a-73a5-42ad-b19a-2c7d40487f86","resolution":{"observed_at":"2026-08-07T14:17:43.723163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:43.338799Z","title":"entity\" should be common objects; e.g., chair, dog, car, lamp, etc","venue":null,"work_id":"c9a6d6af-9b25-43d6-aced-f80787ad39dc","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.060937Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:9957a116b4233be6546e9b8b6459597360bc20ac5ae7c99994896642b586eb14","observation_id":"0d566e46-0c93-4de3-a12b-717ca7d71231","resolution":{"observed_at":"2026-08-07T14:17:43.559229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.659420Z","title":"attribute","venue":null,"work_id":"cf511035-c3aa-439e-a9a1-d85043d9dd4d","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.151845Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:985426d47d6120173306730e05bad48a394b85a7df205e094fc4f9031476b48a","observation_id":"565409cb-f28d-4d98-95c6-948cf8dc5c63","resolution":{"observed_at":"2026-08-07T14:17:45.747117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:42.916014Z","title":"number\" should be","venue":null,"work_id":"15b4dac1-6f92-49a4-ae77-627e23a54a9f","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.209199Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:76c21cb3d3e96dd32552ea01250e5e563213de0d8a6f5912b621f565ee95bc53","observation_id":"b7602f8b-d29c-4bc9-8ccf-fcc9fbe2f955","resolution":{"observed_at":"2026-08-07T14:17:43.136198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:42.501651Z","title":"interaction","venue":null,"work_id":"a712c0b1-1ccd-494a-8762-566d9482307a","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.307178Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:517855ddb056b3528807982ba38f3efbcdd72c51c6d2f35f6ac8d3d837e3f189","observation_id":"ade96861-c5d7-4e22-9424-e63d40f00876","resolution":{"observed_at":"2026-08-07T14:17:42.711995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.381716Z","title":"scene description","venue":null,"work_id":"51ee36fe-303b-46a9-943a-896c19c440f0","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.375452Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:1d3b38132e7724fe586b752485f9967a7b8ecfac4807ec381bcd9933854f00b9","observation_id":"647baadd-296f-4805-976d-e3cbbc00122c","resolution":{"observed_at":"2026-08-07T14:17:45.450909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:45.251284Z","title":"interaction action","venue":null,"work_id":"578bcdf3-d417-428e-95e8-8e92f5c45952","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.477293Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:a2da94a70f36f7045a8636b9713e75f745d726a7d3e0b2ca7b9b889b73b06362","observation_id":"9c65d3ed-347e-481f-a3dc-469ea52434c1","resolution":{"observed_at":"2026-08-07T14:17:45.307905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:42.245731Z","title":"scene description","venue":null,"work_id":"28316c30-dd56-483e-afb5-75d38ac822ee","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:40.539908Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:cf02229ff5bfb876841f036d208fed83eedc05767f8d329689b83cb20afc8ff2","observation_id":"dc85f316-5abb-46c4-8812-1e264cfd02a0","resolution":{"observed_at":"2026-08-07T14:17:42.341356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:33.880000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:33.880000Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:f903873c2588876099a927e7b682fd70431ba6c9e6b073c433d711d7dba9d296","observation_id":"efc1e1c9-8c17-4742-b9b0-0139c9dba46c","resolution":{"observed_at":"2026-08-07T14:17:33.880000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:32.351287Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:32.351287Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:b6aadc496ee7d50f9a14f875679f5e98e2e59000358305d209b264df4c47971f","observation_id":"d18b1dc0-f4fa-498c-909f-2b88b1c80adb","resolution":{"observed_at":"2026-08-07T14:17:32.351287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:46.024997Z","title":null,"venue":null,"work_id":"2b0a23ed-56b1-45ec-a2ff-304623e3343e","year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:37.799160Z"},"links":{"citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:0b4807d14c464ad87d9621da08b07fb953cc726d067ff7e3a9df8d76ffa86efb","observation_id":"4cbbba06-4115-462f-96b0-f121258372c7","resolution":{"observed_at":"2026-08-07T14:17:46.110682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":58,"verified_exact":4,"verified_fuzzy":27},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 11 inbound Pith citation observations for arXiv:2505.19415."}