{"as_of":"2026-08-18T19:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9061458447e218f6ce2a984ff46795112efe0315abe3ee5115c80a5b82f9ccbc","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:31:06.104344Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11907/citation-record","integrity":"/paper/2608.11907/integrity","json":"/paper/2608.11907/citation-record.json","paper":"/paper/2608.11907"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-16T00:31:05.776988Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.776988Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:24ea15c2fcc30ce7670e3028022a92028c45048c73c8c8123b21052501b31d9d","observation_id":"7d4f1618-9d1b-431b-bca6-96194f70d497","resolution":{"observed_at":"2026-08-16T00:31:05.776988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-16T00:31:05.783381Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.783381Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:0889aea81c6f4f584c06fe1be9d16849dc0e0e6578bb944ed4737e013a5fc8e1","observation_id":"6a99321c-763c-4594-88a5-7081434e7ef9","resolution":{"observed_at":"2026-08-16T00:31:05.783381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-16T00:31:05.788627Z","title":"Are we on the right way for evaluating large vision-language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.788627Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:ce448c9f1e3ef7f9285294006a05bb0ec6af46e63a3296e70989411afc2d4edf","observation_id":"bdf9e0d6-4bef-412e-bde4-f77002b4f995","resolution":{"observed_at":"2026-08-16T00:31:05.788627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T00:31:05.794515Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.794515Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:3aa64ecdf1f3c7fb8b2d5ff3ef8bd1c991845fbfa218c5c88b2a1a6206aab901","observation_id":"e5f19177-31d6-494b-a825-acfdffd0961e","resolution":{"observed_at":"2026-08-16T00:31:05.794515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-16T00:31:05.800105Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.800105Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:97bb655a398a1cb57bd814db1d51a72b68fa05a9168a04fe149f41949d95553b","observation_id":"56198b8e-454f-4ee8-b399-46cda0b25a81","resolution":{"observed_at":"2026-08-16T00:31:05.800105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-08-12T12:11:22.336410Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03568","snapshot_observed_at":"2026-08-16T00:31:05.813474Z","title":"Agent ai: Surveying the horizons of multimodal interaction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.813474Z"},"links":{"cited_paper":"/paper/2401.03568","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:3517e43e300bab194abad27bfe95f940445d70e353e1c795d50c12724fab1fc1","observation_id":"9bc1c440-1b91-4518-87fa-bc4479b3823c","resolution":{"observed_at":"2026-08-16T00:31:05.813474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T00:31:05.819502Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.819502Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:4462a3178cf4bad73a09c9c76851522591e677237485aed70cb07aaf1e4b8123","observation_id":"8fa3456b-b15c-4ffd-9df3-4b6d417627f5","resolution":{"observed_at":"2026-08-16T00:31:05.819502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-15T19:53:33.201174Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-08-16T00:31:05.824802Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.824802Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:cc6a2f11a5899b35451d7aeaaba0b1db43c53b75ad06dafe9c3e1308955a210d","observation_id":"c65aa755-dbdf-4fda-90ee-9b668d409b78","resolution":{"observed_at":"2026-08-16T00:31:05.824802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-16T14:51:16.293174Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-16T00:31:05.830130Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.830130Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:e17606793e8b11334af143c9e205cb4a48a1aa5031e9299051d8372ba71f7494","observation_id":"1bf49c15-62a3-4baa-b2f3-488e857f043e","resolution":{"observed_at":"2026-08-16T00:31:05.830130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:07.035700Z","title":"URL https://developers.googleblog.com/en/introducing-gemini-2-5- flash-image/","venue":null,"work_id":"0ac038a3-68fb-4efe-9975-d460b0481709","year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.835396Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:87f761a9f140dc6962b451c4991a31b88268198148abafafd3be140414b0f4f8","observation_id":"3d8a8f52-4260-4a14-b2bd-71a040360acd","resolution":{"observed_at":"2026-08-16T00:31:07.040660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T00:31:05.840495Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.840495Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:aff729d584bfee173a89c3bfc926f1812c8ccf85917be8baaed1257d39adbcf0","observation_id":"e1bbd716-2791-4ee4-8d65-46d2e49c0d52","resolution":{"observed_at":"2026-08-16T00:31:05.840495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:07.020013Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"7a6e363e-fbe9-438c-baee-0c01b1b19775","year":2017},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.845748Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:998fb988d69d77f29c832196bf462b1a82d4556455a8f5a304b72f52367c213d","observation_id":"aa1f129a-d250-4cf5-b4ff-212837f7a3ff","resolution":{"observed_at":"2026-08-16T00:31:07.024918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.851465Z","title":"Gir-bench: Versatile benchmark for generating images with reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.851465Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:95e869c67f3f9fc9705fac556686ded3c349d7b0b9e76f3837b66dc1ae863cb5","observation_id":"a7a6110f-2ffa-4444-a220-ef3b5b24f72a","resolution":{"observed_at":"2026-08-16T00:31:05.851465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.856548Z","title":"Rover: Benchmarking reciprocal cross-modal reasoning for omnimodal generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.856548Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:07a5c6f260ba53328ff9bfd46ddc8b8b2417c6e16d4fc89615e853998e9aeb8f","observation_id":"976ebd1e-caf5-418f-a91b-14d336489526","resolution":{"observed_at":"2026-08-16T00:31:05.856548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-16T00:31:05.861660Z","title":"Uniworld-v1: High-resolution semantic encoders for unified visual understanding and generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.861660Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:46395a909d41d4f934ee7fc7f1bc188569e8af74303febe78340cf9648012ad1","observation_id":"4df0d804-feeb-49d2-a2c7-f9a0ceb95cbc","resolution":{"observed_at":"2026-08-16T00:31:05.861660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.866824Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.866824Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:e453a4e6fc6ddfc98c21560aa33e4882e69533b6224a3036c5903d83d1603ba3","observation_id":"1ff6ea94-dd9c-4d59-8c7b-8cbbbc56db89","resolution":{"observed_at":"2026-08-16T00:31:05.866824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-16T00:31:05.871631Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.871631Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:751894d938b9211d17a24241d3ffc6186b88beaf91f09027499707048414b575","observation_id":"d452d281-5483-4ef7-855a-0ac937c50a26","resolution":{"observed_at":"2026-08-16T00:31:05.871631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.17196","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:06.639807Z","title":"Umnibench: Unified understand and generation model oriented omni-dimensional benchmark, 2025","venue":null,"work_id":"6fcfe899-fcd5-4e57-acab-3cc01ebd1e0c","year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.876038Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:a157c5f90238f93116f353f408653f2c07b1f1eba5b9ec132bf65aab374b8c7c","observation_id":"c5ef1789-950d-4754-854c-b9eee19c0e37","resolution":{"observed_at":"2026-08-16T00:31:06.648930Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T00:31:05.880391Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.880391Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:a22be212fe196967d32fd445f85839dea94f8ee8a54164a0c58d9d97d9cbab75","observation_id":"f6b3b2ce-d380-4f45-b3e8-bc6a4c2f0844","resolution":{"observed_at":"2026-08-16T00:31:05.880391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-16T00:31:05.886228Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.886228Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:ae8368464dda050851f8baa4de6e1fa59763d3a32e0105ceced09aa76765d9dd","observation_id":"634f40eb-f42d-4f37-bd6f-3a400efd2a4f","resolution":{"observed_at":"2026-08-16T00:31:05.886228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.891035Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.891035Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:2e73dc84fb407d5f9c3847d5c5081d67645175c3b06805a794ff4811911e95d7","observation_id":"7d5da735-0e0b-4ca7-bb5d-94baec652197","resolution":{"observed_at":"2026-08-16T00:31:05.891035Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:06.993512Z","title":"URL https://openai.com/index/image-generation-api/","venue":null,"work_id":"bc21cca5-bbc3-4ad4-ad55-138e7bbaa81b","year":null},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.896089Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:99e1849ee6207c802f80808dc8f9a3e0011d5c3f4d493c38aebfd958a4b433fe","observation_id":"084b5dbb-a1bd-4634-b39e-14a46e56b3bc","resolution":{"observed_at":"2026-08-16T00:31:06.998583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-16T00:31:05.901086Z","title":"Transfer between modalities with metaqueries, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.901086Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:1b7dfd6495e795a5ecf3d1c58667efd84445f7c74cdff1113e3af77159a14536","observation_id":"1ba0ab26-e5b7-4bfe-9877-9026269ec873","resolution":{"observed_at":"2026-08-16T00:31:05.901086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-16T00:31:05.906338Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.906338Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:7f526033df2ed17407bdf865f3fa4ba9fa93031d19ba40143bea2be6cf9d43df","observation_id":"906ef5af-7494-42bd-b6a5-b738d3c492c4","resolution":{"observed_at":"2026-08-16T00:31:05.906338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-16T00:31:05.911595Z","title":"Ovis-u1 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.911595Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:633fe20f03b03447c74370b7861e60e9a6569501b6ae371ae088a81cd87b3629","observation_id":"3f9d7d50-5a78-435e-817c-0e09c284d389","resolution":{"observed_at":"2026-08-16T00:31:05.911595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00727","last_updated":"2025-03-02T04:43:08Z","snapshot_observed_at":"2026-08-16T12:53:55.457246Z","submitted_at":"2025-03-02T04:43:08Z","title":"From Understanding the World to Intervening in It: A Unified Multi-Scale Framework for Embodied Cognition","version":1},"cited_work":{"arxiv_id":"2503.00727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00727","snapshot_observed_at":"2026-08-16T00:31:06.400434Z","title":"From Understanding the World to Intervening in It: A Unified Multi-Scale Framework for Embodied Cognition","venue":"cs.RO","work_id":"3435533e-977d-4185-8a12-9d501a0f6448","year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.916966Z"},"links":{"cited_paper":"/paper/2503.00727","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:0b657d260ebb817581925bf01ae6e411ccc2706448af389edd639ed83b0bda2e","observation_id":"05ab8237-b409-4307-aa26-3385b75ff41c","resolution":{"observed_at":"2026-08-16T00:31:06.407547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-16T00:31:05.922909Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.922909Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:5b6ef0bbb15a65193b822f928e63c216ce44243ff390667b6e652716973cef84","observation_id":"6c900f6d-fd35-453a-8ed1-7a9d7f5d804e","resolution":{"observed_at":"2026-08-16T00:31:05.922909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.928340Z","title":"Skywork unipic 2.0: Building kontext model with online rl for unified multimodal model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.928340Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:c1bdacdd5bf5a3b93330372c0d99436dc594bd8c7ecfe1543da69e574ad0d7bf","observation_id":"5460cad6-8b40-4e8a-a939-666cc619efa7","resolution":{"observed_at":"2026-08-16T00:31:05.928340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:05.933256Z","title":"Ggbench: A geometric generative reasoning benchmark for unified multimodal models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.933256Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:1dd3938edec31209f2c3169d3c8093c36498584f9642fd4e72fdfd61879d28f0","observation_id":"ce9a6e48-ea7b-492e-a043-a90dc897c898","resolution":{"observed_at":"2026-08-16T00:31:05.933256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-16T00:31:05.938087Z","title":"Qwen-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.938087Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:1593ee36811ead41f22104e83cddbad810d4ebddcdfa81248e78b9ff43804296","observation_id":"859de7c2-1f64-40e3-811f-3ed850de4bd5","resolution":{"observed_at":"2026-08-16T00:31:05.938087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-16T00:31:05.943233Z","title":"Omnigen2: Exploration to advanced multimodal generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.943233Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:c9e58bae9582ef3354a8b90ec38208a02c48942b2476f45c116016bc25d2548f","observation_id":"eb60004a-8d15-412e-a459-756ed89fada1","resolution":{"observed_at":"2026-08-16T00:31:05.943233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-08-16T00:31:05.948366Z","title":"Reconstruction alignment improves unified multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.948366Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:d411d08a91664ac12c012d8ae5a8a259ec9c25f8ad787971c5ad842efd973f04","observation_id":"9d58370c-8cad-437f-8316-962b99c4d3d8","resolution":{"observed_at":"2026-08-16T00:31:05.948366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-16T00:31:05.953814Z","title":"Show-o2: Improved native unified multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.953814Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:33c8d39eb246210086c013312ec4b53eeb16f498b2de8381d6604c2b088fa2ee","observation_id":"949780f9-a252-4abc-9c0e-c6b7d2c12cfc","resolution":{"observed_at":"2026-08-16T00:31:05.953814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-17T13:10:52.611064Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-16T00:31:05.959651Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.959651Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:fbdf9d70022f18ad81d0d51505fcaadfde0f0257b315c0b2852454ee41112e8e","observation_id":"44ea9f7d-e4d0-437a-b651-fdad456f97ae","resolution":{"observed_at":"2026-08-16T00:31:05.959651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:31:06.098205Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:06.098205Z"},"links":{"citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:5b6af91ea4588f001e024fd39dbbcc333c73cb280cf306a3b325747d635de4a3","observation_id":"63581e84-093f-4b2d-87a3-a431e1addce8","resolution":{"observed_at":"2026-08-16T00:31:06.098205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-16T00:31:06.104344Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:06.104344Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:67ede1d0bb7f2e4bff28b14abbf949ccee95896ed3f4201432b974cfc03f052b","observation_id":"a6b62395-d16f-4434-8746-471fdc995a10","resolution":{"observed_at":"2026-08-16T00:31:06.104344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-12T10:35:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:16:28.607100Z","submitted_at":"2026-08-12T10:35:52Z","title":"Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.11907."}