{"as_of":"2026-08-22T06:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29047aab243e25616575e333b37b8b81fef29dc55e2935c642e31c9c340261ba","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:55.930004Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:05:33.892978Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:37:25.273563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14682","snapshot_observed_at":"2026-08-11T22:05:33.892978Z","title":"Uni- gen: Enhanced training & test-time strategies for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-15T11:25:03.847898Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.892978Z"},"links":{"cited_paper":"/paper/2505.14682","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6bac518d365aaf9c3fcf6745b3edde4a37ce447efc43677e270da3398d268251","observation_id":"7529171f-8a64-4c7a-bce7-ccd3c5170588","resolution":{"observed_at":"2026-08-11T22:05:33.892978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.14682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14682","snapshot_observed_at":"2026-07-02T21:37:25.273563Z","title":"Unigen: Enhanced training & test-time strategies for unified multimodal understanding and generation","venue":null,"work_id":"561fede7-0677-4459-9f9f-d2df942b0301","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-08-20T01:41:57.728123Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2505.14682","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:8a14939290d7f59365423e936f19d6294c0a277bcc4e70dae7d63810a1fcd830","observation_id":"3e6ede4e-781a-4854-8837-c1962009ed84","resolution":{"observed_at":"2026-05-12T18:51:15.663982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14682","snapshot_observed_at":"2026-08-04T22:36:08.154553Z","title":"Unigen: Enhanced training & test-time strategies for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-21T08:23:59.555206Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.154553Z"},"links":{"cited_paper":"/paper/2505.14682","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:663a6c1898cdfe1cd28703424b9dccaed7e6284a1fd392588e150fe099cd462f","observation_id":"1fd8eb57-a07d-4e4e-8bcf-eb0a8e181796","resolution":{"observed_at":"2026-08-04T22:36:08.154553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.14682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14682","snapshot_observed_at":"2026-07-02T21:37:25.273563Z","title":"Unigen: Enhanced training & test-time strategies for unified multimodal understanding and generation","venue":null,"work_id":"561fede7-0677-4459-9f9f-d2df942b0301","year":2025},"citing_paper":{"arxiv_id":"2606.08231","last_updated":"2026-06-06T15:39:29Z","snapshot_observed_at":"2026-08-07T16:58:05.550639Z","submitted_at":"2026-06-06T15:39:29Z","title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T19:36:57.231932Z"},"links":{"cited_paper":"/paper/2505.14682","citing_paper":"/paper/2606.08231"},"observation_digest":"sha256:d407d926639a1b51a2494b2778a5844ff8e554d966d9703b935c6f29a056e341","observation_id":"3c4b1489-358f-4687-aae1-d500560bbb39","resolution":{"observed_at":"2026-07-02T21:37:25.275014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14682/citation-record","integrity":"/paper/2505.14682/integrity","json":"/paper/2505.14682/citation-record.json","paper":"/paper/2505.14682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T15:34:52.512594Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.512594Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c78a79e32917d5b22715e78af9eba883882a339747a3ad55662036804e210b87","observation_id":"52f83fea-7511-4ab7-a0ec-43ee187f46b5","resolution":{"observed_at":"2026-08-07T15:34:52.512594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.538623Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.538623Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:1f3db799b78412108a0d20cc99f601fe9a6425b85b1374c50b68206d0a8f0be6","observation_id":"3ccdf867-2c99-446c-9a6c-d8ebb6f0135a","resolution":{"observed_at":"2026-08-07T15:34:52.538623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:34:52.573669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.573669Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:61537b01ab74cb19177debcf5c01e325c99994b8c497f4ce6d8e6765f545ec5e","observation_id":"a29d6707-0930-4c4f-91ba-124d843d6482","resolution":{"observed_at":"2026-08-07T15:34:52.573669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.593742Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.593742Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:22b16de6caafed19350e3c79e1b77403d5e4e750647cf6ebc4bbc4e0cd9bba76","observation_id":"723682f7-77e5-40ed-95d9-d0776ccbd48f","resolution":{"observed_at":"2026-08-07T15:34:52.593742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.624294Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.624294Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:8ae9ceaf177ae64af7e02f2e3c357a7d354325d7f60dcad36709ff6c80ff0896","observation_id":"1dd1ae7a-d72b-4dc4-85c2-b208561c3573","resolution":{"observed_at":"2026-08-07T15:34:52.624294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.667370Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.667370Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:9a7dce7f675478803fc70981d3dfc465f27d73f09b63926e3664b003b2944490","observation_id":"41889b5a-3469-4d56-bcc6-237abb7e73b1","resolution":{"observed_at":"2026-08-07T15:34:52.667370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.701551Z","title":"Sets: Leveraging self-verification and self-correction for improved test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.701551Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:676431ce68b9cbf913f20c27a9b8cbb71aa26b2f9819d8877c599a7549103c65","observation_id":"fd00a909-2791-402a-9890-700fe45a6f9e","resolution":{"observed_at":"2026-08-07T15:34:52.701551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-21T20:37:42.923128Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T15:34:52.737513Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.737513Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:ee0c67bc4db3c2ebffec08cf1045164c7eda3b1b135d37502e5bd2ca422a99c7","observation_id":"b20ee523-5bdb-4ed2-b2b0-729660110fbe","resolution":{"observed_at":"2026-08-07T15:34:52.737513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:34:52.773916Z","title":"Deepseek-v3 technical report.arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.773916Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:ea89fb71bc853397e7c2ebd36ecbde5f14b8adbe11fad5fb422782a50433b56a","observation_id":"bb32b126-d539-4364-8e45-ee9b1ffd6482","resolution":{"observed_at":"2026-08-07T15:34:52.773916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T15:34:52.819499Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.819499Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:f5113d4ccfa4cefc67187dd47abfd270b3e5ae6485b4e5ec28b3de441fdd7452","observation_id":"55a7a45d-90ed-44dd-8235-3e0642eced0b","resolution":{"observed_at":"2026-08-07T15:34:52.819499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T15:34:52.861983Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.861983Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:0c20a95434cf9251238b2d3cefabb2cf2d0528d83f3d1bcd6000a03630f8cae1","observation_id":"c67c16d5-3ab7-46a2-917c-ff48f0d0e502","resolution":{"observed_at":"2026-08-07T15:34:52.861983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.909519Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.909519Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:5a8f09b40cdd69634ded43832750b825bb7bb65ddf6fcfdf1efea16afa12c971","observation_id":"3859a696-5813-410b-8b04-c23ae7268c3f","resolution":{"observed_at":"2026-08-07T15:34:52.909519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T15:34:52.941000Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.941000Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:6712974d3170a74433bcef3ea6b544a5f8d0d9f32bcf461686c3bd12f7679677","observation_id":"bb2098e1-9e53-41ce-a64b-85e74d3182cd","resolution":{"observed_at":"2026-08-07T15:34:52.941000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T15:34:52.996397Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.996397Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:f606959c542d514dcdaf1aedac638b2e67a5a3019a8917197dc05556a2389430","observation_id":"26ad3188-5404-46a4-89a1-afad38099a2e","resolution":{"observed_at":"2026-08-07T15:34:52.996397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.003939Z","title":"Geneval: An object-focused frame- work for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.003939Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:59d9a80abdc65faa547db18714d0fff2c3810f2b7065a20e57c9f6d288f5957b","observation_id":"f5efc5f2-9304-4718-aec1-1a86e142a83d","resolution":{"observed_at":"2026-08-07T15:34:53.003939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.021250Z","title":"https://x.ai/news/grok-1.5v, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.021250Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:958618cfb0c0c306b0b09eed2c00247f0b08b82be31e17ea4dfec8d4c4bcd735","observation_id":"e2e84395-3dc7-48de-beab-b1a69a24e420","resolution":{"observed_at":"2026-08-07T15:34:53.021250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:34:53.085420Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.085420Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:b6bc9f80c3187ee776122746cf2d5d681f1c8797fb8fa57351a46e20c5d24dd6","observation_id":"783a8d68-ade3-4a30-ad42-6f0486bb4721","resolution":{"observed_at":"2026-08-07T15:34:53.085420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-19T17:50:55.743272Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T15:34:53.137002Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step.arXiv:2501.13926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.137002Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:134bbfdbfd8a22cc1a12fc560747e72c6c8e86b8ccd3889e8f5acad6898366a8","observation_id":"1fc057b5-f3db-4e60-b51b-77bf28e69907","resolution":{"observed_at":"2026-08-07T15:34:53.137002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-15T00:31:45.808844Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-07T15:34:53.201462Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.201462Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:a856522a6482a6a47674bf89fa1ea6dc296c4cf8b8e7202289b46b8c7ddc306f","observation_id":"9ae4cd01-79ad-4ead-9d2a-ada7e66c244a","resolution":{"observed_at":"2026-08-07T15:34:53.201462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T15:34:53.259781Z","title":"Classifier-free diffusion guidance.arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.259781Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:5d6afc9a43125ede90c1285ba2d3c87759236fffe45bb9731c3458367002cad8","observation_id":"53f55328-9d90-4735-b33c-25db97047411","resolution":{"observed_at":"2026-08-07T15:34:53.259781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T15:34:53.306886Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.306886Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:30578bccc785216736b04068b636b09254428a4700bb5ffdb23969a3a014d7f4","observation_id":"0c8de696-4634-4b05-8551-d6ca78412285","resolution":{"observed_at":"2026-08-07T15:34:53.306886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-08-16T12:55:33.152261Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-08-07T15:34:53.349405Z","title":"Efficient test-time scaling via self-calibration.arXiv:2503.00031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.349405Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:ca7f659c0f0dbf09c0cce3413fa0df57d5ed81cf47afe8e6fb5539fd3b6fecc9","observation_id":"02d160ea-3ef4-4150-b529-792935c7a446","resolution":{"observed_at":"2026-08-07T15:34:53.349405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.404595Z","title":"T2i-compbench: A com- prehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.404595Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e7819de1768a9d394dfb7750ec56e5ab4ff083c501402870f0aa040ce3c4df58","observation_id":"d7a48737-5dac-4fcc-af25-5e4dacd87703","resolution":{"observed_at":"2026-08-07T15:34:53.404595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.466962Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.466962Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:224c9787d1bcde527fd04a1d42b790391fcdfdd356591a35e98787a52d214a9b","observation_id":"4168fd3d-96c2-4cf2-a42f-8dcaab03c391","resolution":{"observed_at":"2026-08-07T15:34:53.466962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.509431Z","title":"Unpacking dpo and ppo: Disentangling best practices for learning from preference feedback.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.509431Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e5eee9675225644fe32d4390cc0d45ebe24bde90f7918c5d37f5d3a70f5a7b72","observation_id":"94a9d7f0-ab74-4b31-8f27-4d6f0e347e4a","resolution":{"observed_at":"2026-08-07T15:34:53.509431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.546081Z","title":"text-to-image-2m: A high-quality, diverse text-to-image training dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.546081Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:044936adddfe2b2c1d5efeed9c57a5708fb844879fc342ae0ee17912e75cd0f3","observation_id":"90b0f1c6-29d5-4497-9314-3dc8be323414","resolution":{"observed_at":"2026-08-07T15:34:53.546081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-18T20:29:21.776031Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-07T15:34:53.601708Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified visual encoding.arXiv:2504.04423, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.601708Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:24f4b66097c3db3a12206218c87df87935d74e83bbca26128b2666890622f55a","observation_id":"31234611-dab3-4a1d-a3d0-a54352ddb84b","resolution":{"observed_at":"2026-08-07T15:34:53.601708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.658834Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.658834Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e38045bb423a0dc9256bdce3a061a1289a21bbe61a43bdc5c8ff3874bf445585","observation_id":"88929cfb-eeee-407d-86d5-fbb88bd7afc1","resolution":{"observed_at":"2026-08-07T15:34:53.658834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.714539Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.714539Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:bf91b72bc5dee069a85f3b5afe0c2250f87233f4d1600444b4cc180b928d2832","observation_id":"982002e0-8e72-4afb-9316-9fb10a7b138f","resolution":{"observed_at":"2026-08-07T15:34:53.714539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:34:53.781304Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.781304Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:b8d489c35707e634050361c97ebd484d5d054b0ad37bf4f82d86228f7ad034ab","observation_id":"d56196af-47df-4c75-96f1-e351b73c2c68","resolution":{"observed_at":"2026-08-07T15:34:53.781304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T15:34:53.828874Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.828874Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:4bc9fa73967890cb9610d734422adb29400ec2a355e224e3cd8fcb39a470eaf7","observation_id":"d629b1ae-9e12-4c2b-84e2-de35dadc566c","resolution":{"observed_at":"2026-08-07T15:34:53.828874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.874923Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.874923Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:6525129e5e56336148ee3705d41cbf4aa9885b44a103632565d62120106b8f08","observation_id":"dbd58054-26e3-43d4-9727-aa8e40f15f80","resolution":{"observed_at":"2026-08-07T15:34:53.874923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.920486Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.920486Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:18401e117532b070b626de665ef2e183a17d36195678a88f8372cea0b3e32adf","observation_id":"04f4078a-e59a-4243-a4d3-993af8aa5195","resolution":{"observed_at":"2026-08-07T15:34:53.920486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T15:34:53.968678Z","title":"Hunyuan-dit: A powerful multi- resolution diffusion transformer with fine-grained chinese understanding.arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.968678Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:b016f0aaf1015c316d97c84c70f17535e8cdacbb03609c52f2f3ec915c97cf15","observation_id":"9bbb5788-a59c-4612-a250-14e6e2bce774","resolution":{"observed_at":"2026-08-07T15:34:53.968678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19312","last_updated":"2025-03-25T03:18:46Z","snapshot_observed_at":"2026-08-19T23:35:35.668461Z","submitted_at":"2025-03-25T03:18:46Z","title":"ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19312","snapshot_observed_at":"2026-08-07T15:34:54.013136Z","title":"Imagegen-cot: Enhancing text-to-image in-context learning with chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.013136Z"},"links":{"cited_paper":"/paper/2503.19312","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c7313f75b4bf7ec4d69411a3abffdbb7e3d1bd161c6f3b1342b4485ba4edb400","observation_id":"ca4ad6c1-b257-4436-a767-6af5ff7bb5d2","resolution":{"observed_at":"2026-08-07T15:34:54.013136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.047031Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.047031Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c4613911894aa0d8be2eec3c62adbd20cf7f6bbd0f5d99f049093263f4f6e4c8","observation_id":"45e4b063-c515-41d7-a93e-82ce1dfa65cd","resolution":{"observed_at":"2026-08-07T15:34:54.047031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.097101Z","title":"Visual instruction tuning.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.097101Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:eb66c844d5562839c582e23629ae5073aeb81297cac5e6c8875a2e8eb8ac21af","observation_id":"30077521-d764-4357-aae6-cbc02cabcb78","resolution":{"observed_at":"2026-08-07T15:34:54.097101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:34:54.126661Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.126661Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:4b5265bc982ff8acbd69df21bffe8a3adcb8113220c83a2a4cd19c942c511e14","observation_id":"b6368733-9fef-477b-b20f-a6c9b9c6ef7a","resolution":{"observed_at":"2026-08-07T15:34:54.126661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.824559Z","title":"Oryx MLLM: On-demand spatial-temporal understanding at arbitrary resolution.ICLR, 2025","venue":null,"work_id":"b6edc393-d907-4032-8c7d-1c85d3072d84","year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.151515Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:d93ba3705c6d5ae49eacf56d66d116740fff8e1a1aa9936159148fff28049469","observation_id":"e584414c-19b1-4a33-9fa2-6928c587e898","resolution":{"observed_at":"2026-08-07T15:34:56.828679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-20T06:36:43.390291Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-07T15:34:54.170183Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action.arXiv:2312.17172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.170183Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:42821802f285893c0651f76dff6247518e950e19d74878458d52dfa89eb6a109","observation_id":"3bb90c00-50f0-47ca-b7e3-50a3fd2f7d87","resolution":{"observed_at":"2026-08-07T15:34:54.170183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-08-20T10:02:52.933360Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T15:34:54.204865Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.204865Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e9a6b8c3a5b6da8985ba1670778254367062c2f10b3538fefea5d4ad73e24d2b","observation_id":"a974054f-a8f6-4b30-9fba-5ae051fc1008","resolution":{"observed_at":"2026-08-07T15:34:54.204865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.231257Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.231257Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:7c632d00a6b405bc39f4a78a67ba9a2042038bdb3b56bb6aaf92ad5b5673fd06","observation_id":"3a559694-8a17-472c-8603-2ba29b57c09e","resolution":{"observed_at":"2026-08-07T15:34:54.231257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-19T14:16:58.804962Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-07T15:34:54.260170Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation.arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.260170Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:86ce324981a5c09032b16b268da7fa49691dbaaf79cae3f0da873b69d14ccae0","observation_id":"e0d2967d-0f9c-46f5-8a8d-af0fee297e29","resolution":{"observed_at":"2026-08-07T15:34:54.260170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.344523Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.344523Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:56ce71c154936ab1f75453f38237df9d1f4965817ce0c580d5a9bbddf81f18c9","observation_id":"b9e736e6-6583-4c76-9921-b5aa0b8a23bf","resolution":{"observed_at":"2026-08-07T15:34:54.344523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-08-21T21:54:53.523676Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T15:34:54.404034Z","title":"Finite scalar quantization: Vq-vae made simple.arXiv:2309.15505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.404034Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:da3a0e5eaff57ea4b7a901668445350a6e8fa65123c8df0ac5786b350b9809ea","observation_id":"67ee5d29-e318-4817-8448-150ef028d871","resolution":{"observed_at":"2026-08-07T15:34:54.404034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.800066Z","title":"4M: Massively multimodal masked modeling","venue":null,"work_id":"cc89c61c-7fcb-4af4-93ae-62efa0657055","year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.466396Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c0feeb15911d4f665247d810a20f2884e147252d91e4605e94c7ef8e3c5f5b59","observation_id":"9c6223bf-0d29-4da6-9e12-a8d5af6071e9","resolution":{"observed_at":"2026-08-07T15:34:56.804787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.551750Z","title":"Gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.551750Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:a6cd427f358f98384f4141df43602e9899dd2d64b2834217fc1a789d25ad17f0","observation_id":"3a0b26d5-444a-44ca-8cb2-4ad988125365","resolution":{"observed_at":"2026-08-07T15:34:54.551750Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-08-20T04:37:17.931952Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-07T15:34:54.618377Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.618377Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:f0582bf526b93653d726ff22994370ce802aabef12d05125b85c6456ce66ebb1","observation_id":"72ed0b6e-5140-482c-bf39-a60864f2e53a","resolution":{"observed_at":"2026-08-07T15:34:54.618377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.687530Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.687530Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:3af2c51fda56b98d226837e549ac9542b68abc6a2f756c6a6f3c1c4ab258e89b","observation_id":"457042c4-d2c9-4fdd-a391-87a1a1d0f3a2","resolution":{"observed_at":"2026-08-07T15:34:54.687530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T15:34:54.732431Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.732431Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:9600ec3bc4a223195514496b5cdd22c345ff650e33d5243e2833422b9a5784db","observation_id":"078059fc-f144-40af-b551-fc62dd3a4209","resolution":{"observed_at":"2026-08-07T15:34:54.732431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.938943Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.938943Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:bceb618d3e0329a701125099a385646376c7ee0f79ec53a0ab1a7d538efd2d64","observation_id":"f242a8cd-9bbc-4ae8-9eb6-7544a417f009","resolution":{"observed_at":"2026-08-07T15:34:54.938943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.046840Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.046840Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:fea01c2e06e822012143015068203f287d08af5731127d6ac71bfd269d6bb9ab","observation_id":"e6a5ed8e-c7f1-4399-8062-165a553d84e0","resolution":{"observed_at":"2026-08-07T15:34:55.046840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T15:34:55.250725Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.250725Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:1df0c77bed97fe8bd968bd81279e0b76b495097c6a1f9a9a5522babcc1c7f11b","observation_id":"4e76550e-fba5-4a35-b15a-a9b53de0db40","resolution":{"observed_at":"2026-08-07T15:34:55.250725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-16T18:29:47.623456Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-07T15:34:55.362129Z","title":"Imagenet-21k pretraining for the masses.arXiv:2104.10972, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.362129Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:eca41736707c69264a63f4c73912ad7156d42bad82f12d2f5f89b412a60107b6","observation_id":"34142080-8a96-4211-8d6d-048ac101e8a3","resolution":{"observed_at":"2026-08-07T15:34:55.362129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.466549Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.466549Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:0a53ddc500708e635826e0ba38cc46c1c9077f45535a259f1b515938b7eee8be","observation_id":"37da172c-6c94-4ad1-85e4-c40fd9e49d2e","resolution":{"observed_at":"2026-08-07T15:34:55.466549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.754406Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"9d1d7d14-3c34-41c0-b9ae-ad589d1d6126","year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.654654Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:d1592c7a1d1194d1456bb2d7ae5e21c85ed414e03add5875c05b35dfced7b01e","observation_id":"b34b7e8a-a3e0-42ba-9eb0-12d860fa1324","resolution":{"observed_at":"2026-08-07T15:34:56.758086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T15:34:55.760316Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.760316Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:93df41421ca30cef77bbc7af1bb5228408c48bef8843baff4c6955ef920544a6","observation_id":"20e719e6-c461-449c-b2ac-866aa70f6eff","resolution":{"observed_at":"2026-08-07T15:34:55.760316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T15:34:55.770576Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.770576Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:aa6da450148cff66445537b7d18c7701321f750ed6c403a49d76e9bc588412f6","observation_id":"83b385a8-a10e-46ef-ab1a-eea6ce7f4a7e","resolution":{"observed_at":"2026-08-07T15:34:55.770576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:34:55.778208Z","title":"Kimi k1.5: Scaling reinforcement learning with llms.arXiv:2501.12599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.778208Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:cf6c2bad769d7dedb6da66718dbc24431d5dbf76195a912aa1fc1603433affc6","observation_id":"bd113272-fccd-4aa4-a22e-de30ec086e59","resolution":{"observed_at":"2026-08-07T15:34:55.778208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.743359Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"c392bf81-452a-437d-9209-b5450a62c0fe","year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.784427Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:73c365dd540f4b928a9df7ad106324a652fb70a576e80af9c3e986b6ccd1872f","observation_id":"d7179324-bc70-4faf-99fe-2111eb1aa559","resolution":{"observed_at":"2026-08-07T15:34:56.747202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T15:34:55.788642Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.788642Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:d1c86568393ef3293d6eb7650296014e8996ec0e205f6c49816ba397eed51eb1","observation_id":"4bbe62b5-fde3-4c19-b30d-e018fee5bd08","resolution":{"observed_at":"2026-08-07T15:34:55.788642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:34:55.792791Z","title":"Llama: Open and efficient foundation language models.arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.792791Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:49c65305757433e6daf7f28955f3bad708ccf2941115d586744b23210af6873f","observation_id":"afa9970b-f0fa-494c-bb45-39a1cf410247","resolution":{"observed_at":"2026-08-07T15:34:55.792791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T15:34:55.797059Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.797059Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:01b24f8bfd5dd6589fc9ac8a2e10553fdae6d0ddeeee2209a927b49fad7a3382","observation_id":"ad0c2970-0cfd-4b2b-abe8-f93d345c7370","resolution":{"observed_at":"2026-08-07T15:34:55.797059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.801017Z","title":"Neural discrete representation learning.NeurIPS, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.801017Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:2c612ef97cccd86df67713d9a8834678b020cdda11882aa177e8b7419bd58760","observation_id":"846badcb-5f5b-47e3-8b07-2746accc0d45","resolution":{"observed_at":"2026-08-07T15:34:55.801017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-14T20:52:07.307688Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-07T15:34:55.804718Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.804718Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:eaed0827528d1acf63d709c16a0b3509be52ef8972d994a4b0e3d82b5547e1b9","observation_id":"c7126fe6-580b-4126-8f5d-7bf49f15da5a","resolution":{"observed_at":"2026-08-07T15:34:55.804718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-20T11:45:05.949061Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T15:34:55.808400Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl.arXiv:2504.11455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.808400Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:4782f5f9e82a2e0677499fe9244555f366d3bf7c40be1ce7a8454895e1cf72e2","observation_id":"0dd2d8fc-0dd2-4746-9008-f3120daa65f6","resolution":{"observed_at":"2026-08-07T15:34:55.808400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:34:55.812726Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.812726Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:9df5fac0a72c8fce3c905fdfd84d29d048f0bf87a053b74f11347849a6e56be8","observation_id":"797fd783-9290-4779-a178-3ce9d99374b9","resolution":{"observed_at":"2026-08-07T15:34:55.812726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T15:34:55.815984Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.815984Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:b8f16634bf6ab79e19bc2da67be0821843d1ada633047134cc4edd2b775b2227","observation_id":"e50f3828-5425-42c2-acaf-68bb2490f3fa","resolution":{"observed_at":"2026-08-07T15:34:55.815984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-20T07:39:09.492234Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T15:34:55.820224Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.820224Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:eb7a6cc1eee8eb36f6f566f0277ec5d475fef6fb83f4d967cbff3ea660002e81","observation_id":"e1b25499-ef54-4575-90e3-e45f4e117118","resolution":{"observed_at":"2026-08-07T15:34:55.820224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T15:34:55.824650Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.824650Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:db74d3e5a5727993ff4c8689bb0c9ac40ffbb3f612d4c0fa5777f9ce598d3bfd","observation_id":"ea95bff2-5f5e-4351-8b28-03f390050f15","resolution":{"observed_at":"2026-08-07T15:34:55.824650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.828840Z","title":"Mint: Multi-modal chain of thought in unified generative models for enhanced image generation.arXiv:2503.01298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.828840Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e5d8cc15dd709354a739adebb3def8ffe0eb0e16e9cf8658a69c2807a48e63c5","observation_id":"0cc76da2-e4ec-43f6-9233-39a53873b3f8","resolution":{"observed_at":"2026-08-07T15:34:55.828840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.727353Z","title":"Large language models are better reasoners with self-verification","venue":null,"work_id":"5eb59456-99e6-4fcc-b306-8f70b9bd7e2c","year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.832641Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:ed5f95d48f878f347e147944be48b5a1decfeb38cd7d5ba734cd06288ababa29","observation_id":"2d61d451-a3cc-4c58-b64b-c87b07c62c9e","resolution":{"observed_at":"2026-08-07T15:34:56.730638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T15:34:55.836812Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.836812Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:cc2240ca479029fbe452517b9706b7e1f170a4c8090c06b48ee61b202d08dfb4","observation_id":"728e9b3f-4e14-4fce-8b4b-57d53df7a461","resolution":{"observed_at":"2026-08-07T15:34:55.836812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.717052Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":"8676799d-d8a6-4c9f-bd5a-f145532e3386","year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.840962Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:059312b331eeee24b75d26fe27670249aadfa611ce09eb8d4e8ed5e53fcead57","observation_id":"0d0cf564-ffd4-4eb8-97aa-2616e011c4d8","resolution":{"observed_at":"2026-08-07T15:34:56.720644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T15:34:55.845056Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.845056Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:7267184a1e1750d8724d2cf757e0290457af395964d6c1783ffbb64d137ecfbd","observation_id":"e81342d4-62d6-4e24-a7e8-b08ab321e5d9","resolution":{"observed_at":"2026-08-07T15:34:55.845056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-20T15:12:29.214340Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T15:34:55.848923Z","title":"Llava-critic: Learning to evaluate multimodal models.arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.848923Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:531eaf62d70daa8d1f8d06c20a5e16634067bad4d36ad9fb984a33eca149d42e","observation_id":"9c0703a0-d95f-4e4d-a78c-9d84baac40c0","resolution":{"observed_at":"2026-08-07T15:34:55.848923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:34:55.852874Z","title":"Slowfast-llava: A strong training-free baseline for video large language models.arXiv:2407.15841, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.852874Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:4a0c7ec892fd26ee8c36b1a242bdea8f4c2b7e6fa759f6e282a45aa358c48682","observation_id":"0121dee9-6d54-4503-89a9-2066e849809e","resolution":{"observed_at":"2026-08-07T15:34:55.852874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18943","last_updated":"2025-03-27T17:34:06Z","snapshot_observed_at":"2026-08-16T12:47:14.665410Z","submitted_at":"2025-03-24T17:59:07Z","title":"SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18943","snapshot_observed_at":"2026-08-07T15:34:55.856714Z","title":"Slowfast-llava-1.5: A family of token-efficient video large language models for long-form video understanding.arXiv:2503.18943, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.856714Z"},"links":{"cited_paper":"/paper/2503.18943","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c6081053b6a6bcb2e35cadb3d917f7994b4b28cd0673b72b00392bc45989c7ae","observation_id":"765079fd-8673-4ee6-80de-35b19f652f4c","resolution":{"observed_at":"2026-08-07T15:34:55.856714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:34:55.864539Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.864539Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:e9c9650d8a46c06ca68672cf49438174250535af745990f5315739b0bd3591a0","observation_id":"c61bde09-8bb1-41a4-91b0-14fb9ca232ac","resolution":{"observed_at":"2026-08-07T15:34:55.864539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10798","last_updated":"2025-06-04T07:35:31Z","snapshot_observed_at":"2026-08-16T13:09:29.451373Z","submitted_at":"2024-10-14T17:57:18Z","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10798","snapshot_observed_at":"2026-08-07T15:34:55.868975Z","title":"Mmar: Towards lossless multi-modal auto-regressive probabilistic modeling.arXiv:2410.10798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.868975Z"},"links":{"cited_paper":"/paper/2410.10798","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:05d4a557fc5bcec423e2229960a9a2d273492a22e80f2d89884279184a84b08c","observation_id":"5292e68c-835e-4792-9d06-564ade5c221a","resolution":{"observed_at":"2026-08-07T15:34:55.868975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.873451Z","title":"Hermesflow: Seamlessly closing the gap in multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.873451Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:85c98ad0bb83ef9039ae9df767551d13222933b61930aecbadec6277f9c204a1","observation_id":"799d2c91-9672-4fc5-8b41-02c3ef15c8cf","resolution":{"observed_at":"2026-08-07T15:34:55.873451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-15T19:40:30.225099Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T15:34:55.877402Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.877402Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c37a3b4b4066c7605779c5b951959f93adfb9b3a03dae15874a6b5e7c9f9f96f","observation_id":"5fb6049a-a965-430f-a92e-3813bd5b6a78","resolution":{"observed_at":"2026-08-07T15:34:55.877402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-18T14:08:01.954263Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-08-07T15:34:55.881448Z","title":"X-vila: Cross-modality alignment for large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.881448Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c8499a96c5dd5445d772ec8ba92939db0e76eda067e1203d16edf99d6ae900a0","observation_id":"4806fd98-19bc-45ea-9e7f-f0b3208da644","resolution":{"observed_at":"2026-08-07T15:34:55.881448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.706222Z","title":"Language model beats diffusion-tokenizer is key to visual generation","venue":null,"work_id":"16cee824-d8ee-4247-9273-6b773c70a61f","year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.886007Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:f13daeb7f01e74a51528486716489e82cfaad68b1c2f3a88895243a162248bad","observation_id":"c52337af-fc4b-4ce0-8662-eb2fe8548418","resolution":{"observed_at":"2026-08-07T15:34:56.710212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-07T15:34:55.889892Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.889892Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:7628d6fb61285ff472ebd3b9b7edee5872dc4322cad14a33247bef87102d771d","observation_id":"643bc847-d865-4585-adc9-b1dbe937335b","resolution":{"observed_at":"2026-08-07T15:34:55.889892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:56.691899Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"65d35cbd-5b29-46b1-a9aa-22424e4cf0ad","year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.894512Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:ed44b6701278762460edb321c1e9998f34d80e32d454e7d6e457f1c80ce8e2bd","observation_id":"97a2c1ed-dfcb-4c1b-9e16-a9853daad063","resolution":{"observed_at":"2026-08-07T15:34:56.697844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.898317Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.898317Z"},"links":{"citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:50429f0142d2246b8ef3d78ef9bb9123b7e3be302cd18b8fb0ee89afb062e911","observation_id":"69a51502-6e1c-465e-bf5c-450459cb3dd4","resolution":{"observed_at":"2026-08-07T15:34:55.898317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T15:34:55.902559Z","title":"VideoLLaMA 3: Frontier multimodal foundation models for image and video understanding.arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.902559Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:cbc234f94891e5fe4e475bc40a7d5556506377e1be9876c2f8c566069a184678","observation_id":"cc3c874b-a5c4-43a9-b2fd-aca20f4a9131","resolution":{"observed_at":"2026-08-07T15:34:55.902559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-20T08:25:46.802111Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-07T15:34:55.906384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.906384Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:de6f2150ceeafd5d3678786707cdb8867646f4d6dd73b406efb0b3cb2acf3484","observation_id":"202f015a-ce24-49c9-9654-610a49bdaa9c","resolution":{"observed_at":"2026-08-07T15:34:55.906384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T15:34:55.910000Z","title":"Video instruction tuning with synthetic data.arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.910000Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:f4cce2ea9663a85dc651894eeb996abc7464e86a18b0235f638b22dd8c0ec07c","observation_id":"37f6e468-d31e-4e85-a9f6-ac9bc1835124","resolution":{"observed_at":"2026-08-07T15:34:55.910000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-20T18:58:15.597647Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-07T15:34:55.913350Z","title":"Image and video tokenization with binary spherical quantization.arXiv:2406.07548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.913350Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:9964a36a250ce27072341044128df442e281cfcb2ddea7dde83a6a51760abf7f","observation_id":"53a839f8-3586-4ffc-af44-54354bb9b2c8","resolution":{"observed_at":"2026-08-07T15:34:55.913350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T15:34:55.917512Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.917512Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:fedec720c80388a55018f75b68ce9f9b6ec850741c63abcc7fcaea0da896f55d","observation_id":"a8fddcf2-8c72-4318-ab50-bdb79916dc93","resolution":{"observed_at":"2026-08-07T15:34:55.917512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:34:55.921584Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.921584Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:6e43eb03f1e07660723df5b86c9c7ac65b3245da8f441cf840fae395a590b6c8","observation_id":"0e74cc5c-5dd6-4746-92a7-02b407ac0979","resolution":{"observed_at":"2026-08-07T15:34:55.921584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02949","last_updated":"2025-04-03T18:06:28Z","snapshot_observed_at":"2026-08-16T12:44:10.148687Z","submitted_at":"2025-04-03T18:06:28Z","title":"VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02949","snapshot_observed_at":"2026-08-07T15:34:55.925498Z","title":"Vargpt-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.925498Z"},"links":{"cited_paper":"/paper/2504.02949","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:439fda716ddcd9d54d83c780c5f281539eba96f3c92dff4a08d346d5f32e8405","observation_id":"e4523b3a-873e-4504-abfe-4967ea71a8ad","resolution":{"observed_at":"2026-08-07T15:34:55.925498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-15T17:40:10.309874Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T15:34:55.930004Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.930004Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:8202944df0145fccd15bf4d13ab61c3a80d580c383b684d8207e7b5bbd8a1d2b","observation_id":"208b340b-771f-4eda-aa3a-b4fde362b2f0","resolution":{"observed_at":"2026-08-07T15:34:55.930004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":86,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 4 inbound Pith citation observations for arXiv:2505.14682."}