{"as_of":"2026-08-08T13:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:593e9970d2d8809c4696d09df81ca47bf0785fedebace152b1162bc1dc9efd71","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:53:27.275816Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:36:08.089323Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:51.505020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-04T22:36:08.089323Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.089323Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:2118b27645226b53ce61e19fab652b5c4e9811372c69349888185277d6ac27d7","observation_id":"c63afbc4-b1d7-43af-ba5c-dc92b302b53b","resolution":{"observed_at":"2026-08-04T22:36:08.089323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-04T09:54:26.172394Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.172394Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:f648bd733ed12c690c0875282088a0065e856ffd07c7e85961974f7ca97f3724","observation_id":"1b38343b-63f0-4da6-9d9e-c2958e2738fb","resolution":{"observed_at":"2026-08-04T09:54:26.172394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-02T02:51:49.314780Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:5bad386826413a0925106b2bdd68535e3c5edf2df49465897b41e6f366e958f9","observation_id":"f65b3710-3e23-49d2-92cc-c271d97ff38f","resolution":{"observed_at":"2026-05-20T12:43:17.438705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:2f2231cfe44649591470c52a71d5b9dec175ec26e6882517bdb8e7694548ebac","observation_id":"d3fe3d45-ba2a-4eb6-98ba-c8dccb1f69d1","resolution":{"observed_at":"2026-06-29T23:04:01.711658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:6f6d9ea0ce884a480ac3a402c138ace5305e6fa43f7ddee77ef2373b00372a80","observation_id":"a4bd0c27-f7ff-4223-9366-d8b551a7fab2","resolution":{"observed_at":"2026-07-04T13:39:51.506849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-03T02:26:02.235143Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:e700bf7f307298769896f99d621bd9226dc8fbfc56ac5e7bbcb616f309f8b066","observation_id":"75fc4684-086d-4358-8cb7-ba8102369c62","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-01T18:56:58.185926Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-07T11:54:07.268424Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.185926Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:5c7f6dd248962b7a317865887b2d3be9ed3ecfd6475358cfd074b8f0414782d4","observation_id":"a2b02145-2d74-4af7-b2cf-57e6af75cced","resolution":{"observed_at":"2026-08-01T18:56:58.185926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23380/citation-record","integrity":"/paper/2505.23380/integrity","json":"/paper/2505.23380/citation-record.json","paper":"/paper/2505.23380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:53:21.247048Z","title":"Phi-3 technical re- port: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.247048Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a4d6e34b73f8add154c96e0d80c9ca5ab5d5c888c4140fff26e66057db5f71b0","observation_id":"aec5fbc9-7aeb-4bbe-a4ec-b481b7096a02","resolution":{"observed_at":"2026-08-07T12:53:21.247048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:53:21.392275Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.392275Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:8bda5f2b2201283eecf9d797bbeccb08e7c5ee22f796e79d866382f3ae1b7bfc","observation_id":"58bb2215-a757-4c2a-965b-9064c404f0fa","resolution":{"observed_at":"2026-08-07T12:53:21.392275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:53:21.498548Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.CoRR, abs/2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.498548Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c20b3654f8abfa362e28a707778b6ed8c1cc091fb55e82cb648cff7154c4ffa1","observation_id":"b548974f-40f1-47cd-8543-216fa5d1fe4e","resolution":{"observed_at":"2026-08-07T12:53:21.498548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T12:53:21.647902Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.647902Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:93c5c0daaa4d1c96301dd94832e55860e72c3ab88c7b147cd46e38b8988cfcae","observation_id":"de27a906-4d36-4c4a-a3db-7a66dbc3c57d","resolution":{"observed_at":"2026-08-07T12:53:21.647902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-07T12:53:21.803824Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark.CoRR, abs/1906.07155, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.803824Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:9caa671056c3630cf4eddb66d2a9e5680ecff8011db644b7ac1921dec6a6d875","observation_id":"5188efac-6b8d-4830-88d7-73269d8607d5","resolution":{"observed_at":"2026-08-07T12:53:21.803824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T12:53:21.903111Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.CoRR, abs/2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.903111Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:b55d9b149da2b631a9518329044230f96e508c19203e63736c950d314eb58af3","observation_id":"451f3035-a90e-470e-9aec-921385dd5ba2","resolution":{"observed_at":"2026-08-07T12:53:21.903111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.784289Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":"4f8af2a3-08bc-4637-a8c2-2bfe5826f18f","year":null},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.990830Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:2f5c9d7c84fc204e3aa3016c6fc451664e385bc3402cc5b40e0e70f06f32b0b9","observation_id":"20b0f5b4-8f58-44e8-a842-3f91de0cca06","resolution":{"observed_at":"2026-08-07T12:53:30.932772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.542803Z","title":"Baldridge, Roopal Garg, Peter Anderson, Ranjay Krishna, Mohit Bansal, Jordi Pont-Tuset, and Su Wang","venue":null,"work_id":"40dd8f16-76ba-4255-87f9-35ebe2438c9b","year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.106661Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:4382431ee6b917e2e8ae71d83de6caff5f08b7a55c99a1904249fece11f090bc","observation_id":"dd42ec44-cf96-4338-868e-c364240aa56b","resolution":{"observed_at":"2026-08-07T12:53:30.653559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:53:22.203748Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.203748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:93b5c1ce9b9b3ac83afb76e94f0c885e33a005215af7612c4573060f27935f8f","observation_id":"9dc2eece-21b3-4a7d-a269-9cd6afc167cb","resolution":{"observed_at":"2026-08-07T12:53:22.203748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:22.295884Z","title":"DreamLLM: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.295884Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:20025c5e810389239a01bca0e2188b4e1e42d43497692a5e761d50a089729c01","observation_id":"b9db14ca-f33c-4c9c-a4ac-1bcc3f660906","resolution":{"observed_at":"2026-08-07T12:53:22.295884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.241990Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"97925e52-79f3-42c2-9196-16523414079f","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.391653Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:8f2bbecba858640603caa5a2e808c8223659bd7779a24d13c50ce8297957390f","observation_id":"c8db548b-d4fe-41f3-a841-c5bd44d5cf05","resolution":{"observed_at":"2026-08-07T12:53:30.410352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:29.995099Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"a122db7a-38bd-45e9-bff3-2b918c92cc72","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.481332Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a1d8337ab0b6b10856faedd3ff55b4a401e73775f0c353172eb0fa01595d2489","observation_id":"ba29a64c-395e-4fe1-afd7-b2d004a890d3","resolution":{"observed_at":"2026-08-07T12:53:30.134836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T12:53:22.622402Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.622402Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:bca18da26ac7bbfb13772af429054eea9a90831fa24fd97e5bfa8f83354a466b","observation_id":"66ebf948-5046-4075-86b9-878955536ed3","resolution":{"observed_at":"2026-08-07T12:53:22.622402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:22.801107Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.801107Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0e115ba410af4721b81c0eacca45d4e5303f59458912e100956ec2a0746857e9","observation_id":"018ec1df-5998-4250-a5a9-2177b76fca32","resolution":{"observed_at":"2026-08-07T12:53:22.801107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:53:22.895103Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step.CoRR, abs/2501.13926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.895103Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:8f7607887008ca7cf38f15c0f385f74b11cf18bffbae4cd9296a7adce6895a25","observation_id":"3e8053ea-4c2d-445e-aebf-e7b2b1ee8a09","resolution":{"observed_at":"2026-08-07T12:53:22.895103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:53:23.010341Z","title":"Openai o1 system card.CoRR, abs/2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.010341Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a57ada8fbb6274c7b787b612cd65106cf04af56be8b4f3fd8db3370ddab3b915","observation_id":"9b0265b6-958f-4093-95cd-96faa8adc758","resolution":{"observed_at":"2026-08-07T12:53:23.010341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-08-07T12:53:23.148041Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads.CoRR, abs/2412.00127, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.148041Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:2e9e7a4463bf07a9b225eb8911e544d512ef49666da393ab409fb52d3327c929","observation_id":"668be6c0-d07f-4c16-b854-b3f4c42bb6ef","resolution":{"observed_at":"2026-08-07T12:53:23.148041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-07T12:53:23.280824Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought.CoRR, abs/2501.07542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.280824Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:9ed4c2bfbac5a75e46c5d163ecc3014ebfc47c874ac49a6b8dfc149c13fdfe2d","observation_id":"2c634cf9-a721-40d5-8aac-613f2429c5f9","resolution":{"observed_at":"2026-08-07T12:53:23.280824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:53:23.378411Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.CoRR, abs/2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.378411Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:f4df0f9f778823e61af1f32098fbedcab50ca039db03833e3bce94c4231d31ca","observation_id":"d4fa1d2f-af8a-4a60-aea4-08ba69542773","resolution":{"observed_at":"2026-08-07T12:53:23.378411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-07-06T19:59:56.438747Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T12:53:23.481480Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.481480Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0ac591130ccd89c2633e84343d7f69b9c4e0ed013fae1d3d0e932e0ea4d7263e","observation_id":"43be3b75-d5fa-411d-a840-991ebc006b4b","resolution":{"observed_at":"2026-08-07T12:53:23.481480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:29.765663Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"827f0b95-f5cb-434b-94f2-5bbb3a8d2fc4","year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.546372Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:deac32c865fd184859d7d49111fe9673f8a088737e230172717382de0b99d8af","observation_id":"2e9ad2e1-f710-4333-9696-fce27c100765","resolution":{"observed_at":"2026-08-07T12:53:29.928449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T12:53:23.636560Z","title":"Textbooks are all you need ii: phi-1.5 technical report.arXiv preprint arXiv:2309.05463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.636560Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:941e4fc8b52428d4c14b5f7fa1e3763a761ba28b16cabe9ea744db1557ed5a8a","observation_id":"fc666632-e083-4888-866b-1ae50628efdb","resolution":{"observed_at":"2026-08-07T12:53:23.636560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T12:53:23.757213Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.CoRR, abs/2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.757213Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:69f57fd7261c95f22a0b9e1af2e9eb7abbd76e513607beadecd733a5897ce5fb","observation_id":"c72fe73b-cab8-499d-8243-8f62cb7fce89","resolution":{"observed_at":"2026-08-07T12:53:23.757213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:23.884539Z","title":"World model on million-length video and language with ringattention.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.884539Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:1d8f98754aeeb213a223f99ca2a612dcbb4815c7b5574a0c61e79b9c0ed9d4aa","observation_id":"51de8089-3bda-4734-b1ce-cfd61af89862","resolution":{"observed_at":"2026-08-07T12:53:23.884539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:24.079598Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.079598Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:5bdf30c2a621d39391d6853c8573deb09ff65087b4175f5fb1213801a94d5485","observation_id":"ef2e40da-f413-46e3-91e8-cafa6f0483eb","resolution":{"observed_at":"2026-08-07T12:53:24.079598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:24.253921Z","title":"Visual instruction tuning.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.253921Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:aee3c3e55c5fbbae706e3dfc88dfa740ca78799dbe2e44bd36fa4223563bd558","observation_id":"cd8acce9-ac40-4322-a4be-1e017b220653","resolution":{"observed_at":"2026-08-07T12:53:24.253921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-07T12:53:24.426795Z","title":"Janusflow: Harmonizing autoregres- sion and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.426795Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:d09e13289007d3d4ac3de218af9107766a2a04b9a32c76555b21300773b73cc2","observation_id":"f7a0385d-c4bf-4561-aeb5-f7d4665e6dd0","resolution":{"observed_at":"2026-08-07T12:53:24.426795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T11:50:22.541850Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-08-07T12:53:24.588515Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths.CoRR, abs/2502.06474, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.588515Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:acc9a9baa5882416a23b4444d6b51eb5eff8b5a137a493d544fe7698ccdb94fd","observation_id":"abbcd6f8-fb9e-4226-bd62-53b52b9d3f5c","resolution":{"observed_at":"2026-08-07T12:53:24.588515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T12:53:24.689189Z","title":"Du, Zehuan Yuan, and Xinglong Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.689189Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:4d34a0159b2cffe9d9d9a9213922e719c3136e986dc681c5f4dceb0fdc44c147","observation_id":"8ed1468c-7cf9-4a0c-b1c7-8dcfafffb433","resolution":{"observed_at":"2026-08-07T12:53:24.689189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:28.666064Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"e39bf80f-806b-4a7f-b3bb-7ceb8457b784","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.823422Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c67221f816532eefac141ef1d4e563f95970865a2ef2a1a87ca75c803f06e3c3","observation_id":"f7ab2202-5522-41f1-b062-d5223aef3e5a","resolution":{"observed_at":"2026-08-07T12:53:29.228511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.018029Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.018029Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:901acae62d991617806a42f2827c58f3392a37ecdfc22e586e66bb84eaf86c72","observation_id":"dc850bae-8438-49fc-b1eb-d0faf2e5271d","resolution":{"observed_at":"2026-08-07T12:53:25.018029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:53:25.202348Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.202348Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:1e0dfa87968cd076a49e32667a55ab15e2bcbbe59b4ed132f50daf5646f73191","observation_id":"971cb1b3-6d1f-49e9-bc2e-e50d243c1c7d","resolution":{"observed_at":"2026-08-07T12:53:25.202348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:53:25.336876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.336876Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:8a2e781e5da92a648675881d6f8e78de3ededfafb9a354b241ba8acbd5a586d3","observation_id":"62ac2f3a-ce0f-4374-8b79-36b0b4b1a2de","resolution":{"observed_at":"2026-08-07T12:53:25.336876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:53:25.463377Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.463377Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:233dced5990abb6aac34e05fe211ded96f92517db45a65b89802d9b2427ea342","observation_id":"05dac12b-2ec1-4114-b49e-baa9bdda25cf","resolution":{"observed_at":"2026-08-07T12:53:25.463377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.595623Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.595623Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0aad324fc71ac8b9e110b6211e07a0245685974313db717afbc4f2c3caa7dbfe","observation_id":"2b70c008-595a-485d-b86a-263d5d806029","resolution":{"observed_at":"2026-08-07T12:53:25.595623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.723242Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.723242Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:6d6aa7169bcc0f1060f1dd5c3164fb569fc4ce70801f1c675ffeb73e16bea46e","observation_id":"16b7d5a9-ffd4-40e9-a283-5569a2b83d4b","resolution":{"observed_at":"2026-08-07T12:53:25.723242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.798707Z","title":"Any-to-any generation via composable diffusion.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.798707Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:d46e18e096eb9055201b05a5f51d2557571cde0e800f94146b05ba45348bb2cb","observation_id":"2a227863-0077-490b-81b3-7e8ae235e776","resolution":{"observed_at":"2026-08-07T12:53:25.798707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T12:53:25.864139Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.864139Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:74d88c06efed556418f5e1df561f42c81e8f50f2775c7bf499e7f9da3a777023","observation_id":"de4c8042-f473-4ec0-be7e-fa036b0c4a4a","resolution":{"observed_at":"2026-08-07T12:53:25.864139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:53:25.933048Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.933048Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:3dad2bb6a3734e55c78377c225fbff9d6cd95c99a1cf958d4e66e0762a384c2b","observation_id":"bc8082fa-ff6c-40a4-86de-58673450e2ed","resolution":{"observed_at":"2026-08-07T12:53:25.933048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:53:26.025472Z","title":"Llama: Open and efficient foundation language models.CoRR, abs/2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.025472Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:910591e648271f0d65cdd6757d630e48db7508c218aa8d8194a178b09aeecb88","observation_id":"c9438d87-f325-472f-852a-a530122fe4ab","resolution":{"observed_at":"2026-08-07T12:53:26.025472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:53:26.121878Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.121878Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0b6ed4c18635f5e6c6ef1ea1dbc3afe750fc6758714dfb2bd046c1c40a56c263","observation_id":"cbde4961-f1a8-460f-a1a2-23d466d71dd6","resolution":{"observed_at":"2026-08-07T12:53:26.121878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T12:53:26.245919Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.CoRR, abs/2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.245919Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c8a5e2d6e9ee2e306ddbbae929f7bd35ee677e9f19829f1d3323ed41b2fcd5cb","observation_id":"3b1f686e-b87c-4b9a-a8fa-b6dced2d1622","resolution":{"observed_at":"2026-08-07T12:53:26.245919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T12:53:26.366317Z","title":"Liquid: Language models are scalable multi-modal generators.CoRR, abs/2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.366317Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:ce192a5a7b014851e9a9d99b41a79609848d40e9a938f0a6016e806fec13755e","observation_id":"e308dcb7-501d-44bf-9a0f-d4708432b45f","resolution":{"observed_at":"2026-08-07T12:53:26.366317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T12:53:26.460651Z","title":"Next-gpt: Any-to-any multimodal llm.arXiv preprint arXiv:2309.05519, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.460651Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:f607374e06e2843c221e6da5e2941686d248caf442ddde6f266ee37e6b39e6ae","observation_id":"727c3c1d-52ce-4d27-bf43-8b46fbc2fb7f","resolution":{"observed_at":"2026-08-07T12:53:26.460651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T12:53:26.558833Z","title":"VILA-U: a unified foundation model integrating visual understanding and generation.CoRR, abs/2409.04429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.558833Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:b0875638b57a57c049d1bbdf3dfb45ecf066d32a045e108b9a3426504d663168","observation_id":"fd41ded9-b835-43de-a77e-0011efa915fc","resolution":{"observed_at":"2026-08-07T12:53:26.558833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:53:26.689185Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.689185Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:2b329b62cf8cee1beb322f25a7e3a9497d360609bb1d5a9b59d0b92dcbe2053c","observation_id":"4c66c372-c2ee-43d4-9d91-34869edf7d61","resolution":{"observed_at":"2026-08-07T12:53:26.689185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:53:26.847399Z","title":"Qwen2.5-1m technical report.CoRR, abs/2501.15383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.847399Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:4816f9cca4daae804d8a84232dcffb7dd5ad9d6f75355df9b4a58b7e8ec2cb76","observation_id":"17d2601d-6d50-4659-876f-f6998775a666","resolution":{"observed_at":"2026-08-07T12:53:26.847399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:26.974393Z","title":"Hermesflow: Seamlessly closing the gap in multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.974393Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:47663ded504ee0580e365b030fe10ea89d97918aa7c2f077d75e4e7fe8fce39e","observation_id":"34296fd0-0dcc-4c8b-b655-9991d86c2266","resolution":{"observed_at":"2026-08-07T12:53:26.974393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:27.100136Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.100136Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a201aa024902554215577bd85fb0291ae96a97544d317541b554a0d6a992e2f2","observation_id":"598112ee-2156-417e-9f68-063ebb26669d","resolution":{"observed_at":"2026-08-07T12:53:27.100136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03651","last_updated":"2025-03-05T16:26:58Z","snapshot_observed_at":"2026-08-07T17:27:06.859206Z","submitted_at":"2025-03-05T16:26:58Z","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","version":1},"cited_work":{"arxiv_id":"2503.03651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03651","snapshot_observed_at":"2026-08-07T12:53:27.544486Z","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","venue":"cs.CV","work_id":"58b6f6c8-458d-4dee-925c-4c2830cbc075","year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.204685Z"},"links":{"cited_paper":"/paper/2503.03651","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a3956b1746b420ee2166cc3f8c2495d5f648551ce2a7c994727fc0bf99528619","observation_id":"1266f9e7-3c5b-4c78-baf3-94b4c1da3891","resolution":{"observed_at":"2026-08-07T12:53:27.611095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T12:53:27.275816Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.CoRR, abs/2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.275816Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:188cf376d6f954683ed9027c6d767d10fead69adc3b626cd4c129975b1152f30","observation_id":"b7ac9371-df22-4361-af2c-b5731326aa0e","resolution":{"observed_at":"2026-08-07T12:53:27.275816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 7 inbound Pith citation observations for arXiv:2505.23380."}