{"as_of":"2026-08-19T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c246e2b3b3fa34af33a41a04a28026ddb2ddc45b0cd0cfd706007caabeb32bed","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:26:58.409542Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:09:10.990159Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:29.440180Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-15T23:09:10.990159Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-16T05:36:45.421294Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T23:09:10.990159Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2505.05422"},"observation_digest":"sha256:05252a03471a7f27df79dc278721891992e91074e2f3d8b823bc0376336ad6a3","observation_id":"6bdc7cd4-ff7c-49a9-905d-1c637f54ce25","resolution":{"observed_at":"2026-08-15T23:09:10.990159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-07T11:16:20.624099Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-16T04:47:40.348136Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.624099Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:2e5e6b7fb5c195aaa852240a748b04a5745261657efd780100d32e7a5952ee6c","observation_id":"1b66d188-aedf-42e4-9b63-f192e703d310","resolution":{"observed_at":"2026-08-07T11:16:20.624099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-07T04:09:26.605018Z","title":"Bridging the gap: A unified video comprehen- sion framework for moment retrieval and highlight de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11638","last_updated":"2025-06-13T10:11:01Z","snapshot_observed_at":"2026-08-14T08:05:44.396132Z","submitted_at":"2025-06-13T10:11:01Z","title":"LoRA-Gen: Specializing Large Language Model via Online LoRA Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:26.605018Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2506.11638"},"observation_digest":"sha256:f2e0e63f776c33106ff9d0680459ec4fab77d5f064aaaa456cd581a49cc13f5e","observation_id":"15fdf608-50a4-443a-b870-878a7cd630e2","resolution":{"observed_at":"2026-08-07T04:09:26.605018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:d07cb39f91e1f9ce59198c9e1a2d600053b3278dae8187130d427725fa02f8e5","observation_id":"21e7eaad-27fb-40a0-a9c9-acdb4d3b6e1d","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-03T02:34:00.137676Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.137676Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:159b80125462ceb057adb6f39d026bd3eed158cda378dad703976d17b15a32d1","observation_id":"a0967b82-5fb2-430d-ae00-a9f2fe1aabca","resolution":{"observed_at":"2026-08-03T02:34:00.137676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2604.04911","last_updated":"2026-04-08T04:54:06Z","snapshot_observed_at":"2026-08-12T15:46:16.847409Z","submitted_at":"2026-04-06T17:54:42Z","title":"SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T19:23:50.614589Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2604.04911"},"observation_digest":"sha256:279a07362c88fc2fb3441d94ea20e9ae8b78ae233679975a774aef95857665d5","observation_id":"17c4f5ff-d6f3-4ac4-b784-185498c4a051","resolution":{"observed_at":"2026-05-10T23:00:50.371078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:52b0c13e477bf774ccbc54771ebbe080e185966304f0863ba5906454f615f0ce","observation_id":"d7b75b5d-a3ce-440c-b68a-90040d96e677","resolution":{"observed_at":"2026-05-09T06:55:43.694718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:1897851564774ff8c6b29374481f3a665400a016ddd6f2a583b2b657aaaaad99","observation_id":"f35ec559-82e5-404d-9f3a-262d9319b7cb","resolution":{"observed_at":"2026-05-21T08:19:52.751849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-08-12T22:45:35.785489Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:3c8f68081720be3ece16cb478752a7c0344014eeebb60cf82a64f17988b78ec9","observation_id":"3c0041f6-f342-4a24-b0d8-2bfd251871a0","resolution":{"observed_at":"2026-05-11T04:30:59.889877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:800e20b175ed5a098788fd551328edd29b0aede4578d90b90224b08191a85d20","observation_id":"a6585bc5-4f90-46ac-91cc-5b059183f3b2","resolution":{"observed_at":"2026-07-02T03:06:29.442237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13031/citation-record","integrity":"/paper/2505.13031/integrity","json":"/paper/2505.13031/citation-record.json","paper":"/paper/2505.13031"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:26:58.092350Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.092350Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:83af90e4d18a0dbf44ea1c84f97731a1cad9c280048ee171e91682f3e82d8f3a","observation_id":"7431ca4d-00fc-4ac9-ba5b-c7a196d5b8f2","resolution":{"observed_at":"2026-08-15T20:26:58.092350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-15T20:26:58.099262Z","title":"arXiv preprint arXiv:2505.09568 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.099262Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:8acb311d4f4bb4eb035d456ac157607a5bb65c6987362865be9d0822a5249cbb","observation_id":"a51e9c89-782f-4e8b-966d-59c6fb7bd70c","resolution":{"observed_at":"2026-08-15T20:26:58.099262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-15T20:26:58.105088Z","title":"arXiv preprint arXiv:2310.00426 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.105088Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:56806cf29d853a40ddfffdf2e659a6d49fc22c5e28d450d90c1a48c2dc7cead2","observation_id":"389c266b-d5d5-4b08-8564-f988b4986220","resolution":{"observed_at":"2026-08-15T20:26:58.105088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.512412Z","title":"r1-v: Reinforcing super generalization ability in vision-language models with less than 3","venue":null,"work_id":"6f505fda-7434-4266-a8a7-2fe8df3c0b70","year":null},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.110901Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:0cc6442066b4cf1af9638ecec0eebbbf173d59a6cce0f8bc85e018267c5c9afb","observation_id":"1b0cfad7-a596-43a5-9889-8a122e251c33","resolution":{"observed_at":"2026-08-15T20:26:59.518115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.116559Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.116559Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e6c03452517a506ba3bd2fa3f2780292f56531d5212a72dc57dde7dbff6ddf6a","observation_id":"8d82be19-ace8-4e34-a7fa-675d7a3ffa2d","resolution":{"observed_at":"2026-08-15T20:26:58.116559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.482965Z","title":"Science China Information Sciences67(12), 220101 (2024) 10","venue":null,"work_id":"a0847431-bc8e-440a-ab7f-a017d6ddbc96","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.121570Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:378d1e31f572d34ea6d25b574444fbb243808db5e1c201dca544ef44f68f02e0","observation_id":"766af505-288d-4f51-95e5-2adbc908af8d","resolution":{"observed_at":"2026-08-15T20:26:59.488898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-15T20:26:58.126897Z","title":"arXiv preprint arXiv:2505.14683 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.126897Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:17fcdcb07139a51cc6d9221dadb67401e2cea2e266fab7510f7be4801320e0e5","observation_id":"d9523808-2f9f-45e0-8845-8718a37b2ac6","resolution":{"observed_at":"2026-08-15T20:26:58.126897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-18T18:23:18.371488Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-15T20:26:58.133735Z","title":"arXiv preprint arXiv:2309.11499 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.133735Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:aa8050ba84d4860f058e9390286ba0d083324f60c8acb7b5c7b0ed8176b704a4","observation_id":"83349dd2-4b7d-4060-8d87-1c24a8796109","resolution":{"observed_at":"2026-08-15T20:26:58.133735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-15T20:26:58.139315Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.139315Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:75c8f5e5a2861de4a535f2ef6e311a16df063ffbcfc9fdd1aa4be3c634d72a94","observation_id":"71cab7d0-ea13-4b25-88de-9852fedef3cd","resolution":{"observed_at":"2026-08-15T20:26:58.139315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-08-18T16:01:12.797308Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-15T20:26:58.146231Z","title":"arXiv preprint arXiv:2309.17179 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.146231Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e4d5cf2591d7dfef3c18f332b1834288fcc11d0240600a9b934323be2f84a987","observation_id":"eee365db-c203-4bf0-a66f-19a157c902cb","resolution":{"observed_at":"2026-08-15T20:26:58.146231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-15T20:26:58.153083Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.153083Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:c1886f140c47630cdaf1e421d62783c78a85e18c45d8aa034cd20736a24697cc","observation_id":"257300d6-e990-4252-a71f-e6d7c8cfda74","resolution":{"observed_at":"2026-08-15T20:26:58.153083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.464425Z","title":"Advances in Neural Information Processing Systems pp","venue":null,"work_id":"ca60f815-29b0-43c5-b65c-c87a40664044","year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.158664Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:7fecbf4b4ae7c71ea97fbe4745c3e2ce315572ea1f853f79f14681bf92fcc819","observation_id":"e2edbfb5-4dce-4b66-9659-d94dd2214f9d","resolution":{"observed_at":"2026-08-15T20:26:59.470305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.444956Z","title":null,"venue":null,"work_id":"78518e65-8788-4697-bb37-173049b2b01f","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.163671Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:f64f771f53f1ae4ad0b0d3a33e96aeea13e354728b5467636bcd7da69cc4d588","observation_id":"25e2075e-38a0-460a-90fe-77141058ab01","resolution":{"observed_at":"2026-08-15T20:26:59.450727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:26:58.170393Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.170393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:6d7bd0087ca4bb94a450ab56d335a71d6c69191c7440ab2ec7beb9123eef9e38","observation_id":"3fcd54f2-d329-46df-825b-d4fff51a8731","resolution":{"observed_at":"2026-08-15T20:26:58.170393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-15T20:26:58.175229Z","title":"arXiv preprint arXiv:2501.13926 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.175229Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:4d0e11623593d17e6ff63714bf3942dd4896c57d6152d386cc0de6a6d14fc1b7","observation_id":"7528f7ae-75b6-40a4-bb11-02e6e231d17d","resolution":{"observed_at":"2026-08-15T20:26:58.175229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-15T20:26:58.180483Z","title":"arXiv preprint arXiv:2403.05135 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.180483Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:fc1356a0c8544a2c30954d673d25c777a7d5320e618adca7bda93023b6e35155","observation_id":"daf4f96a-731d-42e2-8f39-e4b1da2c1424","resolution":{"observed_at":"2026-08-15T20:26:58.180483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-18T08:20:39.097651Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-15T20:26:58.185469Z","title":"arXiv preprint arXiv:2504.01934 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.185469Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:ecdf4355877390fdf3deb2914a86ac30c4f02c592b388ad3d8de6c6530cc8e63","observation_id":"a90a0824-2081-47b8-928f-21aa3cabc3d1","resolution":{"observed_at":"2026-08-15T20:26:58.185469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-18T11:13:23.191794Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-15T20:26:58.192292Z","title":"arXiv preprint arXiv:2402.01694 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.192292Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:1a9f4299a7674112ce7651128174931438054339dffeb034ad1f4a187951fb26","observation_id":"8f7ffe76-90bb-44b7-ad54-10d5e720510a","resolution":{"observed_at":"2026-08-15T20:26:58.192292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-15T20:26:58.197909Z","title":"arXiv preprint arXiv:2409.12917 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.197909Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:540f7d6d651172cdadb62fced4ad0bfc882eddb4b15ffabf83cbc8ab2ff087f1","observation_id":"a4882627-c6d9-4a15-b758-8c0764825b81","resolution":{"observed_at":"2026-08-15T20:26:58.197909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.203015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.203015Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:95f101a125e1a0c6ca5092aa1f4c6c4f117a34189ad82998f1edbe230e9ff844","observation_id":"970508f6-7142-4887-a75f-fbc7eeecfd46","resolution":{"observed_at":"2026-08-15T20:26:58.203015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T20:26:58.208127Z","title":"arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.208127Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:6183d3679e0bebee96f0b3cb754f4d01cec6d4c6799ed1b8fab821df70cd27bd","observation_id":"18aca474-96d7-4523-ba18-750605542886","resolution":{"observed_at":"2026-08-15T20:26:58.208127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-16T12:51:49.357503Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-15T20:26:58.214608Z","title":"arXiv preprint arXiv:2503.06520 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.214608Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:f3ebf026a26e91ebafa91f4cc32a62fa170ea7a85d67b5ab41d12a2e37e8416d","observation_id":"6a3dfc0b-2b32-446e-a4c0-85130968bbd0","resolution":{"observed_at":"2026-08-15T20:26:58.214608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-15T20:26:58.220542Z","title":"arXiv preprint arXiv:2503.07265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.220542Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:78b6ed6f9b350906bbafacd0b08c92a4ffac082ae10c850acd5091d80f67fe39","observation_id":"97f83c26-75db-462e-ab39-20c7d35cdd82","resolution":{"observed_at":"2026-08-15T20:26:58.220542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.413777Z","title":"https://openai.com/o1 (2024)","venue":null,"work_id":"08fb03f5-1966-41bc-b2db-b203998dc08d","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.225798Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:295955c13c1770ef58b67fe7773019d317e9181fc9cc98b39fb6bb03c50ced84","observation_id":"7598a37a-d303-4a7a-b95d-38b2f95001f9","resolution":{"observed_at":"2026-08-15T20:26:59.420022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.396296Z","title":null,"venue":null,"work_id":"b3ab979b-e1a1-4881-8d69-63d0cce2e7fd","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.231910Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:899fc1b305c5a9eecc60567623cc69fad8610fb6cf8c3266215e72e0fee01d54","observation_id":"1a45b6d6-9c64-4ef2-be54-7642c52af2ef","resolution":{"observed_at":"2026-08-15T20:26:59.401571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-15T20:26:58.237599Z","title":"arXiv preprint arXiv:2504.06256 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.237599Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:80bc092fd97f464d430a103e183a00d80c20c047fcb62ebf8a76a2bd3df02180","observation_id":"291b28c4-8111-430b-9d8c-04cdec535f42","resolution":{"observed_at":"2026-08-15T20:26:58.237599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.243052Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.243052Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:41fe9838ea595ca34a01fd8fa6389aa839989a5212b559c443ae4f1fd0d3fd47","observation_id":"85580cca-6308-4b8d-8487-64a66c2ff527","resolution":{"observed_at":"2026-08-15T20:26:58.243052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T20:26:58.249057Z","title":"arXiv preprint arXiv:2307.01952 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.249057Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:a76444203e5e6edee7140b868f63a5590f7cdf3ef6739800426d3d668bec899a","observation_id":"919c26c5-2940-41b1-b90f-853ae5be2a05","resolution":{"observed_at":"2026-08-15T20:26:58.249057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14544","last_updated":"2024-06-20T17:54:03Z","snapshot_observed_at":"2026-08-16T13:41:00.258560Z","submitted_at":"2024-06-20T17:54:03Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14544","snapshot_observed_at":"2026-08-15T20:26:58.255579Z","title":"arXiv preprint arXiv:2406.14544 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.255579Z"},"links":{"cited_paper":"/paper/2406.14544","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:d8d1dc72c50962c46439d93e393ef3e1835684ce709fb030182bdab6dd7cbf00","observation_id":"c2050e8c-61c5-498d-b050-32f0d785b733","resolution":{"observed_at":"2026-08-15T20:26:58.255579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-15T20:26:58.261282Z","title":"arXiv preprint arXiv:2412.03069 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.261282Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:08641f6b2c8e2995bf8608180b0b7eb5691f882602032fbfcbdd4880c5bd2585","observation_id":"ec67038c-8d8a-4cdd-b29e-5fc2732a4d94","resolution":{"observed_at":"2026-08-15T20:26:58.261282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.267389Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.267389Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:4f2532024dc276095b59781fe6001cfcc16d8e36a432627a5ca87e5aa2ea0dca","observation_id":"28a7daf4-7488-4264-a553-191935772155","resolution":{"observed_at":"2026-08-15T20:26:58.267389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.355450Z","title":"URL https://laion","venue":null,"work_id":"306d7cb2-20a8-4937-ada0-9951db3318a7","year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.272917Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:75476821554f96394420daabf1c105ce621325b4e2118c93a214b14951a6e4b1","observation_id":"fd21ddc3-1885-4e10-86b5-078be8500a1c","resolution":{"observed_at":"2026-08-15T20:26:59.361428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:26:58.278116Z","title":"arXiv preprint arXiv:2402.03300 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.278116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e9f8689fb8cf12986812abd1ad025ee88bb780155f6c0ebeb328ceb3e5048f3e","observation_id":"dc57ee99-1fd9-474c-8474-4f5352a5cc1e","resolution":{"observed_at":"2026-08-15T20:26:58.278116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.333532Z","title":null,"venue":null,"work_id":"a9387447-1ff5-489e-8aa7-0fe3ac437750","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.283274Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:f9492c9b0c622f21ccf91a2523fdc3236b4c02f2cfa6b2635254b21d3dba03f0","observation_id":"201000fc-ad77-4f4e-bc67-e3e3d979dec3","resolution":{"observed_at":"2026-08-15T20:26:59.340085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.288057Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.288057Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5b267814a9bc49474282407d761072629caae1f74952c220540784472b3dfee4","observation_id":"3c262794-8a07-4f9e-bede-c27c41c66ddf","resolution":{"observed_at":"2026-08-15T20:26:58.288057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-15T20:26:58.292902Z","title":"arXiv preprint arXiv:2406.06525 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.292902Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:f190f2a6decd3ebe1fb8a79995bbc270ed4aa993fcf2abf544ed3924ed50bb5c","observation_id":"4c803fed-c3c5-4f6d-8871-30da9ed25ac7","resolution":{"observed_at":"2026-08-15T20:26:58.292902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.298120Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.298120Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:cc08357f5b93f526c3ec3997722e992fbc6f48876dbd0e9057ad7c52d4fc5c2c","observation_id":"e4632963-3123-4104-b269-d512bd4d163d","resolution":{"observed_at":"2026-08-15T20:26:58.298120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-15T20:26:58.303151Z","title":"arXiv preprint arXiv:2307.05222 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.303151Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:115dec75040eff817ede31e591efc2303dda35b181534b090ff868bb26783585","observation_id":"98a15ab1-62d7-4d53-9d89-e417288b8476","resolution":{"observed_at":"2026-08-15T20:26:58.303151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-15T20:26:58.308208Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.308208Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:dfdd77fe70c556dab8e1305c639ecca2180df360d8d0a61243caff189dd4e678","observation_id":"c29421bb-db06-4785-8940-54aa1b3a4209","resolution":{"observed_at":"2026-08-15T20:26:58.308208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.283295Z","title":"https://qwenlm.github.io/blog/qwen3/ (2025)","venue":null,"work_id":"6661c7f3-54b9-436d-b21a-cc817b90ba5f","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.313105Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e057fa4832c9db4e56acfb9ab1a8a2895b0510a1d1df853b0510208d5ba36ac5","observation_id":"66b03bf8-fcd7-4704-bded-6c384a40c4e6","resolution":{"observed_at":"2026-08-15T20:26:59.291607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-15T20:26:58.318304Z","title":"arXiv preprint arXiv:2412.14164 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.318304Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:ac7b4129c9e235cb8101b3a15bf1abf5775abb236de9e5e332fdf6eff2c6744e","observation_id":"24f5c3f4-324c-4a48-9a70-8ebbefc79636","resolution":{"observed_at":"2026-08-15T20:26:58.318304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-16T12:40:45.550358Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-15T20:26:58.325121Z","title":"arXiv preprint arXiv:2504.11455 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.325121Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:d7f5f3969fadf325f2bf11b69ff2a930099e0d89a05b28235405fb43656dea38","observation_id":"a73daabc-cea4-4e13-a09e-18dec93b933a","resolution":{"observed_at":"2026-08-15T20:26:58.325121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-15T20:26:58.330544Z","title":"arXiv preprint arXiv:2409.18869 (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.330544Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:3b5a65f9e786ae038ef17b7c55281c2a9d54fb856201f4596c55f01148976a22","observation_id":"3230d9c1-e31f-46e9-b892-1fe14743546a","resolution":{"observed_at":"2026-08-15T20:26:58.330544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T20:26:58.336002Z","title":"arXiv preprint arXiv:2203.11171 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.336002Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:283c9b7efa65e0b9dfb38c38e833c7cd78aab9f1815e18629c671412b94a4293","observation_id":"c4351010-997d-4a3b-badc-15655ea7642b","resolution":{"observed_at":"2026-08-15T20:26:58.336002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.341793Z","title":"Advances in neural information processing systems35, 24824–24837 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.341793Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:a3545819779e2231a7d05b973527e13906542355d416ff5fc7712c3c4145553e","observation_id":"5335c9a1-029e-479f-bd32-a2e70ac05448","resolution":{"observed_at":"2026-08-15T20:26:58.341793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-15T20:26:58.349765Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.349765Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:4526f06025d74e22ebe9cd431c9670cb5f29116fb872f97b3d11eccf5d89c0e0","observation_id":"8fd01c75-0378-4401-9204-80ee2baefb7c","resolution":{"observed_at":"2026-08-15T20:26:58.349765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-15T20:26:58.355229Z","title":"arXiv preprint arXiv:2409.11340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.355229Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:7bb2a7ac9163bd9d3e8803e59abad549cceb17d9c9ea02acce9f062d637b144b","observation_id":"be61ba36-fb07-4958-b08c-b7afd65ebeba","resolution":{"observed_at":"2026-08-15T20:26:58.355229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.361913Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.361913Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:34a6f6d8f97ed5f5776a88dddd749677e0810743a34aa93e449466143c654261","observation_id":"53886b6d-17f0-4ff6-9054-18d186fb1d29","resolution":{"observed_at":"2026-08-15T20:26:58.361913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.367010Z","title":"Advances in Neural Information Processing Systems37, 75329–75354 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.367010Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:7ca0ff5a8336dff0527d924fd7883f3148e05856a0a0ce59a9c8ec323987b658","observation_id":"ebd3e111-3b5e-4f16-a112-97f3ec83ebfa","resolution":{"observed_at":"2026-08-15T20:26:58.367010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-15T20:26:58.372378Z","title":"arXiv preprint arXiv:2501.18427 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.372378Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:2c801d4e68b318494af264fadccf8f984690201807f79597349e62beff846cfb","observation_id":"1e8245d0-d674-457d-bc56-822780fdfde5","resolution":{"observed_at":"2026-08-15T20:26:58.372378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-15T20:26:58.378298Z","title":"arXiv preprint arXiv:2408.12528 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.378298Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:a50bec4bda99b76cf3b9953920af5c78039756cdcc5b12c0814931081d047a4c","observation_id":"3b46e205-a7f2-4b77-bdad-2522772c0a0f","resolution":{"observed_at":"2026-08-15T20:26:58.378298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T20:26:58.383514Z","title":"arXiv preprint arXiv:2411.10440 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.383514Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:473443540de5060624417063eeabbb71f949617421290d2a3152493c54c4cd24","observation_id":"0d036f42-8e5b-4d3f-914f-31e1b6e806bf","resolution":{"observed_at":"2026-08-15T20:26:58.383514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.212237Z","title":"In: Forty-first International Conference on Machine Learning (2024)","venue":null,"work_id":"dfdea111-d44e-4cc6-a783-74b2cd5e92f3","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.389387Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5dea3169b7caca3ecd79fd1eb0475e5cd72b317310077a079f26f7f19c63b33e","observation_id":"caa0872c-e1fe-4ea6-a846-d49e2085b19a","resolution":{"observed_at":"2026-08-15T20:26:59.222106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-15T20:26:58.394455Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.394455Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:3a19723311aed4008d7515f3300d660ac0373a7181cf5cc5456e01803a4e65ea","observation_id":"f0d08762-d7eb-44f3-9d89-59bb95314e85","resolution":{"observed_at":"2026-08-15T20:26:58.394455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.399332Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.399332Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:25b5549e1ea9c2f1d56fc2736d1c46d0ab299363658216e8692bc5afa3ecdb27","observation_id":"343a32e8-aecf-439f-acaa-75b61d7c7461","resolution":{"observed_at":"2026-08-15T20:26:58.399332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-15T20:26:58.404285Z","title":"arXiv preprint arXiv:2408.11039 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.404285Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:77e4de704abe865047d754d742135ecb815a22dec251d3abf89c9d59ab9ca4d2","observation_id":"2da049e6-d79a-4250-93a2-0ed83facdd20","resolution":{"observed_at":"2026-08-15T20:26:58.404285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-14T19:11:11.139675Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-15T20:26:58.409542Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.409542Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:55b578aa6e8f964db1bf3bd4b6df1d4764a686f69552953ea24611d70cd2cd40","observation_id":"aafa572c-8539-4cdd-bbf2-ea8757a1f41e","resolution":{"observed_at":"2026-08-15T20:26:58.409542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 10 inbound Pith citation observations for arXiv:2505.13031."}