{"as_of":"2026-08-11T03:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b6bccf081fb2d20ce6e093b573bd40564ad6eeefab2335b85f62d9febf783d1","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:52:01.616287Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T19:16:59.955507Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T06:35:25.039112Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"cited_work":{"arxiv_id":"2508.06328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M2io-r1: An efficient rl-enhanced reasoning framework for multimodal retrieval augmented multimodal generation","venue":null,"work_id":"26e256c5-4bfc-4195-81a0-44aba1b3eb1d","year":2025},"citing_paper":{"arxiv_id":"2510.15253","last_updated":"2026-04-20T08:38:26Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-17T02:33:16Z","title":"Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T06:54:03.390655Z"},"links":{"cited_paper":"/paper/2508.06328","citing_paper":"/paper/2510.15253"},"observation_digest":"sha256:fcdb0a6e6eb7985742b20416e763cd9f631061b880b5c9e7ff3b0a3dd5d78689","observation_id":"cc3ca0e8-c802-4b2a-9e65-07955cd1081b","resolution":{"observed_at":"2026-05-18T06:56:01.645710Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"cited_work":{"arxiv_id":"2508.06328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M2io-r1: An efficient rl-enhanced reasoning framework for multimodal retrieval augmented multimodal generation","venue":null,"work_id":"26e256c5-4bfc-4195-81a0-44aba1b3eb1d","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2508.06328","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:e7bc00bf6f0ffdcadbc3f59fc5952927ff60a3903bf27c0cac77f30f95eb9e37","observation_id":"f270fd2d-939f-42c6-a40a-8b57046463b7","resolution":{"observed_at":"2026-05-14T21:19:28.145008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"cited_work":{"arxiv_id":"2508.06328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M2io-r1: An efficient rl-enhanced reasoning framework for multimodal retrieval augmented multimodal generation","venue":null,"work_id":"26e256c5-4bfc-4195-81a0-44aba1b3eb1d","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2508.06328","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:7eb25374c92148b0d6d5d186933a0d00e65b59fe3d7f7a1e2a15cc07ec0f9d9d","observation_id":"64129fbf-6736-4887-a77b-e32840390c34","resolution":{"observed_at":"2026-05-25T06:35:25.041496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06328","snapshot_observed_at":"2026-07-31T19:16:59.955507Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.955507Z"},"links":{"cited_paper":"/paper/2508.06328","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:325023228807aea285d7f78c0612b7bb1cdf9dfc314e3daf3e61625d05c30652","observation_id":"dc9f4070-00c3-4a44-b032-cd62d2a31c2c","resolution":{"observed_at":"2026-07-31T19:16:59.955507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06328/citation-record","integrity":"/paper/2508.06328/integrity","json":"/paper/2508.06328/citation-record.json","paper":"/paper/2508.06328"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:57.133148Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.133148Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:93701b0f34f486c9a0f69afff69fc0bccf913d86c228a58fd9d6e94a3fd77842","observation_id":"166b1b15-bce7-4b08-b04c-77e19154affe","resolution":{"observed_at":"2026-08-05T22:51:57.133148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:57.217304Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.217304Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:f3d32f1c79dfb17fcf940332e115c7988619c6f46fb84f3ff17c2746a3d1bc6e","observation_id":"96606c61-624b-4d0e-8331-a624f54b9026","resolution":{"observed_at":"2026-08-05T22:51:57.217304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.897567Z","title":null,"venue":null,"work_id":"bcd4a893-2549-40c2-a215-d7f55ad89358","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.323345Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:2b49773fe7cf63587570dc4d8ef76c9475d3f0ba9f1ee16f9fb30007f4c9951e","observation_id":"d3a37d28-db00-47d5-8f54-4fd3926b043f","resolution":{"observed_at":"2026-08-05T22:52:02.900461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:57.438967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.438967Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:54ce6ce5df6fb4132cddb4c65404cfe9efa820866a2ad322db17bcb525e0b432","observation_id":"467567bd-6f02-4fdb-bc3b-df1dee974e10","resolution":{"observed_at":"2026-08-05T22:51:57.438967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06503","last_updated":"2022-05-03T08:05:54Z","snapshot_observed_at":"2026-08-09T00:23:06.653395Z","submitted_at":"2022-01-17T16:28:12Z","title":"Analytic-DPM: an Analytic Estimate of the Optimal Reverse Variance in Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06503","snapshot_observed_at":"2026-08-05T22:51:57.520018Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.520018Z"},"links":{"cited_paper":"/paper/2201.06503","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:96cbc007a939e0b8c93e62b4909a6ddc4d5e93c7eb3d70e65ffbd98b8bb7bd0c","observation_id":"b14f8a55-743d-4ee0-acb7-819b710478c3","resolution":{"observed_at":"2026-08-05T22:51:57.520018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.880183Z","title":"T.; Filimonau, V.; and Sezerel, H","venue":null,"work_id":"3cb2cb99-06e1-4b30-9cbc-f69f8bdf5614","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.620873Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:76269e5c4925649adc57a46750c8c94a445b40d934f8edff9ccc8b6be6edf89e","observation_id":"c91ab4f5-5f8d-49f7-853f-7fbc2d770a94","resolution":{"observed_at":"2026-08-05T22:52:02.884488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17188","last_updated":"2025-03-24T16:16:20Z","snapshot_observed_at":"2026-08-09T12:17:08.167358Z","submitted_at":"2024-11-26T07:55:57Z","title":"Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17188","snapshot_observed_at":"2026-08-05T22:51:57.719785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.719785Z"},"links":{"cited_paper":"/paper/2411.17188","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:1e76c98eb2c3e60ab2737653554d752091aac7b11f130271fcd06ffb288cb7ec","observation_id":"dcb7f03e-bf8e-4b1e-83b3-8cd414883e77","resolution":{"observed_at":"2026-08-05T22:51:57.719785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T22:51:57.810661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.810661Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:2065f8a3ef711cba5efad9a4353a5e15840bafc5baa5beb561ce4adda82806a9","observation_id":"caf7efde-25ea-437e-86d4-0fa0df18c5d3","resolution":{"observed_at":"2026-08-05T22:51:57.810661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-06T23:46:49.824788Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-05T22:51:57.885770Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.885770Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:6dba61b2888eab172613f00157213b68513ff08ba72a597f6d0dcd0b82d0b7f4","observation_id":"da5c3d04-4564-4c39-afb4-15ddc1d0888a","resolution":{"observed_at":"2026-08-05T22:51:57.885770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-08-10T09:36:07.796908Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-05T22:51:57.967973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:57.967973Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:7b8932c7bf2049899471df4661196bccaef39dc4fa6f53959dbee35f5fcd264b","observation_id":"faa91e72-c3b3-467e-ba65-26e99784678e","resolution":{"observed_at":"2026-08-05T22:51:57.967973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09190","last_updated":"2019-07-22T09:01:35Z","snapshot_observed_at":"2026-08-10T10:11:04.408366Z","submitted_at":"2019-07-22T09:01:35Z","title":"ELI5: Long Form Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09190","snapshot_observed_at":"2026-08-05T22:51:58.064115Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.064115Z"},"links":{"cited_paper":"/paper/1907.09190","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:2d09b9247a101ac82523c9ee0816f920353a4016fed9d3fe09a39852c0010dbd","observation_id":"c03fce8e-0fea-4e1d-8e96-f84a198111e3","resolution":{"observed_at":"2026-08-05T22:51:58.064115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T22:51:58.156120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.156120Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:7340429b8a2ae08556fa81806060669fac05a7ec9d5e36d1f14c969780d0e380","observation_id":"572100eb-889d-4650-836c-6032f15332b4","resolution":{"observed_at":"2026-08-05T22:51:58.156120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-05T22:51:58.242804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.242804Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:27a3b4c41ec7d0d8452546eb8f4e41ecd37d215c26e5680cceed990cb88fe513","observation_id":"616b911f-e02e-4024-91be-5534d7cf19f0","resolution":{"observed_at":"2026-08-05T22:51:58.242804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T22:51:58.317099Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.317099Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:acacbf48e5735688af9e987547e19012d93242a8e127c16caad08c650756acac","observation_id":"09b3b646-a010-4f77-a453-2e648898a8c1","resolution":{"observed_at":"2026-08-05T22:51:58.317099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T22:51:58.411735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.411735Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:c05d247c97056f712c548ea80c91cc5c30a6e516f3fb0134147aca3f14c180ed","observation_id":"7eae0fd9-e545-4725-9f34-0e8fd2fc5256","resolution":{"observed_at":"2026-08-05T22:51:58.411735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T22:51:58.490185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.490185Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:bbce8bba2831a0d005f4c71da9957eca371990c48d4fcb7b6a5d76f31be7d8ed","observation_id":"346e2f7d-355e-4902-b41e-afeff6966ae4","resolution":{"observed_at":"2026-08-05T22:51:58.490185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:58.582325Z","title":"u ttler, H.; Lewis, M.; Yih, W.-t.; Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.582325Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:e6c151e62ffa771f26ed60d61089515152ca42bf52c3d181ffa9ad6b91085bdf","observation_id":"c9a97cae-d2bf-49d5-9ece-d0f944505a62","resolution":{"observed_at":"2026-08-05T22:51:58.582325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.864108Z","title":null,"venue":null,"work_id":"54d39469-13bf-4c2c-8b23-3f47f7dab7c7","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.703658Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:64eaa3b6bfa44b3ec38d46d395741e583d4810bddbadd8c45e0f051d12733f46","observation_id":"9be6ecbb-1bfd-4a52-8c86-dd88f9edcb11","resolution":{"observed_at":"2026-08-05T22:52:02.868009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:58.783466Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.783466Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:5ee9b9920171b84cdcc32bd6db08a12ec4b4a362e0dcaba9747df553177f4800","observation_id":"03782846-2ff0-4030-84db-e4f9231354b0","resolution":{"observed_at":"2026-08-05T22:51:58.783466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.848998Z","title":"J.; and Li, C","venue":null,"work_id":"1739af89-6998-46bd-8e40-6c036a145d85","year":2023},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.887884Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:c5957b47836d91c608653be11f10782cdb1bb3d2d6ef13a694ecf5f77e4cad6a","observation_id":"6973163b-00ad-4aa6-bc5c-1083c9e1d886","resolution":{"observed_at":"2026-08-05T22:52:02.851961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T22:51:58.986937Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.986937Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:37956759b4e6bee0491693071283d61d55b3ee16e8c7fe5f5c86ca608ff1ca9f","observation_id":"9a1e24f4-4d32-4e6b-a632-3a1e3806b222","resolution":{"observed_at":"2026-08-05T22:51:58.986937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16365","last_updated":"2025-05-23T14:05:39Z","snapshot_observed_at":"2026-08-03T03:27:56.520381Z","submitted_at":"2024-11-25T13:20:19Z","title":"Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16365","snapshot_observed_at":"2026-08-05T22:51:59.051526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.051526Z"},"links":{"cited_paper":"/paper/2411.16365","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:d91ce500b7b306335cab342a3b4b374611e3d25fa5c917fa22896db32d1ab554","observation_id":"cf54169f-3966-43aa-95db-44fe73531960","resolution":{"observed_at":"2026-08-05T22:51:59.051526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T22:51:59.142513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.142513Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:5aef4f3a57c941fbcd8a25d4955c6c3c9c4eb461d6b48e29b40a8ab7192878e5","observation_id":"7f2d4f58-ed45-42a5-8180-7b25e43619f3","resolution":{"observed_at":"2026-08-05T22:51:59.142513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.838578Z","title":null,"venue":null,"work_id":"32c0e085-b8e6-49b7-a854-56aa48b80f59","year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.235422Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:c419018d59f390e9ad20faa287a0fe19af981f98b28c5429ea7d5d9b8d5b8649","observation_id":"d465bd9d-077c-4574-970d-11975a6411b1","resolution":{"observed_at":"2026-08-05T22:52:02.841964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.828430Z","title":null,"venue":null,"work_id":"2463704f-1ff5-49ce-9b2d-7aa2a223d073","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.363390Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:d68d573d745a9ca08e57f6ea19217ae8ffa5456590d9ad7a4f72b176be33e712","observation_id":"bee83d83-1fdf-4744-a8ea-4f9649ebd7e6","resolution":{"observed_at":"2026-08-05T22:52:02.831807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:59.459017Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.459017Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:87419fe43bffbcde910b602cc60912a3c31a8c8152ae9d36840fa578e01e7530","observation_id":"61a90716-8cd3-46a1-b73a-944a5d80bc40","resolution":{"observed_at":"2026-08-05T22:51:59.459017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-05T22:51:59.554523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.554523Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:ebe6916c65036cd43a0a1a51e78f8aa6e7b6520f865b1eae16a743acca1b1b13","observation_id":"4924b283-8d2a-428c-a8be-b5ea6d75fad2","resolution":{"observed_at":"2026-08-05T22:51:59.554523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12564","last_updated":"2024-11-25T11:24:23Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:38:31Z","title":"FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion","version":2},"cited_work":{"arxiv_id":"2410.12564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12564","snapshot_observed_at":"2026-08-05T22:52:02.066677Z","title":"FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion","venue":"cs.CV","work_id":"b6405de4-9aa8-4bbb-b39e-35d1e60181eb","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.668187Z"},"links":{"cited_paper":"/paper/2410.12564","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:d1b7be9a0191447574dc9c2bb6a69e629798618b418f82122ede69ebe082e58b","observation_id":"cdc89f25-d642-4d3d-8150-92b184212eaa","resolution":{"observed_at":"2026-08-05T22:52:02.172865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T22:51:59.728509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.728509Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:9c957450c12d3fc386a90ccdd0504c3a1f25a9adeb9c64f60bc15d7de521e20a","observation_id":"28806e4b-3ca9-4bd7-82e0-f5c5a351205e","resolution":{"observed_at":"2026-08-05T22:51:59.728509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T22:51:59.876133Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.876133Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:1d15349e4696a7336e0b562e7493bde04f902671b0b8488426ff92396160ed3b","observation_id":"9a197448-9943-4fb1-8ebe-951f76a7ac78","resolution":{"observed_at":"2026-08-05T22:51:59.876133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:51:59.968260Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.968260Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:adabeb8bbc64072d80aaa53d2a7eb1900c5dc98f172021655ca1409ab5fc0617","observation_id":"f600502f-997c-4322-9653-407c2e0d7a1a","resolution":{"observed_at":"2026-08-05T22:51:59.968260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T22:52:00.071755Z","title":"M.; Hauth, A.; Millican, K.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.071755Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:5e9a08018abf469fcfbff27e5507514ddbbcaf29d3453048fe984fb918c11a6e","observation_id":"564215f0-24f1-4d8b-ae9a-5d280df432bf","resolution":{"observed_at":"2026-08-05T22:52:00.071755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T22:52:00.146385Z","title":"I.; Burnell, R.; Bai, L.; Gulati, A.; Tanzer, G.; Vincent, D.; Pan, Z.; Wang, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.146385Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:41b711ce863339036ba042eccfe45bc2154d2de2f66619984d4afd967fb58701","observation_id":"467e1dc4-cee7-4b30-b784-3c6089a9c832","resolution":{"observed_at":"2026-08-05T22:52:00.146385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-08-10T06:38:09.395526Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-05T22:52:00.252799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.252799Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:a7176b82fe4b30eeacea93906fa3cc45d9919ecec28a5ebd2c3d012ecf67b9bf","observation_id":"14846974-58bb-4205-a8e3-e899a064fda3","resolution":{"observed_at":"2026-08-05T22:52:00.252799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.805200Z","title":null,"venue":null,"work_id":"8b441c71-2a76-4740-a172-a33153cb2ac0","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.353775Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:1e8027f3d13889d46d7b2ec7e21308ae2732ed9b607c3b5372e0fd008314beb0","observation_id":"20ccb67d-2680-4046-880c-4dfc0e08e5cf","resolution":{"observed_at":"2026-08-05T22:52:02.808493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-05T22:52:00.547279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.547279Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:6fbd8ceb5676b91936a7260f147e34432bd6721732958fdd7c33c41b695bdc0e","observation_id":"bf6bdab8-5b24-4a69-9e98-363b25af0fbb","resolution":{"observed_at":"2026-08-05T22:52:00.547279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.794325Z","title":null,"venue":null,"work_id":"aa726094-92ac-49ab-97f8-3adb95a0e358","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.684613Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:460b77e1b5ad918db7df6bb6f1165c8b37098c74d611b10efcaba36fd88dccab","observation_id":"1e74e463-6935-44ff-b896-b3cfd28d9ef7","resolution":{"observed_at":"2026-08-05T22:52:02.798169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.656541Z","title":null,"venue":null,"work_id":"a54fe552-bf5b-4e58-a197-248527e8cdf2","year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.804730Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:ded2965c4aa0ba0ed31fdf28380dd54a7aa197e2e8e1236431d87e602a42bf89","observation_id":"eb647160-ad73-4e43-ae48-b938b06a9552","resolution":{"observed_at":"2026-08-05T22:52:02.778630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-05T22:52:00.905160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.905160Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:8395cbbce1663f5c6f36e1dbc05c06f8a5818584e6abb2d31404d5bb6c292bb2","observation_id":"f167b77c-f0d0-418a-ab97-cdfbd338ad22","resolution":{"observed_at":"2026-08-05T22:52:00.905160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-05T22:52:00.999313Z","title":"Q.; and Artzi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.999313Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:52dccd539fa7b4342300bf263ebebf1dc6eccd10cbdfc14099074eb3e700ebc2","observation_id":"dc6b6f67-b604-4400-912f-224baa040300","resolution":{"observed_at":"2026-08-05T22:52:00.999313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19473","last_updated":"2024-06-21T08:26:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:59:01Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19473","snapshot_observed_at":"2026-08-05T22:52:01.107830Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.107830Z"},"links":{"cited_paper":"/paper/2402.19473","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:c18417f98fcb8e43bed5b659c57745e88c07e1177db7ae77b2b29f354f416d3e","observation_id":"864d56bd-ae0e-4ba8-8b6a-b60e8ff9ab74","resolution":{"observed_at":"2026-08-05T22:52:01.107830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:02.484498Z","title":null,"venue":null,"work_id":"a89f2910-3b40-4467-9c79-91cc046c883c","year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.209418Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:f3a1d4479882eaffde76dc5c266b5adcd455b35120d23cab2cbd693cbd2a81e0","observation_id":"013ad6ff-77eb-4701-a287-560cce633b84","resolution":{"observed_at":"2026-08-05T22:52:02.526532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:52:01.353449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.353449Z"},"links":{"citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:0d7516359d80803259f0503e2dfeb4e96d7e45f07a8dbc6e98d0495024fe05be","observation_id":"8970a8ec-9a02-4dcf-8d6a-83c759210c2c","resolution":{"observed_at":"2026-08-05T22:52:01.353449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-07T15:57:57.813561Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-05T22:52:01.416627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.416627Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:2812ca67bac2c427adcfb037539e64f16af771a851db23954ba39cc71dfe624c","observation_id":"576b3a59-825f-4fce-aa03-24bd15a8a85a","resolution":{"observed_at":"2026-08-05T22:52:01.416627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-05T22:52:01.500298Z","title":"J.; Lian, D.; and Xiong, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.500298Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:a699915b23f1e9b34ad04c57937b320efcbcbfebf81e1a3099419af782bac089","observation_id":"9d88d211-7d25-4bd4-9218-0753f25b0e33","resolution":{"observed_at":"2026-08-05T22:52:01.500298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08521","last_updated":"2025-02-07T00:09:43Z","snapshot_observed_at":"2026-07-06T19:01:23.623544Z","submitted_at":"2024-08-16T04:32:10Z","title":"MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering","version":2},"cited_work":{"arxiv_id":"2408.08521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08521","snapshot_observed_at":"2026-08-05T22:52:01.715821Z","title":"MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering","venue":"cs.IR","work_id":"8c04f44e-96cd-41b9-a988-f4860b9eaf5b","year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:01.616287Z"},"links":{"cited_paper":"/paper/2408.08521","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:8871e8631406f5ce3e1466a791bc09e0913916befaafd107c3bb5cb92107c1c4","observation_id":"2ffa5a0d-2af0-48f4-b036-b2e407ed0633","resolution":{"observed_at":"2026-08-05T22:52:01.849099Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 4 inbound Pith citation observations for arXiv:2508.06328."}