{"as_of":"2026-08-14T12:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea740af1268bc85ccf25aaa650f57d89e34dd606e93d6b714b3425e33fa8c317","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:36:01.084911Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07581/citation-record","integrity":"/paper/2608.07581/integrity","json":"/paper/2608.07581/citation-record.json","paper":"/paper/2608.07581"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T00:36:00.968747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.968747Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:2735c015b792c05f818c1497a3535e85c614aec114217b92e6683838f3171cd6","observation_id":"bcc858e9-2c85-480e-b2b0-86ffc1b3ffec","resolution":{"observed_at":"2026-08-11T00:36:00.968747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.554488Z","title":null,"venue":null,"work_id":"57111ebc-b3c2-440c-b8fb-4078f5cca2ec","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.972707Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:95215c62093a4ed215e68384b35f5c87b441fd83cc1bd1982aab2ece6a51a3e1","observation_id":"dfd166a4-ba88-4690-96f9-c1abb37e5db3","resolution":{"observed_at":"2026-08-11T00:36:01.557255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T00:36:00.975962Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.975962Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:2d51229b791fa083b4114fc11a12c586b4c7bf4c537c1834e7a312e766a3c3c0","observation_id":"afdffb96-1086-4ee0-ac21-d9691563c3d1","resolution":{"observed_at":"2026-08-11T00:36:00.975962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-11T00:36:00.979284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.979284Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:64abf54d7ff8b4f3849fab89da057784b084d4df05b2b92c2ad37247aa692d28","observation_id":"42ebee1d-af1e-4d55-962d-4173f2797270","resolution":{"observed_at":"2026-08-11T00:36:00.979284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-11T00:36:00.982550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.982550Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:14ff4f4334379128af0d7a9f27891b19cc05daff85d16c9fdb31f44e7db2c525","observation_id":"b48126ed-e5b0-4c55-9e1c-282650858c1e","resolution":{"observed_at":"2026-08-11T00:36:00.982550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-11T00:36:00.985579Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.985579Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:cfbd22135549d641003702fc98b3c875d6dad87c75656b71cb007e0465910aab","observation_id":"253aa727-6c76-42a7-95bc-4e52d27df8c3","resolution":{"observed_at":"2026-08-11T00:36:00.985579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:00.989085Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.989085Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:30ce811491918845907897c13ee6ca08ab9f4d6def2c171f16cb47b66ddf05c9","observation_id":"f7d123c6-4c8c-45ee-a00a-f1511d78138a","resolution":{"observed_at":"2026-08-11T00:36:00.989085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12800","last_updated":"2025-08-29T10:05:13Z","snapshot_observed_at":"2026-08-13T07:34:29.888681Z","submitted_at":"2025-08-18T10:23:10Z","title":"Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12800","snapshot_observed_at":"2026-08-11T00:36:00.994456Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.994456Z"},"links":{"cited_paper":"/paper/2508.12800","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:68eea5cd4b0f28bd8c82a4705ca9920acaf0e0e3a08a210e2468651027e02ac9","observation_id":"267c2edd-0536-43d5-abcb-1d548312f3af","resolution":{"observed_at":"2026-08-11T00:36:00.994456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.542503Z","title":null,"venue":null,"work_id":"a028ccf2-77ec-457b-8e61-fa222dcc9e67","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.997566Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:f0908e9c5f63a11257840f9d9648453eaced9126ec0ff8f70c9bfd2d02ce69aa","observation_id":"f6e568da-3383-4219-aed2-934e79408e10","resolution":{"observed_at":"2026-08-11T00:36:01.545458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.534628Z","title":null,"venue":null,"work_id":"31bc3661-7bab-4df7-8b99-79b7c891d06f","year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.000236Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:712b1c5754a9d23a13ef56bf965c0c557af33e1a8bbdfefa1cfce08a40f0c61a","observation_id":"4a4c56c3-cc2e-4222-986b-f8c8e49df15d","resolution":{"observed_at":"2026-08-11T00:36:01.537651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T00:36:01.003086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.003086Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:61e8ad27061c14ef8c2f27c27095cf350585e485a830f287f7951477b67a7bb0","observation_id":"113237e0-7488-4f53-ba33-eab608327b9f","resolution":{"observed_at":"2026-08-11T00:36:01.003086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.526814Z","title":null,"venue":null,"work_id":"6cd1af75-b4b1-42c9-8cfe-0bd9ec53184f","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.005837Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:9e1133fa76a7cecb636b310f37e4590e4063724b815c62702cd6c9da552ebbdc","observation_id":"97492cea-090f-4037-a82d-ea53535adefd","resolution":{"observed_at":"2026-08-11T00:36:01.529428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-11T00:36:01.008576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.008576Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:ae0fd0f67c2086b309c777e3212e4ef6704e8bfeb7f87edd47e2c8b7cc326137","observation_id":"23605e2c-8ddd-4081-9b79-0d8fc15a111f","resolution":{"observed_at":"2026-08-11T00:36:01.008576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-11T00:36:01.011369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.011369Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:159c3730a7cee083df5e6e3f1f6ee2e37196ab1fb78d516f24f0fd5f5a629d9a","observation_id":"b7060bc9-2abc-4d04-9b92-81cc05cc0c4a","resolution":{"observed_at":"2026-08-11T00:36:01.011369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.519006Z","title":null,"venue":null,"work_id":"affd0aa2-d7bc-4bba-a253-f1baa451d654","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.014447Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a070c8b11d18b767038c02940c20dc39cfb50fcc82922b147ae4ff222736ca10","observation_id":"aaad2af5-b7df-4a2a-bb56-63acccfec38b","resolution":{"observed_at":"2026-08-11T00:36:01.521879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-08-11T21:54:58.560841Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-08-11T00:36:01.017092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.017092Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:b79b75356a87828ae182906b60c9a764be2661e62412d4072c469aad3b34e7b6","observation_id":"3c826a07-a80f-46a4-b267-3abea1d0865e","resolution":{"observed_at":"2026-08-11T00:36:01.017092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.019846Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.019846Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:646287bd9d44b847657d4cdc13d25f68a264b9404b0398ec0d4d165ad072aa57","observation_id":"e9d5b877-3a00-45f1-be99-124b6b875cb9","resolution":{"observed_at":"2026-08-11T00:36:01.019846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T00:36:01.022292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.022292Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:864ac48920f3d141673585e496f11b53e70e0607047348ff1e4c3d9ba5c10288","observation_id":"ba49155b-49b8-4ecf-87a5-ee1ca0475d31","resolution":{"observed_at":"2026-08-11T00:36:01.022292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-11T00:36:01.025134Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.025134Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:634e8c71258dbdbd546505c1d7f0842db57517874cfb462d9dc78605665fb22c","observation_id":"09a0a754-b403-4527-be31-829b8138caa7","resolution":{"observed_at":"2026-08-11T00:36:01.025134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.510334Z","title":null,"venue":null,"work_id":"f767414d-038f-4144-874d-c1edb02d91de","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.028118Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:f6fc389b361945cad45624b616ce4b909a2b222d578208ae36fbabea18193ccf","observation_id":"21633ddb-1b6a-4adc-bebf-3f93f69a07f2","resolution":{"observed_at":"2026-08-11T00:36:01.513081Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T00:36:01.030834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.030834Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:ef95096d574f2ba85bb97cc30fe6f02da2888e73e266ed8858cf0713920c5397","observation_id":"8b4c6a54-e0d3-4daa-86c6-0a10897c94ef","resolution":{"observed_at":"2026-08-11T00:36:01.030834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-11T00:36:01.033818Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.033818Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:7b25bf816bd0c9bd845d3f7c85d73b6f1286dc87fbb1adc63e7d919af92364c4","observation_id":"dd4ccb93-5a99-4f34-81cd-c8dca86021e4","resolution":{"observed_at":"2026-08-11T00:36:01.033818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16947","last_updated":"2026-07-18T20:03:50Z","snapshot_observed_at":"2026-08-14T06:10:57.443513Z","submitted_at":"2026-07-18T20:03:50Z","title":"When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2607.16947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.16947","snapshot_observed_at":"2026-08-11T00:36:01.306938Z","title":"When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation","venue":"cs.CV","work_id":"23ff471d-39f3-4e7e-8deb-11acbc84bd06","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.036574Z"},"links":{"cited_paper":"/paper/2607.16947","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:0e149f7c67d855f8475ff7074ad4e235bdbe584e2de3992e8f97db478129dd1c","observation_id":"1fd55159-d00a-4060-885b-2c879ece720d","resolution":{"observed_at":"2026-08-11T00:36:01.312293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-11T00:36:01.039435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.039435Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:c49c736f73e8c5f99b0e4fce4c7e48a6b4f7242de0b64d0548bdf282548ac838","observation_id":"bf870af3-7ec5-4309-bf4f-d650250b6261","resolution":{"observed_at":"2026-08-11T00:36:01.039435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.502512Z","title":null,"venue":null,"work_id":"0b04be7a-39d3-4394-ab82-a249beb2bb5d","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.042321Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a8ba93dc8220f84ba518b643188f4cb0a64476dcc57c94344a610acfc8872e5b","observation_id":"d30159e5-8b9e-49f6-b35e-03a37328e9b4","resolution":{"observed_at":"2026-08-11T00:36:01.505262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.494783Z","title":null,"venue":null,"work_id":"b3754124-c241-4a03-9104-831c7fc1388e","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.044931Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:f69f2ee0bd17d195e368aa211f261f05c1deb2a22a678a30fb838f01229a6c65","observation_id":"37162f79-8e37-45d3-90bc-e8e0baec79db","resolution":{"observed_at":"2026-08-11T00:36:01.497435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-11T00:36:01.047616Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.047616Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e6100bb8c848e59cf29b15511fcdeebb96b008fed50856ca161a6054e157ee1b","observation_id":"dd410201-fb9e-493f-82c3-dd805918cdae","resolution":{"observed_at":"2026-08-11T00:36:01.047616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.050562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.050562Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:870ed1c0a16e0f2205a6f4dc3bbfe7ccfc944ff46901af0c100d599049d452c2","observation_id":"6b83e7a8-4513-484c-9150-04db192292b0","resolution":{"observed_at":"2026-08-11T00:36:01.050562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-12T13:11:38.446061Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-11T00:36:01.053166Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.053166Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:ad46183df4aea7a2d627602bbc15be7f739c54fa5aa64ab0fbbe39ff73601f12","observation_id":"21dea8d1-a349-4d73-afc9-6085a711eb7e","resolution":{"observed_at":"2026-08-11T00:36:01.053166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-11T00:36:01.056098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.056098Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:25e7bdbe4f184f1a43a0d017b4883d90a728155dad2cb4213e58e2bc6bc4a8b8","observation_id":"8403012f-6a3b-44ed-aa5b-92cdd066c3d7","resolution":{"observed_at":"2026-08-11T00:36:01.056098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.058958Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.058958Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:0b11966f11e32b211f9b77ddfa97d21af69cc14564c26594309ad60f03fb754e","observation_id":"4cbd1c43-68bd-457b-9c40-68ad9b565561","resolution":{"observed_at":"2026-08-11T00:36:01.058958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-14T06:35:02.186457Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-11T00:36:01.061794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.061794Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:ec2e9be7eedf6248c129c6c188321bffc6d24f6f53f02badaab8daaeaf3b7f62","observation_id":"7c5df10b-470b-4ac5-98be-8c1270150d93","resolution":{"observed_at":"2026-08-11T00:36:01.061794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-11T00:36:01.064518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.064518Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:072cd7415a05f2ffdfa62a4066215cfe76a16718444a74b84d1099dde811fae2","observation_id":"74ec1b88-93e0-49d3-af6a-f1c2b3b09c3a","resolution":{"observed_at":"2026-08-11T00:36:01.064518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-11T00:36:01.067584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.067584Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:9f8867810e5f032d9f80983a64530ebb7d9ed599302ad2346902ef98059283d4","observation_id":"3f1e23d8-8ba2-4c1b-8af7-a4fded0586a9","resolution":{"observed_at":"2026-08-11T00:36:01.067584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.482783Z","title":null,"venue":null,"work_id":"bc619c6f-f525-4a50-9b2f-01e28be81d65","year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.070552Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:f96879cc1eecf644d2351743526d6a1711161377b02eded6261e72df9518e648","observation_id":"4032bd1c-5083-46a1-a163-72ec5eaf19d6","resolution":{"observed_at":"2026-08-11T00:36:01.485564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.073147Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.073147Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:3089ce6601d002e8f64b11c993cd44e9b66425124441bc508acf68a1ca2a0e3a","observation_id":"abf73bd4-8eb0-4be9-bdda-dc5ad1175fe1","resolution":{"observed_at":"2026-08-11T00:36:01.073147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T00:36:01.079000Z","title":"Zhihong Shao, Peiyi Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.079000Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:c81d0943892fcc7387c752756405784f8c37e6509341e3e19db41e04da7adf13","observation_id":"170634ff-68b2-45db-8775-ec9d71c43d34","resolution":{"observed_at":"2026-08-11T00:36:01.079000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-11T00:36:01.075961Z","title":"arXiv:2507.18071 [cs.LG] https: //arxiv.org/abs/2507.18071","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.075961Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:958da0358af4aade819d53cfe0fb54a3efb36abab8bef41ba04d41894e308288","observation_id":"9d5a108e-0298-4566-8b53-50a1771d1f31","resolution":{"observed_at":"2026-08-11T00:36:01.075961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.084911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.084911Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:c27c83a5219844484af72433fe222bfe6c6b39186c7ac762b8c0894491ad480d","observation_id":"f6ac86ed-8a9f-4448-be1f-c4ba65ce1736","resolution":{"observed_at":"2026-08-11T00:36:01.084911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-11T00:36:01.081871Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.081871Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:59e1d1f6b6f1431851b1269faa4401429ca52dca03629012e0a180cbe268384e","observation_id":"9b9b55b2-539a-4808-97f4-9198ae0094d1","resolution":{"observed_at":"2026-08-11T00:36:01.081871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-11T00:36:00.991604Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.991604Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:130183f0dc320059c70d1031f7c1d0b2d4cb2aa1134904cf57b559f79ab8ad5f","observation_id":"6179ed9e-bd58-467e-a60d-6adb24ec082f","resolution":{"observed_at":"2026-08-11T00:36:00.991604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:19:21.724745Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.07581."}