{"as_of":"2026-08-20T02:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33de1f561791dafdbea72161844f08775f176c910ebc13fdfa4af28f80c2a470","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:38:46.508251Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:14.896841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T19:21:48.411112Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:36:14.896841Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-17T10:14:59.808826Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.896841Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:01baa8eb6d25edbd63a99644b8019327ed10d2022fdcca757aaa3da2b32b83c0","observation_id":"ccc0b7ab-2e2b-4db4-ad07-1df3b15e635b","resolution":{"observed_at":"2026-08-06T22:36:14.896841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:29:27.988706Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-14T21:07:06.019881Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.988706Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:6e2f05aab7fce9c490dbaa1e8a21ed492c6c1fe41427577ac64ec3fb5b3eac22","observation_id":"5fdd68c9-9932-4818-b4ee-3ff99ee3e845","resolution":{"observed_at":"2026-08-06T22:29:27.988706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.12432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning","venue":null,"work_id":"2a3dd2aa-c693-4f6f-ab65-a1f34176f4fa","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":241,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:787c45e2a9c84134dea7c28c6f353e5a7c039197349759800632021254bc953a","observation_id":"21d7b7ee-9adf-4259-bc08-f4f631342e59","resolution":{"observed_at":"2026-05-18T19:21:48.413537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-02T20:19:13.888889Z","title":"arXiv preprint arXiv:2505.12432 (2025) 4 16 Authors Suppressed Due to Excessive Length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-13T16:04:59.151622Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:19:13.888889Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2602.23615"},"observation_digest":"sha256:ec00c8da53b0b3818ccbb2d2a97a85b04bf89037b45bcc5a6434e198099d0f30","observation_id":"083c6a0b-ebfc-4fbd-8cd4-7ace85e552bb","resolution":{"observed_at":"2026-08-02T20:19:13.888889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-01T18:40:13.534500Z","title":"Zirun Guo, Minjie Hong, and Tao Jin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17243","last_updated":"2026-07-19T13:24:40Z","snapshot_observed_at":"2026-08-17T19:10:55.924823Z","submitted_at":"2026-07-19T13:24:40Z","title":"LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:40:13.534500Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2607.17243"},"observation_digest":"sha256:12d5c697f955748d5136cfe8ce31ceb0d13a09f2ad617b7d04cbfcd3858a1a9c","observation_id":"77d9b4ec-6780-4bfe-96a7-700501be8b6b","resolution":{"observed_at":"2026-08-01T18:40:13.534500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12432/citation-record","integrity":"/paper/2505.12432/integrity","json":"/paper/2505.12432/citation-record.json","paper":"/paper/2505.12432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T20:38:45.857977Z","title":"Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie, Dale Schuurmans, Quoc V Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:45.857977Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:45583335f2c0b36a9575475db1f710662fd4af94851f25200b9611e2af199114","observation_id":"a505e807-a861-4c0b-98d9-8e1720f2b6fc","resolution":{"observed_at":"2026-08-15T20:38:45.857977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-08-18T16:01:12.797308Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-15T20:38:45.863816Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:45.863816Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:a00ee08a3ff29bc8fb4c7e8d0aef44fb0df62ee87e8092fbf4319f3f57634bab","observation_id":"1da66c8c-df16-4f25-9390-592bbbca1659","resolution":{"observed_at":"2026-08-15T20:38:45.863816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-15T20:38:46.003693Z","title":"Vision- r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.003693Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:08218eba28ad9eb483e34992c992eef26cf4563a89c311a1d2381d7f32b411f3","observation_id":"78eb0315-3194-4bc4-a610-f33084568247","resolution":{"observed_at":"2026-08-15T20:38:46.003693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:38:46.053819Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.053819Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:19a330d573d5e1d9a8c7a54b9e4336b4c472323e0a66f9363ea75eb45065fc4b","observation_id":"01ce5095-d6a1-4c50-abb3-1c032426e652","resolution":{"observed_at":"2026-08-15T20:38:46.053819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05138","last_updated":"2024-02-06T19:16:55Z","snapshot_observed_at":"2026-08-17T14:43:36.795661Z","submitted_at":"2024-02-06T19:16:55Z","title":"SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05138","snapshot_observed_at":"2026-08-15T20:38:46.058897Z","title":"Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.058897Z"},"links":{"cited_paper":"/paper/2402.05138","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:58b456c9b734f24775702c1f25fc8d9aabe1000b940e1b878ff950177e84dfdd","observation_id":"3de2749a-c9ef-48ca-8a11-c16cdaf572ac","resolution":{"observed_at":"2026-08-15T20:38:46.058897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-15T20:38:46.063233Z","title":"Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Botian Shi, Wenhai Wang, Junjun He, Kaipeng Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.063233Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:e2cc985b3a5848d5f41b0f6bcb497dd25dcb203a312cc7fc42e55fbf0546bb4b","observation_id":"fd9a489e-3d24-478e-8cbe-8ca7ff4f0224","resolution":{"observed_at":"2026-08-15T20:38:46.063233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T20:38:46.067524Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.067524Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:603eead53ddc37f76ec5a3700742fb52f39fb71a45ebfff8e512c5b2a8ee3ef7","observation_id":"d3a6211f-9b00-45ea-92a2-ad3aadac7c63","resolution":{"observed_at":"2026-08-15T20:38:46.067524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T20:38:46.071775Z","title":"Yingzhe Peng, Gongrui Zhang, Miaosen Zhang, Zhiyuan You, Jie Liu, Qipeng Zhu, Kai Yang, Xingzhong Xu, Xin Geng, and Xu Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.071775Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:96af26c5cf8d18e4f69f28e7ccb2ce23d50aa8f6113d1442ec72ad8e50076d35","observation_id":"735177b5-6545-4778-bf20-2bc984e92764","resolution":{"observed_at":"2026-08-15T20:38:46.071775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-15T20:38:46.169738Z","title":"John Schulman, Sergey Levine, Pieter Abbeel, Michael Jordan, and Philipp Moritz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.169738Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:1b05b09af7255875cfae3565e0cfea4153179bdd691ecaae056782223605494f","observation_id":"24df8388-fb31-43b5-8374-2447c667c5d1","resolution":{"observed_at":"2026-08-15T20:38:46.169738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:38:46.260365Z","title":"Dast: Difficulty-adaptive slow-thinking for large reasoning models.arXiv preprint arXiv:2503.04472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.260365Z"},"links":{"citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:6e1c2723dc99242af5c2360bb768ffed9a2a0eb9954ac9c69c257c7e78d47bff","observation_id":"673daf41-b42f-45df-bc96-62a88921f2fc","resolution":{"observed_at":"2026-08-15T20:38:46.260365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-16T13:39:53.511689Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-15T20:38:46.265254Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models.arXiv preprint arXiv:2406.17294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.265254Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:94244a6ce3f33074752094ba40c2d70a011ba0f2dc95923b9745fc7e9fe18534","observation_id":"6b05100e-6e67-42f7-bccf-94e02c4e7266","resolution":{"observed_at":"2026-08-15T20:38:46.265254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-16T12:59:16.590181Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-15T20:38:46.270585Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.270585Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:af0e606307403b3fb6d7f0ad96b65464fd3f3af453d6ad7a1622b05a624169a4","observation_id":"e115d9fa-dfea-44cb-baf5-0a547975168d","resolution":{"observed_at":"2026-08-15T20:38:46.270585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T20:38:46.274359Z","title":"net/forum?id=QWTCcxMpPA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.274359Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:74af320a978c611fcda513e0619e25f02918af24b88af5fa1f32c55343b5f968","observation_id":"7f599363-13ac-4945-8cbc-1c801bfcf3c3","resolution":{"observed_at":"2026-08-15T20:38:46.274359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T20:38:46.329461Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.329461Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:edba307bdfce18baf67b2ddf2cceddb9dc059371f3079f55e6f707a6be7be449","observation_id":"a6ed0821-378e-4180-a4dd-925e76b47924","resolution":{"observed_at":"2026-08-15T20:38:46.329461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-15T20:38:46.333604Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.333604Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:37be0af41a155a0d1a2fda258f03ceec2063f9aa7ba412e9cc7c1aac9c4eaef2","observation_id":"db346497-f6f2-465a-b9db-98e7eb84f9c7","resolution":{"observed_at":"2026-08-15T20:38:46.333604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:38:46.337631Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.337631Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:c1ba2a012d4a5598c082dedd79a494f57e93cbaede84475710d43a96a674e104","observation_id":"1ba20f66-acb9-4b26-9a8d-c9b26048fe75","resolution":{"observed_at":"2026-08-15T20:38:46.337631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-15T20:38:46.342233Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.342233Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:1c235aa4d385c298b48cca37bed7ae52e28785fb1d04298cf6e2ede8533ef5fb","observation_id":"51e63674-0375-40a4-ac0e-fe2c5a6716fe","resolution":{"observed_at":"2026-08-15T20:38:46.342233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-15T20:38:46.438147Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?arXiv preprint arXiv:2403.14624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.438147Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:a38158742efb97348e4b6aa89a09785d6fd2415d591c4bd29930b12e9624dd26","observation_id":"ba12231c-599e-4856-8da1-a59661153281","resolution":{"observed_at":"2026-08-15T20:38:46.438147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T20:38:46.508251Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.508251Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:cac3d4f0297b6933e1292588ccdf24d5902c30ec2ff2c4b16fd70c2ccd0edc1d","observation_id":"d8ece693-0bbd-448a-8bda-e65ecbde9a7d","resolution":{"observed_at":"2026-08-15T20:38:46.508251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:38:46.252382Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.252382Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:e04032b55e1f2315edfb496de42f496e8a952e3956428010e937dd0767be2c10","observation_id":"6514ab55-bde0-4c99-8342-b8488a7798b1","resolution":{"observed_at":"2026-08-15T20:38:46.252382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:38:46.256869Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.256869Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:1af02be569fe9b4500b7b13c41d104dd16ecbd4cc6cd16037bbb9cb862d18f17","observation_id":"1b8bf07e-fdf7-4fd9-84f2-e45c3aaa964f","resolution":{"observed_at":"2026-08-15T20:38:46.256869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-15T20:38:46.324995Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2502.14768,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:46.324995Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:93a27d30aa618fb6c5c3e9cfc785723d4bbab308c337ddb8138086ce8e6ce947","observation_id":"12cb828b-d076-4d14-a2f5-f8e6f59452d9","resolution":{"observed_at":"2026-08-15T20:38:46.324995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:38:45.868304Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:45.868304Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:d7f49039d8c62c711041584d7f88fdcf036777c29c07984c73521abc881f51a5","observation_id":"5b74eb5e-bf75-46a1-9f50-7334544e6f31","resolution":{"observed_at":"2026-08-15T20:38:45.868304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14702","last_updated":"2026-05-10T19:30:43Z","snapshot_observed_at":"2026-08-19T19:02:34.472298Z","submitted_at":"2024-10-06T20:35:41Z","title":"Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14702","snapshot_observed_at":"2026-08-15T20:38:45.873197Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:45.873197Z"},"links":{"cited_paper":"/paper/2410.14702","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:8f5e46626b93ba0dbf50637df7e73fc16a5a29351d42627abc5dcd8fe8da97bf","observation_id":"9ed0cbac-6ab7-47ad-802e-2f06fb49c99c","resolution":{"observed_at":"2026-08-15T20:38:45.873197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:38:45.735671Z","title":"Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:45.735671Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.12432"},"observation_digest":"sha256:90aa90ed42ae936e1e0c65231a6145f5adbdecb9766dc071f18708410e912e61","observation_id":"b59c9d22-f03f-4e1d-bcb0-92607a77b814","resolution":{"observed_at":"2026-08-15T20:38:45.735671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T16:50:55.970519Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2505.12432."}