{"as_of":"2026-08-07T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:757c8a06c79109d558965138981e9e405ba86c77b44ef6d68f10d7d25aba6e58","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T05:11:54.685897Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:15:57.618864Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:64d6854a1da21f20cd33870401229f2b0d55e67384d9306b100ade92888226ba","observation_id":"e7d8987a-1e34-4486-b289-3db04d99566c","resolution":{"observed_at":"2026-05-18T19:21:48.458569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-04T08:15:57.618864Z","title":"Perception-aware policy optimization for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-04T08:15:30.884838Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:57.618864Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:55ac3bf1480bba5bb5e7cfe5b9729a0a17d0fff71a41443886733ca224fd439c","observation_id":"f9dc0cc6-1063-4e4d-b0e1-a2eb60bb9f4b","resolution":{"observed_at":"2026-08-04T08:15:57.618864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-03T13:07:43.215122Z","title":"Perception-aware pol- icy optimization for multimodal reasoning.arXiv preprint arXiv:2507.06448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00501","last_updated":"2026-05-26T22:35:38Z","snapshot_observed_at":"2026-08-03T16:22:18.153593Z","submitted_at":"2026-01-01T22:48:26Z","title":"CPPO: Contrastive Perception Policy Optimization for VLM Agents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:07:43.215122Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2601.00501"},"observation_digest":"sha256:965da107b7b6858ca71c0c8148ed8fbcadaf899e14505116b6694caf37e340fc","observation_id":"dc5aac8f-1b8b-458b-abec-5753b23ccdd4","resolution":{"observed_at":"2026-08-03T13:07:43.215122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-03T13:02:00.155950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-06T23:24:03.757272Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:02:00.155950Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:84050f8e4f810c393daadf14c8c12e29e5ae35e521ba7509cbe1423bbcc53b71","observation_id":"9ebbf5eb-e594-43d5-a72d-457eca42dedf","resolution":{"observed_at":"2026-08-03T13:02:00.155950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-04T06:36:33.925089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-06T23:24:03.757272Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:36:33.925089Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:9b91e7aed0b3b5b32be94ce27c7f775ca748ec39bec94bdaba0eec98253952c1","observation_id":"341f5a0e-27d1-46d1-bb01-95fb5bd16c37","resolution":{"observed_at":"2026-08-04T06:36:33.925089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2601.06803","last_updated":"2026-04-20T09:04:42Z","snapshot_observed_at":"2026-07-06T22:41:19.981014Z","submitted_at":"2026-01-11T08:30:49Z","title":"Forest Before Trees: Latent Superposition for Efficient Visual Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T15:58:03.654150Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2601.06803"},"observation_digest":"sha256:3ebc9751f06598ce3b0679ca46550b5f2e083b6c445433fb3c1ad64e883b39a9","observation_id":"82d0a0e6-e459-440b-9954-b295d9485faf","resolution":{"observed_at":"2026-05-16T16:01:05.166099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2602.07605","last_updated":"2026-04-27T13:49:08Z","snapshot_observed_at":"2026-08-03T08:11:38.794368Z","submitted_at":"2026-02-07T16:16:51Z","title":"Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T06:13:33.315525Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2602.07605"},"observation_digest":"sha256:f88201f59a036d1bedc9ff97e98e7e685ea3c63fe0a2ba8bb0feedfc138bb550","observation_id":"bc9d2dd7-5bd4-4085-acbe-2f01483f87ae","resolution":{"observed_at":"2026-05-16T06:17:26.659379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T20:12:46.385646Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:2ddc021cc11f0e2548f40095ab4d3ff13881ea31bf38c22785f771726c3360e2","observation_id":"275b33b6-8eff-42e9-903b-cfa708b08b08","resolution":{"observed_at":"2026-05-15T20:16:34.653831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:06.829915Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:483ca07786ddf0935e09a2f68ffdf853e80111e38cdc14b1b9b772a57812f698","observation_id":"2a9a64f5-7f02-43bc-aea8-a10c3b96c477","resolution":{"observed_at":"2026-05-22T10:31:25.357953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-02T22:00:10.239223Z","title":"Perception-aware policy optimization for multimodal reasoning.arXiv preprint arXiv:2507.06448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:10.239223Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:eb7a550627e09cf27497221a76102297d7c60bc9caabbc37261506fe7ec291a7","observation_id":"8bf1fa6a-ae1d-4042-8c52-3df0ba6d862e","resolution":{"observed_at":"2026-08-02T22:00:10.239223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.03307","last_updated":"2026-04-16T08:04:16Z","snapshot_observed_at":"2026-07-06T22:52:29.705312Z","submitted_at":"2026-03-31T03:57:56Z","title":"V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T23:57:47.657243Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.03307"},"observation_digest":"sha256:94ba16745d548b5eaf9b51850096ff2975c66b737842d60c01bc788b082d5aaa","observation_id":"64d0fd5c-6c9a-43a2-8266-583407ae2783","resolution":{"observed_at":"2026-05-13T23:58:28.528420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:36.010169Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:68776c50f796b660bcbe0430fb3d63c53b51353b28a986e8f28516b2f5128d1c","observation_id":"2e6caec1-8066-4e13-936c-2856a4ff63b7","resolution":{"observed_at":"2026-05-11T08:11:04.218805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:06.774877Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:08498affe2feb074b3aa46922d6262e6aa7c872652447061c7c7476e5bdba1b8","observation_id":"bed31903-6d60-458c-bdf1-19a0053bfdaf","resolution":{"observed_at":"2026-05-12T06:01:26.702734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T07:26:59.917150Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:7c4b22443720e35007366a860dde6a790f7c149c80af2221c0206a2bba52c0d0","observation_id":"fa86347f-5917-44fd-8b0c-296fc21920c1","resolution":{"observed_at":"2026-05-13T07:27:29.206516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.16858","last_updated":"2026-04-18T06:10:57Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T06:10:57Z","title":"Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T06:43:54.201604Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.16858"},"observation_digest":"sha256:ba2ce32778f940d6ca2836f4ec5ee169b8a5b376996d9e91118b243342b3d289","observation_id":"53b754bb-7d08-4d98-833b-eabd2a17a703","resolution":{"observed_at":"2026-05-10T06:46:37.293875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:13b2f6eadea8ca0fb00bdd8bbaacc27c479d82474644f0f2276dd0b9969370b9","observation_id":"c18877d0-e5e9-4621-b704-d2dc5b47f847","resolution":{"observed_at":"2026-05-12T10:21:29.969986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:1e23d59e4c3647e14ab48107e9f6c9e28eaf787e7ee8adcd0dc85c7646587269","observation_id":"52f074b3-f4fe-4727-8cfa-6aefbe46dfa4","resolution":{"observed_at":"2026-05-11T22:11:16.774088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:76cc107bc7ffdaccacd867ff2b491eda464242b63806657c35d3ca6e702c79e1","observation_id":"1be34a22-7c56-4d11-9965-435fddfb70df","resolution":{"observed_at":"2026-05-19T17:02:40.675991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.03485","last_updated":"2026-05-05T08:20:48Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:20:48Z","title":"MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T01:20:54.441367Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.03485"},"observation_digest":"sha256:e736a0021baa1afc6577b64aad0ff2fa20c777c734d23085ed0141ba3abe813c","observation_id":"d9f2fb2f-1d95-4192-a7ec-45ebe732f83c","resolution":{"observed_at":"2026-05-12T11:01:30.624397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:cd92aa9dd8d814f21aea1e0d79d34ed19a6bc5f9bbf6e12e648d5d7571248288","observation_id":"065c6ebb-74a3-43f5-9b64-e0dcacb1ecdb","resolution":{"observed_at":"2026-05-12T06:06:25.242664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-08-03T00:35:33.749027Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.571227Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:26ccb4e641ea899257947525fd2ab7f960a02c653f880942dba82ed68bf9a78a","observation_id":"6b048127-87de-405c-ae5f-1eb83418d932","resolution":{"observed_at":"2026-05-12T05:11:22.911223Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-08-03T00:35:33.749027Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T07:43:50.633779Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:31cbfaf0681a29070e739795c87cd8b5049882e6378c704c352d7d2a64800a16","observation_id":"ab8a3ff7-0a6f-49cf-b733-439b665071c0","resolution":{"observed_at":"2026-05-13T07:47:31.624993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:5c37bfb12871f8205e670bbc77628c258b296985ddd07e4a770559ec0b68ff74","observation_id":"1cbdb3c0-b461-47b3-a991-d6213a5a1cbf","resolution":{"observed_at":"2026-05-12T07:41:26.448786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:12eaf8e4bf765e3eff9487688fc791e4145ca2cb5c37b0a2367d12195bc75e0c","observation_id":"730a824b-9a15-4357-8ae9-130108c9edc3","resolution":{"observed_at":"2026-05-22T07:24:42.923599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.27741","last_updated":"2026-05-26T22:34:03Z","snapshot_observed_at":"2026-08-05T02:00:17.275581Z","submitted_at":"2026-05-26T22:34:03Z","title":"Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T17:45:10.339950Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.27741"},"observation_digest":"sha256:21a5aa6fcd8bafb28a6791738aa3cef5fdbcd6d1ef4aebedb15050d8efe89687","observation_id":"da83562f-cc52-4b05-b104-82d54b740024","resolution":{"observed_at":"2026-06-29T17:53:47.577944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T19:26:37.281563Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.00564"},"observation_digest":"sha256:87d63880daee9a1902682662ab8f74a57c37bd28768696f937586e6dd30f4a22","observation_id":"d55c61b8-93b0-40b2-b23d-f28ea6276ca0","resolution":{"observed_at":"2026-06-28T19:32:34.993488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.07000","last_updated":"2026-06-05T07:43:22Z","snapshot_observed_at":"2026-08-01T16:13:28.792814Z","submitted_at":"2026-06-05T07:43:22Z","title":"Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:02.133241Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.07000"},"observation_digest":"sha256:65d5b0f7daae491e0d1131ebcdc3aa6bac301c1caf437b131dddfca7eea7c3b2","observation_id":"516f15e1-89d9-4ef8-a1be-bd009457c7a0","resolution":{"observed_at":"2026-07-02T19:07:18.029695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-07T06:09:41.751927Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:e08667b90f2ac8e4fbbefe9aca30286297e6bf4ed544836568fa0a887b42078b","observation_id":"ffcadad2-aec4-47fc-afe0-0ef93208dae1","resolution":{"observed_at":"2026-07-02T20:47:23.104445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-04T07:49:41.211792Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:a43a375886cce798e2af4f4ff795835174b9ed153625eb463bf86d381f162bad","observation_id":"bc345b3a-26ef-4a08-8500-5b42088179ed","resolution":{"observed_at":"2026-07-03T20:18:57.746659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.23206","last_updated":"2026-06-22T11:51:51Z","snapshot_observed_at":"2026-08-01T21:25:09.156943Z","submitted_at":"2026-06-22T11:51:51Z","title":"CFPO: Counterfactual Policy Optimization for Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:09.716984Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.23206"},"observation_digest":"sha256:ddca09e7d703a5800af4d2f821b929f1ea2d85b9b73296445343be78408746a1","observation_id":"2d32805b-602d-4a3a-8829-45d73cf98b2d","resolution":{"observed_at":"2026-07-04T10:09:44.512609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.23543","last_updated":"2026-06-22T16:17:30Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:17:30Z","title":"VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T08:34:27.719022Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.23543"},"observation_digest":"sha256:523325cd6e5da9c69323b30c67189b958aacc31622bf5e523cad1b887fdb66fd","observation_id":"054f1806-92bc-43be-a0e2-aea11df5e414","resolution":{"observed_at":"2026-07-04T10:39:46.103753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:c013abb42ecd0a35779a27501a5cb8a2366038b48e6bbc64da1679a6ddcb1b64","observation_id":"5a1459d4-fb35-448e-9015-3d5f92e44d7f","resolution":{"observed_at":"2026-07-04T19:20:06.728831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.26387","last_updated":"2026-06-24T21:12:24Z","snapshot_observed_at":"2026-07-07T00:00:41.502665Z","submitted_at":"2026-06-24T21:12:24Z","title":"Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T01:22:26.135526Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.26387"},"observation_digest":"sha256:82c0513cea1a36a57196e73db4d1f19b50b283082ab7843453a60960abf81bd7","observation_id":"55ac53a3-914e-4dbb-97b5-a3e494d341ec","resolution":{"observed_at":"2026-07-04T15:49:57.363070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.28266","last_updated":"2026-06-26T16:57:40Z","snapshot_observed_at":"2026-07-07T00:02:24.342539Z","submitted_at":"2026-06-26T16:57:40Z","title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T04:09:32.397341Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.28266"},"observation_digest":"sha256:84510405b2b3bcc50a4491e97befea0b8df8d0ed1674f9130165ddda93eedad0","observation_id":"b10acfd0-27ca-4a6c-bef0-a342f495510a","resolution":{"observed_at":"2026-07-01T17:05:51.429152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:8a3381e187700a406973425a6daedf59368d985503789a83558508730e755da4","observation_id":"38cc0a18-c7ba-4451-b6c6-be0006946a7b","resolution":{"observed_at":"2026-06-30T06:04:21.272222Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-07-12T09:29:14.105502Z","title":"arXiv preprint arXiv:2507.06448 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02592","last_updated":"2026-07-01T07:37:10Z","snapshot_observed_at":"2026-08-06T06:30:37.376353Z","submitted_at":"2026-07-01T07:37:10Z","title":"H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-12T09:29:14.105502Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2607.02592"},"observation_digest":"sha256:f48c1cd4d57d61f16397b9aa6532afeeabb5390dd83c8cdf08c49735ed93ec76","observation_id":"c0be25c6-b1c8-4810-ada9-a488ef14bfd1","resolution":{"observed_at":"2026-07-12T09:29:14.105502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-02T03:20:41.123647Z","title":"arXiv preprint arXiv:2507.06448 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-03T21:19:12.349925Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.123647Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:73210c35b16c31164e7ff2b63ebb2f98ebe8dd8cddd5bc7971be387070dcb790","observation_id":"16c75267-7b7e-4d91-8939-5c284401d55e","resolution":{"observed_at":"2026-08-02T03:20:41.123647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-02T06:36:36.304920Z","title":"Perception-aware policy optimization for multimodal reasoning (2025).URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16303","last_updated":"2026-07-14T07:08:28Z","snapshot_observed_at":"2026-08-06T11:35:34.358058Z","submitted_at":"2026-07-14T07:08:28Z","title":"Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:36.304920Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2607.16303"},"observation_digest":"sha256:94319f85716f1b67678e4978781ade6d567e3439cbc5904a21160e66149d3f5a","observation_id":"c2a9dcd2-b824-48a5-bd32-77d62a6a058a","resolution":{"observed_at":"2026-08-02T06:36:36.304920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-01T07:15:04.823955Z","title":"Perception-aware policy optimization for multimodal reasoning.arXiv preprint arXiv:2507.06448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-07T05:31:06.665189Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.823955Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:660666b97c30217e9ac08ce374f6716c98de0cacecce6b7ba4c0688fe0caf657","observation_id":"cf478290-8401-4027-90e6-4ac0fe3c2963","resolution":{"observed_at":"2026-08-01T07:15:04.823955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06448/citation-record","integrity":"/paper/2507.06448/integrity","json":"/paper/2507.06448/citation-record.json","paper":"/paper/2507.06448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:44:24.768682Z","title":"\" * write output.state after.block = add.period write newline","venue":null,"work_id":"00eebc59-e300-4d9d-86e2-f9bc6c1bf336","year":null},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:acd072d2c953c5913196aa743c00c814c3e1e7b4bbab677b74f040b7a1b6a052","observation_id":"a3474fff-fe4f-41f0-9e9d-ccc27fa8be92","resolution":{"observed_at":"2026-05-19T05:12:05.365873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:44:24.772159Z","title":"write newline","venue":null,"work_id":"3b731e2d-843c-43f2-b9b6-7ffd356be7ad","year":null},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:9ca0e49b64c31cfa0f63837fdda91ce42e828be3aa04e0ffa4d4ab9dca0de221","observation_id":"359114f6-0ea0-474b-ae83-2668204d5b4f","resolution":{"observed_at":"2026-05-19T05:12:05.361811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"de71d1f7-0780-4478-997e-aa5b900658b9","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:1ecb21fa9555a52081b9c76d772a3b04c7a745185e33b7c709c5ea8de428624d","observation_id":"c7a6e224-2324-42ff-930b-93ac80289f83","resolution":{"observed_at":"2026-05-19T05:12:05.370389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9bed3112-d0d1-43c5-beca-9cbecfecfe93","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:76e6e5da51c83e4138b1c2c0f5907a9321ecab20010644e44978251ef56e55df","observation_id":"9d108898-0365-4fcc-978b-20562fbabe09","resolution":{"observed_at":"2026-05-19T05:12:05.358137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:3c0be91c239e4a32f62c702fafb82c7b37a2245ece2a4aa20ef4522910f86814","observation_id":"aa9c559b-80fa-40ad-9b0e-07b32c2059ea","resolution":{"observed_at":"2026-05-19T05:12:04.842916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e7b05e9-523d-4ae0-8ad0-88af0b20307a","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:b71aaee3e7c4b8953847cd3c84b2855c4214ea6e992b6c7e6a6e9e488359a54c","observation_id":"58688159-628f-4801-a84b-83b277c74bac","resolution":{"observed_at":"2026-05-19T05:12:05.393909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:25dac58e8d6db0dee28efd168bcbdc26b0313ab8f984bd49cb9fa06e540da66f","observation_id":"51a208cc-713f-419e-9032-46bfb049c5c2","resolution":{"observed_at":"2026-05-19T05:12:04.819520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T.; and Xu, X","venue":null,"work_id":"ef19e37d-e379-44c7-bd21-61f157c1505e","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:43ad0bf70dc51dce8e83c4d51c33ee56b3e9f6e11486ba87c99631d62aa16b25","observation_id":"34cd7699-4101-4461-97f0-3892267b3726","resolution":{"observed_at":"2026-05-19T05:12:04.898943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.09736 , year=","venue":null,"work_id":"d93dbd75-8b00-443c-b084-028dbf97660d","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:ec4816f8a9f11dedea9fcca9471d536578768095ce985b9c78f49e3b5e7057bd","observation_id":"f98ee5d2-74ed-49af-9b10-77eb4a1c9629","resolution":{"observed_at":"2026-05-19T05:12:04.905784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74053a8b-6501-44db-8279-d71c194ea83f","year":2023},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:8d4b4799f61bd0394bf652c874d82d9f2316978727c128a3a0ffb4eee5a5ef03","observation_id":"410b8d1c-b9ef-439d-9c79-d6971078ea2f","resolution":{"observed_at":"2026-05-19T05:12:05.388483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-07T12:10:18.330753Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.24871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-06-29T22:24:00.434533Z","title":"Modomodo: Multi-domain data mixtures for multimodal LLM reinforcement learning.CoRR, abs/2505.24871, 2025","venue":null,"work_id":"02c93aaf-d5d6-4535-b924-aee394832f18","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:2db79ca50bb593837571aa51ce3e07136fd35a031d6478b7b594030276473096","observation_id":"bb4826de-a215-4f05-b0f8-2f7d09409a9e","resolution":{"observed_at":"2026-05-19T05:12:04.799535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:10:08.047045Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":"a7902913-6e82-44c4-a2ee-1dc0a61e41d1","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:f8a29704ca84abe9b04bb2a6afa48af674fb672d317a713d5747797790244532","observation_id":"ffb4f5be-d707-4866-97ce-c3ef6144e1bf","resolution":{"observed_at":"2026-05-19T05:12:04.831599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:54.984614Z","title":"VisionReasoner: Unified visual perception and reasoning via reinforcement learning","venue":null,"work_id":"ee12759a-d7d2-4e0e-9356-44af3786e20b","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:122f066bf19a5cb38b70eee9553dbd23669049d19fca9c44a9cf8f619535b69a","observation_id":"7d976c68-be52-473c-a66f-980e932e76df","resolution":{"observed_at":"2026-05-19T05:12:04.815827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:c5372c1acaa33394a6d06cd2996d63df36d77992f1384014fc7ab67798b9120a","observation_id":"73460f25-4ca9-468c-969b-9099993f6427","resolution":{"observed_at":"2026-05-19T05:12:04.794677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9435dfcf-6e28-4ece-801c-d1d5464e47f9","year":2021},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:c1c068e5442e2f6baa56adb6a69dd209553e41f5ebaf22acb1395299f19e332f","observation_id":"bd619933-98de-4453-99f9-7b4100ecbebb","resolution":{"observed_at":"2026-05-19T05:12:05.385663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18129","last_updated":"2026-04-16T06:56:57Z","snapshot_observed_at":"2026-07-06T21:29:26.614513Z","submitted_at":"2025-05-23T17:41:14Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.18129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18129","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","venue":"cs.CV","work_id":"a6ef804b-0440-48f6-8877-81523ce7a7ec","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.18129","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:cc1bea0aa83a732127e7fda6c956ba02f5bdda0079d6d0e44ab1a368b2b76734","observation_id":"03a99d23-7a15-46c0-9792-07a312aee035","resolution":{"observed_at":"2026-05-19T05:12:04.838451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:9140b04c61cd4aa06f72e6b5124d6e5b04cbf2a865a734101c4a4ba5e34e06db","observation_id":"d72a3571-b1cd-4393-b4f1-333dcafb43b8","resolution":{"observed_at":"2026-05-19T05:12:04.803695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06ddefc7-533b-4c97-b488-f0d48f366f37","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:ecb56a2e6991832fec350eb2b6afbc6a3f9ebc8d7864a594628c139e610f5e96","observation_id":"827b5dc7-20b0-4833-bfd8-ba8355db7ba9","resolution":{"observed_at":"2026-05-19T05:12:05.396393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:dd170214c8bc48b998ed57a9666f1b2bd32973041baf64942fe5928f6d807462","observation_id":"d8de1717-616a-4f19-986b-1fd583b7780c","resolution":{"observed_at":"2026-05-19T05:12:04.866205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:c4a2a6373b4da863185e55fe6223e89335371950b4185e2ae0c1d5c69fb26f2e","observation_id":"1911500e-7472-4bcf-9a28-7987565d2d35","resolution":{"observed_at":"2026-05-19T05:12:04.847081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"618ede83-c2be-4b54-b9e8-c7e87d81c0c5","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:0ab1957c55cf6dffb16f174dee1f73a86562f631e15d22e9eaa4dd1b0f30c552","observation_id":"eeca7c3f-8da5-4eef-b9ef-73363b91c87f","resolution":{"observed_at":"2026-05-19T05:12:05.377351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"32596362-c85e-494e-aa4a-bf04fa1bdf35","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:611230b55b1dd9471e29a88e2aa2582bfd5a7ffa752575cc615049ede926aaa0","observation_id":"2132d01b-cb54-44c6-82f6-09ce990bbddf","resolution":{"observed_at":"2026-05-19T05:12:05.382746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b4fc6b94-2706-4db5-9319-4dd529a156e0","year":2020},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:d911ca3c8b495e99d051f78e657e842996879f956cdf77d29970f97a5bcdb770","observation_id":"bd50d1ed-3010-47a5-8dcb-f2e0c771f194","resolution":{"observed_at":"2026-05-19T05:12:05.373467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:db38a464f129fe6d555dc862a185e83be4acdafccdfd48d2f7e22206eb9ca6e5","observation_id":"f162e7b5-4581-4a42-af20-7e29102e4313","resolution":{"observed_at":"2026-05-19T05:12:04.854537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"005246b9-3a9f-49ea-8fc9-ae50501d1aea","year":1948},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:0313804129d291842f2334b63e3ebf8c25ae7ed9b06da8787df446b0fd152a9b","observation_id":"ff652852-c17e-43ea-9768-716aef33c163","resolution":{"observed_at":"2026-05-19T05:12:05.391352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:9a6e70c003613e41b60a5892da3ce3fcb2efbb568483545808810a9c3df1df70","observation_id":"8498bdca-74c3-4d29-b333-5b79bece4580","resolution":{"observed_at":"2026-05-19T05:12:04.811822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:45cfdee19da0e3e344cf4e13462950484c9c81be8d19942897bb315ea223d93c","observation_id":"b33e7b31-7f1a-48da-a873-cd18218f6cbf","resolution":{"observed_at":"2026-05-19T05:12:04.869640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.216393Z","title":"Satori-r1: Incentivizing multimodal reasoning through explicit visual anchoring","venue":null,"work_id":"386d4dbe-0f7f-41f7-96ba-86b90c02cba7","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:13b0e8f940d4dca7a320c5c7ac27c4c1eb9d896a59116b00c6cf67e3cfa58f9b","observation_id":"f5ed93e1-10c3-484d-805f-5073bfc110ec","resolution":{"observed_at":"2026-05-19T05:12:04.807856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:64bb8662fbfab43a304182621c3c59c8337c280481452a1670d2275e7ba52940","observation_id":"d3897b44-a2e2-4d80-ac28-101316a47de4","resolution":{"observed_at":"2026-05-19T05:12:04.902376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01713","doi":"10.48550/arxiv.2506.01713","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Srpo: Enhancing multimodal llm reasoning via reflection-aware rein- forcement learning.arXiv preprint arXiv:2506.01713","venue":"arXiv (Cornell University)","work_id":"69703666-e5e4-4375-917d-0df8ccc043cd","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:27cf34be017bec8b4ed3cd8d69495c935ba50d9b8745d298ca86a4a4585bc959","observation_id":"b4364fa8-aa8f-482c-a81e-d79415ed2c5f","resolution":{"observed_at":"2026-05-19T05:12:04.886990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.08837","doi":"10.48550/arxiv.2504.08837","metadata_source":"pith","pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","venue":"cs.LG","work_id":"b13ff087-9614-48cc-8991-ad75b6543bbc","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:cd6c2be788a035ec72ffe292eda309516f3107dd42e626b6aadb1afc20055c82","observation_id":"678ba928-3566-4b5c-aa58-e4de9765feb6","resolution":{"observed_at":"2026-05-19T05:12:04.890706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-04T14:10:02.519865Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":"2504.16656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-07-04T20:10:08.032034Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning","venue":null,"work_id":"eb56fa03-88a4-4a9b-b449-b695b39f7832","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:2c36c154af33ce8c942eb083f6f3c3af260ae701c7d50d1a617f301ddb71f2ab","observation_id":"f68c5350-190b-4d9d-8bb9-663afbc9c051","resolution":{"observed_at":"2026-05-19T05:12:04.894974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:31.670525Z","title":"Visionary-r1: Mitigating shortcuts in visual reasoning with reinforcement learning","venue":null,"work_id":"c227c7de-f573-4665-b921-30284b6bdb9a","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:202091c7cf56133a39226577a9e00d43e31c1c5ed066c2bc4e46194ee24f3079","observation_id":"af990ec9-b8b4-44ed-bf44-15eb9a715caa","resolution":{"observed_at":"2026-05-19T05:12:04.876965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:06.399223Z","title":"Perception-R1: Advancing multimodal reasoning capabilities of MLLMs via visual perception reward","venue":null,"work_id":"23f6cb13-af2a-42da-b1a6-609b24d61e5d","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:767e699f135fb7466521363ef95cf5c0619bafe668eb52e2d9cfdda6704a17fb","observation_id":"1ca4b3e0-ef2c-441c-b900-48f483a6cbbe","resolution":{"observed_at":"2026-05-19T05:12:04.880422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":"2407.04973","doi":"10.48550/arxiv.2407.04973","metadata_source":"pith","pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","venue":"cs.AI","work_id":"d1811506-9b67-4c64-ae5a-4abeaaec10f3","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:7b00a09ac015d52ab7cb110fc12c569e9d96daa3e8415de17ee20342e24b395a","observation_id":"173c6a40-503d-4c10-b562-64d19537027f","resolution":{"observed_at":"2026-05-19T05:12:04.858085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":"2503.10615","doi":"10.48550/arxiv.2503.10615","metadata_source":"pith","pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","venue":"cs.CV","work_id":"bd2bf4d0-20bf-49b8-8dac-b54a8019be6c","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:4a956a54abe29b57366068474000b4214647451666026fb902508c12051e6e3a","observation_id":"8217ab54-f0bc-4ed4-be13-d2bacca3cbba","resolution":{"observed_at":"2026-05-19T05:12:04.861860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0a7e42b-ed86-48da-ac61-ed953414fd38","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:8624fedce90353e331276c8566166eee8df6f68152775e026c7fdca6fad53c4c","observation_id":"d435ef96-b13f-4d91-b360-be0bc04ef91e","resolution":{"observed_at":"2026-05-19T05:12:05.379964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:681db7fbb9ea96cd676a21cd2673bccdd0248c9d0d966c3f625b8686d9e77263","observation_id":"6189f1c6-228d-434f-9e00-ccf452c3c943","resolution":{"observed_at":"2026-05-19T05:12:04.883594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:5ccd849ec2a233b19dc30f38f1b568f8bb3bb432ab5b72ac8df9234de0cd11e4","observation_id":"f5254e65-b890-4e9a-8c73-be5decc7e72f","resolution":{"observed_at":"2026-05-19T05:12:04.823768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:27c5103f4c49439f43c5e29142a8255456a7e18c1fecae2cdc6445874faf0505","observation_id":"64104d96-8d54-459a-8005-2951aebd1b1d","resolution":{"observed_at":"2026-05-19T05:12:04.873225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:422fa4e9f280a9bd1c6711812e66941ed62f004926b1aa4a9e700aa4aa75adb8","observation_id":"aed0ea4a-563a-456b-8f8f-9e4d7453fce8","resolution":{"observed_at":"2026-05-19T05:12:04.835044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:e6fab990ff93b018a9324039fd7bcdceffbcbe2f093f13d378f46e7f70cdea05","observation_id":"31d75e9b-8420-4b1f-b5c2-3efea16f1745","resolution":{"observed_at":"2026-05-19T05:12:04.827471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21457","last_updated":"2026-06-08T14:20:16Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:29:31Z","title":"ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.21457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21457","snapshot_observed_at":"2026-07-04T16:29:57.224762Z","title":"arXiv preprint arXiv:2505.21457 , year =","venue":"cs.CV","work_id":"2f6b9068-7d97-4dae-b9fb-d9c4acb49d40","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.21457","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:e76a2412d72bb3696122c262b6734ef289f470057e39f147355d89a021edaaa8","observation_id":"abdc0de2-7310-428f-85bd-6b68a72e6217","resolution":{"observed_at":"2026-06-09T03:07:59.867366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":30,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 39 inbound Pith citation observations for arXiv:2507.06448."}