{"as_of":"2026-08-08T14:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:530d46983d5681481149c4677e8a9cee195010a673a7d1f5e936007df26aa65a","coverage":[{"denominator":227,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:17.658024Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:14:45.547957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:50:10.284267Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2510.21583","last_updated":"2026-05-20T09:16:04Z","snapshot_observed_at":"2026-07-06T22:33:58.663508Z","submitted_at":"2025-10-24T15:50:36Z","title":"Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T19:47:48.545820Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2510.21583"},"observation_digest":"sha256:b486d9ffe24cd9f4080f9eb6cc4cada6a5ac1ab804857bc00459d95610dc3ca1","observation_id":"9161386b-c4f9-478d-afcf-2bc15d5c4f0c","resolution":{"observed_at":"2026-05-21T19:50:33.810618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:92f9899821b27cc6774c6f71784d5c32313e3c3164bc1dc65927d17a33c6db2a","observation_id":"5c9dc37b-4062-4914-bf2e-5acfc1754921","resolution":{"observed_at":"2026-05-22T12:31:32.085860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:2409a27918d2446622332346e69e83882ac08621efea11db76560f6655137eef","observation_id":"cc3102e1-4c8c-419d-be8b-9b6a5b0169e9","resolution":{"observed_at":"2026-05-17T02:11:26.532560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:ce4d5c7ad3a313aa10a6e58bf25329fac354c3315b98cbfa717f48fd2f96430c","observation_id":"7fac40b1-5516-4982-9ade-633169de5a16","resolution":{"observed_at":"2026-05-16T10:02:42.575958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2604.08539","last_updated":"2026-04-19T05:24:16Z","snapshot_observed_at":"2026-08-03T03:38:06.402578Z","submitted_at":"2026-04-09T17:59:39Z","title":"OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:33.968186Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2604.08539"},"observation_digest":"sha256:635f31026e17faa120bcfe3e0b60d1c531712283c45e7c8977ce0abf45b939f8","observation_id":"df4417a6-4e26-4106-8a73-5ae38a3056af","resolution":{"observed_at":"2026-05-11T07:30:58.604506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2605.10937","last_updated":"2026-05-11T17:59:25Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-11T17:59:25Z","title":"Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:40.994346Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2605.10937"},"observation_digest":"sha256:a7d71205a10706fda32ed34ed8d64305fe259f15df82c903e43aaed39b028d87","observation_id":"42e34c38-0cf8-4028-9238-765ca4e6a02b","resolution":{"observed_at":"2026-05-12T07:16:29.388556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2606.21498","last_updated":"2026-06-19T14:50:22Z","snapshot_observed_at":"2026-08-06T22:06:36.715595Z","submitted_at":"2026-06-19T14:50:22Z","title":"Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:14:45.547957Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2606.21498"},"observation_digest":"sha256:710ac539478da4c623f70d86cddcf4810d60511aa00e1a167afca67fbe18588a","observation_id":"950009ec-c769-48be-929b-79169082bc1a","resolution":{"observed_at":"2026-07-04T06:49:36.967214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2606.25634","last_updated":"2026-06-24T09:38:27Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T09:38:27Z","title":"SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:44.441202Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2606.25634"},"observation_digest":"sha256:2a0cc821a9da223bebe86b2fe01431c5a3cba2960450c6d579f91eda928dcddb","observation_id":"91d4c9ac-a3cf-4d38-9d23-bef70906eb8f","resolution":{"observed_at":"2026-07-04T19:50:10.285898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18536/citation-record","integrity":"/paper/2505.18536/integrity","json":"/paper/2505.18536/citation-record.json","paper":"/paper/2505.18536"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:08.011412Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.011412Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:730f064f41cbaacbc526f9a41d40317156bbb0c4c77610fee97a15cee93ddbd2","observation_id":"40097270-201b-4671-98a9-96a86ad89f99","resolution":{"observed_at":"2026-08-07T14:31:08.011412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:31:08.103283Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.103283Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:c59813e4836396e4675d5b3d7b5267c32638b2073b261d1c22bd690771a7bc02","observation_id":"cb105126-c838-4241-9d62-ac96dbab593a","resolution":{"observed_at":"2026-08-07T14:31:08.103283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:08.256788Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.256788Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:9f426201c42acb046e3dbf0a6b855fe30ebf72bffbbadae3a77f6f7ae677e78b","observation_id":"92fa4f2c-49c8-4842-beb4-81fb763b8b74","resolution":{"observed_at":"2026-08-07T14:31:08.256788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:31:08.367729Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.367729Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ad60e72386da3cc6668a3b7979b01ccb7d875c6c8d58039c9d01e18135951473","observation_id":"dc18dca8-c084-486a-bde8-b13d88490781","resolution":{"observed_at":"2026-08-07T14:31:08.367729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:31:08.535029Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.535029Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:aff16785285debd530df22a1414f2b452e5d0b1207413a71d707c4843df7ba49","observation_id":"b69da4cf-d149-4c1b-96e6-1f6d07b198ca","resolution":{"observed_at":"2026-08-07T14:31:08.535029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:31:08.639365Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.639365Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:37c42a05cac63aa3ccb2c7b699546da9ff83b40307f704e542d8d6f283860a79","observation_id":"3ae63e3d-924b-4ddf-9049-9c858c37329e","resolution":{"observed_at":"2026-08-07T14:31:08.639365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:08.792427Z","title":"Introducing openai o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.792427Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:6a1a267d22517095f5da813ddaada91ada60c2cefd091582288c6b4ec1b8fd18","observation_id":"81b9a938-15ac-413e-89a0-9c18cd2a4228","resolution":{"observed_at":"2026-08-07T14:31:08.792427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:31:08.923108Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:08.923108Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:2633a1171d40314b410241429571950dac5f6b7971b98bb71bebaee8f811c2fd","observation_id":"775fcef7-b5f1-4507-a9ea-236e8404c9b1","resolution":{"observed_at":"2026-08-07T14:31:08.923108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18071","last_updated":"2025-03-23T13:40:44Z","snapshot_observed_at":"2026-08-07T16:43:15.782410Z","submitted_at":"2025-03-23T13:40:44Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18071","snapshot_observed_at":"2026-08-07T14:31:09.013331Z","title":"Mind with eyes: from language reasoning to multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.013331Z"},"links":{"cited_paper":"/paper/2503.18071","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:dcbe9a3a2a5bcbaf248543bc8431b7e7178bc5e947b2d1a89fc882108365ed88","observation_id":"e9572b1d-50da-4296-9599-ef43d6891972","resolution":{"observed_at":"2026-08-07T14:31:09.013331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-07T15:57:57.813561Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-07T14:31:09.127322Z","title":"Reinforced mllm: A survey on rl-based reasoning in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.127322Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:9fff00ba77231ea1876b35a70846acdcd3062675dc6604a0a20175338f72f898","observation_id":"05c33b26-e119-48be-820e-93c2b9a5bca1","resolution":{"observed_at":"2026-08-07T14:31:09.127322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.235317Z","title":"A markovian decision process","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.235317Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4a405f375a5b5d3a18f4613ae07ece41995cfc470c43f1c4fb1d0adbf4b50f60","observation_id":"1649ca34-a81d-4b4d-9a27-1477797c16f6","resolution":{"observed_at":"2026-08-07T14:31:09.235317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.350959Z","title":"Convergence of q-learning: A simple proof","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.350959Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:da3c6a0556b15e26f8f711acf6fb835d54c5b54bc0c8c8d5479e9f98ef87aa97","observation_id":"c754e2d2-b518-4e9b-a3cc-22f8c68a7543","resolution":{"observed_at":"2026-08-07T14:31:09.350959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-07T14:31:09.496847Z","title":"Playing atari with deep reinforcement learning.arXiv preprint arXiv:1312.5602, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.496847Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e431c88e71f88203f3f299e040f016c4156490d1e144863474ec532854296db4","observation_id":"b5172b4c-9916-4ecd-89e9-3b917ef718a9","resolution":{"observed_at":"2026-08-07T14:31:09.496847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.619866Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.619866Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:85a8d964ff0cf2eb7c6ef17d13ecc8b65b58735ef41da73639bc052fc1f60783","observation_id":"d94e0d25-b8ca-41a3-a2af-4be34aa47d87","resolution":{"observed_at":"2026-08-07T14:31:09.619866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.734580Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.734580Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:1d47742406a158276dda047cf9b304465c0123e2264a0507eef2bdb765438c12","observation_id":"245fef20-d355-49fc-8b71-b4eb0183c79e","resolution":{"observed_at":"2026-08-07T14:31:09.734580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.823430Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.823430Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:bb847a5eb6277bd316b081d632e0eabe4f4b6d9386fd87dbb7597e3c9e8a2ef3","observation_id":"2a4e90db-6a84-411d-acba-9da6c3092262","resolution":{"observed_at":"2026-08-07T14:31:09.823430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:09.948269Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:09.948269Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:3e47dc859821bba39c8688c773a2de66c503962ee25376bf228c141bbc60566e","observation_id":"549c1f6f-022e-4745-9135-a4973e29a50d","resolution":{"observed_at":"2026-08-07T14:31:09.948269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:10.081908Z","title":"Policy gradi- ent methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.081908Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:74c9075d52001d533f7668ed92a4cf4a00947a3cd878db813d07c86b89016f1f","observation_id":"cf7111c2-ba27-468a-8ef9-5abf2e9bb760","resolution":{"observed_at":"2026-08-07T14:31:10.081908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:10.143958Z","title":"Actor-critic algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.143958Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:0d4e2b1afc16377eda30240be1bae70d817dd4b4db83d38c5c57fa851fae6691","observation_id":"f9cc4bfa-6b53-4b20-84ba-52b228655f65","resolution":{"observed_at":"2026-08-07T14:31:10.143958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:10.255173Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.255173Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:fd1cd0789c578191a4f5405169a4c35f0efc1842d6caf15fe39e7c3f163c4abd","observation_id":"e535d775-dcce-4472-9b7f-d40e5c2b0f2e","resolution":{"observed_at":"2026-08-07T14:31:10.255173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:10.401052Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.401052Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:eb5a442425e12dfe0814badc858fe8e32b1f10e66ef078f41dd509f84263287a","observation_id":"97eef202-39fd-45c0-b930-3f4fc3ddc408","resolution":{"observed_at":"2026-08-07T14:31:10.401052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01230","last_updated":"2024-04-01T16:50:54Z","snapshot_observed_at":"2026-08-07T22:32:40.077692Z","submitted_at":"2024-04-01T16:50:54Z","title":"LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01230","snapshot_observed_at":"2026-08-07T14:31:10.524240Z","title":"Llm as a mastermind: A survey of strategic reasoning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.524240Z"},"links":{"cited_paper":"/paper/2404.01230","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:371ac108e8dfa7a8163f3b95d10fe170bfe47d2891044bc09e8e135a19d857cd","observation_id":"e44ec016-602a-47a9-9e9b-e07d14cb0a49","resolution":{"observed_at":"2026-08-07T14:31:10.524240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:10.596496Z","title":"Reasoning with large language models, a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.596496Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:214da5225540aeb04c83c33eabb710a5b1a329b9264327795d954511ba5246bb","observation_id":"18a603a5-fbfa-4f22-9856-bbadb950af4b","resolution":{"observed_at":"2026-08-07T14:31:10.596496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T14:31:10.735951Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.735951Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:b301f4edb86f6956255b39efca8870577d3acf5858fe6be7708511f0747ee560","observation_id":"8130aecb-d762-4666-9385-a6c66663eb02","resolution":{"observed_at":"2026-08-07T14:31:10.735951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10867","last_updated":"2025-02-15T17:52:11Z","snapshot_observed_at":"2026-08-07T18:15:38.061902Z","submitted_at":"2025-02-15T17:52:11Z","title":"A Tutorial on LLM Reasoning: Relevant Methods behind ChatGPT o1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10867","snapshot_observed_at":"2026-08-07T14:31:10.828360Z","title":"A tutorial on llm reasoning: Relevant methods behind chatgpt o1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.828360Z"},"links":{"cited_paper":"/paper/2502.10867","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:fd50f55c180ecd463affd65697933ce461b55e849743a4cedb1e5574239727ed","observation_id":"2507e31d-74d1-4d0c-9646-f009e4797694","resolution":{"observed_at":"2026-08-07T14:31:10.828360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-07T17:05:53.776402Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-07T14:31:10.991423Z","title":"Thinking machines: A survey of llm based reasoning strategies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:10.991423Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:cf112d1ddfeae515a29d78d66a7baee474eeadb8d9ad4efac9ff6e5cabfbbac6","observation_id":"c7d0d5d5-e971-4419-b65e-6fb3f6c96c97","resolution":{"observed_at":"2026-08-07T14:31:10.991423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T14:31:11.116827Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.116827Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:774d766df69834efa343f7f1983d8acd4a14ad4b50e0706879e5842f156e5850","observation_id":"4be25c8b-00c7-4257-a608-0a4dfca4605f","resolution":{"observed_at":"2026-08-07T14:31:11.116827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-07T15:57:22.394744Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-07T14:31:11.242194Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.242194Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:989f74ab896053774562728dca5aeb020110d38936ffad537d8a7dbc8d206bad","observation_id":"41b48aa1-d17b-4230-8db2-f10c5ecc337c","resolution":{"observed_at":"2026-08-07T14:31:11.242194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11514","last_updated":"2025-05-25T04:36:14Z","snapshot_observed_at":"2026-08-07T18:13:28.419800Z","submitted_at":"2025-02-17T07:29:01Z","title":"Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11514","snapshot_observed_at":"2026-08-07T14:31:11.393683Z","title":"Investigating inference-time scaling for chain of multi-modal thought: A preliminary study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.393683Z"},"links":{"cited_paper":"/paper/2502.11514","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:797c10e106edd1d37ba53ebc65b6f5603edf34917892f1b19ee9ef8ae4e65574","observation_id":"f2629d68-8aff-47db-b431-dec3ae56af11","resolution":{"observed_at":"2026-08-07T14:31:11.393683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T14:31:11.547423Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.547423Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ee540ca760299bd91c4d3eebdf53d9c982cff4fb41b23037041f6395a3ea308a","observation_id":"7babe830-f6d3-4d4c-853a-38d3ad66ec9d","resolution":{"observed_at":"2026-08-07T14:31:11.547423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:11.658758Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.658758Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4eb079258f40d5c4ddd2ef39d8b9d5f7059eaef0abdd8eb94db8fa09fd4649e6","observation_id":"7b47eff1-c366-4880-b0c7-63af299acbcb","resolution":{"observed_at":"2026-08-07T14:31:11.658758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:31:11.745517Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.745517Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:8c91baf371202073100d9fa9a8bd3e29beb1a5e36f9e368dcb4996d437582657","observation_id":"1580e653-fd74-486c-9a03-a89e1b2efe30","resolution":{"observed_at":"2026-08-07T14:31:11.745517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:11.857829Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.857829Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:06d662f944164662d199949bc4dc9d495611989365509f87ea50ff7b0802651a","observation_id":"1c63fa0b-ff1e-47dc-ba9f-59a724e5c016","resolution":{"observed_at":"2026-08-07T14:31:11.857829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:11.968928Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.968928Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:68a1465ffd11422688ffdc817692f5bf4eaaa75db579adfeb74751a21fdbeb9e","observation_id":"16623895-9b4e-4516-b4a9-2942d29a3356","resolution":{"observed_at":"2026-08-07T14:31:11.968928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:31:12.068390Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.068390Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:692daf71bef47a37f57ce9f04d962e4355e2340003bb08f584379a9a7de91ee7","observation_id":"86bcda32-3c84-4331-a4b3-9b6ad94135f3","resolution":{"observed_at":"2026-08-07T14:31:12.068390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T14:31:12.204895Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.204895Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:9ecfdc354215f2178280115c6e5acae921f03f43e40b1ee5b2c2d6b794690e25","observation_id":"5a962b26-e270-435c-9054-635f65b65d34","resolution":{"observed_at":"2026-08-07T14:31:12.204895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T17:33:49.286933Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-07T14:31:12.361455Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.361455Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:3c799b75ea382dae2887845b0fcbe1d37926c927b811b30346fa4e41761c3b18","observation_id":"8a89e05c-8fec-4938-b143-5e4d83dab744","resolution":{"observed_at":"2026-08-07T14:31:12.361455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:31:12.476155Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.476155Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:6429c8de52c8c3e6ec228a60eac0ed737df65a099569421f68c8469380834617","observation_id":"cec5c169-3d82-4565-a809-74ad2bb3a543","resolution":{"observed_at":"2026-08-07T14:31:12.476155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:12.595428Z","title":"Approximating kl divergence","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.595428Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:33f39ce7d8cd6816f0e81999b3a8f7e74c48be4529d1e1f9772963b4e51cf915","observation_id":"3deeddac-e41a-4e02-8e2a-6e3b1a0ad8f3","resolution":{"observed_at":"2026-08-07T14:31:12.595428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:31:12.705003Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.705003Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:66cfa705923466dc8f276161bab51f7c611e184abeb9c195feacb5e3d2c236f0","observation_id":"d9a22cf9-07fd-4372-a117-a775ac9d9bc1","resolution":{"observed_at":"2026-08-07T14:31:12.705003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:31:12.807492Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.807492Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:7d5499faa890c006251f3dcda79cf537d5c7f84230b98d24bc6605580722b531","observation_id":"19d230f4-4c81-402d-850b-fcd968b02023","resolution":{"observed_at":"2026-08-07T14:31:12.807492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T14:31:12.891931Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.891931Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:170747ab9888e59cde395c43868b1f85fc512ab6ac427d91e8251e08dceb380b","observation_id":"58bcbb80-eed5-449a-9c08-cdb14c4ad7e0","resolution":{"observed_at":"2026-08-07T14:31:12.891931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:13.022145Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.022145Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:0c42d64530e306b34a5e05630173270d231c3a91bc5848fd8042b25134ef9036","observation_id":"fa8e1e95-c984-4d5d-9d37-e36825a8a940","resolution":{"observed_at":"2026-08-07T14:31:13.022145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T14:46:11.534671Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:31:13.154734Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.154734Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:c4a2d65787c81799bd0d0ce01885271d5bd93148eb4a407df39462632573519d","observation_id":"061d8941-df23-4968-95e9-82c3a7d639e5","resolution":{"observed_at":"2026-08-07T14:31:13.154734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T14:31:13.239675Z","title":"Visualprm: An effective process reward model for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.239675Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:10aa0b67e3ff88097f7d7e8e189f4e34ff89a1e7f922f127d40538ed4eb041b0","observation_id":"91ff927c-8585-4733-abf8-33827210c667","resolution":{"observed_at":"2026-08-07T14:31:13.239675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T14:31:13.310672Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.310672Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:8c74b41bb0c8cc0a17989841689904a0dc6546270614fe625c08cb0cd4de5d04","observation_id":"051c8f17-2752-4dd2-86b8-fe78be8377d2","resolution":{"observed_at":"2026-08-07T14:31:13.310672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:13.413579Z","title":"Audio-reasoner: Improving reasoning capability in large audio language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.413579Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4e9ce41a7c6873339de8f81b4a8230709e85b1772d3688c3130ac4269c87dbfa","observation_id":"65bc45ee-a926-45a0-a762-ba44de584247","resolution":{"observed_at":"2026-08-07T14:31:13.413579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-07T17:04:37.656728Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-07T14:31:13.461419Z","title":"Reinforce- ment learning outperforms supervised fine-tuning: A case study on audio question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.461419Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:90b826ae242e2fd7239b8256f335f83580a16456cd42aaa0fe3b13debdcefa03","observation_id":"7b9ad463-7fbf-40ee-8a5f-8390c59237f0","resolution":{"observed_at":"2026-08-07T14:31:13.461419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15900","last_updated":"2025-04-29T02:51:19Z","snapshot_observed_at":"2026-08-07T16:00:13.989975Z","submitted_at":"2025-04-22T13:41:26Z","title":"SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15900","snapshot_observed_at":"2026-08-07T14:31:13.506592Z","title":"Sari: Structured audio reasoning via curriculum-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.506592Z"},"links":{"cited_paper":"/paper/2504.15900","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:2376aa94e154800a4a3c1193377cd2c6811e993c492ddea8b060adc0c2a4b1e4","observation_id":"4da64ec5-3e68-4166-89e9-1a7e253e5cce","resolution":{"observed_at":"2026-08-07T14:31:13.506592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-07T14:31:13.565978Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.565978Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4944a6b8455aa7336331a63570200e360951a8bd664e1d3d3c588233c29238ee","observation_id":"0e33bb8d-c9fa-47f6-aa5d-e271e2591963","resolution":{"observed_at":"2026-08-07T14:31:13.565978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-07T14:31:13.645079Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.645079Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:1d0f336cc73ac1cdd0c44d72308154a123f6d5351df8df7d66e1c9f286430fbb","observation_id":"bb8cd184-7364-4401-a920-23f1239dae01","resolution":{"observed_at":"2026-08-07T14:31:13.645079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-07T14:31:13.700122Z","title":"Ui-r1: Enhancing action prediction of gui agents by reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.700122Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:d49836f50a41fae038a1918e11b63dfa7167ee18ec999281988280979e3191e6","observation_id":"5c1d1cfb-edff-4ec0-b4f5-2733b3adcbfc","resolution":{"observed_at":"2026-08-07T14:31:13.700122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T14:31:13.747182Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.747182Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:192cc92587b7d10be162b924adfaae9d05dca9557abe8475757215b070973de4","observation_id":"df3377d1-a140-4ef4-9cf3-330f7444868f","resolution":{"observed_at":"2026-08-07T14:31:13.747182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-08-05T23:52:52.919433Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14239","snapshot_observed_at":"2026-08-07T14:31:13.797112Z","title":"Infigui-r1: Advancing multimodal gui agents from reactive actors to deliberative reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.797112Z"},"links":{"cited_paper":"/paper/2504.14239","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:bb592fe5a6a37584d1e213dcf354330155cf1945d9526c6cda0fcda777c578ab","observation_id":"536638f2-8005-48a4-aa21-835ba8a79f81","resolution":{"observed_at":"2026-08-07T14:31:13.797112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:13.851407Z","title":"Metaspatial: Reinforcing 3d spatial reasoning in vlms for the metaverse","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.851407Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:6d427c0f3cd488150d5d51bb3c5682ca3d12555cd30e434b14130c1c7e49b112","observation_id":"3f8fc103-ae94-46b0-a2ee-6afb7aa41df0","resolution":{"observed_at":"2026-08-07T14:31:13.851407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:13.898943Z","title":"Vagen: Training vlm agents with multi-turn reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.898943Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4954cd4d7d71f07ff8b27d8a4b67121a7a9034061ea1718b46b69e2f0f2cd5a7","observation_id":"5bba1d4a-7bf3-4a4a-86c7-0cf2c789b572","resolution":{"observed_at":"2026-08-07T14:31:13.898943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T14:31:13.950384Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.950384Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:3d9e952827f57e327e9b34d9f7d2daee0c0e4f49c2eadac2e0f6c174b2d57c9f","observation_id":"f9b6a6df-454f-473b-a4f1-bc38cbc032f4","resolution":{"observed_at":"2026-08-07T14:31:13.950384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:13.994703Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.994703Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:dac1aa5c3b7528d54efe09d652915d7ca46e7ad8945a1599ccee0866d5a32197","observation_id":"e804e79d-632a-4614-aa32-b12fa31e5490","resolution":{"observed_at":"2026-08-07T14:31:13.994703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:14.050530Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.050530Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:1074ba96254e9560358b76c0db2e3d2dcdf0f60fb508a36a2d0c24b9ddca5125","observation_id":"8ec617e7-3684-4a89-8b41-a39d5fd66cae","resolution":{"observed_at":"2026-08-07T14:31:14.050530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T14:31:14.095636Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.095636Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:bbc9c52b27288d64282f44e2efd9139c60157c4d88bd64e705558c7f5b0d54bf","observation_id":"081cfcc6-85eb-496c-9b7f-2c9ed819fd1c","resolution":{"observed_at":"2026-08-07T14:31:14.095636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:14.148793Z","title":"Mm-math: Advancing multimodal math evaluation with process evaluation and fine-grained classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.148793Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:2509d26bb148a35234db6ae5b997ecaf2e2d38415dccaa3aaff0e33e43274f84","observation_id":"7e0cb03e-51e6-43a9-81be-841156b56272","resolution":{"observed_at":"2026-08-07T14:31:14.148793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T14:31:14.198563Z","title":"We-math: Does your large multi- modal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.198563Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:cb1bb2bbd1b45b6203bc648afa4dc672abc304dfb3fd4908d3beb9e2085ec73d","observation_id":"cc5df7d0-5c0f-4aeb-b61c-29c32bf1862e","resolution":{"observed_at":"2026-08-07T14:31:14.198563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:14.248813Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.248813Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:7eb9b434501354654cdb349a06a432febb05e5a8a92a3cc90ba3b1f0d9f70735","observation_id":"a04b69c3-4337-40da-b1e5-a0d8569631fb","resolution":{"observed_at":"2026-08-07T14:31:14.248813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T14:31:14.353463Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.353463Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:f2a36407df52deac9909998f7d8bd3bc47252bb73a7f33b7431957e03b8e06f1","observation_id":"676d8967-aa9c-42ae-b9b5-db8c76bef781","resolution":{"observed_at":"2026-08-07T14:31:14.353463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T14:31:14.410946Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.410946Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:f5b3c94121041d005cab340e63f4ee9ec543bf7fadbe3b634bf0f74aecdd4f06","observation_id":"b2a65190-299f-4f0e-b539-ec674f8f4100","resolution":{"observed_at":"2026-08-07T14:31:14.410946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:31:14.468895Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.468895Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ace59aa4007a6c023b96d08e1e46ee01fb2c4f38ccb53e1ffb98a7b413302aac","observation_id":"e892892b-c10d-45a6-8065-9432d3feab2f","resolution":{"observed_at":"2026-08-07T14:31:14.468895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T14:31:14.524790Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.524790Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:76feda90cae0e3d953e676ad9c89e13d9ea163ef1581a889d8a28ca596db774c","observation_id":"72cdbf10-5872-413f-8e80-172e4bc18ba5","resolution":{"observed_at":"2026-08-07T14:31:14.524790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T14:31:14.568519Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.568519Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:dc8d40d323f8186f448623044e252913f5b2fb4ff157ad4783c48d24eccdd30d","observation_id":"9ecc574c-ada4-42b0-9d5d-6131135f8e9a","resolution":{"observed_at":"2026-08-07T14:31:14.568519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-08T00:29:08.656523Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-07T14:31:14.613909Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.613909Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4a59c503fc04c2c5d2734a422b7c8e0b4317edf8046df61dc184eb7d894c6b5c","observation_id":"1e676ee6-46e1-4876-99b2-0bbc10440dfa","resolution":{"observed_at":"2026-08-07T14:31:14.613909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T14:31:14.672507Z","title":"Mm- eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.672507Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:51b171a74229495d8f0b2082f829d3c8c183aafa687927adad05938e0ab417f5","observation_id":"9fa25072-aa78-4ace-88dd-3202fa3459b9","resolution":{"observed_at":"2026-08-07T14:31:14.672507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T14:31:14.730553Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.730553Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:7650cdae8f8c1a09bd2128f5aa8b0c214bbc259738db5c142531367dee86030f","observation_id":"79d184a4-a0f3-43e3-a7be-ea742246e1a9","resolution":{"observed_at":"2026-08-07T14:31:14.730553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T14:31:14.783221Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.783221Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:49e4f09ae017c21d8ed625c2bb0ddf0c6f7bb4fcbbca1163bec37572c9a50bca","observation_id":"5f5aa028-7c61-4799-ba77-a4ed484c335f","resolution":{"observed_at":"2026-08-07T14:31:14.783221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:14.842854Z","title":"Mmr1: Ad- vancing the frontiers of multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.842854Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5b431679f423d4d607faee7dc3d357406efd9e69190a93a0049d7a81612c1481","observation_id":"afac0b4d-6a62-47bd-83f1-497cc0567c8d","resolution":{"observed_at":"2026-08-07T14:31:14.842854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T14:31:14.922706Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.922706Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:0f8b718667d3aae655eaff3fe4944e97a054f468bcf0af09599f1ca98af45c49","observation_id":"1f12bbf5-1ba4-436f-8aad-46720d7a2ad2","resolution":{"observed_at":"2026-08-07T14:31:14.922706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T14:31:14.986136Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.986136Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e075ea0bc8c085305864d95bce858e507ea8742b0fffb5a88b637ab7e04f8cf4","observation_id":"be1b0c93-c556-486c-8a10-b029c698a2e9","resolution":{"observed_at":"2026-08-07T14:31:14.986136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T14:31:15.058067Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.058067Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:b84d500a48205906aed7442296f256cc0fc2e314cdeb88519f0775598e4217b2","observation_id":"a457b09b-f3bc-4a6b-acf1-bffc6f8216c3","resolution":{"observed_at":"2026-08-07T14:31:15.058067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T14:31:15.106642Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.106642Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:a43fff4bbd7cc6dafdfd35c3edcc262bd77f8c082295913424bbeac07182c671","observation_id":"e6ce94ea-7263-4968-aee8-9c4a75542481","resolution":{"observed_at":"2026-08-07T14:31:15.106642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T14:31:15.147711Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.147711Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:679396c39578b7230212196d513716b55651221c56875954d48f54358fc493f4","observation_id":"fab00f3a-ea59-4597-8b1d-393e34eee0cd","resolution":{"observed_at":"2026-08-07T14:31:15.147711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:15.223794Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.223794Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:1236d9f87beb1cb343b65b98c50d98d9e2496140d9b65b1f7c27b455089842d5","observation_id":"5b345cae-a46b-427a-bb86-0ff66b6bf849","resolution":{"observed_at":"2026-08-07T14:31:15.223794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-07T15:59:55.050120Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-07T14:31:15.321786Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.321786Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:fc0d653f677ccab50937a678f149274217c3e15cc3b85ba5dbe1e25fd8ebaa62","observation_id":"00eac3aa-c4fa-40f9-ac6b-2a9297bbe228","resolution":{"observed_at":"2026-08-07T14:31:15.321786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:15.448124Z","title":"Fast-slow thinking for large vision-language model reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.448124Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:c6f49b12886bf5dea1517d5aa9577a95a5f1d5afc708b94f674d2bdcadd264d9","observation_id":"4a7a18cf-e7de-4faa-8a78-5e79f51dd4f3","resolution":{"observed_at":"2026-08-07T14:31:15.448124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T14:31:15.565534Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.565534Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5dc2396b8ad4dd9cbd2640b2aae2dc11e8885dbf9bae45deaa4f8d1aadad2462","observation_id":"a1036505-1980-4395-87a2-f3dfba3bb0fd","resolution":{"observed_at":"2026-08-07T14:31:15.565534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:15.674647Z","title":"Crowdvlm-r1: Expanding r1 ability to vision language model for crowd counting using fuzzy group relative policy reward","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.674647Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e601f222e3c8f79b1f9e767a33120563c12ada9dca3f0115644a67e95abff2a8","observation_id":"56723f23-61f3-4feb-a363-1b8e79caf6f7","resolution":{"observed_at":"2026-08-07T14:31:15.674647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T14:31:15.750218Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.750218Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:de4ed4685789a0f2bfe1ba16c7c0ed533afaadd03b2b84bd12c592056aff4409","observation_id":"570fc3a6-5555-469b-82cf-12e948096f05","resolution":{"observed_at":"2026-08-07T14:31:15.750218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:15.837024Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.837024Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:7125b665d674694ce7ba4e04a582209367b18a159f4933aff05b167fd3cbacca","observation_id":"21a87c45-00b5-4cc3-8c36-faf3d4d6f4e7","resolution":{"observed_at":"2026-08-07T14:31:15.837024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T14:31:15.937329Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:15.937329Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:6c0beb638635a527c51292db4501aa2ff20fa4f13af8ad9f2c1fcd3b8b45234b","observation_id":"0eff6400-1167-46f0-8655-a051a7ff64cf","resolution":{"observed_at":"2026-08-07T14:31:15.937329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22679","last_updated":"2025-05-23T08:41:50Z","snapshot_observed_at":"2026-08-07T16:29:27.502751Z","submitted_at":"2025-03-28T17:59:54Z","title":"Q-Insight: Understanding Image Quality via Visual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22679","snapshot_observed_at":"2026-08-07T14:31:16.030204Z","title":"Q-insight: Understanding image quality via visual reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.030204Z"},"links":{"cited_paper":"/paper/2503.22679","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e05c8c01a542ab39a7996f3ed6b48056473a9319c2e268f39d367d1868dc85de","observation_id":"496011d8-4e0b-4c11-b078-090c603f2b73","resolution":{"observed_at":"2026-08-07T14:31:16.030204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T14:31:16.116604Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.116604Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5103b8681b7537b0009c77065f8b325108c48a06e50a78ab6667ae1b3aac2fb2","observation_id":"54ee01f6-ba4b-4c0a-bea4-e51e7d7f9665","resolution":{"observed_at":"2026-08-07T14:31:16.116604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13617","last_updated":"2025-05-26T10:35:23Z","snapshot_observed_at":"2026-08-07T16:01:10.135028Z","submitted_at":"2025-04-18T10:46:22Z","title":"Compile Scene Graphs with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13617","snapshot_observed_at":"2026-08-07T14:31:16.244853Z","title":"Compile scene graphs with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.244853Z"},"links":{"cited_paper":"/paper/2504.13617","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:853bf50b0d3ede84f669922e1a6504a5ad650d5a758a493cbed7fef30f40db0d","observation_id":"dcfc2b59-51ec-41ed-b2ca-a510e7d13a85","resolution":{"observed_at":"2026-08-07T14:31:16.244853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:16.408178Z","title":"Relation-r1: Cognitive chain-of-thought guided reinforcement learning for unified relational comprehension","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.408178Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:2361a6a8c4fea2a5e9baa53c71da61b9fb8d1e00efd6448958fc86eb6a9b5806","observation_id":"6fe23011-cb10-4f82-b0f2-5d19a96a19ce","resolution":{"observed_at":"2026-08-07T14:31:16.408178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:16.533191Z","title":"R1-track: Direct application of mllms to visual object tracking via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.533191Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5743c49993f54c7c36f4f874e247dce4dd06e11e54e399490a0c4c6bc3675081","observation_id":"1eee2c39-18e0-4c37-8fa5-68c866112ea6","resolution":{"observed_at":"2026-08-07T14:31:16.533191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:16.665298Z","title":"SeekWorld: Geolocation is a natural RL task for o3-like visual clue-tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.665298Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e2d72b52876906449da56514a7afe4133a49062b171012a824046ce3b74a56d5","observation_id":"5cf62a27-321c-471b-b20c-074f2896c833","resolution":{"observed_at":"2026-08-07T14:31:16.665298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-07T14:31:16.855930Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.855930Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:bbcf0e6ad31d4431e18135077e2bd82538ff9be7102bdbe36146c59df5767739","observation_id":"8533d11d-b34c-4e6c-9ea3-fe6cdb35c3f8","resolution":{"observed_at":"2026-08-07T14:31:16.855930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T14:31:16.974601Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:16.974601Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4787b07360102e6cce99197304ddbd3c0297483a7b8377aee1e463ae7a7ea84c","observation_id":"b86b18bf-b91f-452c-bf36-547c9fa8a0c5","resolution":{"observed_at":"2026-08-07T14:31:16.974601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T14:31:17.115856Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.115856Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:48f5d57ca21576b3e671e7e3e8c6c105b9d6f200bddd06ecede87ea499c66421","observation_id":"fa6ac10c-57da-444c-8232-5b6303355bab","resolution":{"observed_at":"2026-08-07T14:31:17.115856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:17.206331Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.206331Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:bfbcd6113a365ac3fb218f13f6f75254181498aab5de47763578671d97947b87","observation_id":"e61f2bfb-3c1d-4de3-9c5c-a0b9edd41418","resolution":{"observed_at":"2026-08-07T14:31:17.206331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-07T14:31:17.317950Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.317950Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:6b7735838c81b83a822b7b2968fbd967c54a701148667d573523ea78b4e4fa47","observation_id":"967f09ed-0582-4c9f-8691-c1c707ee491e","resolution":{"observed_at":"2026-08-07T14:31:17.317950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T14:31:17.425233Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.425233Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:8155509c0ece2cce28f919c295d5b0feb60c856f0b66c6b615ad64119b055d64","observation_id":"ae5e1ace-dbc9-410d-9784-e1158d796821","resolution":{"observed_at":"2026-08-07T14:31:17.425233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T14:31:17.543542Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.543542Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:690b16c5bdc9a0f96ff1cd6530b90e6c958ac81962a86ac784dab2d3316e7deb","observation_id":"ea82e587-f15f-457d-b9f4-c78629abcb86","resolution":{"observed_at":"2026-08-07T14:31:17.543542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:17.658024Z","title":"R1-vision: Let’s first take a look at the image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:17.658024Z"},"links":{"citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5c3798a90a1cb6ae43dc71f7c28ebf1fe5017a1b300383e61bd8494dbab9c240","observation_id":"5214968e-aa2d-443b-8d4e-ed8998ede8dd","resolution":{"observed_at":"2026-08-07T14:31:17.658024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":227},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 227 outbound references and 8 inbound Pith citation observations for arXiv:2505.18536."}