{"as_of":"2026-08-07T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:364c9806fca5651caf5185fa43219104b1a4ca31defb8c7ec81040752b6e292f","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T15:43:34.652373Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:02:19.135116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:d9f6160d7f315cf12a74247cd389efd2e9b22b60bc4cd5180142229843a224b9","observation_id":"663300b5-aaeb-4403-ae12-0634e5dbdc59","resolution":{"observed_at":"2026-05-19T06:59:03.351961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T13:29:47.529564Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.15879"},"observation_digest":"sha256:535a86aff7a909f30e080de39fd46607c09b61e6eef7debfe63de62e2ff2adf7","observation_id":"6388e0e0-b733-4138-9ed3-b930cdf92b31","resolution":{"observed_at":"2026-05-22T13:31:36.123124Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T22:10:19.944658Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv:2504.11468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.944658Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:ed96d75406cfd56358b58e15f19f2414cab11aed4a287915b44c6e24a8a3deb5","observation_id":"24113702-aa5e-43d8-9559-237ebc7b9ba6","resolution":{"observed_at":"2026-08-06T22:10:19.944658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-02T08:39:49.062624Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:d309c4df597a6f9cff782c277fed7753f86ebbb9d89b2035d35b6b9f00f0fa39","observation_id":"edeabbe8-7b09-4e80-bc84-dfeaafec1ec7","resolution":{"observed_at":"2026-05-21T23:40:46.153525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-06T06:12:37.171726Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T15:37:09.572241Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.02592"},"observation_digest":"sha256:14a53a1319abd58b3b7331ee4059037743b23e03379047205f8b04cb64b2dead","observation_id":"ced92bbf-66a5-4550-aaa8-51ebd37cd72b","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T20:26:45.633252Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.633252Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:905af0c92ec6dc4831c34e441ed5e500884d936c8641e5622d427523aa8576f5","observation_id":"42f467dd-ab2f-4c2b-8753-a8a7af1b99b5","resolution":{"observed_at":"2026-08-06T20:26:45.633252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T19:18:38.635881Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06013","last_updated":"2025-07-08T14:17:07Z","snapshot_observed_at":"2026-08-06T19:10:43.785921Z","submitted_at":"2025-07-08T14:17:07Z","title":"CogniSQL-R1-Zero: Lightweight Reinforced Reasoning for Efficient SQL Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:38.635881Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.06013"},"observation_digest":"sha256:c8b00f6eb80b1268ec3afe620a6fdbc1505d89eef1d302f9ac21c9bf4922c988","observation_id":"3e1728a6-ab02-44a2-8312-3188f63d4b44","resolution":{"observed_at":"2026-08-06T19:18:38.635881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T18:43:12.147943Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-06T18:35:22.558057Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.147943Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:accf646a6940ccaa1f347fc472f450c7b899387711cc1a1db14eefd502a22c82","observation_id":"c2b2560b-81c8-414e-9bd5-0cbebde45c4d","resolution":{"observed_at":"2026-08-06T18:43:12.147943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T14:53:04.416178Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.416178Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:a1dc1d68b6400d63d69c15b26fbcca5e27a14b947fa23b4e4cce6d32e3c3e9a4","observation_id":"36c4b4ae-a02e-4d87-8706-ad3c159a4e66","resolution":{"observed_at":"2026-08-06T14:53:04.416178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:295c6e00e4beeb7ea37d750589989440e9ff1741dd1913c9089f39215fd66fc0","observation_id":"21777939-f9bb-4490-ade6-fcc4ea013ce3","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T12:47:43.134908Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21482","last_updated":"2025-07-29T03:51:00Z","snapshot_observed_at":"2026-08-06T12:47:40.811631Z","submitted_at":"2025-07-29T03:51:00Z","title":"Improving Task Diversity in Label Efficient Supervised Finetuning of LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T12:47:43.134908Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.21482"},"observation_digest":"sha256:087839cfc7575c438084a58c16e05e334967a52fc9abeb1e0a8d5feaffb1055a","observation_id":"78f9fddc-fb3a-4d01-9d84-eaf5b6dbb4c1","resolution":{"observed_at":"2026-08-06T12:47:43.134908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T12:40:08.907260Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21619","last_updated":"2025-07-29T09:18:22Z","snapshot_observed_at":"2026-08-06T12:40:03.190716Z","submitted_at":"2025-07-29T09:18:22Z","title":"EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:40:08.907260Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.21619"},"observation_digest":"sha256:231ca3eecbc10eefd73b2c197dc5e0a59fd3564723672841856f42ccba99dcc3","observation_id":"2f1f051a-9bf5-45f5-bfb7-ad7af829376f","resolution":{"observed_at":"2026-08-06T12:40:08.907260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T23:03:06.609642Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:06.609642Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:d1f5ddf76510e8f7f7a5340e18f0c9b9d4e821aac1bd184c4f22c6a6cc3faf11","observation_id":"52ab568b-7125-4c5f-8753-0f7549bbe07d","resolution":{"observed_at":"2026-08-05T23:03:06.609642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:73b87118802295627637856f9f37f6afb45013f91763090f00bd26a4aab8ebb9","observation_id":"584c915c-2f4b-4f5e-abde-3e2cf2752b2d","resolution":{"observed_at":"2026-05-18T22:21:53.234074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T12:27:04.885212Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.885212Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:c91723d2a5551c48fd998fcab4d0f7b6b21ddfbedf2e320ef08948a813139bbe","observation_id":"4f8c97d2-a1cf-4e78-8df9-dba7bdfd113c","resolution":{"observed_at":"2026-08-05T12:27:04.885212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T05:34:40.243499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05226","last_updated":"2025-09-05T16:40:13Z","snapshot_observed_at":"2026-08-06T03:16:59.543245Z","submitted_at":"2025-09-05T16:40:13Z","title":"Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:34:40.243499Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.05226"},"observation_digest":"sha256:c7bb3a94377e61b9868c212e3474151ac86d51f073435dbc5a9fb983b0475660","observation_id":"cd903724-f451-48e7-ab85-592fedc27b69","resolution":{"observed_at":"2026-08-05T05:34:40.243499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-04T22:57:44.986207Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-06T22:01:12.035442Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.986207Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:bdf697cb4801bf0deab4c5b7d98e2a5aeead0c0cb0d979303ee646b55649f6c6","observation_id":"93596ae4-2186-456b-8029-e254c01e1a43","resolution":{"observed_at":"2026-08-04T22:57:44.986207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-04T16:07:28.361696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.361696Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6864521d4a79aebba04ea6b1c194c2b458c143cba6c7d0bae9da00316c81bf48","observation_id":"fe009cb9-2b50-4598-83d3-acbabef4f6b3","resolution":{"observed_at":"2026-08-04T16:07:28.361696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2509.18847","last_updated":"2026-04-15T06:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-23T09:35:49Z","title":"Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T15:00:51.162221Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.18847"},"observation_digest":"sha256:63cc47a38e8d077a7646088ac7830ba7b2ac559d60bc53aad98102b7386c04b3","observation_id":"d1d1bde5-9bfa-410f-af95-ce1fe03e63c7","resolution":{"observed_at":"2026-05-18T15:01:31.296494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:6a71d161159ee56a38fb469afd533a3713bfd11ed931a0c19141ec3adf6ac7be","observation_id":"d4b59fc0-9878-4ddd-876b-91f6ccbf08e0","resolution":{"observed_at":"2026-05-18T13:36:25.155140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2509.23352","last_updated":"2026-05-15T10:34:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-27T14:59:31Z","title":"Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T21:30:24.268903Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.23352"},"observation_digest":"sha256:a180c59d589249e9bc5b4ce9d5cedac692c126610735d26b895b1d8f7ce73673","observation_id":"9b8dd9e8-3217-48f5-9044-2713a86776b4","resolution":{"observed_at":"2026-05-21T21:30:39.192536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:929008dcbda9bb6d800a1ff9cdca526e9c46781258f3a653b0c80a5ef6663741","observation_id":"2835058f-2941-4d99-9c7d-e98982c5b5c9","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-04T07:57:22.810986Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-08-06T20:23:18.801284Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T07:57:22.810986Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2510.23497"},"observation_digest":"sha256:8b2b39fb090a72d145b685d9f60e8744cc61969cc4cc1d203a36e2784fb5fa24","observation_id":"8c171be8-466d-4c50-a6b1-6e4562419737","resolution":{"observed_at":"2026-08-04T07:57:22.810986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:632fb66b96fa2014e6cbc7eb41896911a4eaed68bfe9573e04a7864756c37e2c","observation_id":"94162f6f-42a4-47c7-84a6-2e99cc85a321","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-03T23:27:34.982009Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05933","last_updated":"2026-06-24T14:20:52Z","snapshot_observed_at":"2026-08-06T14:58:22.171505Z","submitted_at":"2025-11-08T08:56:29Z","title":"Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T23:27:34.982009Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.05933"},"observation_digest":"sha256:9237df9bb4cb49da79fbfae0fa227294d5360b24b460763516b6bb16ef926ac8","observation_id":"227654e6-ca34-4b57-9ab6-70a07116a4b7","resolution":{"observed_at":"2026-08-03T23:27:34.982009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-03T21:09:13.251555Z","title":"China Computer Federation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16940","last_updated":"2026-05-29T07:25:18Z","snapshot_observed_at":"2026-08-04T11:14:48.726287Z","submitted_at":"2025-11-21T04:33:11Z","title":"MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:13.251555Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.16940"},"observation_digest":"sha256:ced132a4eeba6345f6c4758760856f4ad9e4e208bd3d1cd83a2e996c3bf7bbb0","observation_id":"4c20dbad-0a8a-46b7-bf7b-cb81c16b9fea","resolution":{"observed_at":"2026-08-03T21:09:13.251555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2511.17652","last_updated":"2026-04-06T19:52:36Z","snapshot_observed_at":"2026-08-01T03:53:15.171510Z","submitted_at":"2025-11-20T13:29:35Z","title":"TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T20:29:39.744103Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.17652"},"observation_digest":"sha256:adba8b941f6992ce586a546047e1e57d62349dd86ef3c4050c6e50f43d9a76e3","observation_id":"6f0c7d33-ee0b-4908-8407-12343980bcf5","resolution":{"observed_at":"2026-05-17T20:30:11.116491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-03T20:27:11.411364Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19923","last_updated":"2026-05-28T23:36:20Z","snapshot_observed_at":"2026-08-03T20:26:55.531608Z","submitted_at":"2025-11-25T04:59:55Z","title":"Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:27:11.411364Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.19923"},"observation_digest":"sha256:0ad85f0c08a55dadc72dab2760e8b71c74f5d6e4e112e30b45dea232063a2952","observation_id":"ddf35aeb-ab0b-4711-8dff-c7247bb83273","resolution":{"observed_at":"2026-08-03T20:27:11.411364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2511.22396","last_updated":"2026-04-08T01:53:03Z","snapshot_observed_at":"2026-07-06T22:37:08.086095Z","submitted_at":"2025-11-27T12:19:37Z","title":"Asking like Socrates: Socrates helps VLMs understand remote sensing images","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T04:54:57.121481Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2511.22396"},"observation_digest":"sha256:d44956a88bbc6fb099c890f41e7061f1395b63d0b82e4620f939bd0c5bd3f331","observation_id":"feca519a-fadb-41ef-bbfc-b48c1c8ccc14","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:3b08b54f40f43cbdae8e1a501b6cb47fc5eea08797d8f35db3087b1c235240c6","observation_id":"88674871-a74a-4b1b-8776-512f7945ef01","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-03T11:13:16.762815Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-07T01:28:13.061117Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.762815Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:2aa48ef884ea848adbace14133085f420106c676d877ff100390e4fac1a0cfab","observation_id":"9cf111ae-be03-4f32-b561-3108f6f4307d","resolution":{"observed_at":"2026-08-03T11:13:16.762815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-02T19:58:14.742025Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:14.742025Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:6587d95a4ec614afb1a5ba799ade881a9f18cd7783e0c4b1c9cf2135755b9591","observation_id":"823cb637-64b5-4a87-90d6-d521c9eadfcb","resolution":{"observed_at":"2026-08-02T19:58:14.742025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2603.19500","last_updated":"2026-04-23T23:00:01Z","snapshot_observed_at":"2026-08-02T12:53:52.187936Z","submitted_at":"2026-03-19T22:08:53Z","title":"Teaching an Agent to Sketch One Part at a Time","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T07:53:15.953601Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2603.19500"},"observation_digest":"sha256:9ed785d1da5d71fdbe827991cea4f0e24b5e469f2de314ae7cf9f32ceea44349","observation_id":"c70ed5cd-9388-4a7e-92ce-e6a59593d17f","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.03179","last_updated":"2026-04-03T16:56:34Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T16:56:34Z","title":"Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:48:52.130130Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.03179"},"observation_digest":"sha256:c27c1b32095cae168d4f5604204865eef4b7d12d88569d48cc7d66a0c6907e71","observation_id":"6e169cf3-e0d2-41a3-b71a-0e8a488fd26a","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-02T17:31:04.989744Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:13.305374Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.05117"},"observation_digest":"sha256:96db316af3696c82eb4693a93e4cafe7f799163ecf49f3b3ca12339c2526179b","observation_id":"9b8e4736-2200-4c0d-8ff0-d93c1f1727df","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:35:21.514502Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.08545"},"observation_digest":"sha256:4d367d94ffb3415087f7769e97db4e13e1b88818082b41207c9571c8a376ef6f","observation_id":"53641dc4-bc0b-471e-96dc-847ae3396003","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.15306","last_updated":"2026-04-16T17:59:43Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:59:43Z","title":"Generalization in LLM Problem Solving: The Case of the Shortest Path","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T10:37:45.355872Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.15306"},"observation_digest":"sha256:af4ca18c4d5a38ef6b8a0dc6899086d20b31f52b13f8eda42073931ca31354b8","observation_id":"63c54e0e-f8e2-44a0-8c55-0f24920ef4a1","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:4f367ea2a10cda797558fd26cbff1c53532d9f65b7ae405426a01f36bc578d04","observation_id":"7c852431-d69f-4047-8c7c-257aa0598ff3","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.18839","last_updated":"2026-04-20T21:06:12Z","snapshot_observed_at":"2026-07-06T23:05:35.374092Z","submitted_at":"2026-04-20T21:06:12Z","title":"One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-05-10T04:56:35.796962Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.18839"},"observation_digest":"sha256:615decbbd1e35994e8da6ba2836d91134a971c37a1aba827cfb25ecf2e2a2c93","observation_id":"69ca1e44-4ed7-4c75-96e5-13fe8d1825ff","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:066a0d6a0794f5d0597ca9fac30785051010dba8e51132e48af6343394e44a76","observation_id":"b1f6c7e3-8b8c-4ebb-a27d-2f6cb7d31507","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.08817","last_updated":"2026-05-09T09:10:03Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:10:03Z","title":"How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:04.955816Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.08817"},"observation_digest":"sha256:a06d4f4f2ac0b914d5825d42307534bffe296f32b3c5249b99759484cc18e180","observation_id":"e8051922-815f-4367-8c4b-300a29563b98","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:f4d98e490e76e5829561df821bf89f77e883a25c4b0538aa275f5c6a67c8f5d4","observation_id":"f2176436-10eb-4ea0-bbf8-da2b115a9287","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.13230","last_updated":"2026-05-28T10:13:36Z","snapshot_observed_at":"2026-08-05T08:58:23.481391Z","submitted_at":"2026-05-13T09:20:03Z","title":"Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:32.638453Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.13230"},"observation_digest":"sha256:b4b1273a217f7012613b13211eb9f066abbfd99e28c9039cede5d293d7280c65","observation_id":"11233d49-b0da-4cfd-9cd2-a9385544f928","resolution":{"observed_at":"2026-05-17T15:43:34.765363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.19852","last_updated":"2026-06-03T11:11:28Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:44:26Z","title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T06:16:47.650748Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.19852"},"observation_digest":"sha256:ddcd9b825691c6ce3093261cb0fe54f1ca8634279c21a474f954118d9a95e8a5","observation_id":"b98e07f9-c4ac-4ba1-9170-79703cd4b01f","resolution":{"observed_at":"2026-05-20T06:18:05.178174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:2f56ebf3bd464f93505639b53627ad4ec24d7f6b0bfb5786167565360e74e7ec","observation_id":"9266a140-c721-4919-ad30-99c840ebd9e8","resolution":{"observed_at":"2026-05-21T05:39:40.523567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:a3da3d577d1c24b0f5f59782df465f242299a571e65a5fb51d64a0b46bd39511","observation_id":"b0cb786d-7ac9-4b0e-8b91-a44e05412304","resolution":{"observed_at":"2026-06-30T17:24:57.491852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:3a4993c455e108a70025ed9498e017da763f63d6e1faee08ec34771533001707","observation_id":"3785af52-345f-441d-a180-2d76d5c2776b","resolution":{"observed_at":"2026-06-30T00:14:04.569192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2606.02518","last_updated":"2026-06-01T17:27:48Z","snapshot_observed_at":"2026-08-01T13:26:48.045604Z","submitted_at":"2026-06-01T17:27:48Z","title":"ToolFG: Towards Well-Grounded Fine-Grained Image Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:06.186594Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2606.02518"},"observation_digest":"sha256:1f44c67b59a8591e524cc99844c0b2f9d1a0633c0287490a384003b16bbf56cc","observation_id":"30f6306f-c6fc-4380-a466-508f6fcaa267","resolution":{"observed_at":"2026-07-01T22:56:20.349143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:8b943082747e79a94955b7e26240469ac513f44a00b06dbb5d9096bac0f56b0d","observation_id":"a4d67d8c-9984-4a16-86f5-a83c116e52e9","resolution":{"observed_at":"2026-07-03T20:48:56.121032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-01T19:53:34.208327Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T00:39:29.703711Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2606.24064"},"observation_digest":"sha256:87ec9cc5d7500f1662d4d5afd0e09606a81cd94f090e27d75570fa2e973d440c","observation_id":"1826d3fd-d7dc-49db-a281-4d2ef82897ab","resolution":{"observed_at":"2026-07-04T16:29:57.013212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2607.06522","last_updated":"2026-07-07T17:27:59Z","snapshot_observed_at":"2026-08-02T11:32:48.615721Z","submitted_at":"2026-07-07T17:27:59Z","title":"Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T03:13:07.963343Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.06522"},"observation_digest":"sha256:a70efda7836e26eed60520777b834ec729c1c9f5593baf93781144c61fe4bc37","observation_id":"6c48bdaf-3f3a-4b4a-b366-ee810459815d","resolution":{"observed_at":"2026-07-08T03:14:31.698320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-06T21:03:10.324376Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-09T13:51:49.149342Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:bb754260e198b2b13098c478608e458bb06d829596a30f760b7d6c3374661571","observation_id":"757dbb39-9cbf-49c1-b8e5-010dd6e76ef0","resolution":{"observed_at":"2026-07-09T13:56:19.219331Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-07-13T06:45:27.857034Z","title":"arXiv preprint arXiv:2504.11468 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-06T21:03:10.324376Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-13T06:45:27.857034Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:3b5f54f53fdc8496a1b95702d0e920dfba163625b89dde704294a73c622678b7","observation_id":"ac7f4469-3187-48a0-ae8c-a5b8904426d0","resolution":{"observed_at":"2026-07-13T06:45:27.857034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-02T03:20:41.224809Z","title":"arXiv preprint arXiv:2504.11468 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-03T21:19:12.349925Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.224809Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:b1915d70e9985ecfe45f9fac827971c0e3fae90caabc08d8f5f881555783978f","observation_id":"3b2f3b5e-95e9-43e5-89b4-e24edf9eb807","resolution":{"observed_at":"2026-08-02T03:20:41.224809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-07-31T21:13:05.201592Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24199","last_updated":"2026-07-27T09:24:41Z","snapshot_observed_at":"2026-08-06T23:25:59.420946Z","submitted_at":"2026-07-27T09:24:41Z","title":"Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T21:13:05.201592Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.24199"},"observation_digest":"sha256:4c693f926fc36579e1884a0fa75c4e3cc41f9cb751b2b0f1489dc176f9951cd2","observation_id":"69641fed-a3c3-4135-b179-c2f374505a6a","resolution":{"observed_at":"2026-07-31T21:13:05.201592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-03T11:36:49.162119Z","title":"arXiv preprint arXiv:2504.11468 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29211","last_updated":"2026-07-31T09:30:33Z","snapshot_observed_at":"2026-08-05T23:12:52.496123Z","submitted_at":"2026-07-31T09:30:33Z","title":"Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T11:36:49.162119Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2607.29211"},"observation_digest":"sha256:a485ed20a746e4fc99536802db30bd45be473e26c3338c533871bab6fb1cdbe9","observation_id":"cf4436d1-3642-4344-af48-54e7b424dc8c","resolution":{"observed_at":"2026-08-03T11:36:49.162119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T19:03:07.091870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03450","last_updated":"2026-08-04T10:46:10Z","snapshot_observed_at":"2026-08-07T03:14:28.934788Z","submitted_at":"2026-08-04T10:46:10Z","title":"Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:07.091870Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2608.03450"},"observation_digest":"sha256:b466a787187532e855e088a811c6d5468e6184a7dbfd2c626cbe0435aadb83b2","observation_id":"701a8f4f-69ed-42a1-9375-ccd59810fc97","resolution":{"observed_at":"2026-08-05T19:03:07.091870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T01:02:19.135116Z","title":"Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05631","last_updated":"2026-08-06T05:58:22Z","snapshot_observed_at":"2026-08-07T03:24:16.190759Z","submitted_at":"2026-08-06T05:58:22Z","title":"ChronoVision: Temporal Reasoning via Latent State Reconstruction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T01:02:19.135116Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2608.05631"},"observation_digest":"sha256:7f4ac4f959f010db22b0e66b87a146051bdbfc9c44f10d392f33d713adac168d","observation_id":"e7278a92-03b9-4394-b7f6-c14401128e84","resolution":{"observed_at":"2026-08-07T01:02:19.135116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.11468/citation-record","integrity":"/paper/2504.11468/integrity","json":"/paper/2504.11468/citation-record.json","paper":"/paper/2504.11468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"description","venue":null,"work_id":"fa56cd8a-a83b-40cd-9646-70a2cc4490bf","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:f9a4b8b399f35e9b03ca489657d06feec2cc2a7cfd061b6ead3a707ec00441d6","observation_id":"377d1c5d-6337-4d2c-965b-2bcd861d1e8c","resolution":{"observed_at":"2026-05-17T15:43:34.680977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13af225f-5c58-4177-9c35-0db9c08151ec","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:4ad67bbc67be026909fd4688b82589b96b6b6a2dd1c0ddb705e261fa6677bec6","observation_id":"2e6fdd68-68aa-4523-b52e-b9daa09501fe","resolution":{"observed_at":"2026-05-17T15:43:34.688049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"—— Here is the input: {input} Figure 10: Prompt for answer rewriting with GPT-4-Turbo","venue":null,"work_id":"1653d069-e272-4934-8d7e-7d6e41093a32","year":2024},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:3f75dc264222f21dd0537e94291e6376f53edc1756432ce2e24bc4c3d4eb603d","observation_id":"6c138ff6-9497-47a2-bd75-c1f2e83be658","resolution":{"observed_at":"2026-05-17T15:43:34.693175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"90c903b1-c672-419c-9a3e-2efc1e1f4146","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:760e4b1cf8a0f9b5d359314c17fff058b7ef66c861a3b28901f98f5dc347cfab","observation_id":"d8b0a96e-1bc8-42c0-afdd-a53cf6be75dc","resolution":{"observed_at":"2026-05-17T15:43:34.696741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"112a63fe-d265-48a4-9f9c-3414d617e282","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:c939d41ca65c9bc637a715863f7cbd10c45b45bda019f6282d7264c1cba79689","observation_id":"1f915c4d-46b9-46a5-a615-e9b11f715519","resolution":{"observed_at":"2026-05-17T15:43:34.700302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34e7384a-b506-45d8-a6fb-788e5095d004","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:f112e2b5df264235f3a0ac7d66385c693c772195cf10dbdb6b5de2621efcfb5e","observation_id":"c214b2cc-f479-42a5-ba73-a1a99e336103","resolution":{"observed_at":"2026-05-17T15:43:34.703720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33e67548-c6a9-48ff-a42a-7aef76cea40a","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:4cf5a878ab45fbfe6745edec8aa37d8593be5a76b39ede26193faca0b6121f64","observation_id":"bf48c659-72e1-44bd-9221-f4de2d795301","resolution":{"observed_at":"2026-05-17T15:43:34.707323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44dea13a-bb63-4c79-ae81-5c8dbda503ef","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:ee7554b88ce3199439d8a3e128fa22d063eac93a01ed9a0beb2d85ef7a89c9a7","observation_id":"f9d54b84-939a-432b-9eef-6004030516f8","resolution":{"observed_at":"2026-05-17T15:43:34.710824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A”, “A)”, “(a)","venue":null,"work_id":"04bc72c4-83bd-4155-bd9d-b3d40459892f","year":2024},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:1be5209c3a33a8f6ba7df90ba601bd0db658e64b6ef76f41aca4721e23a3ddb9","observation_id":"817710e1-b9a3-4930-9f21-4c10b1b614da","resolution":{"observed_at":"2026-05-17T15:43:34.714333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- The angle ∠ AOB = 36∘","venue":null,"work_id":"80f3673f-03e9-42b0-a9d1-383c7a9f6b1a","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:15fa805b557b76f2546b11bae7d3ef4b62b5e7dd7789d68fb8e48a1ef16fd247","observation_id":"fd176a77-ae3b-455e-aec0-13f3cc800221","resolution":{"observed_at":"2026-05-17T15:43:34.717727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore, ∠ OBA = 90","venue":null,"work_id":"c023c56a-fc26-4ba5-8676-da424363ca53","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:882b5acbca51dd38e4dc815e2c9216e38f8ac898086caaab69be8d819d553ed5","observation_id":"0bb6b597-dbce-475a-ac09-8ec07744f140","resolution":{"observed_at":"2026-05-17T15:43:34.721190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e89e7574-9e36-4686-9eb2-c7e5b959f77b","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:416aaedc5cb0ff57750d4381866417bf384d344c6039deb298bc5125fcb7a3fa","observation_id":"f9130c08-2e24-4054-8414-3bfa1debef23","resolution":{"observed_at":"2026-05-17T15:43:34.724942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Points C and D are on the semicircle, with D being the midpoint of arc BC","venue":null,"work_id":"2bdd87ec-1801-476c-ba25-0bc295e0503e","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:577d00127e3ed4079f313a0310d96d3f581cda6fbecffd595a4ccb4e3055f4d4","observation_id":"a00ecbf7-cba9-4c20-b997-cfecd68a0b6f","resolution":{"observed_at":"2026-05-17T15:43:34.728598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Midpoint of Arc: Since D is the midpoint of arc BC, arcs BD and DC are equal","venue":null,"work_id":"f2043bac-7c0a-45e8-90d3-fd2b84e47078","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:8b99e14bdc167a87085b57156c0e5bd0598cd1a862f3c80ea9b94a7d6061ab9f","observation_id":"11eb9db7-a71f-474e-a285-ef97a3632064","resolution":{"observed_at":"2026-05-17T15:43:34.733236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1681ef37-7d89-4fe4-84e8-aada82fc9282","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:9d911bd5fb8adbec06bb2d3ede3e170fd655f8fdec18d447e24a14c6d024ff5b","observation_id":"4ad2767c-783d-479e-b817-83c8d5a89262","resolution":{"observed_at":"2026-05-17T15:43:34.736435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let each be","venue":null,"work_id":"1db25846-cf9c-4f17-ad42-b49e9961a900","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:b71e7847dcde8bba8e7206074d5f099da55f6a52852fc7507f517af303465c34","observation_id":"a4812136-1b4d-4a3f-b69a-d0d469bfa25a","resolution":{"observed_at":"2026-05-17T15:43:34.739290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- By the Inscribed Angle Theorem","venue":null,"work_id":"74cda058-f77a-4c4d-8edc-df93d57b73c5","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:6c4409db34ed05a687be825d3c40a57715d11a09974fc26cee19ed5adba9c0f9","observation_id":"3fd4b36e-47d7-4f48-bc20-062b7fafde3f","resolution":{"observed_at":"2026-05-17T15:43:34.742450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"24ebd162-189a-4698-b0b2-43236cd8e56a","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:67948b53ea6393afe5ba784a8afdacce3b62eadda05173e173e835fbc665b84d","observation_id":"9381ce95-e650-48ae-a8af-c2c11af64fc2","resolution":{"observed_at":"2026-05-17T15:43:34.745099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How many objects are left? •Original Answer: 3 Input Image <think> Okay, let's see","venue":null,"work_id":"5910e8f9-a3fc-49c1-8f75-4ab6c11d1334","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:1f49eae3fefe916fb4da13e7da93c0165e72843d521cec7c620cf36aaf8bec26","observation_id":"f3ab0f9d-be62-43d5-895c-ff53adfe68b4","resolution":{"observed_at":"2026-05-17T15:43:34.748216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To find the value of , I'll substitute the coordinates of the point into the equation","venue":null,"work_id":"f9119289-1410-458b-8053-ea1344ba72f5","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:fe54353e5f252d6bc2d3e05ee5802bc0ccb642915181d9654a247ca8c3a3a4c1","observation_id":"7dc0860c-e552-4caf-88ab-d4217fe9ea96","resolution":{"observed_at":"2026-05-17T15:43:34.751072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a2255f2d-4e1e-4f2e-8f18-428f9c24d021","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:283cf9533e45e173dfef19e7c54cfc0aafbd01f4e3ca69d38c17e08b109930b0","observation_id":"6d55bae2-aee4-497b-a2dd-16e25d5c1b82","resolution":{"observed_at":"2026-05-17T15:43:34.753665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9aa98108-5493-4630-b413-88bacad01f06","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:95a4bb140bf8c4561a2079da80a303b9d93a4081ea4e1df1100ead70154b7c83","observation_id":"8f991278-9cf0-436c-8ba8-c5ec09e9d91b","resolution":{"observed_at":"2026-05-17T15:43:34.756381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"56eab831-f5b4-4e90-bc94-70f483966d12","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:e1fcbd488bd38392adeb155d1e2c19cea5d8ee0f8148f799e5a0e3ad22c2637e","observation_id":"e8ab3baf-dc7d-47a8-85f8-4e8f74c3061a","resolution":{"observed_at":"2026-05-17T15:43:34.758933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"df16f8a3-c23c-4606-8b1a-6f9f1c4a6b00","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:26394729dd0c3c18122bb542e5a673ca070d1f28bd299fc0bb1b533861a66a74","observation_id":"585d2d22-91e7-483f-91d3-8f3dc50cc1d5","resolution":{"observed_at":"2026-05-17T15:43:34.761573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How many objects are left? •Original Answer: 3 Input Image <think> Okay, let's see","venue":null,"work_id":"dedf2d0b-e378-4256-a58d-fda5d2262bcc","year":null},"citing_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T15:43:34.652373Z"},"links":{"citing_paper":"/paper/2504.11468"},"observation_digest":"sha256:56af9182af3b9e0f8e8bb7312acfb67487c8c2282fbc8866f575fa21f47bd519","observation_id":"649384af-e3c0-4f3c-9363-7e67250ae337","resolution":{"observed_at":"2026-05-17T15:43:34.764485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 58 inbound Pith citation observations for arXiv:2504.11468."}