{"as_of":"2026-08-07T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d1fa5436e709c5e9f04779cd8023568271081a429fe1d05535d75c4df514f92","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:43:14.663362Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:56:39.504430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T00:14:04.589912Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"cited_work":{"arxiv_id":"2507.07562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07562","snapshot_observed_at":"2026-06-30T00:14:04.589912Z","title":"The synergy dilemma of long-cot sft and rl: Investigating post-training techniques for reasoning vlms","venue":null,"work_id":"5bc2a507-5b48-4d3f-bb4e-26cf2b3e2c5a","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2507.07562","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:ac81a3a2174274524bde14e0bbc7f5242abd7bbf68bab85a825e1e56c13dc881","observation_id":"4220cfe6-f0bf-41ee-88f0-de5c6f8eacec","resolution":{"observed_at":"2026-05-12T08:40:41.815805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"cited_work":{"arxiv_id":"2507.07562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07562","snapshot_observed_at":"2026-06-30T00:14:04.589912Z","title":"The synergy dilemma of long-cot sft and rl: Investigating post-training techniques for reasoning vlms","venue":null,"work_id":"5bc2a507-5b48-4d3f-bb4e-26cf2b3e2c5a","year":2025},"citing_paper":{"arxiv_id":"2601.07389","last_updated":"2026-05-06T07:45:21Z","snapshot_observed_at":"2026-07-06T22:41:29.385811Z","submitted_at":"2026-01-12T10:14:09Z","title":"On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T14:47:52.094353Z"},"links":{"cited_paper":"/paper/2507.07562","citing_paper":"/paper/2601.07389"},"observation_digest":"sha256:2b1621374382855d95a6f45547fb9c22ad71cc871388cdd1aff3f8e684bdbd80","observation_id":"4fd3e50a-a2b5-42db-8bf4-dda52bf77160","resolution":{"observed_at":"2026-05-16T14:48:00.469365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"cited_work":{"arxiv_id":"2507.07562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07562","snapshot_observed_at":"2026-06-30T00:14:04.589912Z","title":"The synergy dilemma of long-cot sft and rl: Investigating post-training techniques for reasoning vlms","venue":null,"work_id":"5bc2a507-5b48-4d3f-bb4e-26cf2b3e2c5a","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2507.07562","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:eec5a2e51b28739133c9ae9d0c2dd0e41f9c46315a55c6567150832c6347acb9","observation_id":"dd0ea6f6-0c41-48e7-8da5-e4f535269f7b","resolution":{"observed_at":"2026-06-30T00:14:04.591636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07562/citation-record","integrity":"/paper/2507.07562/integrity","json":"/paper/2507.07562/citation-record.json","paper":"/paper/2507.07562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T18:43:12.071992Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.071992Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:f420f476d494559f032d7de25d280a115eed7e27b5ad913884559de1c3bf4c70","observation_id":"89f1901c-ae94-490e-954f-677cf57d7bd4","resolution":{"observed_at":"2026-08-06T18:43:12.071992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-06T18:43:12.351683Z","title":"Cogni- tive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.351683Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:9a49e19ebeccfd931192dd179c0853e904473fb6f3f1c86cc6ddf386698955be","observation_id":"1bb82a37-d36b-4c55-8e65-504b2137b1ba","resolution":{"observed_at":"2026-08-06T18:43:12.351683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:15.488858Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":null,"work_id":"e1be6986-412f-44df-88d1-ce1f71a961d0","year":2024},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.452476Z"},"links":{"citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:a32c5a7e900ab3bd8a81d7ce95ceb4c1a669f9b8b09760b6ac935b927a9ec2cf","observation_id":"d7118bfb-52ae-451f-9256-f4511780ad8c","resolution":{"observed_at":"2026-08-06T18:43:15.589359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:43:12.533076Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.533076Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:52ee7626113b54fa47526e1da23cc639f78489ccd58ab1422dd4481c5683bdfe","observation_id":"932dcfa6-612f-4c2d-8d19-603af71bc7d9","resolution":{"observed_at":"2026-08-06T18:43:12.533076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T18:43:12.605646Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.605646Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:d9784e424d7ec9e1ae69395cc1f04e579746decb1557cfa67273197f1914d5f6","observation_id":"48f42d94-ef92-4dc4-9138-292463bcf64b","resolution":{"observed_at":"2026-08-06T18:43:12.605646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T18:43:12.666793Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.666793Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:ed01dd1cbb8d5c8871e7ea5781dd913dde1aacfcd8ca4b2643d81748354dbacf","observation_id":"18ada49c-25ff-477c-8b05-69225c260b51","resolution":{"observed_at":"2026-08-06T18:43:12.666793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:43:12.819360Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.819360Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:3ec87e45034e080c14d9c16a4ecebe2556ed5801d6a3475a65216ca4f0007a34","observation_id":"f53ea69e-b35b-4a47-9013-8d1695fc6b97","resolution":{"observed_at":"2026-08-06T18:43:12.819360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-07T18:33:53.014392Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13284","snapshot_observed_at":"2026-08-06T18:43:12.895530Z","title":"Acereason-nemotron 1.1: Advancing math and code reasoning through sft and rl synergy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.895530Z"},"links":{"cited_paper":"/paper/2506.13284","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:adac9636bb9732e37c68bdc93f37e3c4bfb54f5a97b179a2bf1b396984a03810","observation_id":"715a276c-f616-4c4e-a226-32d82389387f","resolution":{"observed_at":"2026-08-06T18:43:12.895530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T18:43:13.038090Z","title":"Yi Peng, Xiaokun Wang, Yichen Wei, Jiangbo Pei, Weijie Qiu, Ai Jian, Yunzhuo Hao, Jiachun Pan, Tianyidan Xie, Li Ge, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.038090Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:1f75016e31ca6f565fe84955773de93204cd88cba641d41357ad0ba7263575fd","observation_id":"30494fb6-9a92-41d0-854e-af82ae08b37c","resolution":{"observed_at":"2026-08-06T18:43:13.038090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:43:13.127934Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.127934Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:dd25cf8e0018f0a68b66a4a0ecfe46b1b8602787577d6a10a957a7ab4239c36f","observation_id":"607f44a6-7c83-4c6a-958e-4ea33e61a483","resolution":{"observed_at":"2026-08-06T18:43:13.127934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T18:43:13.188974Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.188974Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:24f242ceb704dbb45d91d69054c649c264c4bc8647feec40f56899b067f2ea99","observation_id":"0947f061-f8f4-4fd4-8074-0c15a6b01239","resolution":{"observed_at":"2026-08-06T18:43:13.188974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:43:13.310210Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.310210Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:c28786a2a11fdf0a5d9c215fd62f540fb6167479e96610910592c6f9b74ed07f","observation_id":"042fe905-15a9-48d6-afaf-1cd6fcb6b17b","resolution":{"observed_at":"2026-08-06T18:43:13.310210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-06T18:43:13.368576Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.368576Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:71950e00dea95b11cd13d72ad4663208a29fc9ac4293aa7d613c99f7b96847a5","observation_id":"e4252390-13a8-40bd-94b3-5c13a46eaf1e","resolution":{"observed_at":"2026-08-06T18:43:13.368576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-07T15:59:55.050120Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-06T18:43:13.461715Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learn- ing for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.461715Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:48e9b2daaf8b99f41ea9fc983558d3aa44d2e69f7af2c578c3704957901bebd4","observation_id":"1c3f7eaa-e072-4070-a191-14f807f18d2d","resolution":{"observed_at":"2026-08-06T18:43:13.461715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-06T18:43:13.654093Z","title":"R1-onevision: Advancing general- ized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.654093Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:96a132fb79b92406e944db1c88121134e0e3efbfbf15bc3f9880e4421c5ba8f4","observation_id":"8a7de96f-9c1e-4d68-87df-a3574142399b","resolution":{"observed_at":"2026-08-06T18:43:13.654093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T18:43:13.832356Z","title":"Demystifying long chain- of-thought reasoning in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.832356Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:d95b424df36e1633ff69fb65518dceb346a15928a7ede5510892deb69de3d7f6","observation_id":"f00d0a4b-b544-4070-b08a-39500efd0c46","resolution":{"observed_at":"2026-08-06T18:43:13.832356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T18:43:14.145096Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:14.145096Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:4f167ef64683935ba0cf0f8774da67ece042079e7e3cf9bda9e22fca577389cb","observation_id":"ee5f3f58-337f-41bf-9cac-c7137806a94d","resolution":{"observed_at":"2026-08-06T18:43:14.145096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T18:43:14.386503Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:14.386503Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:da274d4db875cd546480997c3e93bedd0322e151ba41e0246ffb3a81eea9e014","observation_id":"6993364a-f058-445a-91fb-b92c2850bc60","resolution":{"observed_at":"2026-08-06T18:43:14.386503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T18:43:14.536799Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision , pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:14.536799Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:0217cc35d624ac54921ad5a76d88423de4da10b4a7e9b26d1c57091b170b96fe","observation_id":"2f15e2a6-df26-4486-8f23-3ba1178ff97a","resolution":{"observed_at":"2026-08-06T18:43:14.536799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T18:43:14.663362Z","title":"URL http://arxiv.org/abs/2403.13372","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:14.663362Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:c2b2470b09ad142ff00ba29225bcfb30536991306d809e3c44f4d52bc6d9baa3","observation_id":"66bb2bd0-6a99-4730-a655-82aeb47e628b","resolution":{"observed_at":"2026-08-06T18:43:14.663362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:13.245905Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.245905Z"},"links":{"citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:1166908cc63c9fef2ac3dc15b7f934396f5ac25452ef3944a7ceb0caabe5841f","observation_id":"2da25105-e8bd-433c-94ea-55230efbd11f","resolution":{"observed_at":"2026-08-06T18:43:13.245905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T18:43:12.737770Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.737770Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:df70e24d806aef753b9f198804a8498d8d07c4daecaef4bc703a7c6e5ae68ae9","observation_id":"c6a0d5fc-8fa4-4230-8d97-50b9bb59abc6","resolution":{"observed_at":"2026-08-06T18:43:12.737770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T18:43:13.535549Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:13.535549Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:7ecfc93987659a65da53a1586a5ba7742b6c69439bffb32db95c3460dfae4fa4","observation_id":"24224149-d2cf-4f44-9874-6ae319720223","resolution":{"observed_at":"2026-08-06T18:43:13.535549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T18:43:12.963346Z","title":"Mm-eureka: Exploring the frontiers of multi- modal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.963346Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:521bf775db70b7bc62e9f79796c7d458b91fa957ec799fff287242722cd07526","observation_id":"49fea811-4015-426c-b542-f2c90b4fdc51","resolution":{"observed_at":"2026-08-06T18:43:12.963346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13261","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:43:15.215911Z","title":"Unlocking the potential of difficulty prior in rl-based multimodal reasoning","venue":null,"work_id":"7f9f4df4-0181-4fb7-a9dc-d9ce7b2474f4","year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.271902Z"},"links":{"citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:61d9d79e390e93fae0b7eb89d5478f388120cb9b850e1406c276f820cd83c0d4","observation_id":"565eaac8-595a-41a9-8e04-6a1bf00cc9b3","resolution":{"observed_at":"2026-08-06T18:43:15.339676Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T18:43:12.147943Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.147943Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:1564a9f440e1d4e66552109228ad170265236a27a1030ca7d47f321a4fe320ee","observation_id":"c2b2560b-81c8-414e-9bd5-0cbebde45c4d","resolution":{"observed_at":"2026-08-06T18:43:12.147943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 3 inbound Pith citation observations for arXiv:2507.07562."}