{"as_of":"2026-08-07T17:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:520dcaddf9b6bf3b5b671727455f4d4020ab6d3b6d85f4c04005c818610694e1","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T14:46:30.334667Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20177","snapshot_observed_at":"2026-07-31T14:46:30.334667Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24447","last_updated":"2026-07-27T13:52:09Z","snapshot_observed_at":"2026-08-02T19:54:25.493460Z","submitted_at":"2026-07-27T13:52:09Z","title":"RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T14:46:30.334667Z"},"links":{"cited_paper":"/paper/2605.20177","citing_paper":"/paper/2607.24447"},"observation_digest":"sha256:050afe33bfa7ec63225c977e14569318e8cd807a196b2d443cd6334355787962","observation_id":"7d07c8f7-0df1-49ad-83bf-b49a503c4082","resolution":{"observed_at":"2026-07-31T14:46:30.334667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20177/citation-record","integrity":"/paper/2605.20177/integrity","json":"/paper/2605.20177/citation-record.json","paper":"/paper/2605.20177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nore- geo: Non-reasoning geometry benchmark.arXiv preprint arXiv:2601.10254","venue":null,"work_id":"716099fe-55bd-4e12-a823-0775767639c6","year":null},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:f62f37e85fdb92b683488b14f787e9ba26d6e2e7126a30c771ba852f4780ecd2","observation_id":"58b2735c-2917-443e-abb3-75e0bff75d96","resolution":{"observed_at":"2026-05-20T05:13:21.522642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:7c7db865e9567bfca06a972d0f4e25c1de2e3c4029f54679b7bf36ffe6a69092","observation_id":"4b90cb14-efeb-4715-a8d3-433eb05e6166","resolution":{"observed_at":"2026-05-20T05:13:21.535514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:78b491e07b468d66c70fef3afaf42e8c9fa0b7e33f83274639fa218d7fb8d6c6","observation_id":"ec0b5e64-b557-4071-bc35-f14648cee6bc","resolution":{"observed_at":"2026-05-20T05:13:21.508096Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:5fbd7d7865f35598fa654a0ba8bf5dbca3d64359ec2057d442a062aa0d1301dd","observation_id":"8445d69d-6a82-432a-bee2-4873c9088011","resolution":{"observed_at":"2026-05-20T05:13:21.545362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-02T03:18:39.824103Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":"2312.11370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-07-10T01:46:40.938849Z","title":"G-LLaVA: Solving Geometric Problem with Multi- Modal Large Language Model","venue":"cs.CL","work_id":"3a63b857-2284-4d2e-93fe-e112cfbc77ea","year":2023},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:8b8b936ececf17979651dd3c4e003cc3fd20e00b2aec57e9a10fb7c0635901f7","observation_id":"5715ec37-505e-47c5-b169-dff5fe7e45ab","resolution":{"observed_at":"2026-05-20T05:13:21.504876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:c6f548e2326247b1c9b3594d4f416bd5b4dff11702bca3b97ceeb9fc65a168cc","observation_id":"e07336f4-347c-40a0-9901-4679646b9a37","resolution":{"observed_at":"2026-05-20T05:13:21.481162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00193","last_updated":"2025-05-25T18:16:26Z","snapshot_observed_at":"2026-07-06T19:24:52.534713Z","submitted_at":"2024-09-30T19:45:11Z","title":"Do Vision-Language Models Really Understand Visual Language?","version":3},"cited_work":{"arxiv_id":"2410.00193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.00193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do vision- language models really understand visual language? arXiv preprint arXiv:2410.00193","venue":null,"work_id":"e5343628-4dab-4f6d-b9c0-01ead6b501fa","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2410.00193","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:d85f78631ecd8e8e17246938e777f6d9d2716afb63d35cc2142245e020b50d65","observation_id":"51ea26a9-8f75-4e2d-bd1e-165529af6f56","resolution":{"observed_at":"2026-05-20T05:13:21.514602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:f774910381cb38394e441b7949100835efcf54ff37e0735310a2653cd24ac62f","observation_id":"3e7971cf-bbaf-4d2c-8221-235a3d504af6","resolution":{"observed_at":"2026-05-20T05:13:21.561611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:49:52.205129Z","title":"arXiv preprint arXiv:2508.02669 , year=","venue":null,"work_id":"0dafa899-2698-4eb8-8bfb-00d88f7dd52c","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:80e8e820cb5187fe6d391058a816a04c079e8a1d8fbdde982c8ce8a06f8ea574","observation_id":"ec38e397-937d-4a55-b115-949d5acba2ab","resolution":{"observed_at":"2026-05-20T05:13:21.525956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":"1902.09506","doi":"10.48550/arxiv.1902.09506","metadata_source":"pith","pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","venue":"cs.CL","work_id":"2812ce3d-dce9-486d-b3c5-6261a28e786c","year":2019},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:11032f4e612c21bf3feaa81830e524be1bbeb0100b45b5f2f84ca422cd4632c4","observation_id":"d7aa1115-cc2c-4ed1-9598-d22cb6d7878d","resolution":{"observed_at":"2026-05-20T05:13:21.546757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:46.821192+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:46.821192+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00947","last_updated":"2025-07-13T22:29:38Z","snapshot_observed_at":"2026-08-03T17:23:10.606578Z","submitted_at":"2024-12-01T19:46:22Z","title":"VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information","version":3},"cited_work":{"arxiv_id":"2412.00947","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00947","snapshot_observed_at":"2026-07-02T03:06:30.214152Z","title":"Visonlyqa: Large vision language models still struggle with visual perception of geo- metric information","venue":null,"work_id":"c8027304-6a3c-4211-aeeb-ec8762fbad73","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2412.00947","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:82d1703a278d2ddeecbe49b2c51bd513fbb14d42f0f76949489a309b7adb46ff","observation_id":"4a1f0191-67c1-401c-a645-e41a857a2b47","resolution":{"observed_at":"2026-05-20T05:13:21.501063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.255855Z","title":"Mmr1: Enhancing multimodal reasoning with variance-aware sampling and open resources","venue":null,"work_id":"ab34c4ee-e920-4745-ba3f-3cac237082a2","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:a197b1b850997fdb01986c0f9726f42f9338917d60069117ca2863582731a2e3","observation_id":"9fa14ff1-e144-4db8-936a-0e635473e881","resolution":{"observed_at":"2026-05-20T05:13:21.560557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.00231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-07-03T20:48:56.198380Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":"4af8a742-b9ce-48eb-99e6-35eb96332561","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:81d86967115077f4b5ac65cd21fc18e1b4e073dbf71e22dd9d5f84b6ffae6965","observation_id":"c5eaa9fa-2347-4767-9243-568217237c48","resolution":{"observed_at":"2026-05-20T05:13:21.507568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2511.17731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.17731","snapshot_observed_at":"2026-07-02T01:17:25.615471Z","title":"org/abs/2511.17731","venue":null,"work_id":"b2d6d50d-cab4-479b-866e-cbb76393ee27","year":null},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2511.17731","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:25c30b9167066e30172995ec66282c46eb78c7b027dbcbcdebc382585b83ec6d","observation_id":"8ee5a468-1450-4a4b-baaf-9f19392b0e77","resolution":{"observed_at":"2026-07-02T01:17:25.615471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-07-06T13:40:38.776164Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2208.05358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-07-01T23:26:23.166439Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":"43c13df5-c90f-486d-863a-af7546a2e904","year":2022},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:89ed109fb37ca75e9d801e012a0aafc7987c53f4c4d902d41255ad017cf40723","observation_id":"8161aa63-f862-49da-ae67-ed2dca173ef3","resolution":{"observed_at":"2026-05-20T05:13:21.543836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21523","last_updated":"2025-06-20T08:41:41Z","snapshot_observed_at":"2026-08-07T14:44:18.138977Z","submitted_at":"2025-05-23T05:08:40Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":"2505.21523","doi":"10.48550/arxiv.2505.21523","metadata_source":"pith","pith_arxiv_id":"2505.21523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances in Neural Information Processing Systems , year =","venue":"cs.CL","work_id":"bb9acd95-b27a-4709-9dfa-75f62a65c716","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2505.21523","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:180cf826c223ff8e4c7ea587b351cbdc7456ba8f868592c7d8960b3658a16979","observation_id":"ca1ce379-d2b8-419e-bb4b-08a71fff2d98","resolution":{"observed_at":"2026-05-20T05:13:21.551928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:c05c7f06a3582a9b96b65aa6567c246b2559c54305cc76ee2f1a7695a3a8f7f8","observation_id":"fd501f9b-ba9e-4480-bdc0-61dba6a73518","resolution":{"observed_at":"2026-05-20T05:13:21.557487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00067","last_updated":"2019-09-04T10:43:20Z","snapshot_observed_at":"2026-08-07T00:54:00.522873Z","submitted_at":"2019-05-31T20:29:01Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","version":2},"cited_work":{"arxiv_id":"1906.00067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00067","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OK-VQA: A Visual Question An- swering Benchmark Requiring External Knowledge","venue":null,"work_id":"88b490d2-5ac2-427b-832e-98b0eeb7dc88","year":2019},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/1906.00067","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:adf4ae635c531afb8bd33159fdbe4d064817ec799bacaa19793ae57e74395bde","observation_id":"36e93f43-8a0a-4285-acb9-a2c247a2eb60","resolution":{"observed_at":"2026-05-20T05:13:21.570421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:191c55d70ef902906e22a931493e5ddc2a4057e9e58588e0145de0537148277c","observation_id":"1020f756-3f7b-4e10-911d-ebb048065042","resolution":{"observed_at":"2026-05-20T05:13:21.573194Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":"2503.07536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-07-04T10:39:45.355868Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","venue":"cs.CL","work_id":"30c18d3e-432d-404b-9572-1c7375bee8ed","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:14883a63852a0700a502810831e64b1a81815d889828ddcdc92d21bde5d0a64d","observation_id":"285a4026-1e00-4f33-a829-679f7d2deeb3","resolution":{"observed_at":"2026-05-20T05:13:21.567258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-07-06T13:17:15.959025Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":"2206.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-07-03T20:48:56.125898Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022a","venue":null,"work_id":"9a1c2036-b40c-4789-bbde-66bd3d822dda","year":2022},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:9df7badb0cd3008113c7ab6f6113c8d33c6451f93748a48ef42fbece24e64067","observation_id":"ae7bedce-d04a-4558-ab12-656c1ddcfc70","resolution":{"observed_at":"2026-05-20T05:13:21.565954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.14233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:17:29.010203Z","title":"Descriptive caption enhancement with visual specialists for multimodal perception.arXiv preprint arXiv:2412.14233","venue":null,"work_id":"ffa330d4-2c23-4cfe-a303-051d74f790b4","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:4ef458a409b1dd6e815af31d8b0df06863de33faa10506260f4317119d08029c","observation_id":"ab60bffd-42be-4c82-a373-9b4b783f5001","resolution":{"observed_at":"2026-05-20T05:13:21.519154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":"2501.06186","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-07-03T20:08:55.654788Z","title":"org/abs/2501.06186","venue":null,"work_id":"6543daed-6f88-41e0-a9d5-7bfc9e75ccee","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:bb0a27f77b8dc39d4d5be83d518c76c20007f712e7ac5b52688637e0bdd546ef","observation_id":"04a38104-5c6b-48cf-8edf-7f6ac1384ef9","resolution":{"observed_at":"2026-05-20T05:13:21.529260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dac7420c-02c2-4bae-b0c5-104139d6d7e2","year":2087},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:e73c0bb55464fe705d8fec5a3dea88fcde2da357031dcfb910cbd882cc130d67","observation_id":"11049ae2-ecda-41a2-9b5f-b6b5004bc4ba","resolution":{"observed_at":"2026-05-20T05:13:21.578814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:c612ac37cb7f583fdc0941d3699c5bddb199e0a97dd648d20c9dde6a95587d7a","observation_id":"6983eb48-fcc7-4ed4-9e77-1de6f3922bfd","resolution":{"observed_at":"2026-05-20T05:13:21.563530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-07T11:49:02.400828Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":"2506.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-07-04T15:09:55.331710Z","title":"Gthinker: Towards general multimodal reasoning via cue-guided rethinking","venue":null,"work_id":"e1f4749e-feb8-4358-8fe2-42af07d999c5","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:c38b3457d251195b70c7d4c9f1c39993cf96693910dd1ac8dee0e0690ac0db24","observation_id":"8160789e-f389-48e2-ab36-3b6de0efeffc","resolution":{"observed_at":"2026-05-20T05:13:21.576609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":"2410.16198","doi":"10.48550/arxiv.2410.16198","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math- verse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pp","venue":"arXiv (Cornell University)","work_id":"d845f05a-594c-4588-ba96-fb4b96773d84","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:62868f3e54d3af11ed14e9e55bab39cfddb41c694d4f9d820f8df98e14bd3dda","observation_id":"d7a7893f-c13f-4f80-ba1d-8d33346d535b","resolution":{"observed_at":"2026-05-20T05:13:21.549579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":"a17a7a8c-77b6-41bd-b9af-1cdeae8ab0b3","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:196b147fdd8e8d06abd242f15bc864638fd9d440a17c9e28cf49dbfcd8431386","observation_id":"b85715cc-147b-4f31-a7f8-6813f5d76688","resolution":{"observed_at":"2026-05-20T05:13:21.583182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Table 6.Key hyperparameters used in our Stage-3 training","venue":null,"work_id":"982b1523-f87b-40e2-ae29-516f2b790d72","year":2048},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:34eae780bab7d6cff28b81134779527be10e5ca4c920c1f293f4921494b883be","observation_id":"44244442-f5a8-44d9-a6a3-b3e34868c57c","resolution":{"observed_at":"2026-05-20T05:13:21.581098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8962.8352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7fda0b10-01f8-4522-811d-6f8e8570470c","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:ebc3405c7b32e67cfdec9ad15ca1d9212b60960c3c1f29932d37fc3f746d6f80","observation_id":"dba7d2c7-074f-4993-aa57-2f2a59abf1ee","resolution":{"observed_at":"2026-05-20T05:13:21.555039Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":21,"verified_fuzzy":2},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2605.20177."}