{"as_of":"2026-08-05T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49a1eaa8773e161307ec2e59067758d8cc0b3070c34d2dcc7d77b0c0679a35d3","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T20:09:16.222780Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.11209/citation-record","integrity":"/paper/2606.11209/integrity","json":"/paper/2606.11209/citation-record.json","paper":"/paper/2606.11209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-07-06T19:26:12.102947Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:e5d49a1c61cc6ba85c0206219626f895224c2e1a92687a741c70bf576afcdf69","observation_id":"026f94e9-4d8e-4b7c-a18b-9b97c165eef9","resolution":{"observed_at":"2026-07-04T20:10:07.051662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.707882Z","title":"2025 , eprint =","venue":null,"work_id":"f57e0cd0-dddb-437e-b8da-1c19fce68565","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:04722bb155cac6115af9f6e2483abb823e8af5657909df24ff216dc5e10c4f88","observation_id":"738b258c-4cca-4800-87eb-6406b637eb60","resolution":{"observed_at":"2026-07-04T21:20:08.710383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.771798Z","title":"2025 , eprint =","venue":null,"work_id":"10420d83-3989-4047-b224-a37dd2325170","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:06a97954946583838a4335b8b165d2a0b4bb6191279f8bb245760be4263bc8cb","observation_id":"1fef9c89-47d1-472b-87a7-f1cb03515869","resolution":{"observed_at":"2026-07-04T21:20:08.773107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.744516Z","title":"2024 , eprint =","venue":null,"work_id":"dd690396-f691-4d09-8006-c79e4e36a0eb","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:268542dfc3d8db19bf3cb53179ba480c9d70f3dcca27fe32e5e9a48e68fa18aa","observation_id":"e61012ce-c610-496c-95c0-343d9517fad0","resolution":{"observed_at":"2026-07-04T21:20:08.745681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.742805Z","title":"2025 , eprint =","venue":null,"work_id":"40942d66-2690-44ec-94d0-f7fc80bae9b2","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:75ceaf53187092e4ea3a8d2a8272a64901dba115231b5d7dd1ea132c70aca5d7","observation_id":"7cc66ce7-cb81-462e-a7f4-6c924c638a2a","resolution":{"observed_at":"2026-07-04T21:20:08.743960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.737068Z","title":"2025 , eprint =","venue":null,"work_id":"3fde99a6-5af7-4cf2-b3eb-0a292152b1e9","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:0d75ede35151c581c4490ca7bf6de656457926e60f2b222dbbae2bb3c83b06b6","observation_id":"60d5982f-a6ee-4c6c-917b-10851b08d30a","resolution":{"observed_at":"2026-07-04T21:20:08.738494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.746366Z","title":"2025 , eprint =","venue":null,"work_id":"c521357e-6906-433f-b613-f2531ef0df8c","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:032287756ed78cbc28bb9a2060b29d1c9f66c4b2ed530bc11305b0bacf87c1a0","observation_id":"010116fa-cd8e-4c27-9579-77161bb32a15","resolution":{"observed_at":"2026-07-04T21:20:08.747535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.732900Z","title":"2025 , eprint =","venue":null,"work_id":"a2c3cc2f-875f-4271-ba0a-5b593100a959","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:dda65365f1cf08016cce908f5307e6df84239679b7955e8d4ad9a16f920bb5cd","observation_id":"2f7d0d61-2f3a-4390-8232-757e85870946","resolution":{"observed_at":"2026-07-04T21:20:08.734232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.775687Z","title":"2025 , eprint =","venue":null,"work_id":"ba4f46c7-3fd8-4189-8c1a-4d8e436cbc2e","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:ed69da9eb24328598d7d654c2327e8dde9cdaf55df1547abee117f768f3c218b","observation_id":"3164abb7-02e3-4cb3-a808-5e512ed086ee","resolution":{"observed_at":"2026-07-04T21:20:08.778084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.759104Z","title":"2025 , eprint =","venue":null,"work_id":"e764098f-245d-45d9-9584-bd9a7a31c31f","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:5a0d5ec3463bb8818b765420a1b7e7704454ad5e0d97a32419331446f14ffe73","observation_id":"82128849-1b47-4e59-b8f2-b6710ddcf518","resolution":{"observed_at":"2026-07-04T21:20:08.760333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.762843Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":"d4d1e444-6450-4c46-823f-0b7231c861af","year":null},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:698961621c0cd8d316f761f36ad2dc27980fd7a7c9d4ff65f3a5e7f02cf19fd1","observation_id":"411728aa-3159-4cfc-ae32-60f09a443091","resolution":{"observed_at":"2026-07-04T21:20:08.764665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.774923Z","title":"2025 , eprint =","venue":null,"work_id":"5558b6db-dc96-478b-8a6a-ee700a5d1184","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:e73fe2b09b6ad658e81625fb3387c9d19d8fe46a62171345ea6bb3d0ce036935","observation_id":"fdc8b050-ceb6-4740-a3ae-54e8b4544a39","resolution":{"observed_at":"2026-07-04T21:20:08.778903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.734944Z","title":"2023 , eprint =","venue":null,"work_id":"2bf7fd41-bbe9-4c41-96f2-9cd6ca122bd4","year":2023},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:03dd5555403f777c790e97427a0d9304c01f893bc6d83e14b84892be0004c046","observation_id":"f5a90965-412c-4e92-947f-fd43b32fd124","resolution":{"observed_at":"2026-07-04T21:20:08.736349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.739268Z","title":"2024 , eprint =","venue":null,"work_id":"1163c6ba-01e6-47bc-91be-ee362b8cde2e","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:fc2e5961927f413a7edca05dc4651b7ee8ceb4b8216ceacb8b7ae4905c8ba7d2","observation_id":"5b6c244d-f325-40fa-8160-8c5bcb18bada","resolution":{"observed_at":"2026-07-04T21:20:08.740444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.750086Z","title":"2024 , eprint =","venue":null,"work_id":"e92a32cd-f6a8-4fde-af42-a50904b211e6","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:f077e20ee8ce54525fcd4e84b0ca58d5951aefc0e450868ba8030d0d33d89e3b","observation_id":"a08c9a12-21d9-46d2-ac5c-f20ac70c26df","resolution":{"observed_at":"2026-07-04T21:20:08.751239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.770764Z","title":"2025 , eprint =","venue":null,"work_id":"e64f9e32-b9bc-4884-93fe-840ee35a45d4","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:94340c2bcfc6ba86deb0b77c505a3c8c255a249dafa022a4856be3d885fba487","observation_id":"0cf82240-5362-411a-89c6-613cfa7c1519","resolution":{"observed_at":"2026-07-04T21:20:08.772245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:335b37c7555089923d4413668881aca4900f80f7d03dfe73aa4bf3e8db4fe855","observation_id":"4f0c2d63-f3a4-4c23-b3d8-59c4f26203b2","resolution":{"observed_at":"2026-07-04T20:10:07.046829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.778737Z","title":"2025 , note =","venue":null,"work_id":"897228d6-ed00-43ef-bf68-9b5dc7fbaf8b","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:3b701e9ab147db25b592ee9b1f2f50118e8becb7e301adf105d0f70582365a67","observation_id":"91ef8297-aa4e-41e7-8b15-afa483126256","resolution":{"observed_at":"2026-07-04T21:20:08.780269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.767372Z","title":"2024 , note =","venue":null,"work_id":"a631b658-e466-45f7-b2da-b43ed3d9c3a1","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:b1375741294b7c553c296a448fd9cc2caa358f73123be027d902826cadd57cde","observation_id":"3e670d6f-f62d-467d-ba88-30250406c471","resolution":{"observed_at":"2026-07-04T21:20:08.768626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.779999Z","title":"2024 , note =","venue":null,"work_id":"7e9ae2a0-8e4b-43b8-8ff1-d4dd5c1236f2","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:2b3f362c12fa37f42c597d39387f1fb2f005b9066fa8f0c42c5e50d522b5c1cb","observation_id":"bb385e4c-0a11-49ab-969f-c48edcd398e0","resolution":{"observed_at":"2026-07-04T21:20:08.781667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.723287Z","title":"2025 , eprint =","venue":null,"work_id":"3edb6677-a55e-4cc1-be0f-e708557ad9ae","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:0d73a7852c431c45250f6e84eb54f19e3673ba46647fe810b1399b066757a50c","observation_id":"811ca5a4-f75e-46ab-a602-43998f7b8afa","resolution":{"observed_at":"2026-07-04T21:20:08.725283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.754662Z","title":"2025 , eprint =","venue":null,"work_id":"142fd42e-1ef9-4308-8297-80bd943195c6","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:459ea8b7e6d15b67911c2c29e0fe67d527e2b3c09acd0e3181e0c944cfdda41c","observation_id":"88565c07-b75e-4235-b81c-5b06d1a6bfb9","resolution":{"observed_at":"2026-07-04T21:20:08.756022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.766052Z","title":"2025 , eprint =","venue":null,"work_id":"3d5d4763-1c28-4f6a-b4e1-5d3cd647aede","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:9d291cb241fa359f458d9de403c6e156ecabe9acf58bddc87a7e98fdf87177c9","observation_id":"b1814e67-06c7-4746-a0b7-0dc33fc729bc","resolution":{"observed_at":"2026-07-04T21:20:08.767639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.710964Z","title":"2025 , eprint =","venue":null,"work_id":"19a63c20-94ed-4ab8-802b-92b92ab09e00","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:9be68af349639d273794dfd6ad20feb00b723a2fcba146c60e0474173a161167","observation_id":"4cf6d709-e4d8-4354-8fb3-f662d77ad8d0","resolution":{"observed_at":"2026-07-04T21:20:08.712468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.725974Z","title":"2025 , eprint =","venue":null,"work_id":"fa674084-1e74-43f4-9565-a4832a395b4e","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:2e5df4a5d7640f7b7a6f3a21daae92db124771d762790422e59a237fad5556bc","observation_id":"361afee1-3d4a-4361-9e71-0653f6bbb1a6","resolution":{"observed_at":"2026-07-04T21:20:08.727648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.769559Z","title":"2025 , eprint =","venue":null,"work_id":"33301474-f135-4a8b-bbb5-e92c7a3223e3","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:0fd013658ab9a3a4b6970a2808bc7cd7a8d088c97b2dd0b608e7dfe09e939110","observation_id":"726e5e9e-92d2-4932-a848-7db66605f0c9","resolution":{"observed_at":"2026-07-04T21:20:08.771213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.715370Z","title":"2025 , eprint =","venue":null,"work_id":"f1ac86b9-3b58-4dc9-83cb-7799121accf8","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:404121f28ddd0e98ec0f2a0cc6c3479d7ac02ed3e26f4ec30bedc242794627cf","observation_id":"a1174a33-4536-4180-b272-6ddb59ab9965","resolution":{"observed_at":"2026-07-04T21:20:08.716688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.756184Z","title":"2024 , eprint =","venue":null,"work_id":"3e1dc2bf-7d6f-49f3-8a76-22b129bb0cd0","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:6de88249a5e24d58d91ec194017f59dcbae4da6c98d0947bbf2e58307f99529b","observation_id":"b06202b6-05c5-4923-93b1-77d00975ad2e","resolution":{"observed_at":"2026-07-04T21:20:08.757270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.750168Z","title":"2024 , eprint =","venue":null,"work_id":"dfcf91fc-8855-43c8-9561-1c6cab16eeed","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:da5885e3fb93300f635a4d4ed0a425f8459738de1325ab8529703fee4c493dfc","observation_id":"dbb8830c-50cd-407f-b3cc-871643e6da0c","resolution":{"observed_at":"2026-07-04T21:20:08.751444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.746184Z","title":"2025 , eprint =","venue":null,"work_id":"ed7ebe92-c86b-4e59-8a32-7cbafc6c2a58","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:cde628f85fcf15b0e0e97f4100ca8d3fd67dc0d976d75634b65aab2ef8b30307","observation_id":"1f420d6a-9255-46eb-93fc-dc14394fe8e7","resolution":{"observed_at":"2026-07-04T21:20:08.747257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.744409Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"906e921e-52ef-4086-898d-0c3ded57da1f","year":null},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:256018e092ba0c5e8e1659c5aa8e774a069ebc6d3d2388c1e159f19d82fae34d","observation_id":"12610ce5-ca11-4276-890f-9f829d52a7dd","resolution":{"observed_at":"2026-07-04T21:20:08.745862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.691784Z","title":"2025 , eprint =","venue":null,"work_id":"2618f9b6-868a-417d-9bcb-4d313eecceb6","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:02d820c7a6be509a7735eb7c49ec21aef3e59f243412f403d0640c8e8de6101b","observation_id":"a3d62391-27d4-4324-b719-fa0c1f1cf48d","resolution":{"observed_at":"2026-07-04T21:20:08.693160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.698892Z","title":"2025 , eprint =","venue":null,"work_id":"6846f1e6-2a3e-4b8e-9d7a-48595d717d55","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:11b343e370e4e80f1fcfaff59ac286e12d7a06f41603819eb6074563363fbd2e","observation_id":"632b107b-a597-48b6-865a-20e4ede01178","resolution":{"observed_at":"2026-07-04T21:20:08.700431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.719386Z","title":"2024 , eprint =","venue":null,"work_id":"f2ef2489-d091-41ee-83f3-c959edf85138","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:a82243c27a682a10ceacf247b257eb50dde93e7a7dca1a7b3bfc6dd23bca9679","observation_id":"ce638bc5-9e27-4a8f-a968-8db235c752c9","resolution":{"observed_at":"2026-07-04T21:20:08.722651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.760959Z","title":"2025 , eprint =","venue":null,"work_id":"a1fe914b-88eb-4b8d-9140-26404716e749","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:a2c5d0d1f9a071d096344c52b06fca4383a61a3f014440a5e245b14d03228a44","observation_id":"fa6460c2-6298-473b-8e52-f91c61f104dc","resolution":{"observed_at":"2026-07-04T21:20:08.762181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.765287Z","title":"2025 , eprint =","venue":null,"work_id":"fe0a7b65-b252-4617-a084-11585274eb29","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:77f0447ed4202757910af860759643b03cb801d6823b46c24bd6fbe8476a1bee","observation_id":"096c166b-3bc1-4a28-b627-57f98d17abe9","resolution":{"observed_at":"2026-07-04T21:20:08.766604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.759233Z","title":"2025 , eprint =","venue":null,"work_id":"19dadcac-de77-4653-ba5f-e7dc3e8d5e57","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:623ab9abe4dd127ce36034cba67dc9edfe07635f2c544eb3eedd6231dca51341","observation_id":"19bc4d92-b0d6-42ac-9c72-f0bbd7351d13","resolution":{"observed_at":"2026-07-04T21:20:08.761501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.768342Z","title":"2024 , eprint =","venue":null,"work_id":"99c59816-26a2-4979-b091-7ce2b872568e","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:2c330df8582aa7640bf1db3651bb18c09b7492f1e7b94fbd7133098acdd8d8d1","observation_id":"1f0411a7-efec-4010-af96-3bce9325e281","resolution":{"observed_at":"2026-07-04T21:20:08.770041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.699244Z","title":"2025 , eprint =","venue":null,"work_id":"ae4dba9d-c508-4f53-aa21-6fb4a9c9c6ad","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:3401e3a26cb298752035ab2ff846571a22ac8ba8e0b6d4e86eeaab64718de501","observation_id":"bf94d3be-d89c-49e7-9e78-9b7a9c9b8c44","resolution":{"observed_at":"2026-07-04T21:20:08.700763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.739779Z","title":"2025 , eprint =","venue":null,"work_id":"c06a686f-0960-46c7-8297-2c98d846caa9","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:9ba2c0349818c33521cf9f56bc3713a2e2b3528a3a34aa4ae625a2a5799a28cf","observation_id":"afdf2860-497b-401b-a6a0-b21ffcda53c1","resolution":{"observed_at":"2026-07-04T21:20:08.741252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.741874Z","title":"2025 , eprint =","venue":null,"work_id":"f1117af1-b22a-4542-8676-fa2f5ffb8e0b","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:9d8cb2801c4becd79836c0eaea3e7fe57580770ea2d82fa122de957852ccce91","observation_id":"0516b6ad-b8d0-4e45-bb6d-aaa1c0b71299","resolution":{"observed_at":"2026-07-04T21:20:08.743735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.717496Z","title":"2025 , eprint =","venue":null,"work_id":"17f5ef06-8a91-4e9a-a344-6aed6b30d87f","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:c05d4f9656dec25755f10ef2499463c0ce118f614e9727f2acbbd54ddf67dc93","observation_id":"95dc4b9e-1e3c-4b25-b32c-be8acd6b0e62","resolution":{"observed_at":"2026-07-04T21:20:08.719133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.754403Z","title":"2025 , eprint =","venue":null,"work_id":"db881932-d732-40a1-938e-508f92e3681e","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:d3968b48e0f5550c57c256d3c5e9700710067bf1d50679f5b8c0cefebf528531","observation_id":"75ad7841-e578-4fe2-be7b-7d3ecd718e05","resolution":{"observed_at":"2026-07-04T21:20:08.755591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.756640Z","title":"2025 , eprint =","venue":null,"work_id":"b0261fd8-2480-472f-9c38-ec0d54bfada1","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:b1578c95755e62fd59bd3f85517bf3062ead62bd4009ed5db91e1b9bc582812a","observation_id":"12c9a64a-92b5-4525-8959-909bbd527020","resolution":{"observed_at":"2026-07-04T21:20:08.758076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.723497Z","title":"2025 , eprint =","venue":null,"work_id":"f2f2421c-2c4b-47cb-b2ee-504d70deaf90","year":2025},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:4c660ef6a19ec35becf3f619e42a3d25e6a3e517b16242ccfba82c7784fb6977","observation_id":"44dd9471-4c80-432c-8ac6-c7640706d047","resolution":{"observed_at":"2026-07-04T21:20:08.725048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.747879Z","title":"2026 , eprint =","venue":null,"work_id":"ab18b5ec-2285-4b92-a9e0-7f8d2b23a9ca","year":2026},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:045ba4e2aa8e71fd975ed9444cd7f458ba0f1ae4c77caf292bd8f9867c125d0d","observation_id":"731414cd-e2d5-4c43-bdbf-caaf39e212ec","resolution":{"observed_at":"2026-07-04T21:20:08.749113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.737566Z","title":"2026 , eprint =","venue":null,"work_id":"a9aaa1bc-be83-4e13-b34e-2977ee62dec8","year":2026},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:033731e12c22f6a8eaf564203dfe6283fc3a147d9b7ae4c85911ccddcdf163b7","observation_id":"59639cff-c1eb-4893-acf7-0ade9a9e8def","resolution":{"observed_at":"2026-07-04T21:20:08.739070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:20:08.772852Z","title":"2017 , eprint =","venue":null,"work_id":"3ccf0d56-cbba-43f6-8f13-520b4a14f80d","year":2017},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:5c6df0ad3a0893ca6bb11791f63f471e9c4d9d4d6396b7fc8bb57045723dcf49","observation_id":"34fca55b-f69e-4ace-9dec-9eccad2d863d","resolution":{"observed_at":"2026-07-04T21:20:08.774454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2606.11209."}